Layer 8

O modelo de 7 bilhões que encara gigantes de 235: aberto do zero, com código e dados

O ZGCM-1 aposta que um modelo pequeno não precisa decorar a web: ele compensa pensando por mais tempo e usando ferramentas. Os autores reportam ganho de 4,2 vezes no pré-treino e resultados competitivos com o Qwen3-235B-A22B.

Confiança média·4 min de leitura
Prefere arrastar? A mesma matéria em 6 cards, feita para o celular.
Técnico agachado com laptop diante de racks de servidores em um centro de supercomputação
O ZGCM-1 foi treinado do zero, com código, dados e receita publicados. Foto ilustrativa.Derrick Coetzee · CC0

O ZGCM-1 entrou no arXiv em 11 de setembro: um modelo denso de 7 bilhões de parâmetros, treinado do zero e 100% aberto, com pesos, código de treino e dados publicados. Em matemática e busca agêntica, o paper o coloca competitivo com modelos ordens de grandeza maiores, como o Qwen3-235B-A22B e o GLM-5.1.

Parâmetros são os ajustes internos que dão o tamanho de um modelo de IA: quanto mais, mais ele decora, e mais caro fica rodar. A aposta dos autores é que o pequeno não precisa decorar a web: compensa pensando por mais tempo antes de responder e chamando ferramentas externas, como busca. A janela de contexto é de 256 mil tokens.

A conta de eficiência vem do treino: em FP8 com o otimizador Muon, o time reporta ganho de 4,2 vezes no tempo de pré-treino até a mesma perda, medido em contexto de 16 mil. A divisão de tamanhos é da redação: 235 bilhões contra 7 dá cerca de 34 vezes, com uma ressalva: o Qwen3 é MoE e ativa 22 bilhões por vez.

O limite: todos os números são reportados pelos próprios autores, sem replicação externa até aqui. A diferença é que, com pesos, código e dados abertos, qualquer laboratório pode refazer a conta.

O pequeno não decora a web. Ele pensa por mais tempo e chama ferramentas.

A aposta
A conta do confronto
A eficiência reportada
Janela de contexto256 mil
TreinoFP8 + Muon
= Ganho no pré-treino (16K)4,2x
O confronto de tamanhos
ZGCM-1, denso7 bi
Qwen3-235B-A22B, total235 bi
= Diferença de tamanho~34x

O 4,2x é reportado pelos autores, sem replicação externa. A divisão 235 por 7 é da redação; o Qwen3 é MoE e ativa 22 bilhões por vez.

Layer 8

Um time escolheu publicar pesos, código e dados sabendo que qualquer pessoa pode conferir a conta; a aposta de que pensar por mais tempo vence decorar a web foi decisão de gente.

Como chegou aqui
11 SETO paper entra no arXiv: denso, 7 bilhões, treinado do zero.
11 SETPesos, código de treino e dados publicados no GitHub.
16 SETO paper entra no topo da semana do Hugging Face.
O que você pode verificar, e o que não
O paper, o 4,2x e o contexto de 256 mil, no arXiv.
Pesos, código e dados publicados no repositório zgcagi/ZGCM-1.
Replicação externa dos benchmarks. Nenhuma publicada até 16 de setembro.
Competitivo com gigantes fora dos testes escolhidos pelos autores: não verificado.

Todos os números de desempenho são reportados pelos próprios autores. Com o material aberto, qualquer laboratório pode refazer a conta.

Evidência
arXiv 2609.13356 (ZGCM-1)O paper: 7 bilhões denso, 256 mil de contexto, FP8 com Muon, o 4,2x, os confrontos com Qwen3 e GLM-5.1.primária · 11 set 2026
GitHub zgcagi/ZGCM-1Pesos, código de treino e dados publicados.oficial · 16 set 2026
Hugging Face PapersA entrada no topo da semana.contexto · 16 set 2026

Entidades ZGCM-1, Qwen3-235B-A22B, GLM-5.1, Muon, Hugging Face, GitHub

Apurada e escrita por IA, verificada contra as fontes linkadas acima. Uma pessoa revisou antes de sair. Esta matéria se lê em 6 cards que você desliza, ou nesta página.

Como o Layer 8 é feito
Leia depois
Primeira página
Técnico agachado com laptop diante de racks de servidores em um centro de supercomputação
Layer 8A Conta · Papers · 01

7 bilhões contra 235.

Parâmetros, denso, treinado do zero e 100% aberto
7 bi
256 miltokens de janela de contexto4,2xganho reportado no pré-treino
Layer 8Lado a lado · 02

O confronto que o paper propõe.

ZGCM-1
7 bi

denso, treinado do zero, com pesos, código e dados abertos.

Qwen3-235B-A22B
235 bi

totais no MoE. Em matemática e busca agêntica, o paper coloca o pequeno como competitivo.

Layer 8A conta · 03

A eficiência que os autores reportam.

A eficiência reportada
Janela de contexto256 mil
TreinoFP8 + Muon
= Ganho no pré-treino (16K)4,2x
O confronto de tamanhos
ZGCM-1, denso7 bi
Qwen3-235B-A22B, total235 bi
= Diferença de tamanho~34x
Layer 8

Aberto do zero é um convite para ser desmentido.

Um time publicou pesos, código e dados sabendo que qualquer pessoa pode refazer a conta.

Layer 8E você? · 05

Pequenos e abertos vão vencer os gigantes fechados?

Toque num lado. Seu voto fica salvo neste navegador.

Layer 8O registro inteiro · 06

A conta inteira, com as fontes linkadas, está no site.

arXiv, repositório zgcagi/ZGCM-1 no GitHub, Hugging Face Papers.

A primeira página/context →
Início
01 / 06