O modelo de 7 bilhões que encara gigantes de 235: aberto do zero, com código e dados
O ZGCM-1 aposta que um modelo pequeno não precisa decorar a web: ele compensa pensando por mais tempo e usando ferramentas. Os autores reportam ganho de 4,2 vezes no pré-treino e resultados competitivos com o Qwen3-235B-A22B.

O ZGCM-1 entrou no arXiv em 11 de setembro: um modelo denso de 7 bilhões de parâmetros, treinado do zero e 100% aberto, com pesos, código de treino e dados publicados. Em matemática e busca agêntica, o paper o coloca competitivo com modelos ordens de grandeza maiores, como o Qwen3-235B-A22B e o GLM-5.1.
Parâmetros são os ajustes internos que dão o tamanho de um modelo de IA: quanto mais, mais ele decora, e mais caro fica rodar. A aposta dos autores é que o pequeno não precisa decorar a web: compensa pensando por mais tempo antes de responder e chamando ferramentas externas, como busca. A janela de contexto é de 256 mil tokens.
A conta de eficiência vem do treino: em FP8 com o otimizador Muon, o time reporta ganho de 4,2 vezes no tempo de pré-treino até a mesma perda, medido em contexto de 16 mil. A divisão de tamanhos é da redação: 235 bilhões contra 7 dá cerca de 34 vezes, com uma ressalva: o Qwen3 é MoE e ativa 22 bilhões por vez.
O limite: todos os números são reportados pelos próprios autores, sem replicação externa até aqui. A diferença é que, com pesos, código e dados abertos, qualquer laboratório pode refazer a conta.
O pequeno não decora a web. Ele pensa por mais tempo e chama ferramentas.
A aposta| A eficiência reportada | |
| Janela de contexto | 256 mil |
| Treino | FP8 + Muon |
| = Ganho no pré-treino (16K) | 4,2x |
| O confronto de tamanhos | |
| ZGCM-1, denso | 7 bi |
| Qwen3-235B-A22B, total | 235 bi |
| = Diferença de tamanho | ~34x |
O 4,2x é reportado pelos autores, sem replicação externa. A divisão 235 por 7 é da redação; o Qwen3 é MoE e ativa 22 bilhões por vez.
Um time escolheu publicar pesos, código e dados sabendo que qualquer pessoa pode conferir a conta; a aposta de que pensar por mais tempo vence decorar a web foi decisão de gente.
Todos os números de desempenho são reportados pelos próprios autores. Com o material aberto, qualquer laboratório pode refazer a conta.
Evidência▾
Entidades ZGCM-1, Qwen3-235B-A22B, GLM-5.1, Muon, Hugging Face, GitHub
Apurada e escrita por IA, verificada contra as fontes linkadas acima. Uma pessoa revisou antes de sair. Esta matéria se lê em 6 cards que você desliza, ou nesta página.
Como o Layer 8 é feito →