Kimi K3: o maior modelo open-weight já lançado tem 2,8 tri de parâmetros
A Moonshot lançou o Kimi K3: 2,8 trilhões de parâmetros e 1 milhão de tokens de contexto. O que muda na prática, e o que open-weight realmente entrega.

A Moonshot AI publicou em 16 de julho o Kimi K3, um modelo de 2,8 trilhões de parâmetros que a própria empresa descreve como o primeiro modelo aberto da classe de 3 trilhões. É o maior modelo de pesos abertos já lançado, e ele chegou cerca de um mês depois de o governo dos Estados Unidos retirar de circulação os modelos Fable e Mythos da Anthropic por preocupações de segurança. O resultado é incômodo para quem acompanha a corrida de perto: o modelo de fronteira mais capaz que qualquer pessoa pode obter livremente hoje é chinês.
O que a Moonshot colocou no ar
O K3 usa uma arquitetura de mistura de especialistas: dos 896 especialistas do modelo, apenas 16 são acionados por token, dentro de um framework que a Moonshot chama de Stable LatentMoE e sobre um mecanismo de atenção próprio, o Kimi Delta Attention. A janela de contexto é de 1.048.576 tokens, e a empresa afirma cerca de 2,5 vezes a eficiência de escala da geração anterior.
Vale marcar a diferença de gerações, porque ela é fácil de confundir. O Kimi K2, de julho de 2025, tinha 1 trilhão de parâmetros totais, 32 bilhões ativos por token e 128 mil tokens de contexto. O K3 é outro patamar de escala, não uma atualização de ponto.
Um detalhe que costuma ser preenchido errado: a Moonshot não publicou um número oficial de parâmetros ativos por inferência. Estimativas de terceiros ficam entre 40 e 100 bilhões, e a conta ingênua (2,8 tri vezes 16/896) dá algo perto de 50 bilhões. Qualquer número específico que você ler por aí é estimativa, não dado da empresa.
Onde o K3 ganha, e onde ele não ganha
Nos números divulgados pela própria Moonshot, o K3 lidera dois benchmarks relevantes de trabalho real: SWE Marathon, com 42,0 contra 40,0 do Claude Opus 4.8 e 39,0 do GPT-5.6 Sol, e BrowseComp, com 91,2 contra 90,4 do Sol e 88,0 do Claude Fable 5. São resultados auto-reportados, então merecem o ceticismo de praxe até a validação independente.
No Terminal-Bench 2.1, a tabela da própria empresa mostra 88,3 para o K3 contra 88,8 do GPT-5.6 Sol. É empate técnico, não liderança, e a avaliação independente da Vals colocou o K3 em segundo lugar nesse mesmo teste.
A medição independente mais útil vem do Artificial Analysis, que deu ao K3 nota 57 no Intelligence Index v4.1. Isso o coloca como o modelo de pesos abertos mais capaz disponível, atrás do Claude Fable 5 e do GPT-5.6 Sol, e no mesmo nível do Opus 4.8 e do GPT-5.5. A leitura honesta é a que a própria Moonshot escreveu no anúncio: o desempenho geral ainda fica atrás dos modelos proprietários mais poderosos.
"Open-weight" não quer dizer que você vai rodar isso
Aqui é onde a conversa costuma descarrilar. Pesos abertos soa como "instale na sua infraestrutura e resolva o problema de privacidade". Nessa escala, não é o que acontece.
A 4 bits, no formato MXFP4 para o qual o modelo foi treinado, 2,8 trilhões de parâmetros ocupam cerca de 1,4 TB só de pesos, antes de qualquer ativação ou cache de contexto. E a recomendação da própria Moonshot para servir o modelo é de configurações com 64 aceleradores ou mais, não por causa da memória, mas da banda de interconexão necessária para rotear cada token entre especialistas. A Reuters cita Ryan Fedasiuk, do American Enterprise Institute, dizendo que rodar isso localmente exigiria centenas de milhares de dólares em equipamento.
Some a isso o estado real da abertura: até 26 de julho os pesos ainda não estavam públicos (a Moonshot prometeu a liberação até o dia 27), a licença não foi publicada, e não há dados nem código de treinamento. É open-weight, não open-source, e a diferença importa. Para uma empresa, o que a abertura entrega de concreto é auditabilidade, ausência de dependência de um fornecedor único para o artefato e liberdade de escolher de quem alugar a inferência. Não é rodar na sala do servidor.
O preço quebra a expectativa do modelo chinês barato
A tabela oficial é de US$ 0,30 por milhão de tokens de entrada com acerto de cache, US$ 3,00 sem acerto, e US$ 15,00 por milhão de tokens de saída, sem sobretaxa para contexto longo em nenhum ponto do 1 milhão de tokens.
No custo médio por tarefa medido pelo Artificial Analysis, o K3 sai a cerca de US$ 0,94, contra US$ 1,04 do GPT-5.6 Sol e US$ 2,75 do Fable 5. Só que fica bem acima de GLM-5.2 (US$ 0,47) e Grok 4.5 (US$ 0,31). Ou seja: o K3 não é o modelo chinês barato do ciclo anterior. Ele está precificado em faixa de modelo proprietário intermediário, e a decisão passa a ser de capacidade, não de economia.
O número que não está no anúncio
Na avaliação AA-Omniscience, do Artificial Analysis, a taxa de alucinação do K3 subiu para 51%, contra 39% da geração anterior. Mais capaz e, ao mesmo tempo, mais disposto a inventar. O modelo também é notavelmente verboso: consumiu 130 milhões de tokens de saída para completar a bateria do Intelligence Index, cerca de duas vezes a mediana.
A Moonshot documentou duas limitações de comportamento no próprio anúncio, o que é raro e merece crédito. A primeira é sensibilidade ao histórico de raciocínio: se a aplicação descarta o raciocínio anterior, ou se você troca de modelo no meio da sessão, a qualidade pode ficar bastante instável. A segunda é proatividade excessiva: diante de intenção ambígua, o modelo pode tomar decisões inesperadas em nome do usuário.
Para quem vai colocar um modelo na frente de cliente, esses três fatos valem mais que qualquer benchmark. Capacidade sem camada de verificação não é ganho, é passivo. Um modelo que erra com mais confiança precisa de mais checagem, não de menos.
O que fazer com isso na prática
O caminho acionável é a API, e ela é compatível com o SDK da OpenAI: a documentação oficial usa from openai import OpenAI apontando para https://api.moonshot.ai/v1 com o id kimi-k3. Na prática, testar o modelo em algo que já roda com a OpenAI é trocar duas linhas de configuração, o que derruba o custo de experimentar para quase nada.
Três recomendações concretas. Teste no seu próprio dado e em português, porque nenhum desses benchmarks mede isso. Não coloque o modelo em contato com cliente sem uma etapa de verificação factual no meio, dada a taxa de alucinação. E acompanhe o dia 27 de julho: a liberação dos pesos e, principalmente, qual licença vem com eles definem se isso é uma opção real de arquitetura ou apenas uma API a mais.
Um último dado que dá a dimensão do momento. A demanda pelo K3 foi grande o suficiente para a Moonshot suspender novas assinaturas, e no dia do lançamento as concorrentes chinesas listadas em Hong Kong caíram forte, com Zhipu em queda de 27,7% e MiniMax de 16,5%. A empresa está fechando uma rodada que a avalia em mais de US$ 30 bilhões, com receita recorrente anual de US$ 300 milhões em junho e um IPO em Hong Kong previsto para os próximos seis meses.
Fontes
- Kimi K3: Open Frontier Intelligence, blog oficial da Moonshot AI
- Kimi K3 Quickstart, documentação oficial da API
- China's Moonshot unveils world's largest open AI model, Reuters
- Kimi K3: Intelligence, Performance & Price Analysis, Artificial Analysis
- Kimi K3: benchmarks, pricing, hardware requirements and self-hosting, Northflank
- Moonshot plans Hong Kong listing at a $30 billion valuation, The Next Web


