Moonshot AI lança Kimi K3 com 2,8 trilhões de parâmetros e promete pesos abertos até dia 27
Modelo chinês cobra preço de Claude Sonnet e supera rivais em benchmarks próprios, mas custa 25 centavos para desenhar um pelicano.
Modelo chinês cobra preço de Claude Sonnet e supera rivais em benchmarks próprios, mas custa 25 centavos para desenhar um pelicano.
O laboratório chinês Moonshot AI anunciou nesta quinta-feira o Kimi K3, modelo de 2,8 trilhões de parâmetros disponível via site e API, com liberação de pesos abertos prometida para 27 de julho. A empresa classifica o modelo como o primeiro "aberto de classe 3T", superando o DeepSeek V4 Pro de 1,6 trilhão. Benchmarks autorrelatados mostram o K3 à frente do Claude Opus 4.8 max e do GPT-5.5 high, mas atrás do Claude Fable 5 e do GPT-5.6 Sol. O preço de US$ 3 por milhão de tokens de entrada e US$ 15 por milhão de saída iguala a série Sonnet da Anthropic, tornando-o o modelo chinês mais caro até agora.
A Artificial Analysis avaliou o K3 em sua avaliação privada de trabalho de conhecimento de longo horizonte e deu ao modelo Elo 1547, um salto de 732 pontos sobre o Kimi K2.6. Fica atrás apenas do Claude Fable 5. O custo por tarefa ficou em US$ 0,94, semelhante ao GPT-5.6 Sol (US$ 1,04) e metade do Opus 4.8 (US$ 1,80). O modelo também lidera a arena de código frontend do Arena.ai, superando o próprio Claude Fable 5. O consumo de tokens de saída caiu 21% em relação ao K2.6.
A tabela de preços representa aumento expressivo sobre o Kimi K2.6, que custava US$ 0,95 por milhão de tokens de entrada e US$ 4 por milhão de saída. O K3 dobra o tamanho do modelo anterior de 1 trilhão de parâmetros. Por enquanto, a empresa oferece apenas um nível de esforço de raciocínio, chamado "max", sem opções mais leves ou baratas.
Simon Willison testou o modelo via OpenRouter pedindo um SVG de um pelicano andando de bicicleta. A resposta consumiu 95 tokens de entrada e 16.658 de saída, dos quais 13.241 foram tokens de raciocínio, para um custo de 25 centavos. O modelo gerou 3.417 tokens de resposta final. Willison observa que o teste do pelicano, com 21 meses de existência, perdeu correlação com qualidade real — o GLM-5.2 supera modelos superiores nesse benchmark — e não mede capacidade de chamada de ferramentas nem confiabilidade em conversas longas.
O anúncio vem da própria Moonshot e os benchmarks são autorrelatados. A liberação de pesos abertos ainda não ocorreu e depende de promessa para daqui a onze dias. O pelicano caro expõe o custo do raciocínio único no nível máximo, o que pode limitar uso em tarefas simples. Para quem avalia adoção, resta esperar a versão aberta e testes independentes em cenários de produção.