Modelos e LLMs

DeepSeek lança modelo de 304B parâmetros que supera rivais maiores

Com preço abaixo de concorrentes, modelo promete melhor custo-benefício do mercado

A DeepSeek lançou em 31 de julho de 2026 o V4-Flash-0731, um modelo de linguagem com 304 bilhões de parâmetros. Ele ocupa 167 GB no Hugging Face. Segundo o ranking da Artificial Analysis, ele supera o MiniMax M3, um modelo de 428 bilhões de parâmetros. O anunciante o descreve como a família V4 com "capacidades aprimoradas de agentic".

O custo para usar a API é de US$ 0,14 por milhão de tokens de entrada e US$ 0,27 por milhão de tokens de saída. Esse patamar o coloca como a opção de melhor relação inteligência-preço disponível. A análise da Artificial Analysis o coloca no topo do gráfico de índice de inteligência versus custo por tarefa. O próprio divulgador, Simon Willison, testou o modelo e publicou os resultados.

Desempenho acima do esperado para seu tamanho

Willison executou o V4-Flash via OpenRouter com um prompt padrão para gerar uma imagem. No nível de raciocínio padrão, o resultado foi ruim. Ao aumentar o nível de raciocínio para alto, a qualidade melhorou muito. Isso mostra que o modelo depende de configurações específicas para entregar o que promete.

O anúncio foca nas "capacidades aprimoradas de agentic", mas não detalha os testes que sustentam essa afirmação. O dado concreto é o desempenho em benchmarks públicos da Artificial Analysis. A empresa de análise classificou o V4-Flash acima de um modelo 40% maior. Não há detalhes sobre os conjuntos de dados ou metodologia desses testes.

Preço competitivo e disponibilidade imediata

O modelo está disponível para download no Hugging Face. Também pode ser acessado pela API da OpenRouter. Não há menção a requisitos de hardware específicos para rodá-lo localmente, apenas o tamanho do arquivo. A DeepSeek não especificou se há versões diferentes ou limitações de uso.

O anúncio faz parte da família V4 da DeepSeek, que inclui outros modelos. A empresa chinesa segue a estratégia de oferecer modelos de alto desempenho a custos muito baixos. Essa prática pressiona concorrentes que cobram mais pelo acesso a APIs. O foco em "capacidades agentic" indica uma direção para ferramentas que executam ações, não apenas geram texto.

O valor de US$ 0,14 por milhão de tokens de entrada é agressivo. Para comparação, modelos de porte similar costumam cobrar mais. A combinação de preço baixo e desempenho alto em rankings chama a atenção de desenvolvedores. Eles buscam reduzir custos sem sacrificar a qualidade das respostas para aplicações reais.

O teste público limitado de Willison é uma amostra. Ele mostrou que o modelo precisa de ajustes para funcionar bem. A afirmaçaosobre ser o de melhor custo-benefício depende de testes contínuos. Outros usuários precisam validar se o desempenho se mantém em tarefas diversas.

Fontes

Simon WillisonModelos e LLMs
Como fazemos: nossa equipe monitora diariamente os repositórios de código aberto em maior alta e produz esta cobertura com apoio de modelos de linguagem, sempre a partir de dados verificados na fonte primária — repositório, documentação oficial e ranking público. Os números de estrelas e a posição no ranking refletem o momento da coleta. Entenda o método.