Tecnologia

DeepSeek V4.1 Flash: 552 mil milhões de parâmetros, 8 mil milhões ativos, cache 60% mais barata — e empata com o Opus 5

Adrian Kessler

DeepSeek V4.1 Flash funciona numa nova arquitetura que a empresa chama Causal Encoder-Decoder. Os seus 552 mil milhões de parâmetros estão distribuídos por 20 camadas no codificador e 20 no descodificador, mas apenas 8 mil milhões ativam para tokens de entrada e 16 mil milhões para saída. Isto torna-a estruturalmente mais enxuta do que modelos que ativam fatias de parâmetros maiores para cada operação — uma escolha de design que se traduz diretamente em eficiência de custo de inferência e memória.

Os ganhos de memória são específicos. A cache KV da V4.1 Flash fica em 890 bytes por token, aproximadamente um quarto da V4-Flash. O caching FP4 e a Compressed Sparse Attention 2 reduzem a pegada de cache persistente para um oitavo da geração anterior. O input em cache custa agora $0,003 por milhão de tokens em horas de menor procura — 60% menos que a V4-Flash. O input não em cache caiu 33%, o output 11%.

Nos benchmarks que os programadores mais acompanham, o modelo defende-se. O DeepSWE v1.1 — o teste autónomo de engenharia de software — dá-lhe 74,2, ligeiramente à frente do Opus 5 da Anthropic com 74,0 e acima do GPT-5.6 Sol com 73,0. O GPQA Diamond atinge 90,9. A diferença que se destaca é o Terminal-Bench 3.0: 30,0 contra 43,3 do Opus 5, uma diferença real em tarefas que exigem depuração interativa prolongada.

A visão está integrada desde a pré-treinagem. Anteriormente, a V4 separava a visão numa variante Vision-Exp. A V4.1 Flash substitui ambas por um único modelo construído em torno do DeepSeek-ViT, um codificador treinado para o efeito, desenvolvido em conjunto com o modelo de linguagem desde o início. O nível multimodal desapareceu — todas as chamadas obtêm visão por defeito.

A janela de contexto é de 1 milhão de tokens, com saída limitada a 384.000, suficiente para análise de documentos longos e fluxos de trabalho de agente prolongados sem necessidade de fragmentação. Os utilizadores existentes da API que utilizam os antigos IDs deepseek-v4-flash e deepseek-v4-flash-vision-exp já estão a ser reencaminhados para a V4.1 Flash. A 14 de setembro, o tráfego do DeepSeek V4 Pro também transita — ao preço da Flash.

A DeepSeek descreveu a V4.1 Flash como “o modelo mais pequeno da nossa nova família de arquiteturas”. Um V4.1 Pro maior na mesma arquitetura Causal Encoder-Decoder está implícito. Se mantiver a trajetória de eficiência da Flash, prolongará o desempenho por euro desta arquitetura mais acima na curva de benchmarks — para território atualmente ocupado por modelos que custam significativamente mais por milhão de tokens.

O ponto arquitetónico importa para além da tabela de preços. O crescimento da cache KV é uma restrição primária para executar modelos grandes em contexto longo, e escala com cada token processado. A abordagem da V4.1 Flash — menos parâmetros ativos, cache comprimida — aborda diretamente essa restrição. É um modelo utilizável para implementações de contexto longo, não uma otimização de casos extremos.

Etiquetas: , , , , ,

Discussão

Existem 0 comentários.