Notícias

Lançamentos & Modelos

CONFIRMADO: DeepSeek lança V4.1 Flash com visão nativa e derruba o preço da API

A DeepSeek confirmou o lançamento do V4.1 Flash, menor modelo da nova arquitetura da empresa, com compreensão visual nativa, janela de 1 milhão de tokens, suporte a ferramentas e uma arquitetura MoE desenhada para reduzir o custo de memória. O laboratório também anunciou que pedidos para o V4 Pro serão roteados para o Flash a partir de 14 de setembro, até a chegada do V4.1 Pro.

[{"h":"CONFIRMADO: o experimento de dois dias virou produto oficial","p":"A DeepSeek confirmou em 10 de setembro de 2026 o lançamento do V4.1 Flash, encerrando a fase de teste limitado que havia colocado um identificador temporário dentro da API. O modelo agora aparece na documentação oficial como o menor integrante da nova família arquitetural da empresa. A mudança central não é só de nome: o Flash passa a ter compreensão visual nativa, em vez de depender do modelo experimental Vision Exp, e foi desenhado para elevar o teto de capacidade, acelerar a inferência e aumentar o throughput à medida que a família crescer."},{"h":"A arquitetura é a parte mais importante da notícia","p":"A apresentação oficial descreve um MoE de 552 bilhões de parâmetros com uma arquitetura Causal Encoder Decoder. Segundo a DeepSeek, apenas 8 bilhões de parâmetros ficam ativos na entrada e 16 bilhões na saída. A empresa também afirma que o cache KV ocupa um quarto da memória HBM e um oitavo do armazenamento SSD exigidos pela geração anterior. É uma promessa de eficiência estrutural, não apenas um corte comercial de preço, e pode reduzir o custo de agentes que repetem contexto em muitas chamadas."},{"h":"O que chegou de verdade","p":"A documentação da API lista janela de contexto de 1 milhão de tokens, saída máxima de 384 mil tokens, modos thinking e non-thinking, chamadas de ferramentas, Responses API, compatibilidade com a API da Anthropic e suporte a visão. O nome recomendado para acessar a versão atual é deepseek-flash. Os identificadores antigos deepseek-v4-flash e deepseek-v4-flash-vision-exp ficam temporariamente roteados para o novo modelo, uma decisão importante para quem já tem integração em produção e não quer trocar tudo hoje."},{"h":"Pesos abertos ampliam a aposta","p":"No mesmo dia, o repositório oficial no Hugging Face passou a distribuir os pesos sob licença MIT, com dezenas de shards safetensors e instruções de inferência. Isso não transforma o modelo em uma instalação simples para qualquer empresa: o tamanho total continua exigindo infraestrutura pesada e suporte de software. Mas cria uma segunda rota além da API, relevante para organizações que precisam de controle de dados, customização ou negociação de custo em escala."},{"h":"Benchmarks ambiciosos, mas ainda são números da própria DeepSeek","p":"A tabela oficial coloca o V4.1 Flash em 90,9 no GPQA Diamond, 3.471 no Codeforces, 90,6 no Terminal-Bench 2.1 e 74,2 no DeepSWE v1.1. Em tarefas com ferramentas, a empresa reporta 63,9 no HLE, 31,8 no Agents' Last Exam e 89,6 no BabyVision. Isso sugere uma aposta muito mais agressiva em agentes de código e tarefas multimodais do que o Flash anterior. Mas a ressalva é grande: não há, nesta publicação, uma avaliação independente que confirme a vantagem em carga real, custo total ou estabilidade. Benchmark de laboratório é evidência, não veredito de produção."},{"h":"A conta fica menor e o V4 Pro perde espaço","p":"A página oficial de preços lista o Flash a US$ 0,003 por milhão de tokens de entrada em cache, US$ 0,15 sem cache e US$ 0,60 de saída fora do horário de pico. No pico, os valores dobram. A DeepSeek também diz que, depois de 12h de Pequim em 14 de setembro, todas as chamadas ao deepseek-v4-pro serão encaminhadas ao V4.1 Flash e cobradas pela tarifa do Flash, até o lançamento do V4.1 Pro. Na prática, o fornecedor está transformando o modelo barato no novo caminho padrão para boa parte da demanda."},{"h":"O que muda para empresas brasileiras","p":"Para uma pequena empresa, o ganho mais interessante é arquitetural. Um único endpoint pode analisar documento e imagem, chamar ferramentas e devolver respostas longas, reduzindo a necessidade de costurar um modelo de texto com um serviço visual separado. Isso serve para catálogo, suporte com anexos, conferência de criativos, leitura de contratos e agentes de código. O preço em dólar ajuda, mas não elimina a conta de câmbio, observabilidade, limites de concorrência e fallback. A migração segura é testar prompts reais antes de aceitar o roteamento automático do Pro, principalmente em tarefas que exigem visão e consistência ao longo de muitas rodadas."},{"h":"A leitura do MaxAssistant","p":"A história mudou de sinal forte para confirmado, e agora tem duas frentes: API barata e pesos abertos. A DeepSeek fez algo mais relevante que lançar um Flash rápido: colocou multimodalidade, ferramentas, compressão de memória e uma estratégia de substituição do Pro no mesmo pacote. Meu feeling é que a empresa está comprimindo a diferença entre as faixas da própria API para ganhar volume, não apenas perseguindo uma tabela de benchmark. Se os números se sustentarem fora do harness oficial, o V4.1 Flash pode ser uma opção muito competitiva para agentes de alto volume. Se não se sustentarem, o preço baixo será o único diferencial, e preço sozinho não salva uma automação que erra."},{"h":"Fontes","p":"DeepSeek, anúncio do V4.1 Flash: https://deepseek.com/news/deepseek-v4-1-flash | DeepSeek API Docs, Change Log: https://api-docs.deepseek.com/updates/ | DeepSeek API Docs, Models & Pricing: https://api-docs.deepseek.com/quick_start/pricing | Hugging Face, repositório oficial do modelo: https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash | ccleaks, cobertura independente do lançamento e dos pesos abertos: https://ccleaks.com/news/deepseek-v4-1-flash-open-weights-sep-2026 | TechNode, cobertura do beta limitado: https://technode.com/2026/09/09/deepseek-v4-1-flash-multimodal-limited-beta"}]
WA