Notícias

Lançamentos & Modelos

SINAL FORTE: código de três motores de inferência já roda o "qwen4_exp", pista real de que o Qwen4 sai do papel

Selo: SINAL FORTE. Um pull request aberto no vLLM, outro no SGLang e commits em dois projetos independentes de serving para Apple Silicon já tratam um identificador chamado qwen4_exp como arquitetura real, com kernels dedicados. Alibaba nunca anunciou data, preço ou especificação para o Qwen4, mas o rastro de engenharia é convergente e verificável em código público.

[{"h":"O rastro que ninguém anunciou mas todo mundo já está codando","p":"Selo editorial: SINAL FORTE. Enquanto a Alibaba mantém silêncio oficial sobre datas e especificações do Qwen4, times de infraestrutura de IA em pelo menos quatro projetos de código aberto já estão implementando suporte a um identificador de arquitetura chamado qwen4_exp. O pull request vllm-project/vllm#53909, intitulado simplesmente \"Add qwen4 fuse op\", está aberto desde o fim de agosto de 2026, vindo de um fork externo, sem contagem de parâmetros, model card ou data de lançamento anexados. Ele adiciona kernels Triton dedicados para três famílias de operadores: HyperConnection, Qwen Sparse Attention e operações de estado PLE."},{"h":"Não é um PR isolado, é um padrão repetido em engines concorrentes","p":"O que transforma essa pista de especulação em sinal forte é a convergência. Um dia depois, em 27 de agosto, um pull request no SGLang registrou suporte nativo ao mesmo identificador, com uma classe chamada Qwen4ExpForConditionalGeneration, construída a partir das mesmas peças arquiteturais: GatedResidual, Gated DeltaNet, Qwen Sparse Attention e PLE. O trabalho é creditado a um agente de codificação autônomo apelidado Argus e ainda não passou pela revisão de mantenedores, falhando testes de integração contínua. Paralelamente, dois projetos de serving para Apple Silicon, mlx-serve e mlx-vlm, mantidos por desenvolvedores sem relação direta com a Alibaba, já trazem em seus repositórios classes e caches específicos para qwen4_exp, incluindo um bug documentado sobre cache de prefixo que não estava restaurando corretamente o estado de modelos híbridos dessa família."},{"h":"A base real por trás do codinome: o Qwen3.8-Flash-Next já é confirmado como prévia","p":"Isso não nasce do nada. Em 26 de agosto, a própria Alibaba publicou, via conta oficial da equipe Qwen, o modelo Qwen3.8-Flash-Next e descreveu-o textualmente como uma prévia aberta da arquitetura do Qwen4, com 125 bilhões de parâmetros totais, 6 bilhões ativados por token e um esquema híbrido de Gated DeltaNet mais atenção esparsa. Esse ponto é fato confirmado, não vazamento: está no card oficial do Hugging Face e no anúncio da própria equipe. A dúvida que os PRs de engenharia respondem é diferente, eles mostram que motores de inferência já tratam um modelo Qwen4 completo, batizado com o sufixo Exp, como algo concreto o suficiente para justificar kernels dedicados, meses antes de qualquer anúncio de flagship."},{"h":"O ingrediente picante: um modelo misterioso testando em arena pública","p":"Soma-se a isso um fio mais especulativo. Desde 9 de agosto, rastreadores de modelos anônimos identificaram uma entrada chamada Kiana aparecendo em cerca de uma a cada cinco batalhas do Code Arena, plataforma de comparação cega de modelos. A conta que primeiro reportou o achado apostou que se trata de um modelo Qwen ainda não revelado, citando como precedente o caso Kaleb, outra entrada anônima na mesma arena que foi confirmada como Qwen3.8 Max no dia seguinte à detecção. Isso é rumor dentro do sinal maior: não há confirmação da Alibaba, não há model card e a atribuição é palpite de uma única conta, por mais que o histórico da arena favoreça a hipótese."},{"h":"O que ainda falta para virar notícia oficial","p":"Nenhum dos artefatos encontrados traz contagem de parâmetros do Qwen4 completo, preço, janela de contexto ou data de lançamento. Os PRs de vLLM e SGLang seguem sem merge, o que significa que continuam sujeitos a mudança ou abandono. A Alibaba não mencionou o nome Qwen4 em nenhum comunicado oficial até o fechamento desta matéria, e o precedente da própria empresa mostra que ela costuma anunciar prévias de arquitetura, como o Flash-Next, bem antes do modelo principal, o que pode significar tanto lançamento iminente quanto uma janela ainda longa de meses."},{"h":"O que muda na leitura do MaxAssistant","p":"O valor real aqui não é a data, é a direção. Alibaba já apostou publicamente numa arquitetura que prioriza inovação estrutural sobre simplesmente aumentar parâmetros, e o fato de motores de inferência de terceiros já estarem otimizando para o Qwen4 antes do anúncio oficial sugere que o modelo já circula em algum estágio de teste fechado com parceiros de infraestrutura. Quem depende de Qwen para produção deve acompanhar os PRs abertos como termômetro de proximidade, sem tratar isso como cronograma. O nome Kiana na Code Arena é a parte mais frágil da história e merece ser lida como fofoca de bastidor, não como confirmação."},{"h":"Fontes","p":"vLLM, pull request Add qwen4 fuse op: https://github.com/vllm-project/vllm/pull/53909 | OrcaRouter, Qwen 4 Leak: vLLM PRs Confirm Vision Input for the Flagship: https://www.orcarouter.ai/blog/qwen-4-leak-vllm-fuse-op | OrcaRouter, Kiana Qwen Mystery Model on Code Arena: https://www.orcarouter.ai/blog/kiana-qwen-mystery-model-leak | Qwen (@Alibaba_Qwen) no X, anúncio do Qwen3.8-Flash-Next: https://twitter.com/Alibaba_Qwen/status/1960383600000000000"}]
WA