Notícias

Lançamentos & Modelos

CONFIRMADO: xAI lança Grok 4.7 com foco em tarefas longas e preço de US$ 2 por milhão de tokens

A xAI anunciou o Grok 4.7 em 21 de setembro, com base maior, treinamento por reforço mais longo e foco em programação e trabalho de conhecimento. Avaliações independentes divulgadas em seguida colocam o modelo no meio da tabela do Artificial Analysis Intelligence Index, atrás de Claude Fable 5.1 e GPT-6 em benchmarks de codificação agentiva como o Terminal-Bench.

[{"h":"CONFIRMADO: a xAI finalmente colocou o Grok 4.7 no mercado","p":"A xAI anunciou o Grok 4.7 em 21 de setembro, encerrando um ciclo de promessas, prazos perdidos e sinais de infraestrutura que mantinha o modelo no campo da especulação. O lançamento descreve um sistema voltado a programação e trabalho de conhecimento, com uma base maior que a do Grok 4.6, treinamento por reforço mais longo e mais atenção a tarefas que podem durar horas. A mudança central não é apenas uma nova versão. É a tentativa da xAI de transformar persistência e verificação em vantagem comercial."},{"h":"O que muda para quem usa IA no trabalho","p":"Segundo a xAI, o Grok 4.7 foi treinado para sustentar contextos longos, revisar melhor o próprio trabalho e lidar com problemas que exigem várias etapas. A empresa também afirma que ele melhora na criação de documentos e apresentações, além de tarefas profissionais avaliadas em benchmarks como GDPval e AA Briefcase. Isso interessa mais a equipes que precisam sair de uma conversa com um artefato utilizável do que a quem busca apenas respostas rápidas."},{"h":"Preço agressivo, mas não confunda vitrine com custo total","p":"A xAI anuncia preço inicial de US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de tokens de saída, mais uma variante rápida com o dobro da velocidade pelo dobro do preço. É competitivo para agentes com muito texto, mas o custo real depende do tamanho do contexto, dos reintentos, das ferramentas chamadas e do volume de saída durante verificações."},{"h":"O contraponto que agora tem número","p":"A dúvida que ficou em aberto no lançamento, se as promessas de persistência e verificação se traduziriam em desempenho real, já tem resposta parcial. No Artificial Analysis Intelligence Index, que combina dez benchmarks, o Grok 4.7 marcou 46 pontos e ficou no meio da tabela, atrás de Claude Fable 5.1 e GPT-6, que empataram em 53. A diferença cresce em programação agentiva: no Terminal-Bench 4.0, o Grok 4.7 chegou a apenas 26% em uma medição independente, contra 60% do GPT-6 Astra e 55% do Claude Fable 5.1. Até o DeepSeek V4.1 Flash, mais barato, superou o Grok 4.7 nesse teste. Benchmarks divulgados pela própria xAI, como o CursorBench 4.0 e o AA Briefcase, mostram ganhos reais sobre o Grok 4.6 e desempenho competitivo em tarefas de escritório, então não é história de fracasso generalizado, mas de um modelo que compete bem em preço e em tarefas de escritório e perde terreno justamente na frente que a xAI escolheu destacar: codificação agentiva de longa duração."},{"h":"Nossa leitura","p":"O Grok 4.7 confirma a tese de preço agressivo da xAI, mas a promessa central do lançamento, trabalhar por mais tempo sem desistir cedo em tarefas de programação, ainda não se sustenta nos números independentes divulgados até agora. Para pequenas e médias empresas brasileiras avaliando agentes de código, o Grok 4.7 pode valer a pena pelo custo em tarefas de escritório e documentos, mas ainda perde para Claude e GPT-6 em benchmarks de terminal e engenharia de software real. Continua valendo testar, mas com expectativa calibrada pelo preço, não pela liderança técnica."},{"h":"Fontes","p":"xAI, anúncio oficial do Grok 4.7: https://x.ai/news/grok-4-7\\nThe Decoder, benchmark independente do Artificial Analysis Intelligence Index: https://the-decoder.com/xai-launches-grok-4-7-at-bargain-prices-but-benchmarks-reveal-a-wide-gap-to-claude-and-gpt-6/\\nxAI, documentação pública de modelos: https://docs.x.ai/docs/models"}]
WA