Noticias

Lanzamientos y Modelos

CONFIRMADO: xAI lanza Grok 4.7 para tareas largas a US$ 2 por millón de tokens de entrada

xAI anunció Grok 4.7 el 21 de septiembre, con una base mayor, entrenamiento por refuerzo más largo y foco en programación y trabajo de conocimiento. Evaluaciones independientes publicadas después ubican al modelo en la mitad de la tabla del Artificial Analysis Intelligence Index, detrás de Claude Fable 5.1 y GPT-6 en benchmarks de codificación agéntica como Terminal-Bench.

[{"h":"CONFIRMADO: xAI finalmente pone Grok 4.7 en el mercado","p":"xAI anunció Grok 4.7 el 21 de septiembre, cerrando un ciclo de promesas, plazos incumplidos y señales de infraestructura que mantenían al modelo en el terreno de la especulación. El lanzamiento presenta un sistema orientado a programación y trabajo de conocimiento, con una base mayor que Grok 4.6, un entrenamiento por refuerzo más largo y mayor atención a tareas que pueden durar horas. El cambio central no es solo una nueva versión. Es el intento de xAI de convertir la persistencia y la verificación en una ventaja comercial."},{"h":"Qué cambia para quienes usan IA en el trabajo","p":"Según xAI, Grok 4.7 fue entrenado para sostener contextos largos, revisar mejor su propio trabajo y resolver problemas que exigen varios pasos. La empresa también afirma que mejora en la creación de documentos y presentaciones, además de tareas profesionales evaluadas con benchmarks como GDPval y AA Briefcase. Esto importa más a equipos que necesitan salir de una conversación con un artefacto utilizable que a quienes buscan solo respuestas rápidas."},{"h":"Precio agresivo, pero no confundas la vitrina con el costo total","p":"xAI anuncia un precio inicial de US$ 2 por millón de tokens de entrada y US$ 6 por millón de tokens de salida, más una variante rápida al doble de velocidad por el doble de precio. Es competitivo para agentes con mucho texto, pero el costo real depende del tamaño del contexto, los reintentos, las herramientas llamadas y el volumen de salida durante las verificaciones."},{"h":"El contrapunto ahora tiene números","p":"La duda que quedó abierta en el lanzamiento, si las promesas de persistencia y verificación se traducirían en desempeño real, ya tiene una respuesta parcial. En el Artificial Analysis Intelligence Index, que combina diez benchmarks, Grok 4.7 marcó 46 puntos y quedó en la mitad de la tabla, detrás de Claude Fable 5.1 y GPT-6, empatados en 53. La brecha crece en programación agéntica: en el Terminal-Bench 4.0, una medición independiente ubicó a Grok 4.7 en apenas 26%, frente a 60% de GPT-6 Astra y 55% de Claude Fable 5.1. Incluso el más barato DeepSeek V4.1 Flash lo superó en esa prueba. Los benchmarks publicados por la propia xAI, como CursorBench 4.0 y AA Briefcase, sí muestran ganancias reales sobre Grok 4.6 y resultados competitivos en tareas de oficina, así que no se trata de un fracaso generalizado, sino de un modelo que compite bien en precio y trabajo de oficina, pero pierde terreno justo en el frente que xAI eligió destacar: programación agéntica de larga duración."},{"h":"Nuestra lectura","p":"Grok 4.7 confirma la tesis de precio agresivo de xAI, pero la promesa central del lanzamiento, trabajar más tiempo sin abandonar temprano en tareas de programación, todavía no se sostiene en los números independientes publicados hasta ahora. Para pequeñas y medianas empresas brasileñas que evalúan agentes de código, Grok 4.7 puede valer la pena por el costo en tareas de oficina y documentos, pero sigue perdiendo frente a Claude y GPT-6 en benchmarks de terminal e ingeniería de software real. Vale la pena probarlo, con expectativas calibradas por el precio, no por el liderazgo técnico."},{"h":"Fuentes","p":"xAI, anuncio oficial de Grok 4.7: https://x.ai/news/grok-4-7\\nThe Decoder, benchmark independiente del Artificial Analysis Intelligence Index: https://the-decoder.com/xai-launches-grok-4-7-at-bargain-prices-but-benchmarks-reveal-a-wide-gap-to-claude-and-gpt-6/\\nxAI, documentación pública de modelos: https://docs.x.ai/docs/models"}]
WA