
Imagen para ayudar a comprender el artículo
xAI presentó Grok 4.7 el 21 de septiembre de 2026, hora local, como una actualización orientada especialmente a tareas de programación y agentes de inteligencia artificial. La compañía asegura que el modelo supera a Grok 4.6 en varias evaluaciones, aunque los análisis independientes muestran diferencias relevantes según la prueba y la configuración utilizada.
Texto e imágenes como entrada
El modelo, identificado en la documentación como grok-4.7, dispone de una ventana de contexto de 500.000 tokens. Puede procesar texto e imágenes, pero genera únicamente respuestas en formato de texto.
Los usuarios pueden seleccionar cuatro niveles de esfuerzo de razonamiento: low, medium, high y xhigh. La configuración predeterminada es high. Grok 4.7 está disponible en Cursor y Grok Build, además de la API de Grok, herramientas externas de programación, sistemas de enrutamiento de modelos y plataformas en la nube.
La tarifa estándar es de 2 dólares por cada millón de tokens de entrada y 6 dólares por cada millón de tokens de salida. xAI también ofrece una variante Fast, que promete duplicar la velocidad de generación y cuesta el doble: 4 dólares por millón de tokens de entrada y 12 dólares por millón de salida. En Cursor, el tramo Fast que supera los 256.000 tokens asciende a 6 y 18 dólares, respectivamente.
Mejoras frente a Grok 4.6
Según las cifras publicadas por xAI, Grok 4.7 obtuvo un 46,3% en CursorBench 4.0, un 64,0% en EEBench, 1.657 puntos en AA Briefcase v1.1, un 37,6% en Terminal-Bench 4.0 y un 19,6% en Harvey Legal Agent. Grok 4.6 había registrado, en el mismo orden, un 40,4%, un 53,0%, 1.546 puntos, un 20,3% y un 15,8%.
La comparación no sitúa al nuevo modelo por delante en todos los apartados. En la tabla de xAI, Fable 5.1 superó a Grok 4.7 en CursorBench, AA Briefcase y Terminal-Bench, mientras que quedó por debajo en EEBench y Harvey Legal Agent.
En DeepSWE v1.1 con esfuerzo high, Grok 4.7 alcanzó un 71,0%, por encima del 65,2% de Grok 4.6 y del 70,0% de Fable 5.1, pero detrás del 72,7% de GPT-5.6 Sol. En HealthBench Professional obtuvo un 56,7%, frente al 60,5% de GPT-5.6 Sol y el 62,1% de Fable 5.1.
Las pruebas independientes matizan los resultados
Artificial Analysis concedió a Grok 4.7, bajo la configuración xhigh, 46 puntos en su Intelligence Index, lo que lo ubicó en el puesto 21 entre 212 modelos. La entidad midió una velocidad de salida de 39,2 tokens por segundo, inferior a la mediana de 71 tokens por segundo de los sistemas comparados, y una espera de 0,87 segundos hasta la aparición del primer token.
El evaluador confirmó precios de 2 dólares por millón de tokens de entrada y 6 dólares por millón de salida, con un descuento de caché del 75%. El costo ponderado por tarea de su Intelligence Index fue de 3,74 dólares. VentureBeat, al citar estos datos, señaló que Grok 4.7 utilizó 81.000 tokens de salida por tarea en xhigh, un 196% más que GPT-6 Astra, y resultó más caro por tarea que GPT-5.6 Sol, cuyo costo fue de 1,99 dólares.
Vals AI situó al modelo en el décimo lugar entre 59 sistemas, con un Vals Index del 60,22% y un costo de 11,92 dólares por prueba. Grok 4.6 obtuvo un 59,17% y Grok 4.5, un 51,53%. Grok 4.7 también quedó cuarto en MedScribe, con un 89,38%; cuarto en Terminal-Bench 4.0, con un 28,28%; y quinto en Vibe Code Bench, con un 86,17%. Sus resultados fueron comparativamente más débiles en ProofBench y SAGE.
Diferencias en Terminal-Bench
Terminal-Bench 4.0 muestra hasta qué punto una misma referencia puede arrojar resultados distintos dependiendo de la metodología y el nivel de esfuerzo. xAI informó un 37,6%, mientras que Vals AI registró un 28,28%. VentureBeat publicó cifras del 38,0% y del 26% bajo xhigh, y señaló que GPT-6 Astra alcanzó un 59,6% en esa última condición. The Decoder, por su parte, reportó un 26% para Grok 4.7, un 60% para GPT-6 Astra y un 55% para Claude Fable 5.1.
Despliegue en GitHub Copilot
GitHub comenzó a distribuir Grok 4.7 de manera gradual entre los suscriptores de Copilot Pro, Pro+, Max, Business y Enterprise. El despliegue comprende VS Code, Visual Studio, Copilot CLI, los agentes en la nube de GitHub, JetBrains, Xcode y Eclipse.
Comentarios
Publicar un comentario