Grok 4.6 llega con una ventana de contexto de 500.000 tokens y una apuesta por los agentes de larga duración

SpaceXAI lanzó Grok 4.6 el 12 de agosto, la última iteración de su familia de modelos insignia, orientada directamente al desarrollo de software y a los agentes de IA de larga duración. La compañía, creada después de que SpaceX absorbiera xAI en junio de 2026, presenta el lanzamiento como una respuesta a la creciente demanda de modelos capaces de sostener tareas complejas de varios pasos: investigar un tema, moverse por un código extenso o convertir una idea aproximada en una aplicación funcional.

El modelo mantiene la ventana de contexto de 500.000 tokens de su predecesor, Grok 4.5, con un corte de conocimiento del 1 de febrero de 2026. Acepta texto e imágenes y produce texto, con niveles de razonamiento configurables y un uso de herramientas que abarca llamadas a funciones, ejecución de código, búsqueda web y búsqueda en X. Los precios se mantienen en 2 dólares por cada millón de tokens de entrada y 6 dólares por cada millón de tokens de salida, con una variante más rápida al doble de precio.

SpaceXAI afirma que Grok 4.6 empata con GPT-5.6 Sol en el índice compuesto de inteligencia de Artificial Analysis, con 61 puntos para ambos frente a los 62 de Claude Fable 5 Max. Las pruebas independientes de Artificial Analysis llegan a un veredicto similar: un Elo de 1753 en su indicador GDPval-AA v2 de trabajo de conocimiento agéntico práctico, solo por detrás de Claude Opus 5 y lo bastante cerca de Claude Fable 5 y de Qwen3.8 Max como para quedar dentro del margen de error. El mismo análisis encontró que Grok 4.6 termina las tareas en unos 53 turnos y unos 0,5 mil millones de tokens de entrada de media, frente a los aproximadamente 103 turnos y los 2 mil millones de tokens de Claude Opus 5 con esfuerzo máximo, lo que le otorga una gran ventaja de coste en ejecuciones agénticas largas.

La tabla de resultados del propio proveedor muestra mejoras frente a Grok 4.5 en todas las pruebas, incluido un salto de 11,9 puntos en DeepSWE y de 10,3 puntos en Terminal-Bench, y primeros puestos en GDPVal-AA v2, en AA-Briefcase y en el benchmark legal Harvey LAB. En las medidas específicas de programación el panorama es más mixto: GPT-5.6 Sol Max sigue liderando DeepSWE v1.1 con un 73 por ciento y Terminal-Bench v3.0 con un 34,6 por ciento.

We're building an independent news platform focused on facts over headlines. Join us by supporting our work.

Help keep us independent

El entrenamiento siguió el patrón marcado por Grok 4.5 pero fue más allá: una ejecución suplementaria más larga con datos generados por el modelo y curados, un optimizador mejorado y trayectorias SFT regeneradas por el propio Grok 4.5 en razonamiento, STEM, ingeniería de software, entornos de agentes y trabajo de conocimiento, con las trazas problemáticas filtradas. El aprendizaje por refuerzo cubrió tareas agénticas de optimización de kernels, desarrollo web y diseño asistido por ordenador. La compañía afirma que las salvaguardas del modelo se calibraron a la par que las capacidades ampliadas y se probaron en la suite previa al despliegue más amplia de su historia.

La disponibilidad replica el despliegue de Grok 4.5: el modelo está disponible en Cursor y Grok Build, a través de la API de SpaceXAI y mediante socios como OpenRouter, Vercel y Cloudflare, con el doble de uso incluido en Cursor y Grok Build durante la semana de lanzamiento. El momento encaja con el rápido ritmo de SpaceXAI tras su salida a bolsa; la compañía, que cotiza como SPCX, ha convertido la programación y el trabajo agéntico en su terreno competitivo, y su adquisición del editor Cursor le dio acceso directo al mercado de desarrolladores y a sesiones de programación reales para los datos de entrenamiento.

Traducido por Alessandra

Fuentes: Introducing Grok 4.6 (SpaceXAI, Aug 2026); Introducing Grok 4.6 (Cursor, Aug 2026); Grok 4.6 (xAI Docs, Aug 2026); Grok 4.6 benchmarks and analysis (Artificial Analysis, Aug 2026); SpaceXAI releases Grok 4.6 (9to5Mac, Aug 2026)

Scroll to Top