
SpaceXAI lanzó Grok 4.6 el 12 de agosto, la última iteración de su familia de modelos insignia, orientada directamente al desarrollo de software y a los agentes de IA de larga duración. La compañía, creada después de que SpaceX absorbiera xAI en junio de 2026, presenta el lanzamiento como una respuesta a la creciente demanda de modelos capaces de sostener tareas complejas de varios pasos: investigar un tema, moverse por un código extenso o convertir una idea aproximada en una aplicación funcional.
El modelo mantiene la ventana de contexto de 500.000 tokens de su predecesor, Grok 4.5, con un corte de conocimiento del 1 de febrero de 2026. Acepta texto e imágenes y produce texto, con niveles de razonamiento configurables y un uso de herramientas que abarca llamadas a funciones, ejecución de código, búsqueda web y búsqueda en X. Los precios se mantienen en 2 dólares por cada millón de tokens de entrada y 6 dólares por cada millón de tokens de salida, con una variante más rápida al doble de precio.
SpaceXAI afirma que Grok 4.6 empata con GPT-5.6 Sol en el índice compuesto de inteligencia de Artificial Analysis, con 61 puntos para ambos frente a los 62 de Claude Fable 5 Max. Las pruebas independientes de Artificial Analysis llegan a un veredicto similar: un Elo de 1753 en su indicador GDPval-AA v2 de trabajo de conocimiento agéntico práctico, solo por detrás de Claude Opus 5 y lo bastante cerca de Claude Fable 5 y de Qwen3.8 Max como para quedar dentro del margen de error. El mismo análisis encontró que Grok 4.6 termina las tareas en unos 53 turnos y unos 0,5 mil millones de tokens de entrada de media, frente a los aproximadamente 103 turnos y los 2 mil millones de tokens de Claude Opus 5 con esfuerzo máximo, lo que le otorga una gran ventaja de coste en ejecuciones agénticas largas.
La tabla de resultados del propio proveedor muestra mejoras frente a Grok 4.5 en todas las pruebas, incluido un salto de 11,9 puntos en DeepSWE y de 10,3 puntos en Terminal-Bench, y primeros puestos en GDPVal-AA v2, en AA-Briefcase y en el benchmark legal Harvey LAB. En las medidas específicas de programación el panorama es más mixto: GPT-5.6 Sol Max sigue liderando DeepSWE v1.1 con un 73 por ciento y Terminal-Bench v3.0 con un 34,6 por ciento.
El entrenamiento siguió el patrón marcado por Grok 4.5 pero fue más allá: una ejecución suplementaria más larga con datos generados por el modelo y curados, un optimizador mejorado y trayectorias SFT regeneradas por el propio Grok 4.5 en razonamiento, STEM, ingeniería de software, entornos de agentes y trabajo de conocimiento, con las trazas problemáticas filtradas. El aprendizaje por refuerzo cubrió tareas agénticas de optimización de kernels, desarrollo web y diseño asistido por ordenador. La compañía afirma que las salvaguardas del modelo se calibraron a la par que las capacidades ampliadas y se probaron en la suite previa al despliegue más amplia de su historia.
La disponibilidad replica el despliegue de Grok 4.5: el modelo está disponible en Cursor y Grok Build, a través de la API de SpaceXAI y mediante socios como OpenRouter, Vercel y Cloudflare, con el doble de uso incluido en Cursor y Grok Build durante la semana de lanzamiento. El momento encaja con el rápido ritmo de SpaceXAI tras su salida a bolsa; la compañía, que cotiza como SPCX, ha convertido la programación y el trabajo agéntico en su terreno competitivo, y su adquisición del editor Cursor le dio acceso directo al mercado de desarrolladores y a sesiones de programación reales para los datos de entrenamiento.
Traducido por Alessandra
Fuentes: Introducing Grok 4.6 (SpaceXAI, Aug 2026); Introducing Grok 4.6 (Cursor, Aug 2026); Grok 4.6 (xAI Docs, Aug 2026); Grok 4.6 benchmarks and analysis (Artificial Analysis, Aug 2026); SpaceXAI releases Grok 4.6 (9to5Mac, Aug 2026)

