El modelo económico de DeepSeek supera a su buque insignia en los benchmarks de agentes tras una actualización solo de entrenamiento

El 31 de julio, DeepSeek convirtió discretamente su modelo económico en líder de los benchmarks de agentes: publicó un nuevo checkpoint V4-Flash-0731 en Hugging Face y trasladó la API de V4-Flash a la beta pública ese mismo día. La arquitectura quedó intacta; todas las mejoras provienen de un ciclo de postentrenamiento, y aun así el modelo pequeño supera ahora al buque insignia Pro de la propia compañía en todos los benchmarks de agentes que DeepSeek ha publicado.

Los resultados principales muestran un salto notable respecto a la versión preliminar. En Terminal Bench 2.1, la prueba que usan los desarrolladores para tareas de codificación con agentes, V4-Flash-0731 obtiene 82,7, frente a los 61,8 de la versión preliminar y por delante de los 72,1 de V4-Pro. En DeepSWE, un benchmark de ingeniería de software, el modelo pasó de 7,3 a 54,4 en una sola actualización. Cybergym, que evalúa el rendimiento de los agentes de seguridad, subió de 38,7 a 76,7. La mejora parece selectiva: el mismo ciclo de postentrenamiento dejó al modelo ampliamente competitivo con GLM-5.2 y Opus-4.8 de Anthropic en varias pruebas de agentes, aunque en inferencia sigue siendo mucho más pequeño.

Esos avances conllevan salvedades. Las cifras de los benchmarks las reporta el propio proveedor y se obtuvieron con el modo mínimo del framework interno Harness de DeepSeek, que no se ha publicado, por lo que una evaluación independiente podría arrojar resultados divergentes. Dos conjuntos de pruebas adicionales, DSBench-FullStack y DSBench-Hard, son internos de DeepSeek. La propia documentación de la compañía advierte de que las puntuaciones de los agentes son sensibles al harness utilizado.

El precio es lo que hace interesante esta versión para los desarrolladores. La API cobra 0,14 dólares por millón de tokens de entrada cuando no hay acierto de caché, 0,0028 dólares por millón cuando lo hay y 0,28 dólares por millón de tokens de salida, aproximadamente un tercio de la tarifa de salida de V4-Pro. El modelo conserva el diseño de mezcla de expertos de 284.000 millones de parámetros, con 13.000 millones de parámetros activos por token, una ventana de contexto de 1 millón de tokens y hasta 384.000 tokens de salida con un esfuerzo de razonamiento alto. El checkpoint incluye el módulo de decodificación especulativa DSpark de DeepSeek, que según la compañía ofrece una generación por usuario entre un 60 y un 85 por ciento más rápida con un caudal de servicio equivalente.

Instead of chasing clicks, we focus on delivering reliable information. Your support helps us stay on that path.

Support independent reporting

La vía de actualización de la API es deliberadamente sencilla: los desarrolladores que pasen de la versión preliminar solo necesitan cambiar el identificador del modelo en el código de su cliente. La nueva versión admite de forma nativa el formato Responses API y está adaptada para Codex, lo que la posiciona para las cargas de trabajo de agentes y codificación que DeepSeek parece esperar que dominen el tráfico. La API de V4-Pro y los modelos de la aplicación no se actualizaron en esta versión.

Para los equipos que quieren evitar por completo la API alojada, los pesos tienen licencia MIT y acceso sin restricciones, lo que permite el despliegue local. Ese camino no es trivial: servir el modelo a precisión completa exige un clúster GB300 de cuatro nodos en la configuración de referencia vLLM de DeepSeek, mientras que una cuantización agresiva reduce los requisitos a unos 110 GB de RAM y VRAM combinadas, con la versión sin pérdidas de 8 bits de Unsloth en unos 162 GB y una versión de 3 bits en unos 103 GB.

La señal estratégica es la escalera de modelos: DeepSeek dirige el tráfico cotidiano de agentes y codificación hacia Flash por un tercio del precio, mientras reserva sus cargas de trabajo de razonamiento más difíciles para Pro. La actualización proporciona a las startups y a los desarrolladores independientes una capacidad de agentes cercana a la del buque insignia por una fracción del coste de los modelos propietarios equivalentes.

Traducido por Alessandra

Fuentes: DeepSeek Upgrades DeepSeek-V4-Flash-0731 with Major Agentic and Coding Gains (MarkTechPost, 31 de julio de 2026); DeepSeek-V4-Flash-0731 model card (Hugging Face); DeepSeek puts V4-Flash API into public beta (TechNode, 31 de julio de 2026); DeepSeek API pricing (DeepSeek)

Scroll to Top