Le modèle économique de DeepSeek devance son fleuron sur les benchmarks d’agents après une mise à jour limitée à l’entraînement

Le 31 juillet, DeepSeek a discrètement transformé son modèle économique en leader des benchmarks agents, en publiant un nouveau checkpoint V4-Flash-0731 sur Hugging Face et en faisant passer l’API V4-Flash en bêta publique le même jour. L’architecture n’a pas été touchée, tous les gains proviennent d’un cycle de post-entraînement, et pourtant le petit modèle bat désormais le fleuron Pro de l’entreprise sur tous les benchmarks agents publiés par DeepSeek.

Les principaux résultats montrent un bond spectaculaire par rapport à la version d’aperçu. Sur Terminal Bench 2.1, la mesure utilisée par les développeurs pour les tâches de codage agentique, V4-Flash-0731 obtient 82,7, contre 61,8 pour l’aperçu et devant les 72,1 de V4-Pro. Sur DeepSWE, un benchmark de génie logiciel, le modèle est passé de 7,3 à 54,4 en une seule mise à jour. Cybergym, qui teste les performances des agents de sécurité, est passé de 38,7 à 76,7. L’amélioration semble ciblée : le même cycle de post-entraînement laisse le modèle globalement compétitif face à GLM-5.2 et Opus-4.8 d’Anthropic sur plusieurs tests agentiques, tout en restant bien plus léger à l’inférence.

Ces gains s’accompagnent de réserves. Les chiffres des benchmarks sont autodéclarés par le fournisseur et ont été produits avec le mode minimal du framework interne Harness de DeepSeek, qui n’a pas été publié, ce qui signifie qu’une évaluation indépendante pourrait donner des résultats divergents. Deux ensembles de tests supplémentaires, DSBench-FullStack et DSBench-Hard, sont internes à DeepSeek. La documentation de l’entreprise signale que les scores des agents sont sensibles au harness utilisé.

C’est sur la tarification que cette sortie devient intéressante pour les développeurs. L’API facture 0,14 $ par million de tokens en entrée en cas d’échec du cache, 0,0028 $ par million en cas de succès du cache et 0,28 $ par million de tokens en sortie, soit environ un tiers du tarif de sortie de V4-Pro. Le modèle conserve l’architecture mixture-of-experts à 284 milliards de paramètres, avec 13 milliards de paramètres actifs par token, une fenêtre de contexte d’un million de tokens et jusqu’à 384 000 tokens de sortie à effort de raisonnement élevé. Le checkpoint est livré avec le module de décodage spéculatif DSpark de DeepSeek, qui, selon l’entreprise, offre une génération par utilisateur de 60 à 85 % plus rapide en service à débit équivalent.

Support independent reporting built on evidence, transparency, and scientific rigor.

Keep quality journalism alive

Le passage à la nouvelle version de l’API est volontairement sans friction : les développeurs qui quittent l’aperçu n’ont qu’à changer l’identifiant du modèle dans leur code client. La nouvelle version prend nativement en charge le format Responses API et est adaptée à Codex, ce qui la positionne pour les charges de travail agentiques et de codage que DeepSeek semble s’attendre à voir dominer le trafic. Les modèles V4-Pro de l’API et de l’application n’ont pas été mis à jour dans cette version.

Pour les équipes qui souhaitent éviter entièrement l’API hébergée, les poids sont sous licence MIT et sans restriction d’accès, ce qui permet un déploiement sur site. Cette voie n’est pas triviale : un service en pleine précision exige un cluster GB300 à quatre nœuds dans la configuration de référence vLLM de DeepSeek, tandis qu’une quantification agressive réduit les besoins à environ 110 Go de RAM et de VRAM combinées, avec la version 8 bits sans perte d’Unsloth à environ 162 Go et une version 3 bits à environ 103 Go.

Le signal stratégique, c’est l’échelle des modèles : DeepSeek oriente le trafic agentique et de codage du quotidien vers Flash pour un tiers du prix, tout en réservant ses charges de raisonnement les plus difficiles à Pro. Cette mise à jour offre aux startups et aux développeurs indépendants une capacité agentique proche de celle de son fleuron, pour une fraction du coût des modèles propriétaires équivalents.

Traduit par Lydie

Sources: DeepSeek Upgrades DeepSeek-V4-Flash-0731 with Major Agentic and Coding Gains (MarkTechPost, July 31, 2026); DeepSeek-V4-Flash-0731 model card (Hugging Face); DeepSeek puts V4-Flash API into public beta (TechNode, July 31, 2026); DeepSeek API pricing (DeepSeek)

Scroll to Top