écrits/blog/2026/08
Blog1 août 2026·6 min

DeepSeek V4 Flash 0731 : des agents Opus à 0,28 $

Le modèle économique de DeepSeek atteint 82,7 sur Terminal Bench à 0,14/0,28 $ le million. Ce que le rattrapage du bas de gamme change pour vos agents IA.

Le 31 juillet 2026, DeepSeek a publié DeepSeek-V4-Flash-0731 sur Hugging Face et fait passer l'API officielle V4-Flash en bêta publique. La fiche du modèle est directe sur ce qui a changé : rien au niveau architectural. Le même mélange d'experts creux de 284 milliards de paramètres. Les mêmes 13 milliards de paramètres actifs par token. La même fenêtre de contexte d'un million de tokens. Tout le bond provient d'un ré-entraînement post-hoc.

Et le bond n'est pas mince. Terminal Bench 2.1 est passé de 61,8 sur la version préliminaire à 82,7. DeepSWE est passé de 7,3 à 54,4. Cybergym a presque doublé, de 38,7 à 76,7.

Le prix, lui, est resté à 0,14 $ le million de tokens en entrée et 0,28 $ en sortie.

Cette combinaison — des scores agentiques proches d'Opus pour une fraction dérisoire des tarifs de pointe — est l'information réelle. Non parce que DeepSeek aurait gagné quelque chose, mais à cause de ce qu'elle implique sur l'endroit où se joue la compétition intéressante en 2026.

Les chiffres, avec la réserve d'abord

Les notes de version de DeepSeek portent un avertissement que la plupart des reprises ont omis : tous les chiffres de benchmark sont déclarés par l'éditeur, sur un harnais de test non publié. Lancez vos propres évaluations avant d'y router du trafic de production. Ceci posé, voici ce que l'éditeur annonce :

Benchmark0731PréliminaireÉvolution
Terminal Bench 2.182,761,8+34 %
NL2Repo54,239,4+38 %
Cybergym76,738,7+98 %
DeepSWE54,47,3+645 %
Toolathlon-Verified70,349,7+41 %

Pour situer : sur Terminal Bench 2.1, 0731 obtient 82,7 face aux 81,0 de GLM-5.2 et aux 85,0 de Claude Opus 4.8. Artificial Analysis le place à 50 sur son indice d'intelligence — troisième sur 101 modèles suivis, contre une médiane de 25 pour les modèles comparables.

La ligne DeepSWE mérite qu'on s'y arrête. Passer de 7,3 à 54,4 à classe de poids identique n'est pas un ajustement de réglage : cela signifie que la version préliminaire était de fait cassée sur les tâches d'ingénierie logicielle à long horizon, et que la passe de post-entraînement a réparé quelque chose de structurel dans la façon dont le modèle planifie et se rattrape. Un écart aussi large sur un seul benchmark est un signal de vérification, pas un signal de célébration.

Une réserve de plus, issue du passage d'Artificial Analysis : c'est un modèle de raisonnement, et un modèle bavard. Il a émis 210 millions de tokens de sortie sur l'évaluation de l'indice, contre une médiane de 100 millions. À 0,28 $ le million cela reste bon marché — mais votre coût réel par tâche est piloté par les tokens de sortie, pas par le prix affiché. Budgétez en conséquence.

Ce qui a réellement changé sous le capot

L'architecture est inchangée par rapport à la préliminaire, ce qui vaut la peine d'être rappelé pour qui envisage un déploiement :

  • 284 milliards de paramètres au total, environ 13 milliards actifs par token. Le routeur retient les 6 meilleurs parmi 256 experts routés par couche, plus un expert partagé.
  • Attention hybride — DeepSeek la décrit comme Compressed Sparse combinée à Heavily Compressed Attention, ce qui rend le contexte d'un million de tokens exploitable.
  • Précision mixte native — FP4 pour les experts MoE, FP8 pour les couches denses.
  • Licence MIT, dépôt ouvert sans barrière. Déploiement commercial, modification et fine-tuning autorisés sans accord séparé.
  • Sortie maximale : 384 000 tokens.

La licence MIT sur un dépôt non restreint est l'élément stratégiquement décisif. Pas de formulaire de demande, pas de clause d'usage acceptable, pas de négociation de licence. Pour une équipe à Tunis ou à Riyad qui évalue si elle peut légalement livrer un fine-tune dans un produit client, cela supprime le blocage le plus fréquent dans l'adoption des modèles à poids ouverts.

DeepSeek livre également DSpark, un module de décodage spéculatif, avec une génération par utilisateur annoncée 60 à 85 % plus rapide à débit équivalent. L'échantillonnage recommandé pour l'usage agentique est temperature = 1.0, top_p = 0.95 — des valeurs notablement hautes, qu'il vaut mieux respecter que baisser par réflexe, le post-entraînement ayant été calibré dessus.

L'API a plus changé que le modèle

La mise à jour la plus discrète : v4-flash prend désormais nativement en charge le format Responses API et a été adapté pour Codex. V4-Pro et les modèles web n'ont rien reçu.

C'est un positionnement délibéré. Plutôt que de demander aux développeurs de réécrire leur harnais autour d'une API à la forme DeepSeek, DeepSeek s'est adapté à la forme sur laquelle les équipes construisent déjà. Si votre boucle d'agent est écrite pour le format Responses, le coût de migration se réduit à une URL de base et une clé.

import OpenAI from "openai";
 
const client = new OpenAI({
  baseURL: "https://api.deepseek.com/v1",
  apiKey: process.env.DEEPSEEK_API_KEY,
});
 
const response = await client.responses.create({
  model: "deepseek-v4-flash-0731",
  input: "Audite ce dépôt à la recherche de promesses non gérées et ouvre une PR.",
  temperature: 1.0,
  top_p: 0.95,
});

La concurrence sur la bêta est plafonnée à 2 500 requêtes. Suffisant pour la plupart des flottes d'agents en production, contraignant si vous lancez de gros travaux d'évaluation par lots.

Le calcul tarifaire qui tranche vraiment

C'est ici que le tarif de cache prend tout son sens. Tarification officielle 0731 par million de tokens :

  • Entrée avec cache touché : 0,0028 $
  • Entrée sans cache : 0,14 $
  • Sortie : 0,28 $

Artificial Analysis le classe premier sur 101 modèles pour le tarif de cache. Cette remise de 98 % n'est pas un ornement marketing — pour les charges agentiques, c'est tout l'argument économique.

Prenons un agent de revue de code qui lit un contexte de dépôt de 200 000 tokens à chaque invocation et produit environ 4 000 tokens de revue. Lancé 500 fois par jour :

Sans cache de préfixe : 100 millions de tokens d'entrée à 0,14 $ = 14,00 $, plus 2 millions en sortie à 0,28 $ = 0,56 $. Soit environ 14,56 $/jour.

Avec cache de préfixe sur le contexte du dépôt : l'essentiel de cette entrée touche le cache à 0,0028 $ le million. La même charge retombe autour de 0,85 $/jour.

Même modèle, même sortie, un facteur d'environ 17 — décidé entièrement par le fait d'avoir structuré vos prompts pour que le contexte stable soit en tête et la partie variable en fin. C'est le changement au plus fort effet de levier que la plupart des équipes n'ont pas encore fait. Nous en détaillons les mécanismes dans notre guide sur l'optimisation des coûts d'API IA par mise en cache et routage de modèles.

Auto-hébergement : lisez les chiffres de mémoire avant de planifier

La licence MIT rend l'auto-hébergement légal. Elle ne le rend pas simple.

284 milliards de paramètres dans la précision mixte livrée représentent environ 140 Go de poids. Fortement quantifié, on reste à 70–80 Go. Les recommandations de DeepSeek situent une quantification 3 bits autour de 110 Go de mémoire, ou un nœud 4×GB300 en pleine précision.

Traduction : c'est du matériel serveur multi-GPU, pas une station de travail. L'enthousiasme qui circule sur X à propos d'un modèle « exécutable en local » n'est vrai que si votre définition du local inclut une baie. vLLM et SGLang prennent tous deux le modèle en charge avec le parallélisme d'experts et les noyaux d'attention hybride : le chemin logiciel est propre, le chemin capitalistique ne l'est pas.

Pour la plupart des équipes, la réponse honnête est : utilisez l'API, et gardez l'auto-hébergement comme levier de négociation et comme réponse sur la résidence des données. La licence MIT signifie que vous pouvez déménager si nécessaire, et cette optionnalité a de la valeur même inexercée. Si la souveraineté est le vrai moteur plutôt que le coût, notre article sur la souveraineté numérique et le cloud souverain en Afrique et au MENA traite cette décision correctement.

Pourquoi le segment économique est devenu la course intéressante

Le haut de gamme bouge encore — Opus 4.8 domine 0731 sur Terminal Bench, et GPT-5.6 vient de baisser fortement ses tarifs de sa propre initiative. Mais l'écart entre le meilleur modèle et un modèle cinquante fois moins cher s'est comprimé plus vite sur la dernière année que la frontière n'a progressé.

Pour qui construit des agents, cela change la forme du problème de conception. Quand le segment économique était réellement faible, l'architecture consistait à choisir le modèle le plus fort abordable et à minimiser les appels. Quand ce segment arrive à quelques points du haut de gamme sur votre tâche réelle, l'architecture devient une question de routage : un modèle capable et bon marché sur le chemin à fort volume, un modèle de pointe réservé à la petite fraction d'étapes qui en a vraiment besoin.

Une forme pratique qui fonctionne aujourd'hui :

  1. Évaluez sur votre tâche, pas la leur. Prenez 50 traces réelles de votre agent en production. Passez-les dans 0731 et dans votre modèle actuel. Comparez le taux de complétion et le coût total, pas les scores de benchmark.
  2. Routez par étape, pas par charge. Lectures de fichiers, exécutions de tests, corrections de lint et appels d'outils vont à Flash. Décisions architecturales et résolution d'exigences ambiguës remontent.
  3. Structurez les prompts pour le cache. Contexte stable d'abord, variable ensuite. Cela vaut plus que le choix du modèle.
  4. Gardez un repli. Une API en bêta a une fiabilité de bêta. Le repli multi-modèle n'est pas de la paranoïa à ce stade — voir résilience fournisseur et stratégie de repli multi-modèle.

Ce que cela change pour les équipes au MENA

Deux choses, précisément.

Le coût des tokens a été le plafond silencieux de l'adoption des agents dans la région. Un flux qui coûte 400 $/mois en inférence est une approbation facile à San Francisco et difficile à Tunis ou Casablanca. Des modèles dans cette bande de prix et de capacité font passer un ensemble significatif de projets d'automatisation de « intéressant, plus tard » à « finançable maintenant ».

Et la licence MIT supprime la conversation de conformité qui bloque habituellement l'adoption des poids ouverts dans les secteurs régulés. Banques, santé et clients du secteur public qui ne peuvent pas envoyer de données vers une API hébergée aux États-Unis disposent désormais d'un chemin qui n'exige pas d'accord fournisseur sur mesure — à condition que quelqu'un ait budgété le matériel.

Le résumé honnête

DeepSeek-V4-Flash-0731 est un point de contrôle ré-entraîné, avec des benchmarks déclarés par l'éditeur, une licence réellement permissive, une tarification de cache agressive et des exigences matérielles bien réelles si vous voulez l'exécuter vous-même. Ce n'est pas un modèle de pointe et il ne prétend pas l'être.

Ce qu'il est, en revanche, c'est une preuve solide que la question utile en 2026 n'est plus « quel modèle est le plus intelligent » mais « quel est le modèle le moins cher qui franchit la barre pour cette étape précise ». Lancez l'évaluation sur vos propres traces. La réponse pour votre charge sera plus instructive que n'importe quel classement.


Vous construisez des flux d'agents et voulez que le modèle de coût tienne en production ? Noqta accompagne les équipes en Tunisie et dans le Golfe pour concevoir des systèmes IA qui se livrent — et restent abordables à l'échelle.

Sources