écrits/news/2026/08
News1 août 2026·6 min

OpenAI baisse les tarifs de l'API GPT-5.6 jusqu'à 80% sous la pression des modèles ouverts

OpenAI a réduit de 80% le tarif API de GPT-5.6 Luna et de 20% celui de Terra le 30 juillet, faisant tomber Luna à 0,20 dollar par million de tokens d'entrée. La décision intervient alors que DeepSeek V4, Kimi K3 et GLM-5.2 cassent les prix sur les charges à fort volume.

OpenAI a réduit de 80% le tarif API de GPT-5.6 Luna et de 20% celui de GPT-5.6 Terra le 30 juillet 2026. Le modèle de milieu de gamme passe ainsi de 1,00 à 0,20 dollar par million de tokens d'entrée, et de 6,00 à 1,20 dollar par million de tokens de sortie. Les changements se sont appliqués immédiatement à tous les comptes API sans migration, tandis que le modèle phare GPT-5.6 Sol reste inchangé à 5,00 dollars en entrée et 30,00 dollars en sortie.

L'entreprise présente cette baisse comme un dividende d'efficacité plutôt qu'une remise commerciale, invoquant des "améliorations internes d'efficacité à travers les couches du modèle et les systèmes d'inférence" qui permettent d'accomplir davantage de travail à ressources de calcul constantes. L'objectif affiché, selon les termes d'OpenAI, est de "repousser la frontière prix-performance et de rendre l'IA avancée plus économique pour un éventail plus large de charges de travail d'entreprise".

Points clés

  • GPT-5.6 Luna : de 1,00 à 0,20 dollar par million de tokens d'entrée ; de 6,00 à 1,20 dollar en sortie — une baisse de 80%.
  • GPT-5.6 Terra : de 2,50 à 2,00 dollars en entrée ; de 15,00 à 12,00 dollars en sortie — une baisse de 20%.
  • GPT-5.6 Sol : inchangé à 5,00 dollars en entrée et 30,00 dollars en sortie.
  • Le mode Fast remplace le Priority Processing dans l'API. Sur Sol, il offre des réponses jusqu'à 2,5 fois plus rapides au double du tarif standard par token.
  • Les abonnements ChatGPT et Codex conservent leurs prix et leurs quotas, mais Luna et Terra consomment désormais moins de crédits : la même enveloppe hebdomadaire couvre plus de requêtes.

Détails

C'est l'asymétrie de la baisse qui fait l'information. OpenAI n'a pas réduit ses tarifs de façon uniforme : l'entreprise a repositionné un palier précis. Luna revient dans la bande tarifaire qu'occupaient les générations de modèles précédentes, tandis que Sol reçoit une option de vitesse premium au lieu d'une remise. L'écart entre le palier de production économique et le palier frontière est désormais plus large qu'OpenAI ne l'avait jamais maintenu.

Un détail compte pour quiconque exécute des tâches à contexte long : lorsqu'une requête unique dépasse 272 000 tokens, Luna double son tarif d'entrée et applique un multiplicateur de 1,5 sur les frais de sortie. Cette surcharge modifie sensiblement le calcul au sommet de la fenêtre de contexte, et elle est facile à manquer quand on modélise les coûts à partir du seul tarif affiché.

Impact

Pour les équipes qui livrent déjà sur l'API d'OpenAI, l'effet immédiat est que des charges de travail jugées trop coûteuses deviennent viables. "Pour les DSI, l'impact principal sera d'élargir l'adoption de l'IA plutôt que de simplement réduire les coûts", estime Pareekh Jain, de Pareekh Consulting, qui anticipe une poursuite de la baisse des coûts d'inférence à mesure que les nouvelles puces, les logiciels d'inférence et les architectures de modèles gagnent en efficacité.

Chandrika Dutt, d'Avasant, s'attend à ce que les équipes réinvestissent les économies plutôt que de les conserver, en construisant "des flux de travail agentiques de plus en plus sophistiqués, jusqu'ici difficiles à justifier économiquement". C'est le paradoxe de Jevons appliqué aux tokens : des unités moins chères tendent à élargir la consommation plutôt qu'à réduire les budgets. Le conseil des deux analystes converge — garder une architecture indépendante du fournisseur et traiter le FinOps de l'IA comme une discipline permanente, car le plancher tarifaire bouge encore.

Contexte

La pression vient des modèles à poids ouverts. DeepSeek V4 Flash passe entièrement sous le nouveau tarif de Luna, à 0,14 dollar en entrée et 0,28 dollar en sortie. DeepSeek V4 Pro, lui, alterne l'avantage avec Luna selon le rapport entrée-sortie : pour les traitements riches en entrée sous 272 000 tokens, Luna l'emporte, mais à volumes d'entrée et de sortie égaux, une tâche représentative coûte 1,40 dollar sur Luna contre 1,305 dollar sur V4 Pro.

L'écart se creuse nettement sur les invites très longues. Une requête d'entrée de 900 000 tokens revient à environ 0,54 dollar sur Luna une fois la surcharge de contexte long appliquée, contre environ 0,154 dollar sur DeepSeek V4 Flash — soit l'inversion exacte de l'avantage que la nouvelle grille était censée établir.

C'est là l'argument structurel expliquant cette baisse. Les sorties de modèles ouverts — DeepSeek V4, Kimi K3 de Moonshot, GLM-5.2 de Zhipu — ont banalisé une stratégie en deux temps : prototyper sur une API commerciale, puis basculer la charge de production à fort volume sur une infrastructure auto-hébergée. Chaque baisse de prix côté propriétaire vise à rendre cette seconde étape moins attrayante.

À titre de comparaison, Claude Fable 5 d'Anthropic est affiché à 10 dollars par million de tokens d'entrée et 50 dollars par million de tokens de sortie — un ordre de grandeur au-dessus du nouveau tarif de Luna, signe que le palier frontière et le palier de volume sont désormais tarifés comme deux produits réellement distincts, et non comme deux points d'une même courbe.

La suite

OpenAI a par ailleurs ouvert le 29 juillet le programme ChatGPT for Academic Researchers, étendant l'accès gratuit à ses modèles les plus performants — dont GPT-5.6 Sol Pro — à 100 000 scientifiques, mathématiciens et ingénieurs. Le déploiement démarre avec 10 000 participants et s'élargira jusqu'en 2027, réservé aux universités reconnues, délivrant des diplômes et à forte activité de recherche.

Reste la question ouverte : ces baisses tiendront-elles ? Les analystes interrogés par InfoWorld les jugent globalement soutenables, au motif que les gains d'efficacité matériels et logiciels continueront de faire baisser le coût par token. L'argument inverse, développé dans Forbes, veut qu'une guerre des prix entre fournisseurs de modèles fondamentaux ressemble à la phase précoce de consolidation d'une industrie d'infrastructure — le même schéma qui a concentré la fabrication de puces et le cloud entre quelques acteurs. Dans les deux cas, les équipes qui budgètent leurs dépenses d'IA pour les deux prochains trimestres devraient considérer la grille tarifaire actuelle comme provisoire.


Source : OpenAI