écrits/news/2026/07
News24 juil. 2026·6 min

OpenAI lance ChatGPT Voice sur ordinateur et permet de piloter les agents Codex à la voix

OpenAI a lancé ChatGPT Voice dans ses applications de bureau macOS et Windows le 23 juillet 2026. Propulsée par le modèle full duplex GPT-Live, la fonctionnalité permet de contrôler son ordinateur et de diriger plusieurs agents actifs dans ChatGPT Work ou Codex à la seule voix.

OpenAI a lancé ChatGPT Voice dans ses applications de bureau Mac et Windows le 23 juillet 2026, étendant le modèle full duplex GPT-Live des téléphones aux machines sur lesquelles les utilisateurs travaillent réellement. La fonctionnalité permet de contrôler son ordinateur et de diriger plusieurs agents actifs dans ChatGPT Work ou Codex sans toucher au clavier, avec un déploiement mondial entamé le jour même pour les abonnés Plus, Pro, Business, Edu et Enterprise.

"ChatGPT Voice est désormais dans l'application de bureau", indique OpenAI dans son annonce. "Contrôlez votre ordinateur et dirigez plusieurs agents actifs dans ChatGPT Work ou Codex, uniquement avec votre voix. La fonctionnalité repose sur GPT-Live, qui peut donc parler, écouter et coordonner le travail dans l'application en même temps."

Points clés

  • ChatGPT Voice est arrivé sur les applications de bureau macOS et Windows le 23 juillet 2026, avec un déploiement mondial le jour même.
  • La fonctionnalité s'appuie sur GPT-Live, le modèle vocal full duplex livré sur mobile et sur le web le 8 juillet, qui écoute et parle simultanément au lieu d'attendre la fin d'un tour de parole.
  • La voix fonctionne sur les trois surfaces de l'application — Chat, ChatGPT Work et Codex — de sorte qu'une instruction orale peut créer, surveiller et réorienter des agents de code exécutés en arrière-plan.
  • Sur macOS, une permission optionnelle de contexte d'écran autorise ChatGPT à capturer des appshots de la fenêtre active et à s'en servir comme contexte de conversation.
  • L'accès est ouvert aux offres Plus, Pro, Business, Edu et Enterprise, les comptes Enterprise et Edu bénéficiant de deux semaines d'accès anticipé.

Détails

La base technique est GPT-Live, le modèle présenté par OpenAI au début du mois de juillet. Contrairement aux assistants vocaux classiques qui transcrivent, réfléchissent puis parlent de façon séquentielle, GPT-Live fonctionne en full duplex : il parle tout en écoutant, gère les interruptions en milieu de phrase et délègue les raisonnements plus lourds ou les recherches web à un modèle de pointe distinct exécuté en arrière-plan. C'est cette dernière propriété qui fait de la version bureau bien plus qu'un raccourci de dictée : le fil vocal reste réactif pendant que les tâches lourdes s'exécutent ailleurs.

Dans l'application, cela se traduit par une délégation de tâches. Une demande orale peut ouvrir un fil distinct pour une tâche, puis la même conversation peut vérifier l'avancement de ce fil et lui envoyer des instructions complémentaires sans que l'utilisateur change de fenêtre. Un raccourci clavier configurable, disponible dans Réglages puis Voice, permet d'appeler ChatGPT Voice depuis n'importe quelle autre application, à défaut du bouton Voice intégré.

Les utilisateurs de Mac disposent d'une capacité supplémentaire. Avec le contexte d'écran activé, ChatGPT capture des appshots de la fenêtre au premier plan et les intègre à la conversation : demander des précisions sur "cette erreur" ou "ce design" renvoie alors à ce qui est réellement affiché. Windows n'a pas encore d'équivalent.

OpenAI a documenté des limites concrètes en parallèle du lancement. L'usage vocal est mesuré par fenêtres glissantes de cinq heures et puise dans un quota distinct de la consommation Codex standard. Une seule conversation vocale peut être active à la fois dans l'application. Les permissions sont héritées de l'environnement dans lequel la conversation opère : une session vocale dans Codex dispose exactement des accès dont ce fil disposait déjà, pas davantage.

Impact

Pour les développeurs, il s'agit de la couche d'entrée manquante d'une pile qu'OpenAI assemble depuis plusieurs mois. L'entreprise a fusionné Codex dans ChatGPT le 9 juillet pour créer ChatGPT Work ; Codex comptait environ 5 millions d'utilisateurs hebdomadaires au moment de la fusion et en revendique désormais près de 10 millions. Le pilotage vocal transforme une flotte d'agents de code exécutés en arrière-plan en quelque chose qui se supervise par la conversation plutôt qu'en enchaînant les onglets.

Les premiers utilisateurs sur X décrivent exactement ce basculement. Le développeur Jonathan Roomer note que cette sortie ne fonctionne que parce que plusieurs briques antérieures ont mûri ensemble : "L'utilisation de l'ordinateur devait devenir beaucoup plus rapide. Codex devait pouvoir créer, surveiller et intervenir dans d'autres fils. La voix devait devenir assez naturelle pour tenir une véritable conversation." Un autre utilisateur raconte avoir décrit un bug à l'oral et vu le système retrouver le ticket GitHub, reproduire le défaut, livrer un correctif avec couverture de non-régression et ouvrir une pull request.

Le positionnement concurrentiel est direct. Codex est la réponse d'OpenAI à Claude Code d'Anthropic, et l'orchestration d'agents à la voix est un différenciateur qu'aucun rival n'avait livré sur ordinateur. Le lancement intervient également huit jours après l'annonce par xAI de ses propres travaux en voix full duplex, avec une asymétrie notable : xAI commercialise auprès des développeurs un Voice Agent Builder sans code à environ cinq centimes la minute d'audio, tandis que GPT-Live reste enfermé dans ChatGPT, sans API publique.

La suite

La question ouverte la plus évidente est de savoir si OpenAI exposera GPT-Live via son API. Tant que ce ne sera pas le cas, la qualité du modèle restera une démonstration plutôt qu'une brique de construction, et les équipes souhaitant intégrer de la voix full duplex à leurs propres produits continueront de chercher ailleurs. Restent également en suspens la question d'un équivalent des appshots sous Windows, et celle de la tenue des fenêtres d'usage de cinq heures pour des développeurs qui laissent une session vocale ouverte toute une journée de travail.


Source : OpenAI