écrits/blog/2026/07
Blog22 juil. 2026·6 min

Gemini 3.6 Flash dans Antigravity : guide du codage agentique

Gemini 3.6 Flash arrive dans Google Antigravity avec 17% de tokens en moins, des scores de codage renforcés et une base de connaissances arrêtée à mars 2026. Voici ce qui change pour les développeurs.

Le 21 juillet 2026, Google a livré Gemini 3.6 Flash et l'a immédiatement branché sur Antigravity, son IDE agent-first. Le message est court et sans ambiguïté : même vitesse Flash, codage nettement meilleur, prix sensiblement inférieur. Pour les équipes qui font tourner des agents longue durée contre des dépôts de production, c'est la première version qui rend Flash crédible comme défaut plutôt que comme repli.

Ce guide décortique ce qui a réellement été livré, comment les benchmarks se traduisent en comportement d'agent au quotidien, et comment reconfigurer vos flux Antigravity pour tirer parti de 3.6 Flash sans attendre Gemini 3.5 Pro.

Ce que Google a réellement livré

Gemini 3.6 Flash a été lancé simultanément dans l'application Gemini, Google Antigravity, AI Studio et Android Studio. Les chiffres phares, directement de Google :

  • 17% de tokens de sortie en moins consommés sur les flux multi-étapes complexes par rapport à 3.5 Flash
  • Prix baissé à 1,50 $ par million de tokens d'entrée et 7,50 $ par million de tokens de sortie (contre 9 $ en sortie)
  • Base de connaissances avancée de janvier 2025 à mars 2026 — un saut complet de 14 mois
  • Fenêtre de contexte de plus d'un million de tokens, sortie max de 65 536 tokens
  • Mode réflexion activé par défaut, avec un budget de réflexion configurable pouvant être fixé à illimité

Antigravity expose trois paliers de réflexion dans son interface — High, Medium, Low — mappés sur ce budget de réflexion. Dans l'app Gemini grand public, la même capacité est étiquetée « Enhanced Thinking Mode », et Workspace l'appelle « 3.6 Thinking ». Même bouton, trois noms de marque. Bon à savoir quand vous lisez des tutoriels écrits pour une autre surface.

L'histoire des benchmarks

Les gains d'efficacité comptent, mais ce sont les chiffres de codage qui convertiront les utilisateurs actuels de Claude Sonnet 5 et GPT-5.6 Sol :

Benchmark3.5 Flash3.6 FlashÉcart
DeepSWE (résolution d'issues réelles)37%49%+12 pts
MLE Bench (tâches d'ingénierie ML)49,7%63,9%+14,2 pts
GDPval-AA (travail intellectuel)13491421+72 pts
OSWorld-Verified (utilisation d'ordinateur)78,4%83%+4,6 pts

DeepSWE et MLE Bench sont ceux à lire de près. Les deux mesurent le comportement d'agent de bout en bout sur des tâches multi-fichiers et multi-étapes — pas de la complétion de code en un tour. Un saut de 12 points sur DeepSWE place 3.6 Flash à portée de modèles bien plus gros sur le travail réel de dépôt, aux prix Flash.

Google a présenté l'amélioration du codage comme « du code de meilleure qualité et plus fiable, prêt pour la production, avec des boucles d'exécution réduites ». L'expression à remarquer est boucles d'exécution réduites. Dans les runs agentiques, le plus gros gouffre de coût n'est pas le modèle — c'est le modèle qui décide de relire un fichier pour la quatrième fois ou de rejouer des tests qu'il sait déjà voués à l'échec. Moins de boucles signifie moins de tokens signifie des factures plus basses, en plus de la baisse de prix affichée.

Pourquoi Antigravity est la bonne surface pour cela

Antigravity n'est pas un copilote. C'est un environnement agent-first où vous dépêchez des tâches à des workers autonomes qui planifient, éditent, lancent des tests et vous rendent un diff. Ce flux est exactement ce pour quoi Flash a été reconstruit — l'utilisation parallèle d'outils et le raisonnement multi-étapes sont explicitement cités dans les notes de version.

Trois choses changent quand 3.6 Flash devient votre défaut dans Antigravity :

  1. Les runs d'agents plus longs deviennent économiques. À 7,50 $/M de tokens de sortie, faire tourner Flash sur un refactor parallèle à cinq agents sur un dépôt TypeScript de taille moyenne n'est plus une conversation de budget.
  2. Le palier de réflexion devient un vrai choix. Low est désormais viable pour la génération CRUD standard. Medium gère le travail de fonctionnalité typique. High est réservé aux changements d'architecture où vous auriez précédemment escaladé vers Pro.
  3. La coupure de mars 2026 supprime toute une classe d'hallucinations. Les API de frameworks livrées début 2026 — les agents durables de Vercel AI SDK 7, Next.js 16.3, les patterns Tailwind v4, la spec MCP sans état — sont désormais dans la distribution plutôt que devinées.

Quand choisir 3.6 Flash contre les alternatives

Google garde Gemini 3.5 Pro pour les tests partenaires et a teasé le pré-entraînement de Gemini 4, donc la gamme Antigravity actuelle est :

  • 3.5 Flash-Lite — 0,30 $ entrée / 2,50 $ sortie. À utiliser pour la classification, l'extraction et tout prétraitement à haut débit où vous auriez sinon brûlé un modèle plus gros.
  • 3.6 Flash Low — défaut pour les tâches bien cadrées, éditions mono-fichier, génération de tests directe.
  • 3.6 Flash Medium — travail de fonctionnalité couvrant trois à dix fichiers, refactors, la plupart des runs d'agents.
  • 3.6 Flash High — revues d'architecture, refactors cross-modules, tout ce où la qualité du raisonnement prime sur la latence.
  • 3.5 Flash Cyber — pilote à accès limité pour la détection de vulnérabilités de sécurité. Si vous y avez accès, routez-y vos agents SAST.

L'heuristique à intérioriser : commencez à Medium, descendez à Low quand une tâche est trivialement bornée, escaladez à High seulement quand le diff attendu est architectural. N'utilisez pas High comme couverture de confort — le coût des tokens est réel et l'écart de qualité sur Medium s'est fortement resserré avec 3.6.

Ajustements pratiques du workflow Antigravity

Si votre équipe a déjà des playbooks Antigravity écrits pour 3.5 Flash, trois choses valent la peine d'être revisitées cette semaine :

Retirez l'échafaudage de prompts qui compensait l'ancienne coupure. Des instructions comme « suppose la sémantique de Next.js 15 App Router » ou « la signature Vercel AI SDK 6 est X » ne sont plus nécessaires et peuvent désormais entrer en conflit avec les connaissances propres du modèle. Supprimez-les.

Rééquilibrez les budgets de réflexion. Toute config d'agent bloquée sur High « au cas où » devrait être déplacée sur Medium. Lancez la même tâche dix fois avec les deux paliers et comparez la qualité du diff — dans la plupart des cas, vous constaterez que Medium est désormais indiscernable, à environ la moitié du coût.

Reconsidérez les plafonds de parallélisme. Les équipes bridaient les agents parallèles pour maîtriser le burn. Avec 17% de tokens en moins par flux et la baisse du prix de sortie, doubler les agents parallèles pour la même dépense mensuelle est réaliste. C'est un vrai levier de productivité, pas une revendication marketing.

Le signal plus large

Google n'est pas subtil sur la direction. Le teasing du pré-entraînement de Gemini 4 lors du même événement que le lancement de 3.6 Flash est l'indice — Flash est positionné comme le palier bête de somme sur lequel la plupart des charges de travail agentiques devraient tourner, avec Pro réservé aux extrêmes lourds en raisonnement et Gemini 4 visant ce qui vient après. Toute la pile est refaçonnée autour d'agents durables, parallèles et utilisateurs d'outils comme charge de travail primaire, pas le chat.

Pour les développeurs qui choisissent une pile aujourd'hui, la conclusion est directe : si vous faites déjà tourner des flux agentiques dans Antigravity ou en évaluez un, 3.6 Flash est le modèle à benchmarker. L'économie a suffisamment changé pour que les décisions prises il y a trois mois contre « Flash n'est pas assez intelligent pour notre cas d'usage » méritent un nouveau test.

Pour commencer

  • Utilisateurs Antigravity : 3.6 Flash est disponible dans le sélecteur de modèle. Basculez un projet non critique dessus et comparez les résultats à votre défaut actuel sur une semaine de travail réel.
  • Utilisateurs AI Studio : l'ID de modèle gemini-3.6-flash est actif. Pointez votre intégration SDK existante dessus et rejouez votre suite d'évaluation.
  • Utilisateurs Android Studio : les fonctionnalités IA de l'IDE sont désormais routées via 3.6 Flash par défaut.

La coupure de mars 2026, la baisse de prix et le saut DeepSWE sont chacun individuellement significatifs. Ensemble, ils changent ce que « palier Flash » signifie. Traitez ceci comme le moment de réévaluer les défauts, pas comme un bump de version incrémental.

Sources