Claude Opus 5 est sorti le 24 juillet 2026 et, en 48 heures, deux choses étaient simultanément vraies : le modèle avait pris la première place sur pratiquement tous les grands classements de l'IA, et des développeurs se plaignaient publiquement qu'il était pénible à utiliser. La product leader Claire Vo l'a dit sans détour : « Opus 5 est là… et je déteste travailler avec lui. »
Cette tension mérite d'être décortiquée avec soin. Si vous ignorez le modèle à cause des plaintes, vous passerez à côté de performances de pointe à la moitié du prix de Fable 5. Si vous l'adoptez sans comprendre ses particularités, vous brûlerez des tokens et de l'énergie à parts égales.
La Réalité des Benchmarks
Commençons par ce qui est réellement vrai dans les chiffres.
Frontier-Bench v0.1 — le benchmark de codage agentique d'Anthropic — Opus 5 score 43,3 %, presque 10 points devant Fable 5 (33,7 %) et plus du double d'Opus 4.8 (21,1 %). Sur les tâches qui comptent le plus pour les agents de codage autonomes, Opus 5 n'est pas seulement meilleur que Fable — il joue dans une autre catégorie.
ARC-AGI-3 — le benchmark de raisonnement sur problèmes inédits — Opus 5 score 30,2 %, vérifié indépendamment par l'ARC Prize Foundation. Ce qui frappe n'est pas seulement le chiffre : la Fondation a noté qu'Opus 5 "a utilisé un raisonnement logique avancé pour convertir les dispositions d'ARC-AGI-3 en notation algébrique", développant sa propre représentation mathématique plutôt que de faire correspondre des motifs. C'est qualitativement un raisonnement différent.
IMO 2026 — Opus 5 a obtenu une performance médaille d'or (42/42 points) sur les problèmes de l'Olympiade Internationale de Mathématiques.
La validation indépendante d'Artificial Analysis confirme : Opus 5 est premier sur l'Agentic Index et l'Intelligence Index (61 vs 60 pour Fable 5), et deuxième sur le Coding Index à 0,3 point seulement derrière GPT-5.6 Sol.
Les tests concrets confirment aussi. Dans un jeu de course F1 3D construit depuis un seul fichier HTML, Opus 5 a produit un résultat soigné et fonctionnel avec quelques soucis de physique mineurs. Fable 5 était solide mais plus simple. GPT-5.6 Sol et Kimi K3 ont livré des builds injouables avec une piste manquante.
Alors Pourquoi les Développeurs Sont-ils Frustrés ?
Les plaintes ne portent pas sur l'intelligence. Elles portent sur la personnalité.
Il s'arrête sur les contradictions. Donnez à Opus 5 des instructions qui pointent dans des directions légèrement différentes et il stoppera ou demandera des clarifications plutôt que de faire un choix raisonnable. Fable 5 choisissait une voie et expliquait son raisonnement. Opus 5 traite l'ambiguïté comme une condition d'arrêt.
Il prend des initiatives non demandées. Le modèle s'étend, ajoute des mises en garde, restructure des choses que vous vouliez conserver en l'état. Les équipes produit qui construisent des workflows serrés signalent un "travail supplémentaire" du modèle qui casse les étapes suivantes.
Le "Claudeslop". Vo a inventé ce terme pour des patterns linguistiques idiosyncrasiques — des suites de non-sequiturs, des fins de phrases formulaïques, une cadence distinctive qui rend les sorties machinales d'une façon que les versions précédentes de Claude parvenaient à éviter.
Dans un test à l'aveugle, ces mêmes critiques ont classé Opus 5 au-dessus de tous les modèles concurrents, y compris Fable 5 et GPT-5.6. « Brillant mais agaçant » est le résumé le plus précis.
Tarification : Où se Situe l'Opportunité
5 $ / 25 $ par million de tokens en entrée/sortie — même prix qu'Opus 4.8, moitié du coût de Fable 5 (10 $ / 50 $). Le mode rapide (thinking étendu désactivé) fonctionne à 10 $ / 50 $.
La fenêtre contextuelle de 1M tokens permet de nourrir des codebases entières. Et surtout, Opus 5 n'a pas d'exigences de conservation des données, contrairement à Fable 5 — un avantage significatif pour les déploiements sensibles à la confidentialité.
Pour les workflows agentiques — où une tâche peut nécessiter 20 à 50 appels modèle — la différence de coût entre Opus 5 et Fable 5 se cumule rapidement. Si Opus 5 surpasse Fable 5 sur votre benchmark à la moitié du coût, l'argument business est limpide.
Comment Travailler Vraiment Avec Lui
Les frustrations ci-dessus sont réelles mais prévisibles — ce qui signifie qu'elles sont aussi évitables.
Écrivez des instructions précises et non contradictoires. Opus 5 expose les prompts bâclés que Fable 5 aurait masqués. Utilisez-le comme levier : si votre system prompt est vague, Opus 5 vous le dira. Traitez les blocages comme des signaux pour améliorer vos prompts, pas comme des échecs du modèle.
Définissez les limites du scope explicitement. Dites-lui ce qu'il ne doit pas faire. « Modifie uniquement la fonction que je spécifie. Ne refactorise pas le code environnant. » Opus 5 respecte les contraintes explicites plus fiablement que Fable 5 — vous devez juste les énoncer.
Utilisez-le pour les bons travaux. Opus 5 excelle dans :
- Les tâches de codage agentique à long horizon
- Le raisonnement complexe avec de nombreuses dépendances
- Les tâches où vous voulez que le modèle signale les ambiguïtés plutôt que de mal deviner
- Les déploiements sensibles à la confidentialité
Envisagez un autre modèle quand :
- Vous avez besoin d'itérations créatives rapides où sa verbosité vous ralentit
- Vos instructions sont intrinsèquement ambiguës et vous voulez que le modèle comble le vide plutôt que de s'arrêter
- La latence est critique (Opus 5 tourne plus lentement que Sonnet 5 par conception)
La Stratégie de Routage
Les équipes les plus intelligentes ne choisissent pas un modèle — elles routent les tâches.
- Opus 5 pour les tâches agentiques profondes, la génération de code complexe, les chaînes de raisonnement
- Sonnet 5 pour les tâches interactives rapides, les interfaces de chat, les premières ébauches
- Haiku 4.5 pour la classification, le routage, l'extraction à fort volume
Le niveau d'effort ajustable d'Opus 5 (tokens de réflexion) vous donne un curseur : effort faible pour les réponses rapides, effort élevé pour les problèmes qui nécessitent le modèle complet.
Conclusion
Claude Opus 5 est le meilleur modèle pour les agents de codage autonomes et le raisonnement complexe — sans discussion. L'écart sur Frontier-Bench par rapport à Fable 5 (43,3 % vs 33,7 %) est trop grand pour être ignoré, et les classements indépendants le confirment.
Le verdict « brillant mais agaçant » est exact, mais c'est aussi souvent le symptôme d'une mauvaise utilisation. Les équipes qui écrivent des instructions précises, routent les tâches délibérément, et traitent ses blocages comme du feedback plutôt que des échecs trouveront qu'Opus 5 délivre des résultats de pointe à la moitié du prix de l'alternative.
Les développeurs qui le détestent tournent souvent leurs prompts Fable 5 inchangés. Écrivez pour les points forts d'Opus 5 et vous livrerez un meilleur travail plus vite — même si vous avez envie de fermer le terminal de frustration de temps en temps.