Anthropic vient de lever le voile sur Claude Opus 4.8, la nouvelle version de son modèle phare. Présentée comme une amélioration « modeste mais tangible » par rapport à Opus 4.7, cette mise à jour pousse les curseurs sur le code, le raisonnement avec outils, la vitesse… et surtout sur l’honnêteté du modèle. Petit tour d’horizon de ce qui change vraiment.
Des benchmarks en hausse, devant GPT-5.5 et Gemini 3.1 Pro
Sur le papier, Opus 4.8 progresse sur la plupart des catégories testées par Anthropic, et devance ses concurrents directs — GPT-5.5 d’OpenAI et Gemini 3.1 Pro de Google — sur la majorité des évaluations. Les gains les plus nets concernent le code agentique et le raisonnement multidisciplinaire avec outils.
| Benchmark | Opus 4.7 | Opus 4.8 |
|---|---|---|
| SWE-bench Verified (code) | 87,6 % | 88,6 % |
| SWE-bench Pro (code agentique) | 64,3 % | 69,2 % |
| Raisonnement avec outils | 54,7 % | 57,9 % |
| Online-Mind2Web (agent web) | — | 84 % |
À titre de comparaison, GPT-5.5 plafonne à 58,6 % sur SWE-bench Pro, là où Opus 4.8 atteint 69,2 %. Le modèle est aussi le seul à avoir bouclé l’intégralité des cas du benchmark Super-Agent de bout en bout, et signe le meilleur score sur le Legal Agent Benchmark.
Le contrôle de l’effort débarque
Nouveauté la plus visible côté utilisateur : sur claude.ai (et Cowork), vous pouvez désormais choisir la quantité d’« effort » que Claude consacre à une tâche. En clair, vous arbitrez entre rapidité et profondeur de réflexion selon le besoin — réponse express pour une question simple, ou réflexion poussée pour un problème complexe.
Workflows dynamiques : des centaines de sous-agents en parallèle
Pour les tâches lourdes, Opus 4.8 introduit les workflows dynamiques : la capacité à lancer des centaines de sous-agents en parallèle pour décomposer et traiter un gros chantier (audit de code, migration, recherche massive…). La fonctionnalité est disponible dans Claude Code pour les offres Enterprise, Team et Max.
Un mode rapide 3× moins cher
Le mode rapide (Fast mode), qui fait tourner le modèle à environ 2,5× la vitesse normale, devient trois fois moins cher que sur les versions précédentes. Important : il s’agit toujours d’Opus à pleine puissance qui répond plus vite, et non d’un repli sur un modèle plus petit.
- Tarif standard : 5 $ / million de tokens en entrée, 25 $ / million en sortie (inchangé par rapport à Opus 4.7)
- Mode rapide : 10 $ / million en entrée, 50 $ / million en sortie
Plus honnête, et moins enclin à la tromperie
C’est peut-être le progrès le plus important. Selon Anthropic, Opus 4.8 est environ quatre fois moins susceptible que son prédécesseur de laisser passer sans le signaler un défaut dans le code qu’il a écrit. Le modèle a aussi tendance à signaler de lui-même les problèmes sur les entrées et sorties d’une analyse — un réflexe que les autres modèles laissent souvent à la charge de l’utilisateur. L’équipe alignement note par ailleurs des taux de comportements « désalignés » nettement plus bas.
Disponibilité
Claude Opus 4.8 est disponible immédiatement, au même prix qu’Opus 4.7. Côté API, il s’appelle claude-opus-4-8. Une mise à jour de la Messages API permet aussi d’ajouter des entrées système en cours de tâche sans casser le cache de prompt — un détail technique qui compte pour les développeurs.
En résumé
Opus 4.8 n’est pas une révolution, mais une consolidation bien sentie : meilleur en code, plus rapide, moins cher en mode rapide, et surtout plus fiable et transparent. Pour celles et ceux qui utilisent Claude au quotidien — en particulier pour le développement — la montée de version se justifie largement.
Sources : Anthropic — Introducing Claude Opus 4.8, The Decoder, VentureBeat.