← Tous les modèles

Claude Opus 4.8 : référence historique du modèle

1M tokens · Text / Vision / Code · Prompt cache

Okou n'exécute plus Claude Opus 4.8. Cette page est conservée comme référence pour ses caractéristiques, ses tarifs et ses benchmarks. Pour le même type de travail, utilisez Claude Opus 5.5.

Voir Claude Opus 5.5

Claude Opus 4.8 est le modèle phare d'Anthropic sorti le 28 mai 2026, une montée de version directe d'Opus 4.7 au même prix de liste fournisseur de 5 $/25 $. Il affiche les meilleurs scores SWE-bench Pro (69,2 %), OSWorld-Verified (83,4 %), MCP-Atlas (82,2 %) et Humanity's Last Exam (57,9 % avec outils) jamais livrés par Anthropic, et c'est le premier modèle à dépasser les 10 % sur le standard de réussite intégrale des agents juridiques.

Les deux changements structurels à connaître sont les workflows dynamiques (planifier une tâche, puis la déployer sur des centaines de sous-agents en parallèle au sein d'une même session) et une baisse de prix du mode rapide à une vitesse de 2,5× pour 10 $/50 $ par million de tokens — trois fois moins cher que le mode rapide des modèles Claude précédents. Les niveaux d'effort s'étendent à high (par défaut), extra et max. Anthropic présente lui-même cette sortie comme une « amélioration modeste mais tangible » plutôt que comme un bond en avant.

Qu'est-ce que Claude Opus 4.8 ?

28 mai 2026

Les lectures indépendantes (LLM Stats, VentureBeat, Vellum) corroborent le classement relatif face à la 4.7 et aux concurrents : la 4.8 l'emporte sur chaque cellule de l'ensemble comparatif publié par Anthropic, sauf Terminal-Bench 2.1, où GPT-5.5 reste en tête (78,2 % contre 74,6 % pour la 4.8). Le saut de la 4.7 à la 4.8 sur SWE-bench Pro est de +4,9 points ; sur USAMO 2026, il est de +27,4 ; et sur le nouveau F1 longue portée GraphWalks à 1M tokens, il est de +27,8. Considérez les scores absolus comme indicatifs — SWE-bench Verified approche de la saturation sur tous les modèles de pointe.

Ce qui distingue Claude Opus 4.8

Principales caractéristiques d'architecture et de capacités.

Opus 4.8 conserve la fenêtre de contexte de 1M tokens et la sortie maximale de 128K d'Opus 4.7, facturées au tarif d'entrée standard sur l'ensemble de la fenêtre. Le contrôle de l'effort s'étend à trois niveaux : high (la nouvelle valeur par défaut), extra (xhigh dans Claude Code) et max. L'API Messages accepte désormais des entrées système en milieu de conversation sans rompre la mise en cache des prompts. Les workflows dynamiques permettent à Claude de planifier et de répartir des centaines de sous-agents en parallèle au sein d'une même session. Le mode rapide tourne à ~2,5× la vitesse standard pour 10 $ / 50 $ par million de tokens. Les entrées multimodales en texte, vision et code restent inchangées.

Spécifications en un coup d'œil

FamilleGénération Claude 4
ModalitésTexte, vision, code
LanguesAnglais en priorité, multilingue
Mise en cache des promptsPrise en charge (Anthropic)
Fenêtre de contexte1M tokens
Sortie maximaleJusqu'à 128K tokens
Niveaux d'effortHigh (par défaut) / Extra / Max
Prix de liste fournisseur5 $ en entrée / 25 $ en sortie par million (mode rapide 10 $/50 $, vitesse 2,5×)

Benchmarks de Claude Opus 4.8

Scores rapportés par le fournisseur, issus de la system card Opus 4.8 d'Anthropic, avec des comparaisons face à Opus 4.7, GPT-5.5 et Gemini 3.1 Pro à effort maximal et moyennes sur 5 essais. La 4.8 est en tête dans six des sept cellules publiées par Anthropic ; GPT-5.5 conserve l'avantage sur Terminal-Bench 2.1. SWE-bench Verified approche de la saturation sur tous les modèles de pointe — l'ensemble SWE-bench Pro, plus difficile, est le signal le plus durable.

SWE-bench Verifiedrapporté par le fournisseur ; en hausse depuis les 87,6 % d'Opus 4.7
88,6 %
SWE-bench Proen tête du classement (4.7 : 64,3 %, GPT-5.5 : 58,6 %, Gemini 3.1 Pro : 54,2 %)
69,2 %
Terminal-Bench 2.1en hausse depuis les 66,1 % de la 4.7 sur la 2.0 ; GPT-5.5 est en tête ici à 78,2 %
74,6 %
OSWorld-Verified (usage de l'ordinateur)en tête du classement (4.7 : 82,8 %, GPT-5.5 : 78,7 %)
83,4 %
Online-Mind2Web (agent navigateur)rapporté par le fournisseur
84 %
MCP-Atlasen hausse depuis les 77,3 % d'Opus 4.7
82,2 %
BrowseComp (agent unique)en hausse depuis les 79,3 % d'Opus 4.7
84,3 %
F1 longue portée GraphWalks (1M tokens)en hausse depuis les 40,3 % d'Opus 4.7
68,1 %
Humanity's Last Exam (avec outils)49,8 % sans outils ; en tête du classement
57,9 %
GPQA Diamondstable face à la 4.7 — saturé sur les modèles de pointe
~93 %
USAMO 2026 (mathématiques)en hausse depuis les 69,3 % d'Opus 4.7
96,7 %
GDPval-AA (travail du savoir)en tête (4.7 : 1753, GPT-5.5 : 1769)
1890 Elo
Finance Agent v2en tête du classement
53,9 %
Réussite intégrale agent juridiquepremier modèle à franchir ce standard
>10 %

Tarification de Claude Opus 4.8

Anciens tarifs du fournisseur par million de tokens. Ces valeurs de référence ne sont pas les frais actuels de Okou.

Entrée$5.00
Sortie$25.00
Lecture cache$0.50
Écriture cache$6.25

Comment Claude Opus 4.8 se comporte en pratique

Comportement observé lors d'exécutions d'agents en production.

Éditions de code dès la première tentative

Anthropic indique qu'Opus 4.8 a environ quatre fois moins de risques que la 4.7 de laisser passer des défauts lors d'une revue de code, et le saut de +4,9 points sur SWE-bench Pro (69,2 % contre 64,3 %) le confirme sur l'ensemble de codage le plus difficile et le moins saturé. Choisissez la 4.8 pour les correctifs qui doivent s'appliquer proprement à travers de nombreux fichiers.

Mémorisation longue portée

Le F1 GraphWalks à 1M tokens passe de 40,3 % à 68,1 % — le plus grand gain sur un seul benchmark de cette sortie. La fenêtre de 1M tokens est désormais réellement exploitable dans le haut de sa plage, et plus seulement sur le papier.

Honnêteté et excès de confiance

Anthropic rapporte une réduction de plus de dix fois de l'excès de confiance par rapport à la 4.7, un taux de 0 % de signalement non critique de résultats erronés (une première pour la famille Claude), et un taux de 3,7 % d'omission de remonter des événements importants à l'utilisateur. L'incidence des défauts d'alignement est d'environ 1,9, soit pratiquement à égalité avec le meilleur Mythos Preview aligné d'Anthropic.

Vitesse et mode rapide

La vitesse standard est comparable à celle d'Opus 4.7. Le changement de prix est l'élément marquant : le mode rapide à une vitesse de 2,5× coûte 10 $ / 50 $ par million de tokens, trois fois moins cher que le mode rapide des modèles Claude précédents. Utile pour les étapes d'orchestration où la latence horloge compte.

Réserve sur l'injection de prompts

La system card d'Anthropic note que la 4.8 est un peu moins robuste à l'injection de prompts agentique que la 4.7 — le red-teaming de Gray Swan affiche un taux de réussite des attaques d'environ 9,6 % contre 6,0 % pour la 4.7. Les équipes qui exécutent la 4.8 dans des pipelines traitant des entrées non fiables devraient revoir leur approche de sandboxing.

Meilleures tâches d'agent pour Claude Opus 4.8

La migration à l'échelle de la base de code qui demandait autrefois un sprint

Confiez à Opus 4.8 une migration touchant quelques centaines de fichiers — changement d'ORM, montée de version de framework, correctif de sécurité sur un monorepo — et laissez les workflows dynamiques répartir le travail entre des sous-agents en parallèle au sein d'une même session. Le saut de +4,9 points sur SWE-bench Pro et la réduction par quatre des défauts manqués en revue de code sont ce qui se concrétise sur ce type d'exécution.

La recherche à 1M tokens qui tient vraiment la route

Glissez un projet de contrat de 200 pages, trois propositions concurrentes et les avis juridiques du dernier trimestre dans la fenêtre, puis demandez à Opus 4.8 de signaler chaque clause plus stricte que le marché. Le saut de GraphWalks à 1M de 40,3 % à 68,1 % est ce qui rend ce type de synthèse inter-documents nouvellement fiable.

L'orchestrateur d'agents qui ne ment pas sur son travail

Utilisez la 4.8 comme planificateur qui décompose une demande en dix étapes, en confie chacune à des sous-agents moins chers, et rend compte du résultat. Le taux de 0 % de signalement non critique de résultats erronés, combiné à la baisse par dix de l'excès de confiance, est la raison pour laquelle les équipes en production choisissent la 4.8 lorsque l'auto-rapport de l'agent doit être digne de confiance.

Le flux sensible à la latence qui devient enfin rentable en mode rapide

Le mode rapide à une vitesse de 2,5× coûtait autrefois trois fois ce qu'il coûte aujourd'hui (10 $/50 $ par million contre le palier précédent). Pour les copilotes interactifs, les synthétiseurs d'astreinte, ou toute étape où la latence horloge domine l'expérience, la 4.8 en mode rapide est désormais le choix par défaut de la famille Claude.

Quand éviter Claude Opus 4.8

Évitez Opus 4.8 sur le travail routinier à fort volume où Sonnet 4.6 atteint le même niveau de qualité pour une fraction du coût, sur les réponses de chat critiques en latence où Kimi K2.7 Code est bien plus rapide, sur le codage agentique en terminal où GPT-5.5 reste en tête de Terminal-Bench 2.1 (78,2 % contre 74,6 % pour la 4.8), et sur les pipelines qui ingèrent des entrées non fiables sans sandboxing — la robustesse de la 4.8 à l'injection de prompts est légèrement plus faible que celle de la 4.7.

Claude Opus 4.8 vs autres modèles

Claude Opus 4.8 vs GPT-5.5

Opus 4.8 est en tête sur six des sept cellules de l'ensemble comparatif d'Anthropic, avec les écarts les plus marqués sur SWE-bench Pro (69,2 % contre 58,6 %) et OSWorld-Verified (83,4 % contre 78,7 %). GPT-5.5 conserve l'avantage sur Terminal-Bench 2.1 (78,2 % contre 74,6 %). Choisissez la 4.8 pour le codage multi-fichiers et les agents d'usage de l'ordinateur ; choisissez GPT-5.5 spécifiquement lorsque le travail piloté en terminal domine.

Claude Opus 4.8 vs Gemini 3.1 Pro

Opus 4.8 mène par de larges marges sur SWE-bench Pro (+15,0) et OSWorld-Verified (+7,2). Les deux modèles restent dans le bruit sur les benchmarks scientifiques saturés comme GPQA Diamond. Par défaut, optez pour la 4.8 sur le travail agentique ; envisagez Gemini spécifiquement lorsque vous avez besoin de l'intégration des outils de Google.

Questions fréquentes

Comment les tarifs d'Opus 4.8 se comparent-ils à ceux de la 4.7 ?

Les tarifs réguliers sont identiques : 5 $ par million de tokens en entrée, 25 $ par million en sortie, 0,50 $ par million d'entrée mise en cache. Le changement concerne le mode rapide, désormais à 10 $ / 50 $ par million de tokens à une vitesse de 2,5× — trois fois moins cher que le mode rapide des modèles Claude précédents.

Que sont les workflows dynamiques ?

Une nouvelle capacité qui permet à Opus 4.8 de planifier une tâche puis d'exécuter des centaines de sous-agents en parallèle au sein d'une même session. Anthropic présente cela comme la voie vers des migrations à l'échelle d'une base de code, sur des centaines de milliers de lignes de code en une seule exécution d'agent.

Quels niveaux d'effort Opus 4.8 prend-il en charge ?

Trois niveaux : high (la nouvelle valeur par défaut), extra (xhigh dans Claude Code) et max. Les réglages plus élevés dépensent davantage de tokens en raisonnement avant de produire une réponse ; les réglages plus bas favorisent la vitesse et l'efficacité face aux limites de débit.

Opus 4.8 prend-il en charge la mise en cache des prompts ?

Oui. L'entrée mise en cache est facturée à 0,50 $ par million de tokens, soit une remise de 10× sur la portion mise en cache. L'API Messages accepte désormais aussi des entrées système en milieu de conversation sans rompre le cache.

Alternatives

Disponibilité de Claude Opus 4.8 sur Okou

Claude Opus 4.8 n’est plus proposé sur Okou. Consultez Claude Opus 5.5 pour une alternative actuellement prise en charge. Cette page conserve des informations historiques, pas les tarifs actuels de Okou.