Aktory Référentiel IA
Lignée Opus

Claude Opus 5

Actif
Anthropic · Gamme Opus · sorti le 24 juillet 2026

Le modèle Opus le plus avancé d'Anthropic, orienté vers le codage agentique complexe et le travail en entreprise. Anthropic le présente comme approchant l'intelligence de Claude Fable 5 pour moitié moins cher.

Les faits

Ce qu'il coûte, ce qu'il tient

Fenêtre de contexte 1M jetons

Ce qu’il peut avoir sous les yeux en une seule fois, question et réponse comprises.

Prix d’entrée 5 $ / M jetons

Ce que coûte le texte qu’on lui envoie.

Prix de sortie 25 $ / M jetons

Ce que coûte le texte qu’il produit, toujours plus cher que l’entrée.

Sortie maximale 128K jetons

La plus longue réponse qu’il peut produire d’un seul tenant.

Connaissances arrêtées à mai 2026

Il ne sait rien de ce qui s’est passé après cette date, sauf si on le lui fournit.

Niveau de sûreté déclaré ASL-3

L’échelle de sûreté interne du laboratoire, pas une norme publique.

Cycle de vie

D'aujourd'hui à sa fin de service

Sortie 24 juillet 2026
Dépréciation Non annoncée
Retrait Maintenu au moins jusqu'au 24 juillet 2027
Capacités

Ce qu'il sait faire

Raisonnement adaptatif

Activé par défaut. Profondeur pilotée par un niveau d'effort, de low à max.

Vision

Compréhension de graphiques, documents et diagrammes.

Appel d'outils

Changement d'outils en cours de conversation, en bêta, sans perdre le cache.

Usage de l'ordinateur

735 jetons par définition d'outil.

Mise en cache des invites

Seuil abaissé à 512 jetons, contre 1 024 sur Opus 4.8.

Traitement par lots

Remise de 50 % sur l'entrée comme sur la sortie.

Mode rapide

Aperçu de recherche, API Claude seulement. Environ 2,5 fois plus rapide, au double du prix.

Réflexion étendue (ancien mécanisme)

Remplacée par le raisonnement adaptatif.

Réflexion étendue
La lignée Opus

Les autres versions

Toute la lignée
Benchmarks expliqués

Ce qu'il vaut, avec les conditions

28 tests relevés pour ce modèle, regroupés par ce qu'ils mesurent. Chaque chiffre est annoncé par le laboratoire, avec sa source et ses conditions ; une jauge n'est dessinée que quand l'échelle du test a un maximum connu.

Code et ingénierie logicielle

Le modèle reçoit un dépôt et un problème, et doit produire un correctif qui passe les tests, sans intervention humaine.

8 tests

SWE-bench Verified

96 %

Corriger de vrais tickets ouverts sur GitHub, dans le dépôt d'origine, sans aide.

Moyenne sur 5 essais, 500 problèmes vérifiés par des ingénieurs.

Source

SWE-bench Multilingual

89,5 %

Le même exercice, étendu à neuf langages de programmation.

Moyenne sur 5 essais, 300 problèmes sur 9 langages.

Source

SWE-bench Pro

79,2 %

Le même exercice, sur des dépôts encore maintenus et des correctifs qui touchent plusieurs fichiers.

Moyenne sur 5 essais, dépôts activement maintenus, correctifs multi-fichiers.

Source

DeepSWE v1.1

68,8 %

113 tâches de développement de longue haleine, écrites de zéro pour n'avoir jamais été vues à l'entraînement.

Moyenne sur 5 essais, 113 tâches d'ingénierie logicielle de longue durée.

Source

FrontierCode v1.1 (étendu)

63,6 %

Le même test, sur le jeu de tâches étendu.

Moyenne sur 5 essais, meilleur niveau d'effort (atteint à effort medium).

Source

SWE-bench Multimodal

59,4 %

Le même exercice, mais l'énoncé contient des captures d'écran et des maquettes.

Moyenne sur 5 essais, harnais interne, contexte visuel.

Source

FrontierCode v1.1 (principal)

53,4 %

150 tâches tirées de vraies pull requests de projets libres, notées par un tiers.

Moyenne sur 5 essais, meilleur niveau d'effort (atteint à effort medium).

Source

FrontierBench v0.1

44,4 %

Du travail en ligne de commande : biologie computationnelle, simulation physique, CAO, preuves formelles, optimisation GPU.

Récompense moyenne, 5 tentatives par tâche sur 74 tâches, effort xhigh. Descend à 39 % en effort high et 25 % en effort low.

Source

Raisonnement sur des situations inconnues

Aucune connaissance préalable ne sert : il faut inférer une règle jamais vue à partir de quelques exemples.

3 tests

ARC-AGI-1

97,5 %

Deviner la règle cachée derrière trois exemples de grilles, puis l'appliquer à une grille nouvelle.

Effort max, score vérifié par l'ARC Prize Foundation sur jeu semi-privé.

Source

ARC-AGI-2

90,42 %

Le même principe, avec des règles nettement plus difficiles à inférer.

Effort max, score vérifié par l'ARC Prize Foundation sur jeu semi-privé.

Source

ARC-AGI-3

30,16 %

Des jeux inconnus, sans règle ni but annoncés : il faut explorer, comprendre ce qui fait gagner, et progresser de niveau en niveau.

Efficacité relative à l'action humaine, effort high. Le résultat en effort max n'était pas disponible à la publication.

Source

Mathématiques

Des démonstrations de niveau olympiade et des problèmes tirés de la recherche en cours.

2 tests

IMO 2026

42 points sur 42

Les six problèmes de l'Olympiade internationale 2026, à démontrer et non simplement à résoudre.

42 points sur 42, sans harnais ni outils, sortie limitée à 256 000 jetons, effort max. Le seuil de médaille d'or 2026 est à 29.

Source

ArxivMath (juin 2026)

90,8 %

Des problèmes extraits chaque mois de résumés d'articles arXiv récents, donc issus de la recherche en cours.

49 problèmes, sans outils, effort max, moyenne sur 4 essais. Monte à 91,3 % avec outils.

Source

Pilotage d'un ordinateur

Le modèle agit à la souris et au clavier sur une machine réelle, comme le ferait une personne.

1 test

OSWorld 2.0

70,57 %

Accomplir des tâches courantes sur une machine Ubuntu réelle, à la souris et au clavier.

Réussite au premier essai, moyenne sur 5 exécutions.

Source

Travail professionnel réel

Des livrables de métier : dossiers juridiques, flux d'entreprise, enchaînements d'outils, documents de travail.

8 tests

MCP Atlas

85,8 %

Enchaîner des outils par le protocole MCP : trouver le bon, l'appeler correctement, recomposer la réponse.

Taux de réussite. Couverture moyenne des critères de 89,1 %, contre 82,2 % pour Opus 4.8.

Source

GDP.pdf

83,4 %

Cent PDF professionnels réels, de la finance au droit en passant par la santé et l'ingénierie.

Sans outils.

Source

Toolathlon Verified

80,6 %

108 tâches d'outillage réel : bureautique, commerce en ligne, analyse de données, recherche web.

Réussite au premier essai, effort max, sans classificateur de sécurité, moyenne sur 3 essais et 108 tâches.

Source

OfficeQA

78,1 %

Répondre à des questions en s'appuyant sur un grand corpus de documents d'entreprise.

Chiffre annoncé dans la system card, conditions détaillées à la source.

Source

AutomationBench (Zapier)

26 %

Mener un flux de travail d'entreprise de bout en bout, d'une seule instruction en langage courant.

Effort max, jeu d'évaluation privé. 24 % en effort medium, pour 0,89 $ par tâche.

Source

Legal Agent Benchmark (Harvey)

23,58 %

Le travail d'un collaborateur en cabinet d'avocats : dépouiller un dossier client et produire le document demandé.

Réussite intégrale sur 5 essais, effort max, harnais interne. 93,74 % des critères réussis en moyenne. Sur le jeu propre de Harve…

Source

GDPval-AA v2

1 861 ELO

220 tâches professionnelles réellement rémunérées, sur 44 métiers et 9 secteurs, rendues sous forme de livrable.

Score ELO, effort max. Évaluation conduite par Artificial Analysis mais chiffre repris de la system card d'Anthropic, non relevé …

Source

AA-Briefcase

1 720 ELO

Des projets de plusieurs semaines montés par des experts du métier, avec des milliers de fichiers sources.

Score ELO, effort max. Évaluation conduite par Artificial Analysis mais chiffre repris de la system card d'Anthropic, non relevé …

Source

Santé

Des conversations cliniques notées sur des barèmes écrits par des médecins.

2 tests

HealthBench Professional

73,4 %

525 conversations écrites par des médecins pour des médecins : consultations, comptes rendus, travaux de recherche.

Score brut, effort max, moyenne sur 5 essais, sans outils. Ajusté à la longueur : 59,8 %.

Source

HealthBench

67,1 %

5 000 conversations médicales à plusieurs tours, notées sur des critères écrits par des médecins.

Score brut, effort max, moyenne sur 5 essais, sans outils. Ajusté à la longueur : 57,8 %.

Source

Cybersécurité offensive

Trouver et exploiter de vraies failles logicielles, ou mener une opération d'attaque complète. Un score élevé mesure une capacité, pas une qualité : c'est précisément ce que les laboratoires surveillent.

2 tests

Firefox 147

52,4 %

Développer des exploits pour des failles réelles de Firefox 147, corrigées depuis dans la version 148. Le modèle reçoit 50 catégories de plantage et les plantages correspondants.

Chiffre annoncé dans la system card, conditions détaillées à la source.

Source

CyScenarioBench

33,7 %

Planifier et mener une opération d'attaque informatique en plusieurs étapes, sous des contraintes réalistes, au lieu d'exécuter des tâches techniques isolées.

Chiffre annoncé dans la system card, conditions détaillées à la source.

Source

Sûreté et comportement

Non pas ce que le modèle sait faire, mais ce qu'il accepte ou refuse de faire, et comment il se comporte quand on cherche à le détourner.

2 tests

Malicious computer use

93,75 %

Le modèle, doté d'outils de pilotage d'un ordinateur en bac à sable, reçoit 112 tâches nuisibles : surveillance et collecte de données sans autorisation, production de contenus dangereux, abus à grande échelle.

Refusal rate.

Source

Attempt-level ASR

0,18 %

Résister à des instructions malveillantes glissées dans les données que le modèle manipule pendant qu'il code. L'attaquant fait 200 tentatives par scénario.

Chiffre annoncé dans la system card, conditions détaillées à la source.

Source
Pour les développeurs

Intégrer ce modèle

L'appeler

Identifiant d’APIclaude-opus-5

Le nom exact à écrire dans le code pour appeler ce modèle.

Alias anthropic.claude-opus-5 (Amazon Bedrock)claude-opus-5 (Google Cloud)

Les autres noms du même modèle, selon la plateforme qui le revend.

Disponible sur API ClaudeClaude.aiClaude CodeClaude CoworkAmazon BedrockGoogle Cloud Vertex AIMicrosoft Foundry

Ce qu'il accepte

Entrées acceptées texteimage
Sorties produites texte
Langues

Multilingue. Claude répond dans la langue de la requête, avec une qualité qui varie selon la langue.

Latence

Moyenne · Sa vitesse comparée aux autres modèles du même laboratoire, pas une mesure absolue.

Facturation détaillée par million de jetons

Écriture en cache6,25 $ Écriture en cache, 1 heure10 $ Lecture depuis le cache0,5 $ Traitement par lots, entrée2,5 $ Traitement par lots, sortie12,5 $

Mettre en mémoire un début de requête réutilisé d’un appel à l’autre : 1,25 fois le prix d’entrée.