SWE-bench Verified
Corriger de vrais tickets ouverts sur GitHub, dans le dépôt d'origine, sans aide.
Moyenne sur 5 essais, 500 problèmes vérifiés par des ingénieurs.
Source
Le modèle Opus le plus avancé d'Anthropic, orienté vers le codage agentique complexe et le travail en entreprise. Anthropic le présente comme approchant l'intelligence de Claude Fable 5 pour moitié moins cher.
Ce qu’il peut avoir sous les yeux en une seule fois, question et réponse comprises.
Ce que coûte le texte qu’on lui envoie.
Ce que coûte le texte qu’il produit, toujours plus cher que l’entrée.
La plus longue réponse qu’il peut produire d’un seul tenant.
Il ne sait rien de ce qui s’est passé après cette date, sauf si on le lui fournit.
L’échelle de sûreté interne du laboratoire, pas une norme publique.
Activé par défaut. Profondeur pilotée par un niveau d'effort, de low à max.
Compréhension de graphiques, documents et diagrammes.
Changement d'outils en cours de conversation, en bêta, sans perdre le cache.
735 jetons par définition d'outil.
Seuil abaissé à 512 jetons, contre 1 024 sur Opus 4.8.
Remise de 50 % sur l'entrée comme sur la sortie.
Aperçu de recherche, API Claude seulement. Environ 2,5 fois plus rapide, au double du prix.
Remplacée par le raisonnement adaptatif.
28 tests relevés pour ce modèle, regroupés par ce qu'ils mesurent. Chaque chiffre est annoncé par le laboratoire, avec sa source et ses conditions ; une jauge n'est dessinée que quand l'échelle du test a un maximum connu.
Le modèle reçoit un dépôt et un problème, et doit produire un correctif qui passe les tests, sans intervention humaine.
Corriger de vrais tickets ouverts sur GitHub, dans le dépôt d'origine, sans aide.
Moyenne sur 5 essais, 500 problèmes vérifiés par des ingénieurs.
SourceLe même exercice, étendu à neuf langages de programmation.
Moyenne sur 5 essais, 300 problèmes sur 9 langages.
SourceLe même exercice, sur des dépôts encore maintenus et des correctifs qui touchent plusieurs fichiers.
Moyenne sur 5 essais, dépôts activement maintenus, correctifs multi-fichiers.
Source113 tâches de développement de longue haleine, écrites de zéro pour n'avoir jamais été vues à l'entraînement.
Moyenne sur 5 essais, 113 tâches d'ingénierie logicielle de longue durée.
SourceLe même test, sur le jeu de tâches étendu.
Moyenne sur 5 essais, meilleur niveau d'effort (atteint à effort medium).
SourceLe même exercice, mais l'énoncé contient des captures d'écran et des maquettes.
Moyenne sur 5 essais, harnais interne, contexte visuel.
Source150 tâches tirées de vraies pull requests de projets libres, notées par un tiers.
Moyenne sur 5 essais, meilleur niveau d'effort (atteint à effort medium).
SourceDu travail en ligne de commande : biologie computationnelle, simulation physique, CAO, preuves formelles, optimisation GPU.
Récompense moyenne, 5 tentatives par tâche sur 74 tâches, effort xhigh. Descend à 39 % en effort high et 25 % en effort low.
SourceAucune connaissance préalable ne sert : il faut inférer une règle jamais vue à partir de quelques exemples.
Deviner la règle cachée derrière trois exemples de grilles, puis l'appliquer à une grille nouvelle.
Effort max, score vérifié par l'ARC Prize Foundation sur jeu semi-privé.
SourceLe même principe, avec des règles nettement plus difficiles à inférer.
Effort max, score vérifié par l'ARC Prize Foundation sur jeu semi-privé.
SourceDes jeux inconnus, sans règle ni but annoncés : il faut explorer, comprendre ce qui fait gagner, et progresser de niveau en niveau.
Efficacité relative à l'action humaine, effort high. Le résultat en effort max n'était pas disponible à la publication.
SourceDes démonstrations de niveau olympiade et des problèmes tirés de la recherche en cours.
Les six problèmes de l'Olympiade internationale 2026, à démontrer et non simplement à résoudre.
42 points sur 42, sans harnais ni outils, sortie limitée à 256 000 jetons, effort max. Le seuil de médaille d'or 2026 est à 29.
SourceDes problèmes extraits chaque mois de résumés d'articles arXiv récents, donc issus de la recherche en cours.
49 problèmes, sans outils, effort max, moyenne sur 4 essais. Monte à 91,3 % avec outils.
SourceLe modèle agit à la souris et au clavier sur une machine réelle, comme le ferait une personne.
Accomplir des tâches courantes sur une machine Ubuntu réelle, à la souris et au clavier.
Réussite au premier essai, moyenne sur 5 exécutions.
SourceDes livrables de métier : dossiers juridiques, flux d'entreprise, enchaînements d'outils, documents de travail.
Enchaîner des outils par le protocole MCP : trouver le bon, l'appeler correctement, recomposer la réponse.
Taux de réussite. Couverture moyenne des critères de 89,1 %, contre 82,2 % pour Opus 4.8.
SourceCent PDF professionnels réels, de la finance au droit en passant par la santé et l'ingénierie.
Sans outils.
Source108 tâches d'outillage réel : bureautique, commerce en ligne, analyse de données, recherche web.
Réussite au premier essai, effort max, sans classificateur de sécurité, moyenne sur 3 essais et 108 tâches.
SourceRépondre à des questions en s'appuyant sur un grand corpus de documents d'entreprise.
Chiffre annoncé dans la system card, conditions détaillées à la source.
SourceMener un flux de travail d'entreprise de bout en bout, d'une seule instruction en langage courant.
Effort max, jeu d'évaluation privé. 24 % en effort medium, pour 0,89 $ par tâche.
SourceLe travail d'un collaborateur en cabinet d'avocats : dépouiller un dossier client et produire le document demandé.
Réussite intégrale sur 5 essais, effort max, harnais interne. 93,74 % des critères réussis en moyenne. Sur le jeu propre de Harve…
Source220 tâches professionnelles réellement rémunérées, sur 44 métiers et 9 secteurs, rendues sous forme de livrable.
Score ELO, effort max. Évaluation conduite par Artificial Analysis mais chiffre repris de la system card d'Anthropic, non relevé …
SourceDes projets de plusieurs semaines montés par des experts du métier, avec des milliers de fichiers sources.
Score ELO, effort max. Évaluation conduite par Artificial Analysis mais chiffre repris de la system card d'Anthropic, non relevé …
SourceDes conversations cliniques notées sur des barèmes écrits par des médecins.
525 conversations écrites par des médecins pour des médecins : consultations, comptes rendus, travaux de recherche.
Score brut, effort max, moyenne sur 5 essais, sans outils. Ajusté à la longueur : 59,8 %.
Source5 000 conversations médicales à plusieurs tours, notées sur des critères écrits par des médecins.
Score brut, effort max, moyenne sur 5 essais, sans outils. Ajusté à la longueur : 57,8 %.
SourceTrouver et exploiter de vraies failles logicielles, ou mener une opération d'attaque complète. Un score élevé mesure une capacité, pas une qualité : c'est précisément ce que les laboratoires surveillent.
Développer des exploits pour des failles réelles de Firefox 147, corrigées depuis dans la version 148. Le modèle reçoit 50 catégories de plantage et les plantages correspondants.
Chiffre annoncé dans la system card, conditions détaillées à la source.
SourcePlanifier et mener une opération d'attaque informatique en plusieurs étapes, sous des contraintes réalistes, au lieu d'exécuter des tâches techniques isolées.
Chiffre annoncé dans la system card, conditions détaillées à la source.
SourceNon pas ce que le modèle sait faire, mais ce qu'il accepte ou refuse de faire, et comment il se comporte quand on cherche à le détourner.
Le modèle, doté d'outils de pilotage d'un ordinateur en bac à sable, reçoit 112 tâches nuisibles : surveillance et collecte de données sans autorisation, production de contenus dangereux, abus à grande échelle.
Refusal rate.
SourceRésister à des instructions malveillantes glissées dans les données que le modèle manipule pendant qu'il code. L'attaquant fait 200 tentatives par scénario.
Chiffre annoncé dans la system card, conditions détaillées à la source.
Sourceclaude-opus-5
Le nom exact à écrire dans le code pour appeler ce modèle.
anthropic.claude-opus-5 (Amazon Bedrock)claude-opus-5 (Google Cloud) Les autres noms du même modèle, selon la plateforme qui le revend.
Multilingue. Claude répond dans la langue de la requête, avec une qualité qui varie selon la langue.
Moyenne · Sa vitesse comparée aux autres modèles du même laboratoire, pas une mesure absolue.
Mettre en mémoire un début de requête réutilisé d’un appel à l’autre : 1,25 fois le prix d’entrée.