Aktory Référentiel IA
Toutes les entreprises

Anthropic

Vérifiée
Est. 2021 · San Francisco · MAJ 03.08.2026
Site officiel

Entreprise américaine de recherche en intelligence artificielle, éditrice des modèles Claude, centrée sur la sûreté et l'interprétabilité des systèmes.

Benchmarks expliqués

Ce que valent les modèles, avec les conditions

Les scores ci-dessous sont ceux de Claude Opus 5, sorti le 24 juillet 2026, regroupés par ce qu'ils mesurent : 28 tests relevés, chacun annoncé par le laboratoire avec sa source et ses conditions. Une jauge n'est dessinée que quand l'échelle du test a un maximum connu.

Code et ingénierie logicielle

Le modèle reçoit un dépôt et un problème, et doit produire un correctif qui passe les tests, sans intervention humaine.

8 tests

SWE-bench Verified

96 %

Corriger de vrais tickets ouverts sur GitHub, dans le dépôt d'origine, sans aide.

Moyenne sur 5 essais, 500 problèmes vérifiés par des ingénieurs.

Source

SWE-bench Multilingual

89,5 %

Le même exercice, étendu à neuf langages de programmation.

Moyenne sur 5 essais, 300 problèmes sur 9 langages.

Source

SWE-bench Pro

79,2 %

Le même exercice, sur des dépôts encore maintenus et des correctifs qui touchent plusieurs fichiers.

Moyenne sur 5 essais, dépôts activement maintenus, correctifs multi-fichiers.

Source

DeepSWE v1.1

68,8 %

113 tâches de développement de longue haleine, écrites de zéro pour n'avoir jamais été vues à l'entraînement.

Moyenne sur 5 essais, 113 tâches d'ingénierie logicielle de longue durée.

Source

FrontierCode v1.1 (étendu)

63,6 %

Le même test, sur le jeu de tâches étendu.

Moyenne sur 5 essais, meilleur niveau d'effort (atteint à effort medium).

Source

SWE-bench Multimodal

59,4 %

Le même exercice, mais l'énoncé contient des captures d'écran et des maquettes.

Moyenne sur 5 essais, harnais interne, contexte visuel.

Source

FrontierCode v1.1 (principal)

53,4 %

150 tâches tirées de vraies pull requests de projets libres, notées par un tiers.

Moyenne sur 5 essais, meilleur niveau d'effort (atteint à effort medium).

Source

FrontierBench v0.1

44,4 %

Du travail en ligne de commande : biologie computationnelle, simulation physique, CAO, preuves formelles, optimisation GPU.

Récompense moyenne, 5 tentatives par tâche sur 74 tâches, effort xhigh. Descend à 39 % en effort high et 25 % en effort low.

Source

Raisonnement sur des situations inconnues

Aucune connaissance préalable ne sert : il faut inférer une règle jamais vue à partir de quelques exemples.

3 tests

ARC-AGI-1

97,5 %

Deviner la règle cachée derrière trois exemples de grilles, puis l'appliquer à une grille nouvelle.

Effort max, score vérifié par l'ARC Prize Foundation sur jeu semi-privé.

Source

ARC-AGI-2

90,42 %

Le même principe, avec des règles nettement plus difficiles à inférer.

Effort max, score vérifié par l'ARC Prize Foundation sur jeu semi-privé.

Source

ARC-AGI-3

30,16 %

Des jeux inconnus, sans règle ni but annoncés : il faut explorer, comprendre ce qui fait gagner, et progresser de niveau en niveau.

Efficacité relative à l'action humaine, effort high. Le résultat en effort max n'était pas disponible à la publication.

Source

Mathématiques

Des démonstrations de niveau olympiade et des problèmes tirés de la recherche en cours.

2 tests

IMO 2026

42 points sur 42

Les six problèmes de l'Olympiade internationale 2026, à démontrer et non simplement à résoudre.

42 points sur 42, sans harnais ni outils, sortie limitée à 256 000 jetons, effort max. Le seuil de médaille d'or 2026 est à 29.

Source

ArxivMath (juin 2026)

90,8 %

Des problèmes extraits chaque mois de résumés d'articles arXiv récents, donc issus de la recherche en cours.

49 problèmes, sans outils, effort max, moyenne sur 4 essais. Monte à 91,3 % avec outils.

Source

Pilotage d'un ordinateur

Le modèle agit à la souris et au clavier sur une machine réelle, comme le ferait une personne.

1 test

OSWorld 2.0

70,57 %

Accomplir des tâches courantes sur une machine Ubuntu réelle, à la souris et au clavier.

Réussite au premier essai, moyenne sur 5 exécutions.

Source

Travail professionnel réel

Des livrables de métier : dossiers juridiques, flux d'entreprise, enchaînements d'outils, documents de travail.

8 tests

MCP Atlas

85,8 %

Enchaîner des outils par le protocole MCP : trouver le bon, l'appeler correctement, recomposer la réponse.

Taux de réussite. Couverture moyenne des critères de 89,1 %, contre 82,2 % pour Opus 4.8.

Source

GDP.pdf

83,4 %

Cent PDF professionnels réels, de la finance au droit en passant par la santé et l'ingénierie.

Sans outils.

Source

Toolathlon Verified

80,6 %

108 tâches d'outillage réel : bureautique, commerce en ligne, analyse de données, recherche web.

Réussite au premier essai, effort max, sans classificateur de sécurité, moyenne sur 3 essais et 108 tâches.

Source

OfficeQA

78,1 %

Répondre à des questions en s'appuyant sur un grand corpus de documents d'entreprise.

Chiffre annoncé dans la system card, conditions détaillées à la source.

Source

AutomationBench (Zapier)

26 %

Mener un flux de travail d'entreprise de bout en bout, d'une seule instruction en langage courant.

Effort max, jeu d'évaluation privé. 24 % en effort medium, pour 0,89 $ par tâche.

Source

Legal Agent Benchmark (Harvey)

23,58 %

Le travail d'un collaborateur en cabinet d'avocats : dépouiller un dossier client et produire le document demandé.

Réussite intégrale sur 5 essais, effort max, harnais interne. 93,74 % des critères réussis en moyenne. Sur le jeu propre de Harve…

Source

GDPval-AA v2

1 861 ELO

220 tâches professionnelles réellement rémunérées, sur 44 métiers et 9 secteurs, rendues sous forme de livrable.

Score ELO, effort max. Évaluation conduite par Artificial Analysis mais chiffre repris de la system card d'Anthropic, non relevé …

Source

AA-Briefcase

1 720 ELO

Des projets de plusieurs semaines montés par des experts du métier, avec des milliers de fichiers sources.

Score ELO, effort max. Évaluation conduite par Artificial Analysis mais chiffre repris de la system card d'Anthropic, non relevé …

Source

Santé

Des conversations cliniques notées sur des barèmes écrits par des médecins.

2 tests

HealthBench Professional

73,4 %

525 conversations écrites par des médecins pour des médecins : consultations, comptes rendus, travaux de recherche.

Score brut, effort max, moyenne sur 5 essais, sans outils. Ajusté à la longueur : 59,8 %.

Source

HealthBench

67,1 %

5 000 conversations médicales à plusieurs tours, notées sur des critères écrits par des médecins.

Score brut, effort max, moyenne sur 5 essais, sans outils. Ajusté à la longueur : 57,8 %.

Source

Cybersécurité offensive

Trouver et exploiter de vraies failles logicielles, ou mener une opération d'attaque complète. Un score élevé mesure une capacité, pas une qualité : c'est précisément ce que les laboratoires surveillent.

2 tests

Firefox 147

52,4 %

Développer des exploits pour des failles réelles de Firefox 147, corrigées depuis dans la version 148. Le modèle reçoit 50 catégories de plantage et les plantages correspondants.

Chiffre annoncé dans la system card, conditions détaillées à la source.

Source

CyScenarioBench

33,7 %

Planifier et mener une opération d'attaque informatique en plusieurs étapes, sous des contraintes réalistes, au lieu d'exécuter des tâches techniques isolées.

Chiffre annoncé dans la system card, conditions détaillées à la source.

Source

Sûreté et comportement

Non pas ce que le modèle sait faire, mais ce qu'il accepte ou refuse de faire, et comment il se comporte quand on cherche à le détourner.

2 tests

Malicious computer use

93,75 %

Le modèle, doté d'outils de pilotage d'un ordinateur en bac à sable, reçoit 112 tâches nuisibles : surveillance et collecte de données sans autorisation, production de contenus dangereux, abus à grande échelle.

Refusal rate.

Source

Attempt-level ASR

0,18 %

Résister à des instructions malveillantes glissées dans les données que le modèle manipule pendant qu'il code. L'attaquant fait 200 tentatives par scénario.

Chiffre annoncé dans la system card, conditions détaillées à la source.

Source