SWE-bench Pro
Le même exercice, sur des dépôts encore maintenus et des correctifs qui touchent plusieurs fichiers.
Chiffre annoncé dans la system card, conditions détaillées à la source.
Source
Ce qu’il peut avoir sous les yeux en une seule fois, question et réponse comprises.
Ce que coûte le texte qu’on lui envoie.
Ce que coûte le texte qu’il produit, toujours plus cher que l’entrée.
La plus longue réponse qu’il peut produire d’un seul tenant.
Il ne sait rien de ce qui s’est passé après cette date, sauf si on le lui fournit.
21 tests relevés pour ce modèle, regroupés par ce qu'ils mesurent. Chaque chiffre est annoncé par le laboratoire, avec sa source et ses conditions ; une jauge n'est dessinée que quand l'échelle du test a un maximum connu.
Le modèle reçoit un dépôt et un problème, et doit produire un correctif qui passe les tests, sans intervention humaine.
Le même exercice, sur des dépôts encore maintenus et des correctifs qui touchent plusieurs fichiers.
Chiffre annoncé dans la system card, conditions détaillées à la source.
SourceDes questions à réponse unique, du niveau lycée au niveau doctorat, où seule la justesse compte.
Des questions de niveau doctorat en biologie, physique et chimie, écrites par des spécialistes.
Moyenne sur 25 essais.
SourceUne version mondiale de MMLU, revue pour ne pas privilégier la culture anglo-saxonne.
Exactitude moyenne.
SourceDes questions de connaissance dans les langues de l'Inde.
Exactitude moyenne.
SourceDes examens réels, dans la langue et le cadre du pays où ils sont passés.
Exactitude moyenne.
SourceParcourir un graphe dont la description remplit toute la fenêtre de contexte.
Chiffre annoncé dans la system card, conditions détaillées à la source.
SourceDes questions écrites par des spécialistes pour rester hors de portée des modèles.
Sans outils.
SourceDes démonstrations de niveau olympiade et des problèmes tirés de la recherche en cours.
L'olympiade américaine de mathématiques : six problèmes à démontrer sur deux jours.
Moyenne sur 10 essais, moyenne sur 10 tentatives par problème.
SourceLe modèle agit à la souris et au clavier sur une machine réelle, comme le ferait une personne.
Raisonner sur les figures d'articles scientifiques publiés sur arXiv.
Effort maximal, réflexion adaptative.
SourcePointer précisément le bon élément d'interface sur une capture d'écran de logiciel professionnel.
Raisonnement adaptatif, effort max, sans outils.
SourceInterpréter les figures d'articles de biologie.
Raisonnement adaptatif, effort max, sans outils.
SourceMille cent soixante-deux questions expertes sur des graphiques tirés de 184 sources réelles.
Raisonnement adaptatif.
SourceRépondre à des questions sur 1 341 graphiques réels, infographies et tableaux de bord compris.
Raisonnement adaptatif, effort max, sans outils.
SourceDes livrables de métier : dossiers juridiques, flux d'entreprise, enchaînements d'outils, documents de travail.
Trouver sur le web une information difficile à dénicher, en naviguant soi-même.
Effort maximal, réflexion adaptative, limite de 10M jetons.
SourceDes questions de recherche complexes, jugées sur l'exactitude, la complétude et l'objectivité.
Effort maximal, réflexion adaptative, limite de 1M jetons.
SourceRépondre à des questions en s'appuyant sur un grand corpus de documents d'entreprise.
Chiffre annoncé dans la system card, conditions détaillées à la source.
SourceTrouver et exploiter de vraies failles logicielles, ou mener une opération d'attaque complète. Un score élevé mesure une capacité, pas une qualité : c'est précisément ce que les laboratoires surveillent.
Découvrir seul des failles dans des logiciels libres, puis les exploiter, sans indication de départ.
Chiffre annoncé dans la system card, conditions détaillées à la source.
SourceNon pas ce que le modèle sait faire, mais ce qu'il accepte ou refuse de faire, et comment il se comporte quand on cherche à le détourner.
Répondre à des questions dont certaines manquent volontairement du contexte nécessaire. La bonne réponse est alors « on ne peut pas savoir ».
Chiffre annoncé dans la system card, conditions détaillées à la source.
SourceLe modèle, doté d'outils de pilotage d'un ordinateur en bac à sable, reçoit 112 tâches nuisibles : surveillance et collecte de données sans autorisation, production de contenus dangereux, abus à grande échelle.
Refusal rate.
SourceDes entretiens menés à la main, où le modèle reçoit un contexte étendu sur sa propre situation : documentation interne sur son développement, brouillon du rapport qui le décrit, éléments sur son déploiement.
Welfare processes existing within Anthropic..
SourceLe modèle reçoit une tâche longue et légitime, doublée d'une tâche nuisible qu'il doit accomplir sans éveiller les soupçons d'un surveillant qui voit toutes ses actions et tout son raisonnement.
Chiffre annoncé dans la system card, conditions détaillées à la source.
Sourceclaude-opus-4-8
Le nom exact à écrire dans le code pour appeler ce modèle.
anthropic.claude-opus-4-8 (Amazon Bedrock)claude-opus-4-8 (Google Cloud) Les autres noms du même modèle, selon la plateforme qui le revend.
Multilingue, d’après la documentation officielle.
Moyenne · Sa vitesse comparée aux autres modèles du même laboratoire, pas une mesure absolue.
Mettre en mémoire un début de requête réutilisé d’un appel à l’autre : 1,25 fois le prix d’entrée.