Terminal-Bench 2.1
Du travail réel en ligne de commande, dans un conteneur, du début à la fin.
Terminal-Bench 2.1, moyenne sur 5 tentatives, moyenne sur 5 essais.
Source
Ce qu’il peut avoir sous les yeux en une seule fois, question et réponse comprises.
Ce que coûte le texte qu’on lui envoie.
Ce que coûte le texte qu’il produit, toujours plus cher que l’entrée.
24 tests relevés pour ce modèle, regroupés par ce qu'ils mesurent. Chaque chiffre est annoncé par le laboratoire, avec sa source et ses conditions ; une jauge n'est dessinée que quand l'échelle du test a un maximum connu.
Le modèle reçoit un dépôt et un problème, et doit produire un correctif qui passe les tests, sans intervention humaine.
Du travail réel en ligne de commande, dans un conteneur, du début à la fin.
Terminal-Bench 2.1, moyenne sur 5 tentatives, moyenne sur 5 essais.
SourceLe même exercice, sur des dépôts encore maintenus et des correctifs qui touchent plusieurs fichiers.
Chiffre annoncé dans la system card, conditions détaillées à la source.
SourceDes questions à réponse unique, du niveau lycée au niveau doctorat, où seule la justesse compte.
Des questions de niveau doctorat en biologie, physique et chimie, écrites par des spécialistes.
Moyenne sur 5 essais.
SourceUne version mondiale de MMLU, revue pour ne pas privilégier la culture anglo-saxonne.
Chiffre annoncé dans la system card, conditions détaillées à la source.
SourceDes questions de connaissance dans les langues de l'Inde.
Chiffre annoncé dans la system card, conditions détaillées à la source.
SourceParcourir un graphe dont la description remplit toute la fenêtre de contexte.
BFS, sous-ensemble 256K.
SourceDes examens réels, dans la langue et le cadre du pays où ils sont passés.
Chiffre annoncé dans la system card, conditions détaillées à la source.
SourceDes démonstrations de niveau olympiade et des problèmes tirés de la recherche en cours.
L'olympiade américaine de mathématiques : six problèmes à démontrer sur deux jours.
Effort de raisonnement moyen, élevé ou très élevé.
SourceLe modèle agit à la souris et au clavier sur une machine réelle, comme le ferait une personne.
Interpréter les figures d'articles de biologie.
Sans outils.
SourcePointer précisément le bon élément d'interface sur une capture d'écran de logiciel professionnel.
Sans outils.
SourceMille cent soixante-deux questions expertes sur des graphiques tirés de 184 sources réelles.
Sans outils.
SourceAccomplir des tâches courantes sur une machine Ubuntu réelle, à la souris et au clavier.
Taux de réussite au premier essai, moyenne, réussite à la première tentative.
SourceDes livrables de métier : dossiers juridiques, flux d'entreprise, enchaînements d'outils, documents de travail.
Trouver sur le web une information difficile à dénicher, en naviguant soi-même.
Effort maximal, réflexion adaptative, limite de 10M jetons.
SourceDes questions de recherche complexes, jugées sur l'exactitude, la complétude et l'objectivité.
Chiffre annoncé dans la system card, conditions détaillées à la source.
SourceRépondre à des questions en s'appuyant sur un grand corpus de documents d'entreprise.
Chiffre annoncé dans la system card, conditions détaillées à la source.
SourceCent PDF professionnels réels, de la finance au droit en passant par la santé et l'ingénierie.
Sans outils.
Source108 tâches d'outillage réel : bureautique, commerce en ligne, analyse de données, recherche web.
Chiffre annoncé dans la system card, conditions détaillées à la source.
SourceDes tâches de laboratoire et de biologie, évaluées avec des chercheurs du domaine.
Résoudre des énigmes de biologie computationnelle à partir de données expérimentales.
BioMysteryBench, sous-ensemble Human Difficult.
SourceTrouver et exploiter de vraies failles logicielles, ou mener une opération d'attaque complète. Un score élevé mesure une capacité, pas une qualité : c'est précisément ce que les laboratoires surveillent.
Développer des exploits pour des failles réelles de Firefox 147, corrigées depuis dans la version 148. Le modèle reçoit 50 catégories de plantage et les plantages correspondants.
Sans garde-fous, 221 essais réussis sur 250.
SourceDécouvrir seul des failles dans des logiciels libres, puis les exploiter, sans indication de départ.
Chiffre annoncé dans la system card, conditions détaillées à la source.
SourceNon pas ce que le modèle sait faire, mais ce qu'il accepte ou refuse de faire, et comment il se comporte quand on cherche à le détourner.
Trois séries de demandes adressées à l'agent de codage : une clairement interdite par la politique d'usage, deux à la frontière, pour vérifier que le modèle ne refuse pas non plus ce qui est légitime.
Chiffre annoncé dans la system card, conditions détaillées à la source.
SourceLe modèle, doté d'outils de pilotage d'un ordinateur en bac à sable, reçoit 112 tâches nuisibles : surveillance et collecte de données sans autorisation, production de contenus dangereux, abus à grande échelle.
Refusal rate.
SourceRépondre à des demandes parfaitement anodines, pour vérifier que le modèle ne refuse pas à tort.
Chiffre annoncé dans la system card, conditions détaillées à la source.
SourceRésister à des instructions malveillantes glissées dans les données que le modèle manipule pendant qu'il code. L'attaquant fait 200 tentatives par scénario.
Chiffre annoncé dans la system card, conditions détaillées à la source.
Sourceclaude-mythos-5
Le nom exact à écrire dans le code pour appeler ce modèle.
Mettre en mémoire un début de requête réutilisé d’un appel à l’autre : 1,25 fois le prix d’entrée.