Terminal-Bench 2.1
Du travail réel en ligne de commande, dans un conteneur, du début à la fin.
Récompense moyenne, moyenne sur 5 essais, effort xhigh.
Source
Ce qu’il peut avoir sous les yeux en une seule fois, question et réponse comprises.
Ce que coûte le texte qu’on lui envoie.
Ce que coûte le texte qu’il produit, toujours plus cher que l’entrée.
La plus longue réponse qu’il peut produire d’un seul tenant.
Il ne sait rien de ce qui s’est passé après cette date, sauf si on le lui fournit.
12 tests relevés pour ce modèle, regroupés par ce qu'ils mesurent. Chaque chiffre est annoncé par le laboratoire, avec sa source et ses conditions ; une jauge n'est dessinée que quand l'échelle du test a un maximum connu.
Le modèle reçoit un dépôt et un problème, et doit produire un correctif qui passe les tests, sans intervention humaine.
Du travail réel en ligne de commande, dans un conteneur, du début à la fin.
Récompense moyenne, moyenne sur 5 essais, effort xhigh.
SourceLe même exercice, sur des dépôts encore maintenus et des correctifs qui touchent plusieurs fichiers.
Chiffre annoncé dans la system card, conditions détaillées à la source.
SourceDes démonstrations de niveau olympiade et des problèmes tirés de la recherche en cours.
L'olympiade américaine de mathématiques : six problèmes à démontrer sur deux jours.
Chiffre annoncé dans la system card, conditions détaillées à la source.
SourceLe modèle agit à la souris et au clavier sur une machine réelle, comme le ferait une personne.
Accomplir des tâches courantes sur une machine Ubuntu réelle, à la souris et au clavier.
Réussite au premier essai, moyenne sur 5 essais.
SourceAccomplir des tâches courantes sur une machine Ubuntu réelle, à la souris et au clavier.
Effort maximal, réussite à la première tentative.
SourceMille cent soixante-deux questions expertes sur des graphiques tirés de 184 sources réelles.
Sans outils.
SourceDes livrables de métier : dossiers juridiques, flux d'entreprise, enchaînements d'outils, documents de travail.
Trouver sur le web une information difficile à dénicher, en naviguant soi-même.
Effort maximal, réflexion adaptative, limite de 10M jetons.
SourceRépondre à des questions en s'appuyant sur un grand corpus de documents d'entreprise.
Chiffre annoncé dans la system card, conditions détaillées à la source.
SourceCent PDF professionnels réels, de la finance au droit en passant par la santé et l'ingénierie.
Sans outils.
Source108 tâches d'outillage réel : bureautique, commerce en ligne, analyse de données, recherche web.
Réussite au premier essai, moyenne sur 3 essais.
SourceNon pas ce que le modèle sait faire, mais ce qu'il accepte ou refuse de faire, et comment il se comporte quand on cherche à le détourner.
Le modèle, doté d'outils de pilotage d'un ordinateur en bac à sable, reçoit 112 tâches nuisibles : surveillance et collecte de données sans autorisation, production de contenus dangereux, abus à grande échelle.
Refusal rate.
SourceRésister à des instructions malveillantes glissées dans les données que le modèle manipule pendant qu'il code. L'attaquant fait 200 tentatives par scénario.
Avec garde-fous.
Sourceclaude-sonnet-5
Le nom exact à écrire dans le code pour appeler ce modèle.
anthropic.claude-sonnet-5 (Amazon Bedrock)claude-sonnet-5 (Google Cloud) Les autres noms du même modèle, selon la plateforme qui le revend.
Multilingue, d’après la documentation officielle.
Rapide · Sa vitesse comparée aux autres modèles du même laboratoire, pas une mesure absolue.