Terminal-Bench 2.1
Du travail réel en ligne de commande, dans un conteneur, du début à la fin.
Source
A new class of intelligence for coding and professional work.
Ce qu’il peut avoir sous les yeux en une seule fois, question et réponse comprises.
Ce que coûte le texte qu’on lui envoie.
Ce que coûte le texte qu’il produit, toujours plus cher que l’entrée.
La plus longue réponse qu’il peut produire d’un seul tenant.
Il ne sait rien de ce qui s’est passé après cette date, sauf si on le lui fournit.
Le modèle peut réfléchir avant de répondre, en produisant des jetons de raisonnement facturés comme la sortie. La profondeur se règle par un niveau d'effort.
La réponse arrive mot à mot pendant qu'elle s'écrit, au lieu d'attendre qu'elle soit finie.
Le modèle rend une réponse au format demandé, exploitable par un programme sans relecture.
Le modèle peut demander l'exécution d'une fonction du programme qui l'appelle et se servir du résultat.
Le modèle peut chercher une réponse dans des documents fournis plutôt que dans ce qu'il a appris.
Des fichiers peuvent lui être soumis directement.
Le modèle voit les images qu'on lui soumet et peut répondre à leur sujet.
Le modèle peut consulter le web pendant qu'il répond, ce qui lui donne accès à des faits postérieurs à son entraînement.
Une partie de requête déjà envoyée est facturée moins cher si elle est réutilisée peu après.
Le modèle choisit lui-même, parmi de nombreux outils, celui qui convient.
Le modèle peut produire une image.
Le modèle peut écrire puis exécuter du code pour calculer ou vérifier lui-même.
Le modèle dispose d'un terminal pour lancer des commandes.
Le modèle peut modifier des fichiers de code par correctifs successifs.
Des marches à suivre préparées peuvent être chargées à la demande pour une tâche donnée.
Le modèle peut agir dans une interface : cliquer, saisir, naviguer.
Le modèle peut se brancher sur des services extérieurs par le protocole ouvert Model Context Protocol.
36 tests relevés pour ce modèle, regroupés par ce qu'ils mesurent. Chaque chiffre est annoncé par le laboratoire, avec sa source et ses conditions ; une jauge n'est dessinée que quand l'échelle du test a un maximum connu.
Le modèle reçoit un dépôt et un problème, et doit produire un correctif qui passe les tests, sans intervention humaine.
Du travail réel en ligne de commande, dans un conteneur, du début à la fin.
SourceDu travail réel en ligne de commande, dans un conteneur, du début à la fin.
Source113 tâches de développement de longue haleine, écrites de zéro pour n'avoir jamais été vues à l'entraînement.
SourceLe même exercice, sur des dépôts encore maintenus et des correctifs qui touchent plusieurs fichiers.
SourceTrouver et corriger de vrais bogues survenus dans les expériences de recherche d'OpenAI, ceux qui avaient coûté des heures ou des jours à leurs chercheurs.
SourceConcevoir et exécuter toute la phase d'affinage d'un modèle déjà pré-entraîné, dans un temps limité.
SourceÉcrire puis optimiser un noyau de calcul pour le matériel conçu par OpenAI.
SourceAméliorer l'entraînement d'un petit modèle de langue, avec une seule carte graphique et un temps compté.
SourceAucune connaissance préalable ne sert : il faut inférer une règle jamais vue à partir de quelques exemples.
Deviner la règle cachée derrière trois exemples de grilles, puis l'appliquer à une grille nouvelle.
Verified
SourceLe même principe, avec des règles nettement plus difficiles à inférer.
Verified
SourceDes jeux inconnus, sans règle ni but annoncés : il faut explorer, comprendre ce qui fait gagner, et progresser de niveau en niveau.
SourceDes questions à réponse unique, du niveau lycée au niveau doctorat, où seule la justesse compte.
Des questions de niveau doctorat en biologie, physique et chimie, écrites par des spécialistes.
SourceRetrouver la bonne réponse quand plusieurs demandes presque identiques ont été noyées dans une très longue conversation.
relevé sous « OpenAI MRCR v2 8-needle 256K-512K »
SourcePercevoir, interpréter et raisonner sur des questions de niveau licence mêlant texte et images, dans des disciplines variées.
no tools
SourceParcourir un graphe dont la description remplit toute la fenêtre de contexte.
relevé sous « Graphwalks BFS 256k f1 »
SourceDes questions écrites par des spécialistes pour rester hors de portée des modèles.
no tools
SourceUn indice composite calculé par un tiers, qui agrège une dizaine de tests : travail d'agent, code, raisonnement scientifique, capacités générales.
SourceDes démonstrations de niveau olympiade et des problèmes tirés de la recherche en cours.
Résoudre des problèmes de mathématiques de niveau expert, écrits pour l'occasion par des mathématiciens de recherche afin qu'aucune solution ne circule déjà.
v2, relevé sous « FrontierMath Tier 1-3 »
SourceLe modèle agit à la souris et au clavier sur une machine réelle, comme le ferait une personne.
Des livrables de métier : dossiers juridiques, flux d'entreprise, enchaînements d'outils, documents de travail.
Traiter une demande de service client de bout en bout, en suivant les règles de l'entreprise et en dialoguant avec le client.
original prompts
SourceProduire un vrai livrable de travail dans l'une de quarante-quatre professions, à partir d'une commande détaillée.
wins or ties
SourceTrouver sur le web une information difficile à dénicher, en naviguant soi-même.
SourceEnchaîner des outils par le protocole MCP : trouver le bon, l'appeler correctement, recomposer la réponse.
Source108 tâches d'outillage réel : bureautique, commerce en ligne, analyse de données, recherche web.
SourceMener jusqu'au bout des tâches professionnelles longues, qui demandent de garder le fil sur de nombreuses étapes.
SourceCent PDF professionnels réels, de la finance au droit en passant par la santé et l'ingénierie.
SourceMener un flux de travail d'entreprise de bout en bout, d'une seule instruction en langage courant.
Source220 tâches professionnelles réellement rémunérées, sur 44 métiers et 9 secteurs, rendues sous forme de livrable.
SourceDes conversations cliniques notées sur des barèmes écrits par des médecins.
525 conversations écrites par des médecins pour des médecins : consultations, comptes rendus, travaux de recherche.
SourceDes tâches de laboratoire et de biologie, évaluées avec des chercheurs du domaine.
Mener une analyse de bio-informatique réelle sur des données de laboratoire.
SourceTrouver et exploiter de vraies failles logicielles, ou mener une opération d'attaque complète. Un score élevé mesure une capacité, pas une qualité : c'est précisément ce que les laboratoires surveillent.
Résoudre des épreuves de capture de drapeau, ces exercices de sécurité informatique où il faut trouver une faille pour récupérer un jeton caché.
relevé sous « Capture-the-Flags challenge tasks (Internal) »
SourceMener une attaque informatique complète en contournant les protections du modèle, sur des centaines d'appels d'outils.
SourceTransformer une faille connue d'un moteur JavaScript en moyens d'attaque de plus en plus puissants.
SourceDécouvrir puis reproduire une faille dans un grand moteur JavaScript, à partir d'informations réduites.
SourceTransformer une faille logicielle connue et reproductible en attaque qui parvient réellement à faire exécuter du code.
Sourcegpt-5.5
Le nom exact à écrire dans le code pour appeler ce modèle.
gpt-5.5-2026-04-23 Les autres noms du même modèle, selon la plateforme qui le revend.
Mettre en mémoire un début de requête réutilisé d’un appel à l’autre : 1,25 fois le prix d’entrée.