Terminal-Bench 2.1
Du travail réel en ligne de commande, dans un conteneur, du début à la fin.
SourceEntreprise américaine de recherche en intelligence artificielle, éditrice des modèles GPT et de ChatGPT. Fondée en 2015 sous forme d'organisation à but non lucratif, elle est aujourd'hui structurée en deux entités : la fondation OpenAI Foundation, qui gouverne, et la société OpenAI Group, qui exploite.
Les scores ci-dessous sont ceux de GPT-5.6 Luna, sorti le 9 juillet 2026, regroupés par ce qu'ils mesurent : 26 tests relevés, chacun annoncé par le laboratoire avec sa source et ses conditions. Une jauge n'est dessinée que quand l'échelle du test a un maximum connu.
Le modèle reçoit un dépôt et un problème, et doit produire un correctif qui passe les tests, sans intervention humaine.
Du travail réel en ligne de commande, dans un conteneur, du début à la fin.
Source113 tâches de développement de longue haleine, écrites de zéro pour n'avoir jamais été vues à l'entraînement.
SourceLe même exercice, sur des dépôts encore maintenus et des correctifs qui touchent plusieurs fichiers.
SourceTrouver et corriger de vrais bogues survenus dans les expériences de recherche d'OpenAI, ceux qui avaient coûté des heures ou des jours à leurs chercheurs.
SourceConcevoir et exécuter toute la phase d'affinage d'un modèle déjà pré-entraîné, dans un temps limité.
SourceÉcrire puis optimiser un noyau de calcul pour le matériel conçu par OpenAI.
SourceAméliorer l'entraînement d'un petit modèle de langue, avec une seule carte graphique et un temps compté.
SourceAucune connaissance préalable ne sert : il faut inférer une règle jamais vue à partir de quelques exemples.
Des jeux inconnus, sans règle ni but annoncés : il faut explorer, comprendre ce qui fait gagner, et progresser de niveau en niveau.
SourceDes questions à réponse unique, du niveau lycée au niveau doctorat, où seule la justesse compte.
Des questions de niveau doctorat en biologie, physique et chimie, écrites par des spécialistes.
SourceParcourir un graphe dont la description remplit toute la fenêtre de contexte.
relevé sous « GraphWalks BFS 256k f1 »
SourcePercevoir, interpréter et raisonner sur des questions de niveau licence mêlant texte et images, dans des disciplines variées.
no tools
SourceRetrouver la bonne réponse quand plusieurs demandes presque identiques ont été noyées dans une très longue conversation.
relevé sous « OpenAI MRCR v2 8-needle 512K-1M »
SourceUn indice composite calculé par un tiers, qui agrège une dizaine de tests : travail d'agent, code, raisonnement scientifique, capacités générales.
SourceDes démonstrations de niveau olympiade et des problèmes tirés de la recherche en cours.
Résoudre des problèmes de mathématiques de niveau expert, écrits pour l'occasion par des mathématiciens de recherche afin qu'aucune solution ne circule déjà.
v2, relevé sous « FrontierMath Tier 1-3 »
SourceLe modèle agit à la souris et au clavier sur une machine réelle, comme le ferait une personne.
Accomplir des tâches courantes sur une machine Ubuntu réelle, à la souris et au clavier.
SourceDes livrables de métier : dossiers juridiques, flux d'entreprise, enchaînements d'outils, documents de travail.
Trouver sur le web une information difficile à dénicher, en naviguant soi-même.
Source108 tâches d'outillage réel : bureautique, commerce en ligne, analyse de données, recherche web.
SourceMener jusqu'au bout des tâches professionnelles longues, qui demandent de garder le fil sur de nombreuses étapes.
SourceCent PDF professionnels réels, de la finance au droit en passant par la santé et l'ingénierie.
SourceMener un flux de travail d'entreprise de bout en bout, d'une seule instruction en langage courant.
Source220 tâches professionnelles réellement rémunérées, sur 44 métiers et 9 secteurs, rendues sous forme de livrable.
SourceDes conversations cliniques notées sur des barèmes écrits par des médecins.
525 conversations écrites par des médecins pour des médecins : consultations, comptes rendus, travaux de recherche.
SourceTrouver et exploiter de vraies failles logicielles, ou mener une opération d'attaque complète. Un score élevé mesure une capacité, pas une qualité : c'est précisément ce que les laboratoires surveillent.
Résoudre des épreuves de capture de drapeau, ces exercices de sécurité informatique où il faut trouver une faille pour récupérer un jeton caché.
SourceDécouvrir puis reproduire une faille dans un grand moteur JavaScript, à partir d'informations réduites.
SourceTransformer une faille connue d'un moteur JavaScript en moyens d'attaque de plus en plus puissants.
SourceTransformer une faille logicielle connue et reproductible en attaque qui parvient réellement à faire exécuter du code.
Source