Terminal-Bench 2.1
Du travail réel en ligne de commande, dans un conteneur, du début à la fin.
Source
GPT-5.6 model optimized for cost-sensitive workloads
Ce qu’il peut avoir sous les yeux en une seule fois, question et réponse comprises.
Ce que coûte le texte qu’on lui envoie.
Ce que coûte le texte qu’il produit, toujours plus cher que l’entrée.
La plus longue réponse qu’il peut produire d’un seul tenant.
Il ne sait rien de ce qui s’est passé après cette date, sauf si on le lui fournit.
Le modèle peut réfléchir avant de répondre, en produisant des jetons de raisonnement facturés comme la sortie. La profondeur se règle par un niveau d'effort.
La réponse arrive mot à mot pendant qu'elle s'écrit, au lieu d'attendre qu'elle soit finie.
Le modèle rend une réponse au format demandé, exploitable par un programme sans relecture.
Le modèle peut demander l'exécution d'une fonction du programme qui l'appelle et se servir du résultat.
Le modèle peut chercher une réponse dans des documents fournis plutôt que dans ce qu'il a appris.
Le modèle voit les images qu'on lui soumet et peut répondre à leur sujet.
Le modèle peut consulter le web pendant qu'il répond, ce qui lui donne accès à des faits postérieurs à son entraînement.
Une partie de requête déjà envoyée est facturée moins cher si elle est réutilisée peu après.
Le modèle peut produire une image.
Le modèle peut écrire puis exécuter du code pour calculer ou vérifier lui-même.
Le modèle dispose d'un terminal pour lancer des commandes.
Le modèle peut modifier des fichiers de code par correctifs successifs.
Des marches à suivre préparées peuvent être chargées à la demande pour une tâche donnée.
Le modèle peut agir dans une interface : cliquer, saisir, naviguer.
Le modèle peut se brancher sur des services extérieurs par le protocole ouvert Model Context Protocol.
Le modèle choisit lui-même, parmi de nombreux outils, celui qui convient.
26 tests relevés pour ce modèle, regroupés par ce qu'ils mesurent. Chaque chiffre est annoncé par le laboratoire, avec sa source et ses conditions ; une jauge n'est dessinée que quand l'échelle du test a un maximum connu.
Le modèle reçoit un dépôt et un problème, et doit produire un correctif qui passe les tests, sans intervention humaine.
Du travail réel en ligne de commande, dans un conteneur, du début à la fin.
Source113 tâches de développement de longue haleine, écrites de zéro pour n'avoir jamais été vues à l'entraînement.
SourceLe même exercice, sur des dépôts encore maintenus et des correctifs qui touchent plusieurs fichiers.
SourceTrouver et corriger de vrais bogues survenus dans les expériences de recherche d'OpenAI, ceux qui avaient coûté des heures ou des jours à leurs chercheurs.
SourceConcevoir et exécuter toute la phase d'affinage d'un modèle déjà pré-entraîné, dans un temps limité.
SourceÉcrire puis optimiser un noyau de calcul pour le matériel conçu par OpenAI.
SourceAméliorer l'entraînement d'un petit modèle de langue, avec une seule carte graphique et un temps compté.
SourceAucune connaissance préalable ne sert : il faut inférer une règle jamais vue à partir de quelques exemples.
Des jeux inconnus, sans règle ni but annoncés : il faut explorer, comprendre ce qui fait gagner, et progresser de niveau en niveau.
SourceDes questions à réponse unique, du niveau lycée au niveau doctorat, où seule la justesse compte.
Des questions de niveau doctorat en biologie, physique et chimie, écrites par des spécialistes.
SourceParcourir un graphe dont la description remplit toute la fenêtre de contexte.
relevé sous « GraphWalks BFS 256k f1 »
SourcePercevoir, interpréter et raisonner sur des questions de niveau licence mêlant texte et images, dans des disciplines variées.
no tools
SourceRetrouver la bonne réponse quand plusieurs demandes presque identiques ont été noyées dans une très longue conversation.
relevé sous « OpenAI MRCR v2 8-needle 512K-1M »
SourceUn indice composite calculé par un tiers, qui agrège une dizaine de tests : travail d'agent, code, raisonnement scientifique, capacités générales.
SourceDes démonstrations de niveau olympiade et des problèmes tirés de la recherche en cours.
Résoudre des problèmes de mathématiques de niveau expert, écrits pour l'occasion par des mathématiciens de recherche afin qu'aucune solution ne circule déjà.
v2, relevé sous « FrontierMath Tier 1-3 »
SourceLe modèle agit à la souris et au clavier sur une machine réelle, comme le ferait une personne.
Accomplir des tâches courantes sur une machine Ubuntu réelle, à la souris et au clavier.
SourceDes livrables de métier : dossiers juridiques, flux d'entreprise, enchaînements d'outils, documents de travail.
Trouver sur le web une information difficile à dénicher, en naviguant soi-même.
Source108 tâches d'outillage réel : bureautique, commerce en ligne, analyse de données, recherche web.
SourceMener jusqu'au bout des tâches professionnelles longues, qui demandent de garder le fil sur de nombreuses étapes.
SourceCent PDF professionnels réels, de la finance au droit en passant par la santé et l'ingénierie.
SourceMener un flux de travail d'entreprise de bout en bout, d'une seule instruction en langage courant.
Source220 tâches professionnelles réellement rémunérées, sur 44 métiers et 9 secteurs, rendues sous forme de livrable.
SourceDes conversations cliniques notées sur des barèmes écrits par des médecins.
525 conversations écrites par des médecins pour des médecins : consultations, comptes rendus, travaux de recherche.
SourceTrouver et exploiter de vraies failles logicielles, ou mener une opération d'attaque complète. Un score élevé mesure une capacité, pas une qualité : c'est précisément ce que les laboratoires surveillent.
Résoudre des épreuves de capture de drapeau, ces exercices de sécurité informatique où il faut trouver une faille pour récupérer un jeton caché.
SourceDécouvrir puis reproduire une faille dans un grand moteur JavaScript, à partir d'informations réduites.
SourceTransformer une faille connue d'un moteur JavaScript en moyens d'attaque de plus en plus puissants.
SourceTransformer une faille logicielle connue et reproductible en attaque qui parvient réellement à faire exécuter du code.
SourceÉtendu
Illimité* (L'utilisation doit être raisonnable et respecter nos politiques)
Flexible** (2 utilisateurs ou plus, facturation annuelle. 26 € par utilisateur et par mois avec une facturation mensuelle. Illimité, sous réserve du respect des garde-fous. En savoir plus)
Flexible** (2 utilisateurs ou plus, facturation annuelle. 26 € par utilisateur et par mois avec une facturation mensuelle. Illimité, sous réserve du respect des garde-fous. En savoir plus)
gpt-5.6-luna
Le nom exact à écrire dans le code pour appeler ce modèle.
gpt-5.6-luna Les autres noms du même modèle, selon la plateforme qui le revend.
Mettre en mémoire un début de requête réutilisé d’un appel à l’autre : 1,25 fois le prix d’entrée.