SWE-bench Verified
Corriger de vrais tickets ouverts sur GitHub, dans le dépôt d'origine, sans aide.
Source
Previous frontier model for professional work with configurable reasoning effort
Ce qu’il peut avoir sous les yeux en une seule fois, question et réponse comprises.
Ce que coûte le texte qu’on lui envoie.
Ce que coûte le texte qu’il produit, toujours plus cher que l’entrée.
La plus longue réponse qu’il peut produire d’un seul tenant.
Il ne sait rien de ce qui s’est passé après cette date, sauf si on le lui fournit.
Le modèle peut réfléchir avant de répondre, en produisant des jetons de raisonnement facturés comme la sortie. La profondeur se règle par un niveau d'effort.
La réponse arrive mot à mot pendant qu'elle s'écrit, au lieu d'attendre qu'elle soit finie.
Le modèle rend une réponse au format demandé, exploitable par un programme sans relecture.
Le modèle peut demander l'exécution d'une fonction du programme qui l'appelle et se servir du résultat.
Le modèle peut chercher une réponse dans des documents fournis plutôt que dans ce qu'il a appris.
Des fichiers peuvent lui être soumis directement.
Le modèle voit les images qu'on lui soumet et peut répondre à leur sujet.
Le modèle peut consulter le web pendant qu'il répond, ce qui lui donne accès à des faits postérieurs à son entraînement.
Une partie de requête déjà envoyée est facturée moins cher si elle est réutilisée peu après.
Le modèle peut produire une image.
Le modèle peut écrire puis exécuter du code pour calculer ou vérifier lui-même.
Le modèle dispose d'un terminal pour lancer des commandes.
Le modèle peut modifier des fichiers de code par correctifs successifs.
Des marches à suivre préparées peuvent être chargées à la demande pour une tâche donnée.
Le modèle peut se brancher sur des services extérieurs par le protocole ouvert Model Context Protocol.
24 tests relevés pour ce modèle, regroupés par ce qu'ils mesurent. Chaque chiffre est annoncé par le laboratoire, avec sa source et ses conditions ; une jauge n'est dessinée que quand l'échelle du test a un maximum connu.
Le modèle reçoit un dépôt et un problème, et doit produire un correctif qui passe les tests, sans intervention humaine.
Corriger de vrais tickets ouverts sur GitHub, dans le dépôt d'origine, sans aide.
SourceRéaliser de vraies missions de développement freelance, payées, telles qu'elles ont été publiées sur une place de marché.
relevé sous « SWE-Lancer, IC Diamond »
SourceDu travail réel en ligne de commande, dans un conteneur, du début à la fin.
SourceLe même exercice, sur des dépôts encore maintenus et des correctifs qui touchent plusieurs fichiers.
relevé sous « SWE-Bench Pro, Public »
SourceAucune connaissance préalable ne sert : il faut inférer une règle jamais vue à partir de quelques exemples.
Des questions à réponse unique, du niveau lycée au niveau doctorat, où seule la justesse compte.
Retrouver la bonne réponse quand plusieurs demandes presque identiques ont été noyées dans une très longue conversation.
relevé sous « OpenAI MRCR v2 8-needle 4K-8K »
SourceParcourir un graphe dont la description remplit toute la fenêtre de contexte.
relevé sous « GraphWalks bfs <128k »
SourceDes questions de niveau doctorat en biologie, physique et chimie, écrites par des spécialistes.
no tools
SourceLes 57 matières de MMLU, posées dans quatorze langues autres que l'anglais.
SourcePercevoir, interpréter et raisonner sur des questions de niveau licence mêlant texte et images, dans des disciplines variées.
no tools
SourceDes questions écrites par des spécialistes pour rester hors de portée des modèles.
no tools, relevé sous « HLE »
SourceDes démonstrations de niveau olympiade et des problèmes tirés de la recherche en cours.
L'examen américain d'invitation en mathématiques, une compétition lycéenne prestigieuse.
no tools
SourceLe tournoi de mathématiques organisé par Harvard et le MIT, une compétition entre équipes de lycéens.
no tools, relevé sous « HMMT, Feb 2025 »
SourceRésoudre des problèmes de mathématiques de niveau expert, écrits pour l'occasion par des mathématiciens de recherche afin qu'aucune solution ne circule déjà.
relevé sous « FrontierMath Tier 1-3 »
SourceLe modèle agit à la souris et au clavier sur une machine réelle, comme le ferait une personne.
Raisonner sur les figures d'articles scientifiques publiés sur arXiv.
w/ Python
SourcePointer précisément le bon élément d'interface sur une capture d'écran de logiciel professionnel.
w/ Python
SourceAccomplir des tâches courantes sur une machine Ubuntu réelle, à la souris et au clavier.
SourceDes livrables de métier : dossiers juridiques, flux d'entreprise, enchaînements d'outils, documents de travail.
Traiter une demande de service client de bout en bout, en suivant les règles de l'entreprise et en dialoguant avec le client.
SourceRetrouver sur le web une information difficile à trouver, en gardant sous les yeux tout ce qui a déjà été lu.
SourceProduire un vrai livrable de travail dans l'une de quarante-quatre professions, à partir d'une commande détaillée.
ties allowed, wins or ties
SourceTrouver sur le web une information difficile à dénicher, en naviguant soi-même.
SourceRépondre à des questions en s'appuyant sur un grand corpus de documents d'entreprise.
SourceEnchaîner des outils par le protocole MCP : trouver le bon, l'appeler correctement, recomposer la réponse.
relevé sous « Scale MCP-Atlas »
Sourcegpt-5.2
Le nom exact à écrire dans le code pour appeler ce modèle.
gpt-5.2-2025-12-11 Les autres noms du même modèle, selon la plateforme qui le revend.
Mettre en mémoire un début de requête réutilisé d’un appel à l’autre : 1,25 fois le prix d’entrée.