Code et ingénierie logicielle
28 tests
Le modèle reçoit un dépôt et un problème, et doit produire un correctif qui passe les tests, sans intervention humaine.
SWE-bench Verified
Pourcentage, sur 100
Université de Princeton Aussi relevé sous : SWE-bench · SWE-Bench Verified (coding)
Corriger de vrais tickets ouverts sur GitHub, dans le dépôt d'origine, sans aide.
La part des 500 problèmes résolus. Chaque problème a été relu par des ingénieurs pour vérifier qu'il était réellement soluble, et un correctif ne compte que s'il fait passer les tests du dépôt.
SWE-bench Pro
Pourcentage, sur 100
Scale AI Aussi relevé sous : SWE-Bench Pro (Public) · SWE-Bench Pro, Public
Le même exercice, sur des dépôts encore maintenus et des correctifs qui touchent plusieurs fichiers.
La part des problèmes résolus. Variante plus dure que SWE-bench Verified : dépôts activement maintenus, correctifs répartis sur plusieurs fichiers, et solutions moins susceptibles d'avoir fuité dans les données d'entraînement.
SWE-bench Multilingual
Pourcentage, sur 100
Université de Princeton
Le même exercice, étendu à neuf langages de programmation.
La part des 300 problèmes résolus, répartis sur neuf langages. Mesure si la compétence tient hors de l'écosystème Python d'origine.
SWE-bench Multimodal
Pourcentage, sur 100
Université de Princeton
Le même exercice, mais l'énoncé contient des captures d'écran et des maquettes.
La part des problèmes résolus quand la description du ticket s'appuie sur des images. Il faut donc lire l'interface autant que le code.
Attention
Anthropic mesure ce test sur son propre harnais, construit sur le jeu public de développement. Le chiffre n'est pas directement comparable à un classement public.
DeepSWE v1.1
Pourcentage, sur 100
Together AI Aussi relevé sous : DeepSWE
113 tâches de développement de longue haleine, écrites de zéro pour n'avoir jamais été vues à l'entraînement.
La part des tâches menées à bout. Elles sont volontairement variées et proches de la complexité réelle d'un projet, et rédigées spécialement pour ce test afin d'écarter toute contamination.
FrontierCode v1.1 (principal)
Pourcentage, sur 100
Cognition
150 tâches tirées de vraies pull requests de projets libres, notées par un tiers.
Un score composite sur le jeu principal : chaque correctif est jugé sur des critères bloquants (les tests retenus à part) puis sur un barème pondéré, qui vérifie la couverture de tests exigée et l'absence de pratiques interdites. Le modèle travaille seul dans un conteneur, sans intervention.
FrontierCode v1.1 (étendu)
Pourcentage, sur 100
Cognition
Le même test, sur le jeu de tâches étendu.
Le même score composite, calculé sur le jeu étendu de FrontierCode. Il est mécaniquement plus haut que celui du jeu principal : les deux chiffres ne se comparent pas entre eux, seulement d'un modèle à l'autre.
FrontierBench v0.1
Pourcentage, sur 100
Équipe de Terminal-Bench
Du travail en ligne de commande : biologie computationnelle, simulation physique, CAO, preuves formelles, optimisation GPU.
La récompense moyenne obtenue sur 74 tâches, cinq essais chacune. Successeur de Terminal-Bench 2.1, avec des tâches plus dures et davantage de science et d'ingénierie.
Attention
C'est une récompense moyenne, pas un taux de réussite : une tâche partiellement accomplie rapporte des points.
Terminal-Bench 2.1
Pourcentage, sur 100
Terminal-Bench Aussi relevé sous : Terminal-Bench · Terminal Bench 2.1
Du travail réel en ligne de commande, dans un conteneur, du début à la fin.
La récompense moyenne obtenue sur des tâches d'ingénierie menées au terminal. Le prédécesseur de FrontierBench, dont les versions 2.0 et 2.1 ne se comparent pas entre elles.
Attention
Le test est sensible à la latence : un point d'accès plus lent termine moins d'épisodes dans le temps imparti, ce qui pénalise le score sans que le modèle soit moins capable.
CursorBench
Pourcentage, sur 100
Cursor
De vraies tâches de code, exécutées dans l'agent de production de Cursor.
La part des tâches réussies. Les énoncés viennent de l'usage interne de Cursor et du trafic de ses clients, donc du travail réellement demandé à un assistant de code.
SWE-bench Verified (hard subset)
Pourcentage, sur 100
Université de Princeton Aussi relevé sous : SWE-bench Verified (sous-ensemble difficile)
Le sous-ensemble le plus difficile de SWE-bench Verified.
La part des problèmes résolus parmi les plus durs du jeu vérifié, ceux que les générations précédentes échouaient massivement.
Novel compiler
Pourcentage, sur 100
Anthropic
Écrire un compilateur pour un langage que le modèle n'a jamais vu.
La part des cas de test passés par le compilateur produit. Anthropic retient cette tâche parce qu'elle n'est pas encore saturée, là où beaucoup d'autres ne départagent plus les modèles récents.
OpenRCA
Pourcentage, sur 100
Publié à ICLR 2025
Trouver la cause première d'une panne logicielle dans 335 incidents réels tirés de trois systèmes d'entreprise (télécoms, banque, place de marché), à partir de 68,5 Go de journaux, de métriques et de traces.
La part des incidents pour lesquels le modèle identifie correctement le composant en cause, l'heure de début et la raison de la panne. Les trois doivent être justes.
Terminal-Bench 2.0
Pourcentage, sur 100
Terminal-Bench
Du travail réel en ligne de commande, dans un conteneur, du début à la fin.
La récompense moyenne obtenue sur des tâches d'ingénierie menées au terminal.
Attention
Version 2.0 du test. Son chiffre ne se compare pas à celui de la 2.1, qui a corrigé des tâches jugées ambiguës. Le test est par ailleurs sensible à la latence : un point d'accès plus lent termine moins d'épisodes dans le temps imparti, ce qui pénalise le score sans que le modèle soit moins capable.
FrontierCode
Pourcentage, sur 100
Anthropic
Des tâches de programmation à la frontière de ce que les modèles savent faire, tirées de travaux réels.
La part des tâches menées à bien.
Attention
Le test existe en plusieurs sous-ensembles (principal, étendu, Diamond) dont les difficultés diffèrent nettement. Deux chiffres ne se comparent que si le sous-ensemble est le même ; il est indiqué dans les conditions quand la source le précise.
Aider's polyglot
Pourcentage, sur 100
Aider Aussi relevé sous : Aider’s polyglot · Aider Polyglot · Aider’s polyglot: diff · Aider’s polyglot: whole · Aider's polyglot: diff · Aider's polyglot: whole
Résoudre des exercices de programmation d'Exercism en modifiant des fichiers source, dans plusieurs langages.
La part des exercices résolus, avec un seul nouvel essai autorisé après un échec. Le libellé dit la façon d'écrire la modification : « diff » n'envoie que les lignes changées, « whole » réécrit le fichier entier. Les deux mesurent le même exercice et se comparent entre eux.
Internal Research Debugging Evaluation
Pourcentage, sur 100
OpenAI
Trouver et corriger de vrais bogues survenus dans les expériences de recherche d'OpenAI, ceux qui avaient coûté des heures ou des jours à leurs chercheurs.
La part des bogues résolus.
KernelGen 1P
Pourcentage, sur 100
OpenAI
Écrire puis optimiser un noyau de calcul pour le matériel conçu par OpenAI.
La part des noyaux à la fois corrects et plus rapides que la version de référence. Le modèle reçoit un environnement de développement, un banc d'essai et des tests ; il doit réduire le temps de calcul sans tricher, par exemple en déplaçant le calcul ailleurs ou en trompant la mesure.
NanoGPT
Pourcentage, sur 100
OpenAI
Améliorer l'entraînement d'un petit modèle de langue, avec une seule carte graphique et un temps compté.
Une note ramenée entre 0 et 1 selon le gain obtenu sur la référence. Le modèle doit modifier le code d'entraînement, régler les paramètres, trouver les goulots d'étranglement et atteindre une qualité visée.
Attention
Cette épreuve mesure la capacité d'un modèle à améliorer lui-même l'entraînement d'un autre modèle : elle est publiée au titre du suivi des risques, pas de la performance commerciale.
PostTrainBench Lite
Pourcentage, sur 100
OpenAI
Concevoir et exécuter toute la phase d'affinage d'un modèle déjà pré-entraîné, dans un temps limité.
Le gain obtenu sur un test visé. Le modèle reçoit un modèle libre, de la puissance de calcul, un accès à internet et des jeux de données ; il choisit lui-même les données, les méthodes et les boucles d'évaluation, sans avoir le droit de s'entraîner sur les réponses du test.
Attention
Comme NanoGPT, cette épreuve mesure la capacité d'un modèle à en améliorer un autre, et relève du suivi des risques.
SWE-Lancer
Pourcentage, sur 100
OpenAI Aussi relevé sous : SWE-Lancer IC SWE · SWE-Lancer, IC Diamond · SWE-Lancer: IC SWE Diamond · SWE-Lancer Diamond IC-SWE
Réaliser de vraies missions de développement freelance, payées, telles qu'elles ont été publiées sur une place de marché.
La part des missions dont le travail rendu passe les tests écrits par les clients d'origine. Le test se mesure aussi en dollars, puisque chaque mission a un prix : c'est le seul benchmark du catalogue à donner une valeur monétaire au travail rendu.
LiveCodeBench
Pourcentage, sur 100
Universités de Berkeley, MIT et Cornell
Écrire un programme qui résout un exercice de concours publié après l'entraînement du modèle.
La part des exercices résolus. Le jeu est renouvelé en continu et daté, pour que le modèle ne puisse pas avoir vu les solutions pendant son entraînement : les conditions précisent la fenêtre de dates retenue.
LiveCodeBench Pro
Pourcentage, sur 100
Non déclaré par la source
Résoudre des problèmes de compétition de haut niveau, tirés de Codeforces, de l'ICPC et des olympiades d'informatique.
La part des problèmes résolus. Le niveau est nettement au-dessus de LiveCodeBench : ce sont des épreuves de concours pour compétiteurs entraînés.
MLE-Bench
Pourcentage, sur 100
OpenAI
Mener une compétition d'apprentissage automatique de bout en bout, des données brutes au modèle entraîné.
La part des compétitions où le modèle atteint le niveau d'une médaille, en préparant les données, en entraînant un modèle et en soumettant un résultat sans aide.
SciCode
Pourcentage, sur 100
Non déclaré par la source
Écrire le code dont un chercheur a besoin pour reproduire un calcul scientifique publié.
La part des sous-problèmes résolus, tirés d'articles scientifiques et découpés en étapes de programmation.
NL2Repo
Pourcentage, sur 100
Daoguang Zan et ses coauteurs pour la tâche, Jingzhe Ding et ses coauteurs pour le jeu de tests
Construire un dépôt de code entier à partir d'un cahier des charges écrit en langage courant.
La part des dépôts produits qui satisfont les exigences. L'épreuve ne porte pas sur une fonction isolée : il faut tenir un plan sur la durée, garder des interfaces cohérentes entre les fichiers et corriger soi-même les incohérences.
Attention
Le nom désigne à la fois une tâche, définie en 2024, et un jeu de tests publié fin 2025 sous le nom NL2Repo-Bench. Une source qui écrit « NL2Repo » sans préciser laisse le doute : le chiffre ne se compare qu'à un chiffre de même provenance.
DSBench-FullStack
Pourcentage, sur 100
DeepSeek
Un jeu de tests interne de DeepSeek, portant sur le développement complet d'une application.
Ce que DeepSeek en publie, sans plus de détail : « DSBench-FullStack is an internal full-stack development test set ». Ni les tâches, ni le barème, ni le nombre de cas ne sont publics.
Attention
Jeu interne au laboratoire qui publie le score. Personne d'autre ne peut le repasser, et aucun chiffre d'un autre modèle ne s'y compare.
DSBench-Hard
Pourcentage, sur 100
DeepSeek
Un jeu de tests interne de DeepSeek, réservé aux problèmes difficiles pour un agent de programmation.
Ce que DeepSeek en publie, sans plus de détail : « DSBench-Hard is an internal Coding Agent hard-problem test set ». Ni les tâches, ni le barème ne sont publics.
Attention
Jeu interne au laboratoire qui publie le score. Personne d'autre ne peut le repasser, et aucun chiffre d'un autre modèle ne s'y compare.