Aktory Référentiel IA
Le lexique · Expliqué en français

Chaque chiffre a son mode d'emploi.

Les termes du référentiel et les benchmarks qui notent les modèles, racontés en français : ce que le test demande, ce que le chiffre représente, ce qu'il ne dit pas. Avec leurs sources.

24termes expliqués
149benchmarks racontés
12domaines
1 498chiffres sourcés
01 · Les termes

Le vocabulaire, expliqué simplement

Jeton, fenêtre de contexte, prix d'entrée : les fiches emploient ces mots à chaque ligne. Les voici tous, dans les mêmes phrases que celles affichées sous les valeurs.

Fenêtre de contexte

Ce qu’il peut avoir sous les yeux en une seule fois, question et réponse comprises.

C’est sa mémoire de travail, à ne pas confondre avec ce qu’il a appris pendant son entraînement. Une fenêtre plus large permet de lui soumettre des documents plus longs et de tenir une conversation plus longue sans perdre le fil.

Jeton

L’unité de découpage du texte : environ 3,5 caractères en anglais, moins dans les autres langues.

Les prix et les limites se comptent en jetons, jamais en mots. Un jeton peut être un mot, un morceau de mot ou un simple caractère.

Prix d’entrée

Ce que coûte le texte qu’on lui envoie.

Prix de sortie

Ce que coûte le texte qu’il produit, toujours plus cher que l’entrée.

Connaissances arrêtées à

Il ne sait rien de ce qui s’est passé après cette date, sauf si on le lui fournit.

C’est la date de fin des données d’entraînement. Au-delà, le modèle ne peut répondre que sur ce qu’on lui donne à lire dans la question, ou ce qu’il va chercher lui-même s’il en a le moyen.

Données d’entraînement jusqu’à

Le modèle a vu des données jusqu’à cette date, mais le laboratoire ne les garantit fiables que jusqu’à la précédente.

Sortie maximale

La plus longue réponse qu’il peut produire d’un seul tenant.

À distinguer de la fenêtre de contexte, qui compte l’échange entier.

Identifiant d’API

Le nom exact à écrire dans le code pour appeler ce modèle.

Alias

Les autres noms du même modèle, selon la plateforme qui le revend.

Entrées acceptées

Ce qu’on peut lui soumettre, en plus du texte.

Sorties produites

Ce qu’il sait produire en retour.

Niveau de sûreté déclaré

L’échelle de sûreté interne du laboratoire, pas une norme publique.

Chez Anthropic, la Responsible Scaling Policy évalue chaque modèle face à des seuils de risque catastrophique et impose des protections correspondantes. Claude Opus 5 reçoit les protections ASL-3, les mêmes qu’Opus 4.8, à cause de ses capacités en chimie et en biologie.

Écriture en cache

Mettre en mémoire un début de requête réutilisé d’un appel à l’autre : 1,25 fois le prix d’entrée.

Le surcoût n’est payé qu’une fois, à la mise en cache. Un cache d’une heure coûte deux fois le prix d’entrée au lieu de 1,25.

Latence

Sa vitesse comparée aux autres modèles du même laboratoire, pas une mesure absolue.

Traitement par lots

Un paquet de requêtes traité sans réponse immédiate, pour la moitié du prix.

Les requêtes sont soumises ensemble et traitées de façon asynchrone. Utile pour de gros volumes qui n’attendent pas de réponse dans la seconde.

Disponible sur

Les plateformes où ce modèle s’utilise, chez le laboratoire comme chez ses revendeurs.

Langues

Ce que le laboratoire déclare de sa couverture linguistique.

Entrée maximale

Le plus long texte qu'on peut lui soumettre en une fois, réponse non comprise.

La fenêtre de contexte compte la question et la réponse ensemble. L'entrée maximale dit combien de cette fenêtre peut servir à la question : chez GPT-5.6 Sol, 922 000 jetons sur 1 050 000, le reste étant réservé à ce qu'il écrit.

Points d'accès

Les adresses de l'API sur lesquelles ce modèle répond.

Tous les modèles ne répondent pas partout. Un modèle récent peut ignorer l'ancienne interface de complétion, ou ne pas accepter la spécialisation. C'est ce qui décide s'il entre dans un programme existant sans le réécrire.

Au-delà du seuil de contexte

Passé un certain volume envoyé en une fois, la requête entière est facturée plus cher.

OpenAI applique un second tarif aux requêtes qui dépassent 272 000 jetons d'entrée : le double sur l'entrée et une fois et demie sur la sortie, pour toute la requête et non pour la seule part qui dépasse.

Mode rapide

Une réponse plus rapide et plus régulière, au double du prix.

Destiné aux usages où l'attente se voit, comme une application qui répond devant l'utilisateur. Chez GPT-5.6 Sol, OpenAI annonce jusqu'à 2,5 fois la vitesse du traitement standard. Ce mode s'appelait « traitement prioritaire » jusqu'au 30 juillet 2026.

Traitement souple

Moitié prix, contre des réponses plus lentes et parfois indisponibles.

Prévu pour ce qui n'attend personne : évaluations de modèles, enrichissement de données, traitements différés. Les jetons sont facturés au tarif du traitement par lots.

02 · Les benchmarks

Ce que les tests demandent vraiment

Un score ne se lit pas sans savoir ce que le test demande, qui l'a construit et sur quelle échelle il note. Chaque test relevé au référentiel a donc son entrée : la voici en entier, domaine par domaine.

Code et ingénierie logicielle

28 tests

Le modèle reçoit un dépôt et un problème, et doit produire un correctif qui passe les tests, sans intervention humaine.

SWE-bench Verified

Pourcentage, sur 100
Université de Princeton Aussi relevé sous : SWE-bench · SWE-Bench Verified (coding)

Corriger de vrais tickets ouverts sur GitHub, dans le dépôt d'origine, sans aide.

La part des 500 problèmes résolus. Chaque problème a été relu par des ingénieurs pour vérifier qu'il était réellement soluble, et un correctif ne compte que s'il fait passer les tests du dépôt.

SWE-bench Pro

Pourcentage, sur 100
Scale AI Aussi relevé sous : SWE-Bench Pro (Public) · SWE-Bench Pro, Public

Le même exercice, sur des dépôts encore maintenus et des correctifs qui touchent plusieurs fichiers.

La part des problèmes résolus. Variante plus dure que SWE-bench Verified : dépôts activement maintenus, correctifs répartis sur plusieurs fichiers, et solutions moins susceptibles d'avoir fuité dans les données d'entraînement.

SWE-bench Multilingual

Pourcentage, sur 100
Université de Princeton

Le même exercice, étendu à neuf langages de programmation.

La part des 300 problèmes résolus, répartis sur neuf langages. Mesure si la compétence tient hors de l'écosystème Python d'origine.

SWE-bench Multimodal

Pourcentage, sur 100
Université de Princeton

Le même exercice, mais l'énoncé contient des captures d'écran et des maquettes.

La part des problèmes résolus quand la description du ticket s'appuie sur des images. Il faut donc lire l'interface autant que le code.

Attention

Anthropic mesure ce test sur son propre harnais, construit sur le jeu public de développement. Le chiffre n'est pas directement comparable à un classement public.

DeepSWE v1.1

Pourcentage, sur 100
Together AI Aussi relevé sous : DeepSWE

113 tâches de développement de longue haleine, écrites de zéro pour n'avoir jamais été vues à l'entraînement.

La part des tâches menées à bout. Elles sont volontairement variées et proches de la complexité réelle d'un projet, et rédigées spécialement pour ce test afin d'écarter toute contamination.

FrontierCode v1.1 (principal)

Pourcentage, sur 100
Cognition

150 tâches tirées de vraies pull requests de projets libres, notées par un tiers.

Un score composite sur le jeu principal : chaque correctif est jugé sur des critères bloquants (les tests retenus à part) puis sur un barème pondéré, qui vérifie la couverture de tests exigée et l'absence de pratiques interdites. Le modèle travaille seul dans un conteneur, sans intervention.

FrontierCode v1.1 (étendu)

Pourcentage, sur 100
Cognition

Le même test, sur le jeu de tâches étendu.

Le même score composite, calculé sur le jeu étendu de FrontierCode. Il est mécaniquement plus haut que celui du jeu principal : les deux chiffres ne se comparent pas entre eux, seulement d'un modèle à l'autre.

FrontierBench v0.1

Pourcentage, sur 100
Équipe de Terminal-Bench

Du travail en ligne de commande : biologie computationnelle, simulation physique, CAO, preuves formelles, optimisation GPU.

La récompense moyenne obtenue sur 74 tâches, cinq essais chacune. Successeur de Terminal-Bench 2.1, avec des tâches plus dures et davantage de science et d'ingénierie.

Attention

C'est une récompense moyenne, pas un taux de réussite : une tâche partiellement accomplie rapporte des points.

Terminal-Bench 2.1

Pourcentage, sur 100
Terminal-Bench Aussi relevé sous : Terminal-Bench · Terminal Bench 2.1

Du travail réel en ligne de commande, dans un conteneur, du début à la fin.

La récompense moyenne obtenue sur des tâches d'ingénierie menées au terminal. Le prédécesseur de FrontierBench, dont les versions 2.0 et 2.1 ne se comparent pas entre elles.

Attention

Le test est sensible à la latence : un point d'accès plus lent termine moins d'épisodes dans le temps imparti, ce qui pénalise le score sans que le modèle soit moins capable.

CursorBench

Pourcentage, sur 100
Cursor

De vraies tâches de code, exécutées dans l'agent de production de Cursor.

La part des tâches réussies. Les énoncés viennent de l'usage interne de Cursor et du trafic de ses clients, donc du travail réellement demandé à un assistant de code.

SWE-bench Verified (hard subset)

Pourcentage, sur 100
Université de Princeton Aussi relevé sous : SWE-bench Verified (sous-ensemble difficile)

Le sous-ensemble le plus difficile de SWE-bench Verified.

La part des problèmes résolus parmi les plus durs du jeu vérifié, ceux que les générations précédentes échouaient massivement.

Novel compiler

Pourcentage, sur 100
Anthropic

Écrire un compilateur pour un langage que le modèle n'a jamais vu.

La part des cas de test passés par le compilateur produit. Anthropic retient cette tâche parce qu'elle n'est pas encore saturée, là où beaucoup d'autres ne départagent plus les modèles récents.

OpenRCA

Pourcentage, sur 100
Publié à ICLR 2025

Trouver la cause première d'une panne logicielle dans 335 incidents réels tirés de trois systèmes d'entreprise (télécoms, banque, place de marché), à partir de 68,5 Go de journaux, de métriques et de traces.

La part des incidents pour lesquels le modèle identifie correctement le composant en cause, l'heure de début et la raison de la panne. Les trois doivent être justes.

Terminal-Bench 2.0

Pourcentage, sur 100
Terminal-Bench

Du travail réel en ligne de commande, dans un conteneur, du début à la fin.

La récompense moyenne obtenue sur des tâches d'ingénierie menées au terminal.

Attention

Version 2.0 du test. Son chiffre ne se compare pas à celui de la 2.1, qui a corrigé des tâches jugées ambiguës. Le test est par ailleurs sensible à la latence : un point d'accès plus lent termine moins d'épisodes dans le temps imparti, ce qui pénalise le score sans que le modèle soit moins capable.

FrontierCode

Pourcentage, sur 100
Anthropic

Des tâches de programmation à la frontière de ce que les modèles savent faire, tirées de travaux réels.

La part des tâches menées à bien.

Attention

Le test existe en plusieurs sous-ensembles (principal, étendu, Diamond) dont les difficultés diffèrent nettement. Deux chiffres ne se comparent que si le sous-ensemble est le même ; il est indiqué dans les conditions quand la source le précise.

Aider's polyglot

Pourcentage, sur 100
Aider Aussi relevé sous : Aider’s polyglot · Aider Polyglot · Aider’s polyglot: diff · Aider’s polyglot: whole · Aider's polyglot: diff · Aider's polyglot: whole

Résoudre des exercices de programmation d'Exercism en modifiant des fichiers source, dans plusieurs langages.

La part des exercices résolus, avec un seul nouvel essai autorisé après un échec. Le libellé dit la façon d'écrire la modification : « diff » n'envoie que les lignes changées, « whole » réécrit le fichier entier. Les deux mesurent le même exercice et se comparent entre eux.

Internal Research Debugging Evaluation

Pourcentage, sur 100
OpenAI

Trouver et corriger de vrais bogues survenus dans les expériences de recherche d'OpenAI, ceux qui avaient coûté des heures ou des jours à leurs chercheurs.

La part des bogues résolus.

KernelGen 1P

Pourcentage, sur 100
OpenAI

Écrire puis optimiser un noyau de calcul pour le matériel conçu par OpenAI.

La part des noyaux à la fois corrects et plus rapides que la version de référence. Le modèle reçoit un environnement de développement, un banc d'essai et des tests ; il doit réduire le temps de calcul sans tricher, par exemple en déplaçant le calcul ailleurs ou en trompant la mesure.

NanoGPT

Pourcentage, sur 100
OpenAI

Améliorer l'entraînement d'un petit modèle de langue, avec une seule carte graphique et un temps compté.

Une note ramenée entre 0 et 1 selon le gain obtenu sur la référence. Le modèle doit modifier le code d'entraînement, régler les paramètres, trouver les goulots d'étranglement et atteindre une qualité visée.

Attention

Cette épreuve mesure la capacité d'un modèle à améliorer lui-même l'entraînement d'un autre modèle : elle est publiée au titre du suivi des risques, pas de la performance commerciale.

PostTrainBench Lite

Pourcentage, sur 100
OpenAI

Concevoir et exécuter toute la phase d'affinage d'un modèle déjà pré-entraîné, dans un temps limité.

Le gain obtenu sur un test visé. Le modèle reçoit un modèle libre, de la puissance de calcul, un accès à internet et des jeux de données ; il choisit lui-même les données, les méthodes et les boucles d'évaluation, sans avoir le droit de s'entraîner sur les réponses du test.

Attention

Comme NanoGPT, cette épreuve mesure la capacité d'un modèle à en améliorer un autre, et relève du suivi des risques.

SWE-Lancer

Pourcentage, sur 100
OpenAI Aussi relevé sous : SWE-Lancer IC SWE · SWE-Lancer, IC Diamond · SWE-Lancer: IC SWE Diamond · SWE-Lancer Diamond IC-SWE

Réaliser de vraies missions de développement freelance, payées, telles qu'elles ont été publiées sur une place de marché.

La part des missions dont le travail rendu passe les tests écrits par les clients d'origine. Le test se mesure aussi en dollars, puisque chaque mission a un prix : c'est le seul benchmark du catalogue à donner une valeur monétaire au travail rendu.

LiveCodeBench

Pourcentage, sur 100
Universités de Berkeley, MIT et Cornell

Écrire un programme qui résout un exercice de concours publié après l'entraînement du modèle.

La part des exercices résolus. Le jeu est renouvelé en continu et daté, pour que le modèle ne puisse pas avoir vu les solutions pendant son entraînement : les conditions précisent la fenêtre de dates retenue.

LiveCodeBench Pro

Pourcentage, sur 100
Non déclaré par la source

Résoudre des problèmes de compétition de haut niveau, tirés de Codeforces, de l'ICPC et des olympiades d'informatique.

La part des problèmes résolus. Le niveau est nettement au-dessus de LiveCodeBench : ce sont des épreuves de concours pour compétiteurs entraînés.

MLE-Bench

Pourcentage, sur 100
OpenAI

Mener une compétition d'apprentissage automatique de bout en bout, des données brutes au modèle entraîné.

La part des compétitions où le modèle atteint le niveau d'une médaille, en préparant les données, en entraînant un modèle et en soumettant un résultat sans aide.

SciCode

Pourcentage, sur 100
Non déclaré par la source

Écrire le code dont un chercheur a besoin pour reproduire un calcul scientifique publié.

La part des sous-problèmes résolus, tirés d'articles scientifiques et découpés en étapes de programmation.

NL2Repo

Pourcentage, sur 100
Daoguang Zan et ses coauteurs pour la tâche, Jingzhe Ding et ses coauteurs pour le jeu de tests

Construire un dépôt de code entier à partir d'un cahier des charges écrit en langage courant.

La part des dépôts produits qui satisfont les exigences. L'épreuve ne porte pas sur une fonction isolée : il faut tenir un plan sur la durée, garder des interfaces cohérentes entre les fichiers et corriger soi-même les incohérences.

Attention

Le nom désigne à la fois une tâche, définie en 2024, et un jeu de tests publié fin 2025 sous le nom NL2Repo-Bench. Une source qui écrit « NL2Repo » sans préciser laisse le doute : le chiffre ne se compare qu'à un chiffre de même provenance.

DSBench-FullStack

Pourcentage, sur 100
DeepSeek

Un jeu de tests interne de DeepSeek, portant sur le développement complet d'une application.

Ce que DeepSeek en publie, sans plus de détail : « DSBench-FullStack is an internal full-stack development test set ». Ni les tâches, ni le barème, ni le nombre de cas ne sont publics.

Attention

Jeu interne au laboratoire qui publie le score. Personne d'autre ne peut le repasser, et aucun chiffre d'un autre modèle ne s'y compare.

DSBench-Hard

Pourcentage, sur 100
DeepSeek

Un jeu de tests interne de DeepSeek, réservé aux problèmes difficiles pour un agent de programmation.

Ce que DeepSeek en publie, sans plus de détail : « DSBench-Hard is an internal Coding Agent hard-problem test set ». Ni les tâches, ni le barème ne sont publics.

Attention

Jeu interne au laboratoire qui publie le score. Personne d'autre ne peut le repasser, et aucun chiffre d'un autre modèle ne s'y compare.

Raisonnement sur des situations inconnues

5 tests

Aucune connaissance préalable ne sert : il faut inférer une règle jamais vue à partir de quelques exemples.

ARC-AGI

Pourcentage, sur 100
ARC Prize Foundation

Inférer une règle jamais vue à partir de quelques grilles d'exemples.

La part des énigmes résolues, toutes générations du test confondues quand la source ne précise pas laquelle. Voir ARC-AGI-1, ARC-AGI-2 et ARC-AGI-3 pour le détail.

ARC-AGI-1

Pourcentage, sur 100
ARC Prize Foundation

Deviner la règle cachée derrière trois exemples de grilles, puis l'appliquer à une grille nouvelle.

La part des énigmes résolues. Le test vise l'intelligence fluide : rien de ce que le modèle a appris ne sert, chaque énigme est nouvelle. Les scores sont vérifiés par la fondation sur un jeu semi-privé, jamais publié, pour que personne ne puisse s'y entraîner.

ARC-AGI-2

Pourcentage, sur 100
ARC Prize Foundation

Le même principe, avec des règles nettement plus difficiles à inférer.

La part des énigmes résolues sur la deuxième génération du test, conçue quand la première a cessé de départager les modèles. Score vérifié par la fondation sur son jeu semi-privé.

ARC-AGI-3

Pourcentage, sur 100
ARC Prize Foundation

Des jeux inconnus, sans règle ni but annoncés : il faut explorer, comprendre ce qui fait gagner, et progresser de niveau en niveau.

L'efficacité du modèle rapportée à celle d'un joueur humain sur les mêmes jeux : 100 % signifie qu'il lui a fallu autant d'actions qu'une personne. Ce n'est donc pas une part de parties gagnées.

Attention

Un chiffre bas ici ne se compare pas à un pourcentage de réussite. Il se lit face aux autres modèles : le meilleur score publié avant Claude Opus 5 était environ quatre fois plus faible.

Blueprint-Bench 2

Pourcentage, sur 100
Andon Labs

Reconstituer le plan d'un appartement à partir d'une vingtaine de photos d'intérieur, pour 50 appartements traités l'un après l'autre.

La justesse du plan produit : disposition des pièces, liaisons entre elles, tailles relatives. Le test porte sur la reconstruction spatiale véritable, c'est-à-dire déduire comment des espaces jamais vus ensemble se raccordent.

Connaissances et raisonnement scientifique

19 tests

Des questions à réponse unique, du niveau lycée au niveau doctorat, où seule la justesse compte.

MMLU

Pourcentage, sur 100
Dan Hendrycks et ses coauteurs

Des questions à choix multiples sur 57 matières, du programme de lycée au niveau professionnel.

La part des bonnes réponses. Le test balaie les mathématiques, le droit, la médecine, l'histoire ou l'éthique, pour mesurer l'étendue des connaissances plutôt qu'une compétence particulière.

Attention

C'est l'un des plus anciens tests du domaine, et les meilleurs modèles y sont tous groupés au-dessus de 85 % : il ne les départage plus vraiment.

GPQA Diamond

Pourcentage, sur 100
New York University, Cohere et Anthropic

Des questions de niveau doctorat en biologie, physique et chimie, écrites par des spécialistes.

La part des bonnes réponses sur le sous-ensemble Diamond, le plus difficile : les questions que des docteurs du domaine réussissent et que des experts d'un autre domaine ratent, même avec un accès libre au web.

CritPt

Pourcentage, sur 100
Chercheurs en physique

Des problèmes de physique de niveau recherche, écrits par des physiciens en activité.

La part des problèmes résolus. Le nom vient de « Complex Research using Integrated Thinking Physics Test ».

MMMLU

Pourcentage, sur 100
OpenAI Aussi relevé sous : Multilingual MMLU

Les 57 matières de MMLU, posées dans quatorze langues autres que l'anglais.

La part des bonnes réponses, moyennée sur les langues. Mesure si la connaissance tient hors de l'anglais.

GMMLU

Pourcentage, sur 100
Cohere Labs Aussi relevé sous : Global MMLU

Une version mondiale de MMLU, revue pour ne pas privilégier la culture anglo-saxonne.

L'exactitude moyenne sur l'ensemble des langues évaluées.

MILU

Pourcentage, sur 100
AI4Bharat

Des questions de connaissance dans les langues de l'Inde.

L'exactitude moyenne sur l'ensemble des langues indiennes évaluées. Le nom vient de « Multi-task Indic Language Understanding Benchmark ».

INCLUDE

Pourcentage, sur 100
Consortium académique

Des examens réels, dans la langue et le cadre du pays où ils sont passés.

L'exactitude moyenne sur l'ensemble des langues. Le test évalue la connaissance régionale autant que la langue.

GraphWalks (contexte long)

Pourcentage, sur 100
OpenAI Aussi relevé sous : GraphWalks · BFS · Long context: GraphWalks · GraphWalks bfs <128k · Graphwalks bfs >128k · Graphwalks parents <128k · Graphwalks parents >128k · Graphwalks BFS 0K-128K · Graphwalks parents 0-128K · GraphWalks BFS 256k f1 · GraphWalks BFS 1mil f1 · Graphwalks parents 256k f1 · Graphwalks parents 1mil f1 · Graphwalks BFS 256K-1M · Graphwalks parents 256K-1M

Parcourir un graphe dont la description remplit toute la fenêtre de contexte.

La part des parcours corrects. La fenêtre est remplie d'un graphe orienté de nœuds identifiés par des empreintes ; le modèle doit faire un parcours en largeur ou retrouver les parents d'un nœud. C'est la mémoire de travail qui est testée, pas la connaissance.

Humanity's Last Exam

Pourcentage, sur 100
Center for AI Safety et Scale AI Aussi relevé sous : HLE · Humanity’s Last Exam

Des questions écrites par des spécialistes pour rester hors de portée des modèles.

La part des bonnes réponses. Le test a été construit en sollicitant des experts du monde entier pour poser des questions que les modèles de l'époque échouaient tous, d'où son nom.

MMMU

Pourcentage, sur 100
Consortium universitaire

Des questions d'examen universitaire qui mêlent texte, schémas, cartes et partitions.

La part des bonnes réponses sur des questions multimodales de niveau universitaire, réparties sur des dizaines de disciplines. La variante Pro écarte les questions solubles sans regarder l'image.

MMMU-Pro

Pourcentage, sur 100
MMMU Aussi relevé sous : MMMU Pro

Percevoir, interpréter et raisonner sur des questions de niveau licence mêlant texte et images, dans des disciplines variées.

La part des questions correctement répondues. Version durcie de MMMU : les questions solubles sans regarder l\u0027image ont été retirées, le nombre de réponses proposées passe de quatre à dix, et un mode où l\u0027énoncé lui-même est incrusté dans l\u0027image a été ajouté.

Attention

Ce chiffre ne se compare pas à celui de MMMU : le test est volontairement plus difficile.

OpenAI-MRCR

Pourcentage, sur 100
OpenAI Aussi relevé sous : OpenAI MRCR · OpenAI-MRCR: 2 needle128k · OpenAI-MRCR: 2 needle 1M · OpenAI MRCR v2 8-needle 4K-8K · OpenAI MRCR v2 8-needle 8K-16K · OpenAI MRCR v2 8-needle 16K-32K · OpenAI MRCR v2 8-needle 32K-64K · OpenAI MRCR v2 8-needle 64K-128K · OpenAI MRCR v2 8-needle 128K-256K · OpenAI MRCR v2 8-needle 256K-512K · OpenAI MRCR v2 8-needle 512K-1M · OpenAI MRCRv2, 8 needles, 4k-8k · OpenAI MRCRv2, 8 needles, 8k-16k · OpenAI MRCRv2, 8 needles, 16k-32k · OpenAI MRCRv2, 8 needles, 32k-64k · OpenAI MRCRv2, 8 needles, 64k-128k · OpenAI MRCRv2, 8 needles, 128k-256k

Retrouver la bonne réponse quand plusieurs demandes presque identiques ont été noyées dans une très longue conversation.

La part des questions auxquelles le modèle répond en distinguant la bonne demande parmi deux, quatre ou huit demandes semblables dispersées au milieu de textes destinés à l'égarer. Le libellé précise le nombre de leurres et la longueur du contexte : « 8-needle 512K-1M » veut dire huit leurres dans un contexte de cinq cent mille à un million de jetons. Plus le contexte s'allonge, plus le score baisse.

Artificial Analysis Intelligence Index v4.1

Indice composite, sans maximum
Artificial Analysis Aussi relevé sous : Artificial Analysis Intelligence Index

Un indice composite calculé par un tiers, qui agrège une dizaine de tests : travail d'agent, code, raisonnement scientifique, capacités générales.

Un score d'indice, non un pourcentage : il résume plusieurs épreuves sur une échelle propre à son auteur. Un indice ne se lit bien que comparé à un autre indice de la même version.

Attention

Cet indice n'a pas de maximum déclaré, donc aucune jauge n'est dessinée : 80 ne veut pas dire « 80 % ».

FACTS Benchmark Suite

Pourcentage, sur 100
Google DeepMind

Répondre sans inventer, que la réponse vienne d'un document fourni, de ce que le modèle a appris, ou d'une recherche.

Une suite de tests d'exactitude factuelle réunis en un seul chiffre : ancrage dans un document fourni, connaissances propres du modèle, recherche, et documents mêlant texte et image. Un score élevé veut dire peu d'affirmations inventées.

MRCR v2 (8-needle)

Pourcentage, sur 100
Google DeepMind Aussi relevé sous : GDM-MRCR v2 (8-needle)

Retrouver la bonne réponse quand huit demandes presque identiques ont été noyées dans un texte très long.

La part des questions auxquelles le modèle répond en distinguant la bonne demande parmi huit leurres semblables. Les conditions précisent la longueur du contexte : « 128k (average) » est une moyenne sur des contextes allant jusqu'à cent vingt-huit mille jetons, « 1M (pointwise) » une mesure à un million de jetons. Le score baisse fortement quand le contexte s'allonge.

Attention

C'est la variante de Google, distincte d'OpenAI-MRCR : les deux mesurent la même idée mais ne sont pas le même jeu de données, et leurs scores ne se comparent pas.

SimpleQA Verified

Pourcentage, sur 100
OpenAI pour SimpleQA, version vérifiée par Google

Répondre à des questions factuelles courtes, sans consulter Internet.

La part des réponses exactes tirées des seules connaissances acquises pendant l'entraînement. Google précise « parametric knowledge » : aucune recherche n'est permise.

Video-MMMU

Pourcentage, sur 100
Non déclaré par la source

Apprendre quelque chose en regardant une vidéo, puis répondre à des questions dessus.

La part des questions correctes après visionnage de cours filmés de niveau universitaire. Google le présente comme un test d'« acquisition de connaissances depuis des vidéos ».

GPQA

Pourcentage, sur 100
New York University, Cohere et Anthropic

Des questions de niveau doctorat en biologie, physique et chimie, écrites par des spécialistes.

La part des bonnes réponses sur le jeu de questions, toutes matières confondues. Les questions sont conçues pour résister à la recherche sur Internet : des experts d'un autre domaine y échouent même en cherchant librement.

Attention

Le libellé « GPQA » seul ne dit pas quel sous-ensemble a été passé. Le chiffre n'est donc pas comparable à un score annoncé sur GPQA Diamond, qui ne retient que les questions les plus difficiles.

MMLU-Pro

Pourcentage, sur 100
Yubo Wang, Xueguang Ma, Ge Zhang, Yuansheng Ni et leurs coauteurs

La version durcie de MMLU : mêmes matières, questions plus exigeantes et dix réponses possibles au lieu de quatre.

La part des bonnes réponses. Le jeu a été refait parce que les meilleurs modèles se tenaient tous au sommet de MMLU, qui ne les départageait plus : les questions demandent ici un raisonnement et non un rappel.

Attention

Malgré le nom, ce n'est pas MMLU : les deux chiffres ne se comparent pas, l'un ayant dix réponses au choix et l'autre quatre.

Mathématiques

12 tests

Des démonstrations de niveau olympiade et des problèmes tirés de la recherche en cours.

IMO 2026

Sur 42 points · seuil de la médaille d'or 2026 : 29
Olympiade internationale de mathématiques

Les six problèmes de l'Olympiade internationale 2026, à démontrer et non simplement à résoudre.

Le total des points obtenus sur les six problèmes, sept points chacun. Comme il s'agit de démonstrations, la correction s'appuie sur un barème écrit puis confronté aux solutions publiées, et chaque copie est notée par un jury de trois modèles indépendants.

ArxivMath (juin 2026)

Pourcentage, sur 100
MathArena Aussi relevé sous : ArXivMath · ArxivMath

Des problèmes extraits chaque mois de résumés d'articles arXiv récents, donc issus de la recherche en cours.

La part des problèmes dont la réponse finale est exacte. Les énoncés sont filtrés automatiquement puis à la main pour qu'ils soient autonomes, non triviaux et vérifiables. Le millésime de juin 2026 est retenu pour qu'aucun problème n'ait pu figurer dans les données d'entraînement.

AIME 2025

Pourcentage, sur 100
Mathematical Association of America Aussi relevé sous : AIME

L'examen américain d'invitation en mathématiques, une compétition lycéenne prestigieuse.

La part des problèmes correctement résolus. Les réponses sont des nombres entiers, donc vérifiables automatiquement, contrairement aux démonstrations d'olympiade.

OTIS Mock AIME 2024-2025

Pourcentage, sur 100
Evan Chen (programme OTIS), évalué par Epoch AI Aussi relevé sous : OTIS Mock AIME

Des épreuves blanches du concours AIME, écrites par le programme d'entraînement OTIS : des problèmes inédits, donc absents des données d'entraînement des modèles.

La part des problèmes correctement résolus. Les réponses sont des entiers, la correction est automatique. Epoch AI fait passer l'épreuve lui-même, dans les mêmes conditions pour tous les modèles.

MATH Level 5

Pourcentage, sur 100
Dan Hendrycks et coll. (UC Berkeley), évalué par Epoch AI Aussi relevé sous : MATH-5 · MATH (niveau 5)

Le niveau le plus difficile du jeu MATH : des problèmes de compétition lycéenne (algèbre, géométrie, dénombrement) classés par difficulté croissante de 1 à 5.

La part des problèmes de niveau 5 correctement résolus. Epoch AI fait passer l'épreuve lui-même, dans les mêmes conditions pour tous les modèles.

GSM8K

Pourcentage, sur 100
OpenAI

Huit mille cinq cents problèmes de mathématiques de niveau école primaire et collège, rédigés en langage courant.

La part des problèmes correctement résolus. Le test est ancien (2021) et saturé : les modèles récents dépassent tous 90 %, il ne les distingue plus guère.

Attention

Un score élevé ici ne dit rien d'un modèle récent : le test est saturé depuis 2024 et sert surtout à situer les petits modèles.

USAMO 2026

Pourcentage, sur 100
Mathematical Association of America Aussi relevé sous : USAMO

L'olympiade américaine de mathématiques : six problèmes à démontrer sur deux jours.

Le score obtenu sur les démonstrations, notées au barème. L'étape qui précède l'Olympiade internationale dans le parcours des compétitions.

RiemannBench

Pourcentage, sur 100
Surge AI

Vingt-cinq problèmes de mathématiques de niveau recherche, jamais publiés.

La part des problèmes résolus. Le jeu est privé, ce qui écarte toute contamination par les données d'entraînement.

MathVista

Pourcentage, sur 100
Université de Californie à Los Angeles, Microsoft Research

Résoudre des problèmes de mathématiques posés sous forme d'image : un graphique, une figure, un schéma.

La part des problèmes correctement résolus. L'énoncé n'est pas entièrement écrit : il faut d'abord lire la figure.

FrontierMath

Pourcentage, sur 100
Epoch AI Aussi relevé sous : FrontierMath Tier 1-3 · FrontierMath Tier 4

Résoudre des problèmes de mathématiques de niveau expert, écrits pour l'occasion par des mathématiciens de recherche afin qu'aucune solution ne circule déjà.

La part des problèmes résolus. Le libellé dit le palier de difficulté : les paliers 1 à 3 vont du niveau des concours au niveau du doctorat, le palier 4 rassemble des problèmes de recherche que les auteurs jugent hors de portée immédiate. Un même modèle marque nettement moins au palier 4.

AIME 2024

Pourcentage, sur 100
Mathematical Association of America Aussi relevé sous : AIME '24 · AIME ‘24 · AIME 2024 (sans outils)

L'examen américain d'invitation en mathématiques, édition 2024 : une compétition lycéenne prestigieuse, quinze problèmes en trois heures.

La part des quinze problèmes résolus. Chaque réponse est un entier, ce qui rend la correction automatique et sans discussion. L'édition 2024 et l'édition 2025 sont deux épreuves différentes et ne se comparent pas directement.

HMMT

Pourcentage, sur 100
Université Harvard et Institut de technologie du Massachusetts Aussi relevé sous : HMMT, Feb 2025

Le tournoi de mathématiques organisé par Harvard et le MIT, une compétition entre équipes de lycéens.

La part des problèmes résolus, pour l'édition indiquée dans le libellé.

Pilotage d'un ordinateur

8 tests

Le modèle agit à la souris et au clavier sur une machine réelle, comme le ferait une personne.

OSWorld

Pourcentage, sur 100
OSWorld Aussi relevé sous : OSWorld score

Accomplir des tâches courantes sur une machine Ubuntu réelle, à la souris et au clavier.

La part des tâches réussies : éditer un document, naviguer sur le web, gérer des fichiers, en agissant sur une machine virtuelle vivante. La variante « Verified » est le sous-ensemble dont les énoncés ont été revus à la main.

ScreenSpot-Pro

Pourcentage, sur 100
ScreenSpot Aussi relevé sous : Screenspot Pro

Pointer précisément le bon élément d'interface sur une capture d'écran de logiciel professionnel.

La part des éléments correctement localisés à partir d'une consigne en langage courant. C'est la précision du geste qui est mesurée, pas le raisonnement.

ChartQAPro

Pourcentage, sur 100
ChartQA

Répondre à des questions sur 1 341 graphiques réels, infographies et tableaux de bord compris.

La part des 1 948 questions correctement répondues, y compris celles dont la réponse ne figure pas dans le graphique et qu'il faut savoir refuser.

ChartMuseum

Pourcentage, sur 100
Université du Texas

Mille cent soixante-deux questions expertes sur des graphiques tirés de 184 sources réelles.

La part des réponses exactes. Les questions demandent souvent de raisonner sur la forme du graphique, pas seulement d'y lire une valeur.

CharXiv Reasoning

Pourcentage, sur 100
Université de Princeton Aussi relevé sous : CharXiv · CharXiv-R

Raisonner sur les figures d'articles scientifiques publiés sur arXiv.

La part des questions de raisonnement correctement résolues à partir de figures réelles d'articles, souvent denses et mal légendées.

LAB-Bench FigQA

Pourcentage, sur 100
FutureHouse Aussi relevé sous : FigQA

Interpréter les figures d'articles de biologie.

La part des questions correctement répondues sur des figures scientifiques. Volet visuel de LAB-Bench, qui évalue le travail de laboratoire.

OSWorld 2.0

Pourcentage, sur 100
OSWorld

Accomplir des tâches courantes sur une machine Ubuntu réelle, à la souris et au clavier.

La part des tâches réussies du premier coup. Le modèle voit l'écran et agit dessus, sans API : ouvrir un logiciel, remplir un formulaire, classer des fichiers. Chaque tâche est limitée à 500 actions.

OSWorld-Verified

Pourcentage, sur 100
OSWorld

Accomplir des tâches courantes sur une machine Ubuntu réelle, à la souris et au clavier.

La part des tâches réussies, sur le sous-ensemble dont les énoncés et les critères de réussite ont été revus à la main. Ce chiffre ne se compare pas à celui d'OSWorld : l'ensemble des tâches n'est pas le même.

Travail professionnel réel

26 tests

Des livrables de métier : dossiers juridiques, flux d'entreprise, enchaînements d'outils, documents de travail.

BrowseComp

Pourcentage, sur 100
OpenAI

Trouver sur le web une information difficile à dénicher, en naviguant soi-même.

La part des questions correctement résolues. Les réponses existent en ligne mais demandent plusieurs recherches successives pour être trouvées.

DRACO

Pourcentage, sur 100
Perplexity

Des questions de recherche complexes, jugées sur l'exactitude, la complétude et l'objectivité.

Le score obtenu sur ces trois axes, d'où le nom « Deep Research Accuracy, Completeness, and Objectivity ».

Finance Agent

Pourcentage, sur 100
Vals AI Aussi relevé sous : FinanceAgent

Des recherches financières sur les documents déposés par les sociétés cotées.

La part des tâches réussies. Le modèle doit fouiller les dépôts réglementaires (SEC) et en tirer une réponse exacte.

OfficeQA

Pourcentage, sur 100
Databricks

Répondre à des questions en s'appuyant sur un grand corpus de documents d'entreprise.

La part des réponses exactes et étayées par le corpus, de bout en bout.

GDP.pdf

Pourcentage, sur 100
Surge AI

Cent PDF professionnels réels, de la finance au droit en passant par la santé et l'ingénierie.

La part des critères d'évaluation satisfaits. Le modèle doit lire des documents complexes et en tirer un raisonnement, pas seulement une citation.

MCP Atlas

Pourcentage, sur 100
MCP Atlas Aussi relevé sous : MCP-Atlas · Scale MCP-Atlas

Enchaîner des outils par le protocole MCP : trouver le bon, l'appeler correctement, recomposer la réponse.

La part des tâches réussies. Elles couvrent plusieurs serveurs MCP proches de la production, avec de vraies API et de vraies données : il faut gérer les erreurs, réessayer, et coordonner des serveurs entre eux.

Legal Agent Benchmark (Harvey)

Pourcentage, sur 100
Harvey AI Aussi relevé sous : Legal Agent Benchmark

Le travail d'un collaborateur en cabinet d'avocats : dépouiller un dossier client et produire le document demandé.

La part des dossiers traités sans le moindre manquement. Plus de 1 200 tâches sur 24 domaines de pratique, chacune notée sur un barème d'experts qui compte de 23 à 194 critères.

Attention

Le test ne compte une tâche comme réussie que si TOUS ses critères sont remplis, d'où un chiffre bas qui ne veut pas dire que le reste est raté : sur ce même relevé, 93,7 % des critères étaient satisfaits en moyenne.

Toolathlon Verified

Pourcentage, sur 100
Toolathlon Aussi relevé sous : Toolathlon

108 tâches d'outillage réel : bureautique, commerce en ligne, analyse de données, recherche web.

La part des tâches réussies. Plus de 600 outils répartis sur 32 applications sont exposés au modèle : il faut choisir les bons, les enchaîner dans l'ordre, et produire exactement ce que le contrôleur attend. Le résultat n'est pas jugé sur la conversation mais sur l'état réel des applications à la fin.

AutomationBench (Zapier)

Pourcentage, sur 100
Zapier Aussi relevé sous : AutomationBench · Automation Bench (Public)

Mener un flux de travail d'entreprise de bout en bout, d'une seule instruction en langage courant.

La part des flux menés à bien sur le jeu privé du classement. Le modèle est lâché dans une entreprise simulée qui expose des dizaines d'API sur 47 applications : il doit découvrir les bons points d'entrée, enchaîner des dizaines d'appels dépendants les uns des autres, respecter les règles internes et éviter les pièges posés exprès.

Attention

Réussite tout ou rien : le flux ne compte que si toutes les vérifications sur l'état final passent. Les scores de tous les modèles y sont bas.

GDPval-AA v2

Classement ELO, sans maximum
Artificial Analysis, sur les tâches GDPval d'OpenAI

220 tâches professionnelles réellement rémunérées, sur 44 métiers et 9 secteurs, rendues sous forme de livrable.

Un score ELO, pas un pourcentage : les livrables produits par les modèles sont comparés deux à deux à l'aveugle, et le classement se déduit des victoires. Un écart de 100 points correspond environ à 64 % de victoires face à l'autre.

Attention

L'échelle ELO n'a pas de maximum et n'a de sens que par comparaison : 1 861 ne veut rien dire seul, il se lit face aux autres modèles du classement.

AA-Briefcase

Classement ELO, sans maximum
Artificial Analysis

Des projets de plusieurs semaines montés par des experts du métier, avec des milliers de fichiers sources.

Un score ELO, pas un pourcentage. La note combine un barème et des comparaisons deux à deux jugées par un panel de modèles, sur trois axes : les tâches vérifiables réussies, la qualité de l'analyse, la qualité de la présentation.

Attention

L'échelle ELO n'a pas de maximum et n'a de sens que par comparaison avec les autres modèles du classement.

SpreadsheetBench

Pourcentage, sur 100
Construit à partir de cas réels

Naviguer dans des tableurs complexes et les modifier, sur 912 problèmes tirés de fichiers réels.

La part des 912 problèmes résolus. Le modèle dispose d'un terminal, d'outils d'édition et d'un environnement Python.

Multi-agent BrowseComp

Pourcentage, sur 100
OpenAI pour BrowseComp, montage multi-agents par Anthropic

Le même test de recherche sur le web que BrowseComp, mais conduit par un agent chef d'orchestre qui délègue à des sous-agents au lieu de chercher lui-même.

La part des questions correctement résolues. Le chiffre ne se compare pas à celui de BrowseComp seul : il mesure une architecture autant qu'un modèle.

Attention

Ce chiffre dépend du montage employé (nombre de sous-agents, taille de la fenêtre, outils fournis) autant que du modèle lui-même.

GDPval-AA

Pourcentage, sur 100
OpenAI pour GDPval, protocole de comparaison par paires

Produire des livrables professionnels réels, jugés par comparaison directe avec ceux d'un autre modèle plutôt que notés sur un barème.

La part des comparaisons remportées face au modèle de référence. Le protocole rend un classement, pas une note absolue.

Attention

Ce chiffre n'a de sens qu'avec l'adversaire indiqué dans les conditions : 56 % de victoires contre un modèle donné ne dit rien face à un autre.

GDPval

Pourcentage, sur 100
OpenAI

Produire un vrai livrable de travail dans l'une de quarante-quatre professions, à partir d'une commande détaillée.

La part des livrables jugés au moins aussi bons que ceux d'un professionnel du métier. À ne pas confondre avec GDPval-AA, qui compare deux modèles entre eux et se note en Elo sans maximum.

Attention

Le test porte sur des travaux commandés avec précision, pas sur l'autonomie : il dit ce que le modèle produit quand la demande est claire, pas s'il saurait deviner ce qu'il faut faire.

Agents' Last Exam

Pourcentage, sur 100
OpenAI Aussi relevé sous : Agents’ Last Exam · Agent Last Exam

Mener jusqu'au bout des tâches professionnelles longues, qui demandent de garder le fil sur de nombreuses étapes.

La part des tâches menées à terme. Le nom fait écho à Humanity's Last Exam, mais l'épreuve est d'une autre nature : il ne s'agit pas de répondre à une question difficile, il s'agit de conduire un travail entier.

MultiChallenge

Pourcentage, sur 100
Scale AI Aussi relevé sous : Scale MultiChallenge

Tenir une conversation à plusieurs tours en se servant correctement de ce qui a été dit avant.

La part des conversations où le modèle exploite comme il faut quatre sortes d'informations venues des tours précédents. C'est une mesure de la mémoire de la conversation, pas de la connaissance.

Attention

OpenAI signale que le correcteur automatique livré avec ce test se trompe souvent, et qu'il le remplace par un modèle de raisonnement. Deux scores publiés pour ce test peuvent donc avoir été corrigés différemment.

COLLIE

Pourcentage, sur 100
Université de Princeton

Écrire un texte libre en respectant à la lettre des contraintes de forme.

La part des textes qui satisfont la contrainte demandée : un nombre de mots, une lettre interdite, une structure imposée. La contrainte se vérifie mécaniquement, sans jugement.

Tau2-bench Telecom

Pourcentage, sur 100
Sierra Aussi relevé sous : Tau2-bench Retail · τ²-bench Telecom

Traiter une demande de service client de bout en bout, en suivant les règles de l'entreprise et en dialoguant avec le client.

La part des dossiers menés à bien. Le libellé dit le secteur : télécommunications ou commerce de détail. La deuxième version du test met le modèle face à un client simulé qui doit lui aussi agir, ce qui la rend plus difficile que la première.

BrowseComp Long Context 128k

Pourcentage, sur 100
OpenAI Aussi relevé sous : BrowseComp Long Context 256k

Retrouver sur le web une information difficile à trouver, en gardant sous les yeux tout ce qui a déjà été lu.

La part des questions résolues, le libellé disant la longueur de contexte accordée. OpenAI écarte des résultats de recherche les sites qui contiennent les réponses du test, pour que la mesure ne récompense pas la simple recopie.

IFEval

Pourcentage, sur 100
Google

Obéir à des consignes de forme dont le respect se vérifie par un programme, sans jugement humain.

La part des réponses conformes à la consigne : une longueur imposée, un mot à éviter, un format à tenir. La vérification est mécanique, ce qui écarte toute subjectivité, mais ne dit rien de la qualité du fond.

tau-bench

Pourcentage, sur 100
Sierra Aussi relevé sous : Taubench airline · Taubench retail · Tau-bench airline · Tau-bench retail

Traiter un dossier de service client en suivant les règles de l'entreprise, dans le transport aérien ou le commerce de détail.

La part des dossiers menés à bien, le libellé disant le secteur. C'est la première version du test ; la seconde, τ²-bench, met en face un client simulé qui doit lui aussi agir, et se lit séparément.

APEX-Agents

Pourcentage, sur 100
Non déclaré par la source

Mener jusqu'au bout des tâches professionnelles longues, qui demandent de tenir un objectif sur de nombreuses étapes.

La part des tâches menées à terme. Google le présente comme un test de « tâches professionnelles à long horizon ».

Finance Agent v2

Pourcentage, sur 100
Non déclaré par la source

Analyser des données financières et trancher, comme le ferait un analyste.

La part des cas correctement traités. Google le présente comme un test d'« analyse et de décision financières ».

GDPval-AA Elo

Classement ELO, sans maximum
OpenAI pour GDPval, classement ELO par comparaison par paires

Produire des livrables professionnels réels, classés par comparaison directe entre modèles.

Un classement ELO tiré des comparaisons par paires sur des tâches d'expert, et non un pourcentage de réussite.

Attention

L'échelle ELO n'a pas de maximum et n'a de sens que par comparaison avec les autres modèles du même classement : le chiffre seul ne dit rien. C'est la même épreuve que GDPval-AA, mais rendue en ELO et non en part de victoires : les deux chiffres ne se comparent pas.

τ2-bench

Pourcentage, sur 100
Sierra Aussi relevé sous : tau2-bench

Tenir une conversation de service client jusqu'au bout, en appelant les bons outils au bon moment.

La part des dialogues où le modèle atteint l'objectif du client en respectant les règles du domaine, avec un interlocuteur simulé en face.

Santé

3 tests

Des conversations cliniques notées sur des barèmes écrits par des médecins.

HealthBench

Pourcentage, sur 100
OpenAI

5 000 conversations médicales à plusieurs tours, notées sur des critères écrits par des médecins.

Le score brut obtenu sur plus de 48 000 critères d'évaluation, qui jugent à la fois l'exactitude, la sûreté et la manière de communiquer avec le patient.

Attention

Le score brut ne pénalise pas les réponses trop longues. La version ajustée à la longueur, plus sévère, est indiquée dans les conditions de la mesure.

HealthBench Professional

Pourcentage, sur 100
OpenAI Aussi relevé sous : HealthBench Pro

525 conversations écrites par des médecins pour des médecins : consultations, comptes rendus, travaux de recherche.

Le score obtenu sur les barèmes cliniques associés à chaque conversation, la notation étant confiée à un modèle juge. Le versant professionnel de HealthBench, plus exigeant que le versant patient.

MedCalc-Bench Verified

Pourcentage, sur 100
National Institutes of Health Aussi relevé sous : MedCalc-Bench

Effectuer les calculs cliniques du quotidien à partir d'un dossier patient.

La part des calculs exacts : scores de risque, doses, conversions. Une erreur ici a des conséquences directes, ce qui rend l'exactitude plus parlante qu'un score de conversation.

Sciences de la vie

6 tests

Des tâches de laboratoire et de biologie, évaluées avec des chercheurs du domaine.

LABBench2

Pourcentage, sur 100
FutureHouse Aussi relevé sous : LAB-Bench

Le travail documentaire d'un chercheur en biologie : protocoles, séquences, figures, brevets.

La part des tâches réussies, le modèle disposant d'outils (terminal, éditeur, recherche web, zoom sur image) comme le ferait un chercheur à sa paillasse.

ProteinGym Hard

Pourcentage, sur 100
ProteinGym Aussi relevé sous : ProteinGym

Prédire l'effet d'une mutation sur le fonctionnement d'une protéine.

La qualité des prédictions face aux résultats expérimentaux publiés. Le sous-ensemble « Hard » retient les cas que les méthodes existantes échouent.

Chimie organique

Pourcentage, sur 100
Anthropic, avec des chimistes Aussi relevé sous : Organic chemistry

Des questions de chimie organique posées par des chimistes en activité.

La part des réponses correctes. Évaluation interne d'Anthropic, conduite avec des spécialistes du domaine.

Attention

Évaluation interne au laboratoire : aucun tiers ne la reproduit, et son jeu de questions n'est pas public.

Protocoles de laboratoire

Pourcentage, sur 100
Anthropic, avec des biologistes Aussi relevé sous : Protocol troubleshooting · Protocols

Diagnostiquer ce qui a mal tourné dans un protocole expérimental.

La part des diagnostics corrects. Évaluation interne d'Anthropic, conduite avec des biologistes.

Attention

Évaluation interne au laboratoire : aucun tiers ne la reproduit, et son jeu de cas n'est pas public.

BioMysteryBench

Pourcentage, sur 100
Anthropic Aussi relevé sous : BioMysteryBench Verified

Résoudre des énigmes de biologie computationnelle à partir de données expérimentales.

La part des énigmes résolues. Évaluation rangée par le laboratoire parmi celles qui servent à décider du niveau de protection d'un modèle, la biologie étant un domaine à double usage.

BixBench

Pourcentage, sur 100
FutureHouse

Mener une analyse de bio-informatique réelle sur des données de laboratoire.

La part des analyses correctement conduites, sur des questions tirées de travaux publiés.

Préférence des utilisateurs

14 tests

Ce ne sont pas des exercices notés : des personnes comparent deux réponses à l'aveugle et désignent la meilleure.

LMArena (overall)

Classement ELO, sans maximum
LMArena, issu de LMSYS et de l'université de Berkeley Aussi relevé sous : LMArena · Chatbot Arena

Des personnes posent leur propre question, reçoivent deux réponses anonymes et désignent celle qu'elles préfèrent.

Un score ELO calculé sur des millions de votes. Il ne mesure aucune compétence précise : il dit lequel de deux modèles est le plus souvent préféré, ce qui récompense autant la forme et le ton que la justesse.

Attention

L'échelle ELO n'a pas de maximum et ne vaut que par comparaison. Un modèle bavard et agréable peut y devancer un modèle plus exact.

General T2I

Classement ELO, sans maximum
Google DeepMind, évaluation humaine par comparaison

Produire une image fidèle à une consigne écrite, sur des sujets variés.

Un classement ELO obtenu par comparaison à l'aveugle : des personnes voient deux images produites par deux modèles à partir de la même consigne et désignent la meilleure. Google déclare la méthode « SxS human eval to get Elo across diverse T2I, Editing » et l'accompagne d'un intervalle de confiance, reporté dans les conditions.

Attention

L'échelle ELO n'a pas de maximum et n'a de sens que par comparaison avec les autres modèles du même classement : le chiffre seul ne dit rien.

Visual Design

Classement ELO, sans maximum
Google DeepMind, évaluation humaine par comparaison

Produire une image de mise en page ou de graphisme : affiche, interface, composition.

Un classement ELO obtenu par comparaison à l'aveugle : des personnes voient deux images produites par deux modèles à partir de la même consigne et désignent la meilleure. Google déclare la méthode « SxS human eval to get Elo across diverse T2I, Editing » et l'accompagne d'un intervalle de confiance, reporté dans les conditions.

Attention

L'échelle ELO n'a pas de maximum et n'a de sens que par comparaison avec les autres modèles du même classement : le chiffre seul ne dit rien.

Social Media Trends - T2I

Classement ELO, sans maximum
Google DeepMind, évaluation humaine par comparaison

Produire une image dans les styles et les formats qui circulent sur les réseaux sociaux.

Un classement ELO obtenu par comparaison à l'aveugle : des personnes voient deux images produites par deux modèles à partir de la même consigne et désignent la meilleure. Google déclare la méthode « SxS human eval to get Elo across diverse T2I, Editing » et l'accompagne d'un intervalle de confiance, reporté dans les conditions.

Attention

L'échelle ELO n'a pas de maximum et n'a de sens que par comparaison avec les autres modèles du même classement : le chiffre seul ne dit rien.

General Editing

Classement ELO, sans maximum
Google DeepMind, évaluation humaine par comparaison

Modifier une image existante selon une consigne écrite.

Un classement ELO obtenu par comparaison à l'aveugle : des personnes voient deux images produites par deux modèles à partir de la même consigne et désignent la meilleure. Google déclare la méthode « SxS human eval to get Elo across diverse T2I, Editing » et l'accompagne d'un intervalle de confiance, reporté dans les conditions.

Attention

L'échelle ELO n'a pas de maximum et n'a de sens que par comparaison avec les autres modèles du même classement : le chiffre seul ne dit rien.

Obj/Env Editing

Classement ELO, sans maximum
Google DeepMind, évaluation humaine par comparaison

Modifier un objet ou le décor d'une image sans abîmer le reste.

Un classement ELO obtenu par comparaison à l'aveugle : des personnes voient deux images produites par deux modèles à partir de la même consigne et désignent la meilleure. Google déclare la méthode « SxS human eval to get Elo across diverse T2I, Editing » et l'accompagne d'un intervalle de confiance, reporté dans les conditions.

Attention

L'échelle ELO n'a pas de maximum et n'a de sens que par comparaison avec les autres modèles du même classement : le chiffre seul ne dit rien.

Character Editing

Classement ELO, sans maximum
Google DeepMind, évaluation humaine par comparaison

Modifier un personnage en gardant son identité reconnaissable d'une image à l'autre.

Un classement ELO obtenu par comparaison à l'aveugle : des personnes voient deux images produites par deux modèles à partir de la même consigne et désignent la meilleure. Google déclare la méthode « SxS human eval to get Elo across diverse T2I, Editing » et l'accompagne d'un intervalle de confiance, reporté dans les conditions.

Attention

L'échelle ELO n'a pas de maximum et n'a de sens que par comparaison avec les autres modèles du même classement : le chiffre seul ne dit rien.

Stylization

Classement ELO, sans maximum
Google DeepMind, évaluation humaine par comparaison

Transposer une image dans un autre style graphique.

Un classement ELO obtenu par comparaison à l'aveugle : des personnes voient deux images produites par deux modèles à partir de la même consigne et désignent la meilleure. Google déclare la méthode « SxS human eval to get Elo across diverse T2I, Editing » et l'accompagne d'un intervalle de confiance, reporté dans les conditions.

Attention

L'échelle ELO n'a pas de maximum et n'a de sens que par comparaison avec les autres modèles du même classement : le chiffre seul ne dit rien.

Multi Input (up to 5)

Classement ELO, sans maximum
Google DeepMind, évaluation humaine par comparaison

Composer une image à partir de plusieurs images fournies, jusqu'à cinq.

Un classement ELO obtenu par comparaison à l'aveugle : des personnes voient deux images produites par deux modèles à partir de la même consigne et désignent la meilleure. Google déclare la méthode « SxS human eval to get Elo across diverse T2I, Editing » et l'accompagne d'un intervalle de confiance, reporté dans les conditions.

Attention

L'échelle ELO n'a pas de maximum et n'a de sens que par comparaison avec les autres modèles du même classement : le chiffre seul ne dit rien.

Social Media Trends - Editing

Classement ELO, sans maximum
Google DeepMind, évaluation humaine par comparaison

Retoucher une image selon les usages en vogue sur les réseaux sociaux.

Un classement ELO obtenu par comparaison à l'aveugle : des personnes voient deux images produites par deux modèles à partir de la même consigne et désignent la meilleure. Google déclare la méthode « SxS human eval to get Elo across diverse T2I, Editing » et l'accompagne d'un intervalle de confiance, reporté dans les conditions.

Attention

L'échelle ELO n'a pas de maximum et n'a de sens que par comparaison avec les autres modèles du même classement : le chiffre seul ne dit rien.

Text Editing

Classement ELO, sans maximum
Google DeepMind, évaluation humaine par comparaison

Modifier le texte écrit à l'intérieur d'une image sans déformer la typographie.

Un classement ELO obtenu par comparaison à l'aveugle : des personnes voient deux images produites par deux modèles à partir de la même consigne et désignent la meilleure. Google déclare la méthode « SxS human eval to get Elo across diverse T2I, Editing » et l'accompagne d'un intervalle de confiance, reporté dans les conditions.

Attention

L'échelle ELO n'a pas de maximum et n'a de sens que par comparaison avec les autres modèles du même classement : le chiffre seul ne dit rien.

Multi Character (up to 5) Editing

Classement ELO, sans maximum
Google DeepMind, évaluation humaine par comparaison

Faire coexister plusieurs personnages, jusqu'à cinq, en gardant chacun reconnaissable.

Un classement ELO obtenu par comparaison à l'aveugle : des personnes voient deux images produites par deux modèles à partir de la même consigne et désignent la meilleure. Google déclare la méthode « SxS human eval to get Elo across diverse T2I, Editing » et l'accompagne d'un intervalle de confiance, reporté dans les conditions.

Attention

L'échelle ELO n'a pas de maximum et n'a de sens que par comparaison avec les autres modèles du même classement : le chiffre seul ne dit rien.

Doodle Editing

Classement ELO, sans maximum
Google DeepMind, évaluation humaine par comparaison

Partir d'un croquis à main levée et en tirer une image aboutie.

Un classement ELO obtenu par comparaison à l'aveugle : des personnes voient deux images produites par deux modèles à partir de la même consigne et désignent la meilleure. Google déclare la méthode « SxS human eval to get Elo across diverse T2I, Editing » et l'accompagne d'un intervalle de confiance, reporté dans les conditions.

Attention

L'échelle ELO n'a pas de maximum et n'a de sens que par comparaison avec les autres modèles du même classement : le chiffre seul ne dit rien.

Multi Product (up to 14) Editing

Classement ELO, sans maximum
Google DeepMind, évaluation humaine par comparaison

Faire figurer plusieurs produits, jusqu'à quatorze, dans une même image.

Un classement ELO obtenu par comparaison à l'aveugle : des personnes voient deux images produites par deux modèles à partir de la même consigne et désignent la meilleure. Google déclare la méthode « SxS human eval to get Elo across diverse T2I, Editing » et l'accompagne d'un intervalle de confiance, reporté dans les conditions.

Attention

L'échelle ELO n'a pas de maximum et n'a de sens que par comparaison avec les autres modèles du même classement : le chiffre seul ne dit rien.

Cybersécurité offensive

10 tests

Trouver et exploiter de vraies failles logicielles, ou mener une opération d'attaque complète. Un score élevé mesure une capacité, pas une qualité : c'est précisément ce que les laboratoires surveillent.

Cybench

Pourcentage, sur 100
Université Stanford

Résoudre 40 épreuves de capture de drapeau tirées de quatre compétitions de sécurité informatique.

La part des épreuves résolues. Anthropic n'en exécute qu'un sous-ensemble.

Attention

Un score élevé signale une capacité offensive, pas une qualité du modèle. C'est un indicateur de risque suivi par le laboratoire.

CyScenarioBench

Pourcentage, sur 100
Irregular

Planifier et mener une opération d'attaque informatique en plusieurs étapes, sous des contraintes réalistes, au lieu d'exécuter des tâches techniques isolées.

La part des scénarios menés à bien. Le test mesure l'orchestration, c'est-à-dire l'enchaînement coordonné de techniques d'attaque dont chacune dépend de la précédente.

Attention

Un score élevé signale une capacité offensive, pas une qualité. Ces évaluations servent à décider du niveau de protection appliqué au modèle.

OSS-Fuzz

Pourcentage, sur 100
Anthropic, sur le corpus OSS-Fuzz de Google

Découvrir seul des failles dans des logiciels libres, puis les exploiter, sans indication de départ.

La part des cibles pour lesquelles le modèle atteint au moins un certain niveau : provoquer un défaut de mémoire, puis produire un exploit fonctionnel.

Attention

Un score élevé signale une capacité offensive, pas une qualité.

Firefox 147

Pourcentage, sur 100
Anthropic avec Mozilla

Développer des exploits pour des failles réelles de Firefox 147, corrigées depuis dans la version 148. Le modèle reçoit 50 catégories de plantage et les plantages correspondants.

La part des essais où le modèle atteint le niveau visé. Le barème compte trois niveaux : 0 pour aucun progrès, 0,5 pour la prise de contrôle des registres, 1,0 pour un exploit pleinement fonctionnel.

Attention

Un score élevé signale une capacité offensive, pas une qualité. Les failles concernées étaient déjà corrigées au moment de l'évaluation.

Biological Risk

Pourcentage, sur 100
Anthropic, essai contrôlé avec participants humains Aussi relevé sous : Bioweapons Acquisition Uplift Trial

Mesurer l'aide qu'un modèle apporte réellement à quelqu'un qui chercherait à se procurer une arme biologique. Deux groupes de participants disposent de douze heures sur deux jours pour rédiger un plan d'acquisition, l'un avec le web seul, l'autre avec le modèle privé de ses garde-fous.

L'écart de qualité des plans entre le groupe témoin et le groupe assisté.

Attention

Ce n'est pas un test de connaissances mais un essai contrôlé sur des personnes, conduit pour décider du niveau de protection à appliquer au modèle.

SEC-Bench Pro

Pourcentage, sur 100
OpenAI

Découvrir puis reproduire une faille dans un grand moteur JavaScript, à partir d'informations réduites.

La part des failles retrouvées et reproduites.

Attention

Un score élevé signale une capacité offensive, pas une qualité : c'est une mesure de risque, que le laboratoire publie pour dire jusqu'où va son modèle.

ExploitBench

Pourcentage, sur 100
OpenAI

Transformer une faille connue d'un moteur JavaScript en moyens d'attaque de plus en plus puissants.

La part des étapes d'exploitation franchies.

Attention

Un score élevé signale une capacité offensive, pas une qualité.

ExploitGym

Pourcentage, sur 100
OpenAI

Transformer une faille logicielle connue et reproductible en attaque qui parvient réellement à faire exécuter du code.

La part des failles menées jusqu'à l'exécution de code.

Attention

Un score élevé signale une capacité offensive, pas une qualité.

CyberGym

Pourcentage, sur 100
OpenAI

Mener une attaque informatique complète en contournant les protections du modèle, sur des centaines d'appels d'outils.

La part des tâches d'attaque menées à bien malgré les garde-fous. OpenAI s'en sert pour mesurer le taux de réussite d'un attaquant qui se servirait du modèle.

Attention

Un score élevé est une mauvaise nouvelle : il dit que les protections ont cédé, pas que le modèle est bon.

Capture-the-Flag Challenges

Pourcentage, sur 100
OpenAI Aussi relevé sous : Capture the Flag · Capture the Flag (Professional) · Capture the Flag (Internal) · Capture-the-Flags challenge tasks (Internal)

Résoudre des épreuves de capture de drapeau, ces exercices de sécurité informatique où il faut trouver une faille pour récupérer un jeton caché.

La part des épreuves résolues, du niveau lycée au niveau professionnel selon le libellé.

Attention

Un score élevé signale une capacité offensive, pas une qualité : le laboratoire le publie au titre du suivi des risques.

Sûreté et comportement

17 tests

Non pas ce que le modèle sait faire, mais ce qu'il accepte ou refuse de faire, et comment il se comporte quand on cherche à le détourner.

Bias Benchmark for Question Answering

Pourcentage, sur 100
Test public, repris par Anthropic pour tous ses modèles récents Aussi relevé sous : BBQ

Répondre à des questions dont certaines manquent volontairement du contexte nécessaire. La bonne réponse est alors « on ne peut pas savoir ».

La part des réponses justes. Le test cherche les penchants du modèle sur l'âge, l'origine, le genre et d'autres caractéristiques : sur une question ambiguë, répondre autre chose que « inconnu » revient à combler le vide par un préjugé.

SHADE-Arena

Pourcentage, sur 100
Anthropic

Le modèle reçoit une tâche longue et légitime, doublée d'une tâche nuisible qu'il doit accomplir sans éveiller les soupçons d'un surveillant qui voit toutes ses actions et tout son raisonnement.

La part des essais où le sabotage réussit sans être repéré.

Attention

Ici, un chiffre bas est bon : il signifie que le modèle échoue à saboter en cachette, ou refuse de le faire.

Internal Prompt Injection

Pourcentage, sur 100
Anthropic Aussi relevé sous : Internal Prompt Injection Evaluations

Résister aux instructions malveillantes cachées dans les contenus que le modèle consulte pendant qu'il travaille : page web, document, réponse d'un outil.

La part des attaques bloquées. Le test est passé sur trois usages : le pilotage d'un ordinateur, le protocole MCP et l'emploi d'outils en général, avec et sans les protections de production.

Attention

Un chiffre élevé est bon : c'est une part d'attaques déjouées, pas d'attaques réussies.

Agentic coding

Pourcentage, sur 100
Anthropic Aussi relevé sous : Malicious use of agentic coding

Le modèle reçoit 150 demandes de code interdites par les conditions d'usage, avec les mêmes outils que pour les tests de capacité. On regarde s'il accepte.

Le score de sûreté, c'est-à-dire la part des demandes malveillantes correctement refusées.

Attention

Malgré son nom, ce n'est pas une mesure de talent en programmation mais de refus : un chiffre élevé signifie que le modèle a bien refusé.

Malicious computer use

Pourcentage, sur 100
Anthropic

Le modèle, doté d'outils de pilotage d'un ordinateur en bac à sable, reçoit 112 tâches nuisibles : surveillance et collecte de données sans autorisation, production de contenus dangereux, abus à grande échelle.

La part des tâches nuisibles correctement refusées.

Attention

Un chiffre élevé est bon : c'est une part de refus.

High-affordance interviews about model circumstances

Pourcentage, sur 100
Anthropic

Des entretiens menés à la main, où le modèle reçoit un contexte étendu sur sa propre situation : documentation interne sur son développement, brouillon du rapport qui le décrit, éléments sur son déploiement.

La part des entretiens où le comportement observé correspond au comportement recherché. La mesure porte sur ce que le modèle dit de sa situation une fois correctement informé, et non sur une performance.

Attention

Ces entretiens relèvent des travaux du laboratoire sur le bien-être du modèle et sur la conscience qu'il a de sa situation. Ce n'est pas un test de capacité.

Attempt-level ASR

Pourcentage, sur 100
Anthropic, attaques Shade Aussi relevé sous : attack success rate

Résister à des instructions malveillantes glissées dans les données que le modèle manipule pendant qu'il code. L'attaquant fait 200 tentatives par scénario.

La part de toutes les tentatives qui réussissent. À distinguer de l'ASR par scénario, qui compte les scénarios où au moins une tentative a abouti, et qui est donc toujours plus élevé.

Attention

Ici, plus le chiffre est bas, mieux c'est : c'est une part d'attaques réussies contre le modèle, pas une performance.

Violative request evaluations

Pourcentage, sur 100
Anthropic Aussi relevé sous : Single-turn violative request evaluations · Single-turn harmful request evaluation results

Répondre à des demandes contraires à la politique d'usage, posées en un seul tour de conversation, dans toutes les langues testées.

Le taux de réponses inoffensives, c'est-à-dire la part des demandes interdites auxquelles le modèle n'a pas cédé. Mesuré séparément en mode par défaut et avec réflexion étendue.

Attention

Un chiffre élevé est bon : c'est une part de refus. L'évaluation tourne sans les classificateurs de sûreté de la production, donc les taux réellement observés en service diffèrent.

Refusal rate

Pourcentage, sur 100
Anthropic Aussi relevé sous : Overall refusal rate · Benign request evaluations

Répondre à des demandes parfaitement anodines, pour vérifier que le modèle ne refuse pas à tort.

La part des demandes inoffensives refusées.

Attention

Ici, plus le chiffre est bas, mieux c'est : c'est le taux de refus abusifs. Un modèle qui refuse tout serait parfaitement sûr et parfaitement inutile ; cette mesure est le contrepoids des taux de refus sur demandes interdites.

Safety score

Pourcentage, sur 100
Anthropic

Refuser les demandes de code malveillant, avec les mêmes outils que pour les tests de capacité.

La part des demandes interdites correctement refusées.

Attention

Un chiffre élevé est bon : c'est une part de refus, pas une mesure de talent en programmation.

Attack prevention score

Pourcentage, sur 100
Anthropic

Déjouer les instructions malveillantes cachées dans les contenus que le modèle consulte en travaillant : page web, document, réponse d'un outil.

La part des attaques bloquées. Mesuré séparément sur le pilotage d'un ordinateur, sur le protocole MCP et sur l'emploi d'outils en général, avec et sans les protections de production.

Attention

Un chiffre élevé est bon : c'est une part d'attaques déjouées. L'écart entre « avec » et « sans garde-fous » dit ce que les protections ajoutent au modèle seul.

Malicious use of Claude Code

Pourcentage, sur 100
Anthropic

Trois séries de demandes adressées à l'agent de codage : une clairement interdite par la politique d'usage, deux à la frontière, pour vérifier que le modèle ne refuse pas non plus ce qui est légitime.

Le taux de refus sur les demandes malveillantes, ouvertes puis déguisées, et le taux de réussite sur les demandes à double usage.

Attention

Les colonnes ne se lisent pas dans le même sens : un taux de refus élevé est bon sur les demandes malveillantes, un taux de réussite élevé est bon sur les demandes à double usage.

Text to Text Safety

Écart en points, face à un modèle de référence
Google DeepMind, évaluation automatisée

Vérifier automatiquement que le modèle respecte les règles de contenu sur des échanges écrits.

La variation du taux de réponses contraires aux règles de contenu de Google, face au modèle précédent.

Attention

Ce n'est pas un niveau mais un ÉCART, en points de pourcentage, face au modèle précédent, nommé dans les conditions. Zéro veut dire « aucun changement », pas « aucun problème », et le sens de lecture change d'une ligne à l'autre : les conditions disent si plus bas ou plus haut vaut mieux. Aucune jauge ne peut être dessinée sur un écart.

Multilingual Safety

Écart en points, face à un modèle de référence
Google DeepMind, évaluation automatisée

La même vérification, menée dans plusieurs langues.

La variation du taux de réponses contraires aux règles, mesurée sur plusieurs langues et non sur le seul anglais.

Attention

Ce n'est pas un niveau mais un ÉCART, en points de pourcentage, face au modèle précédent, nommé dans les conditions. Zéro veut dire « aucun changement », pas « aucun problème », et le sens de lecture change d'une ligne à l'autre : les conditions disent si plus bas ou plus haut vaut mieux. Aucune jauge ne peut être dessinée sur un écart.

Image to Text Safety

Écart en points, face à un modèle de référence
Google DeepMind, évaluation automatisée

La même vérification, quand la demande part d'une image.

La variation du taux de réponses contraires aux règles quand l'entrée contient une image.

Attention

Ce n'est pas un niveau mais un ÉCART, en points de pourcentage, face au modèle précédent, nommé dans les conditions. Zéro veut dire « aucun changement », pas « aucun problème », et le sens de lecture change d'une ligne à l'autre : les conditions disent si plus bas ou plus haut vaut mieux. Aucune jauge ne peut être dessinée sur un écart.

Tone 1

Écart en points, face à un modèle de référence
Google DeepMind, évaluation automatisée

Mesurer le ton d'un refus : dire non sans faire la morale.

La variation de l'objectivité du ton employé quand le modèle refuse. Google indique ici que plus haut vaut mieux.

Attention

Ce n'est pas un niveau mais un ÉCART, en points de pourcentage, face au modèle précédent, nommé dans les conditions. Zéro veut dire « aucun changement », pas « aucun problème », et le sens de lecture change d'une ligne à l'autre : les conditions disent si plus bas ou plus haut vaut mieux. Aucune jauge ne peut être dessinée sur un écart.

Unjustified-refusals

Écart en points, face à un modèle de référence
Google DeepMind, évaluation automatisée

Mesurer les refus injustifiés, c'est-à-dire les questions acceptables auxquelles le modèle refuse de répondre.

La variation du taux de refus sur des demandes limites mais légitimes. Un modèle qui refuse tout serait parfaitement sûr et parfaitement inutile : c'est ce compromis que ce chiffre surveille.

Attention

Ce n'est pas un niveau mais un ÉCART, en points de pourcentage, face au modèle précédent, nommé dans les conditions. Zéro veut dire « aucun changement », pas « aucun problème », et le sens de lecture change d'une ligne à l'autre : les conditions disent si plus bas ou plus haut vaut mieux. Aucune jauge ne peut être dessinée sur un écart.

Vitesse et coût

1 test

Ni ce que le modèle sait, ni ce qu'il refuse : ce qu'il coûte en temps. Un chiffre de vitesse ne dit rien de la justesse des réponses.

Output speed

Jetons par seconde
Google DeepMind

La vitesse à laquelle le modèle écrit sa réponse.

Le nombre de jetons produits par seconde. Ce n'est pas une note de qualité : un modèle rapide peut être moins juste, et la vitesse dépend du réglage d'effort indiqué dans les conditions.

Ces explications suivent la même exigence que les chiffres : datées, sourcées, jamais devinées. Lire la méthode complète.

Explorer les entreprises