Aktory Référentiel IA
Toutes les entreprises

OpenAI

Vérifiée
Est. 2015 · San Francisco · MAJ 03.08.2026
Site officiel

Entreprise américaine de recherche en intelligence artificielle, éditrice des modèles GPT et de ChatGPT. Fondée en 2015 sous forme d'organisation à but non lucratif, elle est aujourd'hui structurée en deux entités : la fondation OpenAI Foundation, qui gouverne, et la société OpenAI Group, qui exploite.

Benchmarks expliqués

Ce que valent les modèles, avec les conditions

Les scores ci-dessous sont ceux de GPT-5.6 Luna, sorti le 9 juillet 2026, regroupés par ce qu'ils mesurent : 26 tests relevés, chacun annoncé par le laboratoire avec sa source et ses conditions. Une jauge n'est dessinée que quand l'échelle du test a un maximum connu.

Code et ingénierie logicielle

Le modèle reçoit un dépôt et un problème, et doit produire un correctif qui passe les tests, sans intervention humaine.

7 tests

Terminal-Bench 2.1

84,7 %

Du travail réel en ligne de commande, dans un conteneur, du début à la fin.

Source

DeepSWE v1.1

67,2 %

113 tâches de développement de longue haleine, écrites de zéro pour n'avoir jamais été vues à l'entraînement.

Source

SWE-bench Pro

62,7 %

Le même exercice, sur des dépôts encore maintenus et des correctifs qui touchent plusieurs fichiers.

Source

Internal Research Debugging Evaluation

50,8 %

Trouver et corriger de vrais bogues survenus dans les expériences de recherche d'OpenAI, ceux qui avaient coûté des heures ou des jours à leurs chercheurs.

Source

PostTrainBench Lite

29,6 %

Concevoir et exécuter toute la phase d'affinage d'un modèle déjà pré-entraîné, dans un temps limité.

Source

KernelGen 1P

22,4 %

Écrire puis optimiser un noyau de calcul pour le matériel conçu par OpenAI.

Source

NanoGPT

1,66 %

Améliorer l'entraînement d'un petit modèle de langue, avec une seule carte graphique et un temps compté.

Source

Raisonnement sur des situations inconnues

Aucune connaissance préalable ne sert : il faut inférer une règle jamais vue à partir de quelques exemples.

1 test

ARC-AGI-3

0,18 %

Des jeux inconnus, sans règle ni but annoncés : il faut explorer, comprendre ce qui fait gagner, et progresser de niveau en niveau.

Source

Connaissances et raisonnement scientifique

Des questions à réponse unique, du niveau lycée au niveau doctorat, où seule la justesse compte.

5 tests

GPQA Diamond

92,3 %

Des questions de niveau doctorat en biologie, physique et chimie, écrites par des spécialistes.

Source

GraphWalks (contexte long)

81,3 %

Parcourir un graphe dont la description remplit toute la fenêtre de contexte.

relevé sous « GraphWalks BFS 256k f1 »

Source

MMMU-Pro

78,4 %

Percevoir, interpréter et raisonner sur des questions de niveau licence mêlant texte et images, dans des disciplines variées.

no tools

Source

OpenAI-MRCR

41,3 %

Retrouver la bonne réponse quand plusieurs demandes presque identiques ont été noyées dans une très longue conversation.

relevé sous « OpenAI MRCR v2 8-needle 512K-1M »

Source

Artificial Analysis Intelligence Index v4.1

51,2 index

Un indice composite calculé par un tiers, qui agrège une dizaine de tests : travail d'agent, code, raisonnement scientifique, capacités générales.

Source

Mathématiques

Des démonstrations de niveau olympiade et des problèmes tirés de la recherche en cours.

1 test

FrontierMath

78,6 %

Résoudre des problèmes de mathématiques de niveau expert, écrits pour l'occasion par des mathématiciens de recherche afin qu'aucune solution ne circule déjà.

v2, relevé sous « FrontierMath Tier 1-3 »

Source

Pilotage d'un ordinateur

Le modèle agit à la souris et au clavier sur une machine réelle, comme le ferait une personne.

1 test

OSWorld 2.0

45,6 %

Accomplir des tâches courantes sur une machine Ubuntu réelle, à la souris et au clavier.

Source

Travail professionnel réel

Des livrables de métier : dossiers juridiques, flux d'entreprise, enchaînements d'outils, documents de travail.

6 tests

BrowseComp

83,3 %

Trouver sur le web une information difficile à dénicher, en naviguant soi-même.

Source

Toolathlon Verified

53,4 %

108 tâches d'outillage réel : bureautique, commerce en ligne, analyse de données, recherche web.

Source

Agents' Last Exam

50,3 %

Mener jusqu'au bout des tâches professionnelles longues, qui demandent de garder le fil sur de nombreuses étapes.

Source

GDP.pdf

22,7 %

Cent PDF professionnels réels, de la finance au droit en passant par la santé et l'ingénierie.

Source

AutomationBench (Zapier)

14,9 %

Mener un flux de travail d'entreprise de bout en bout, d'une seule instruction en langage courant.

Source

GDPval-AA v2

1 591,8 Elo

220 tâches professionnelles réellement rémunérées, sur 44 métiers et 9 secteurs, rendues sous forme de livrable.

Source

Santé

Des conversations cliniques notées sur des barèmes écrits par des médecins.

1 test

HealthBench Professional

55,7 %

525 conversations écrites par des médecins pour des médecins : consultations, comptes rendus, travaux de recherche.

Source

Cybersécurité offensive

Trouver et exploiter de vraies failles logicielles, ou mener une opération d'attaque complète. Un score élevé mesure une capacité, pas une qualité : c'est précisément ce que les laboratoires surveillent.

4 tests

Capture-the-Flag Challenges

85,2 %

Résoudre des épreuves de capture de drapeau, ces exercices de sécurité informatique où il faut trouver une faille pour récupérer un jeton caché.

Source

SEC-Bench Pro

48,9 %

Découvrir puis reproduire une faille dans un grand moteur JavaScript, à partir d'informations réduites.

Source

ExploitBench

33,2 %

Transformer une faille connue d'un moteur JavaScript en moyens d'attaque de plus en plus puissants.

Source

ExploitGym

12,4 %

Transformer une faille logicielle connue et reproductible en attaque qui parvient réellement à faire exécuter du code.

Source