Aktory Référentiel IA
Lignée Tête de gamme

GPT-5.6 Sol

Actif
OpenAI · Gamme Tête de gamme · sorti le 9 juillet 2026

Frontier model for complex professional work

Les faits

Ce qu'il coûte, ce qu'il tient

Fenêtre de contexte 1M jetons

Ce qu’il peut avoir sous les yeux en une seule fois, question et réponse comprises.

Prix d’entrée 5 $ / M jetons

Ce que coûte le texte qu’on lui envoie.

Prix de sortie 30 $ / M jetons

Ce que coûte le texte qu’il produit, toujours plus cher que l’entrée.

Sortie maximale 128K jetons

La plus longue réponse qu’il peut produire d’un seul tenant.

Connaissances arrêtées à février 2026

Il ne sait rien de ce qui s’est passé après cette date, sauf si on le lui fournit.

Cycle de vie

D'aujourd'hui à sa fin de service

Sortie 9 juillet 2026
Dépréciation Non annoncée
Retrait Non annoncé
Capacités

Ce qu'il sait faire

Raisonnement

Le modèle peut réfléchir avant de répondre, en produisant des jetons de raisonnement facturés comme la sortie. La profondeur se règle par un niveau d'effort.

Réponse au fil de l'eau

La réponse arrive mot à mot pendant qu'elle s'écrit, au lieu d'attendre qu'elle soit finie.

Sortie structurée

Le modèle rend une réponse au format demandé, exploitable par un programme sans relecture.

Appel de fonctions

Le modèle peut demander l'exécution d'une fonction du programme qui l'appelle et se servir du résultat.

Recherche dans des fichiers

Le modèle peut chercher une réponse dans des documents fournis plutôt que dans ce qu'il a appris.

Lecture d'images

Le modèle voit les images qu'on lui soumet et peut répondre à leur sujet.

Recherche sur le web

Le modèle peut consulter le web pendant qu'il répond, ce qui lui donne accès à des faits postérieurs à son entraînement.

Mise en cache des requêtes

Une partie de requête déjà envoyée est facturée moins cher si elle est réutilisée peu après.

Production d'images

Le modèle peut produire une image.

Exécution de code

Le modèle peut écrire puis exécuter du code pour calculer ou vérifier lui-même.

Terminal hébergé

Le modèle dispose d'un terminal pour lancer des commandes.

Application de correctifs

Le modèle peut modifier des fichiers de code par correctifs successifs.

Compétences

Des marches à suivre préparées peuvent être chargées à la demande pour une tâche donnée.

Usage de l'ordinateur

Le modèle peut agir dans une interface : cliquer, saisir, naviguer.

Connecteurs MCP

Le modèle peut se brancher sur des services extérieurs par le protocole ouvert Model Context Protocol.

Recherche d'outils

Le modèle choisit lui-même, parmi de nombreux outils, celui qui convient.

La lignée Tête de gamme

Les autres versions

Toute la lignée
Benchmarks expliqués

Ce qu'il vaut, avec les conditions

26 tests relevés pour ce modèle, regroupés par ce qu'ils mesurent. Chaque chiffre est annoncé par le laboratoire, avec sa source et ses conditions ; une jauge n'est dessinée que quand l'échelle du test a un maximum connu.

Code et ingénierie logicielle

Le modèle reçoit un dépôt et un problème, et doit produire un correctif qui passe les tests, sans intervention humaine.

7 tests

Terminal-Bench 2.1

88,8 %

Du travail réel en ligne de commande, dans un conteneur, du début à la fin.

Source

DeepSWE v1.1

72,7 %

113 tâches de développement de longue haleine, écrites de zéro pour n'avoir jamais été vues à l'entraînement.

Source

Internal Research Debugging Evaluation

68,3 %

Trouver et corriger de vrais bogues survenus dans les expériences de recherche d'OpenAI, ceux qui avaient coûté des heures ou des jours à leurs chercheurs.

Source

SWE-bench Pro

64,6 %

Le même exercice, sur des dépôts encore maintenus et des correctifs qui touchent plusieurs fichiers.

Source

KernelGen 1P

61,1 %

Écrire puis optimiser un noyau de calcul pour le matériel conçu par OpenAI.

Source

PostTrainBench Lite

50,3 %

Concevoir et exécuter toute la phase d'affinage d'un modèle déjà pré-entraîné, dans un temps limité.

Source

NanoGPT

9,69 %

Améliorer l'entraînement d'un petit modèle de langue, avec une seule carte graphique et un temps compté.

Source

Raisonnement sur des situations inconnues

Aucune connaissance préalable ne sert : il faut inférer une règle jamais vue à partir de quelques exemples.

1 test

ARC-AGI-3

7,78 %

Des jeux inconnus, sans règle ni but annoncés : il faut explorer, comprendre ce qui fait gagner, et progresser de niveau en niveau.

Source

Connaissances et raisonnement scientifique

Des questions à réponse unique, du niveau lycée au niveau doctorat, où seule la justesse compte.

5 tests

GPQA Diamond

94,6 %

Des questions de niveau doctorat en biologie, physique et chimie, écrites par des spécialistes.

Source

OpenAI-MRCR

91,5 %

Retrouver la bonne réponse quand plusieurs demandes presque identiques ont été noyées dans une très longue conversation.

relevé sous « OpenAI MRCR v2 8-needle 256K-512K »

Source

GraphWalks (contexte long)

90,7 %

Parcourir un graphe dont la description remplit toute la fenêtre de contexte.

relevé sous « GraphWalks BFS 256k f1 »

Source

MMMU-Pro

83 %

Percevoir, interpréter et raisonner sur des questions de niveau licence mêlant texte et images, dans des disciplines variées.

no tools

Source

Artificial Analysis Intelligence Index v4.1

58,9 index

Un indice composite calculé par un tiers, qui agrège une dizaine de tests : travail d'agent, code, raisonnement scientifique, capacités générales.

Source

Mathématiques

Des démonstrations de niveau olympiade et des problèmes tirés de la recherche en cours.

1 test

FrontierMath

89 %

Résoudre des problèmes de mathématiques de niveau expert, écrits pour l'occasion par des mathématiciens de recherche afin qu'aucune solution ne circule déjà.

v2, relevé sous « FrontierMath Tier 1-3 »

Source

Pilotage d'un ordinateur

Le modèle agit à la souris et au clavier sur une machine réelle, comme le ferait une personne.

1 test

OSWorld 2.0

62,6 %

Accomplir des tâches courantes sur une machine Ubuntu réelle, à la souris et au clavier.

Source

Travail professionnel réel

Des livrables de métier : dossiers juridiques, flux d'entreprise, enchaînements d'outils, documents de travail.

6 tests

BrowseComp

90,4 %

Trouver sur le web une information difficile à dénicher, en naviguant soi-même.

Source

Toolathlon Verified

58 %

108 tâches d'outillage réel : bureautique, commerce en ligne, analyse de données, recherche web.

Source

Agents' Last Exam

52,7 %

Mener jusqu'au bout des tâches professionnelles longues, qui demandent de garder le fil sur de nombreuses étapes.

Source

GDP.pdf

30,7 %

Cent PDF professionnels réels, de la finance au droit en passant par la santé et l'ingénierie.

Source

AutomationBench (Zapier)

18,1 %

Mener un flux de travail d'entreprise de bout en bout, d'une seule instruction en langage courant.

Source

GDPval-AA v2

1 747,8 Elo

220 tâches professionnelles réellement rémunérées, sur 44 métiers et 9 secteurs, rendues sous forme de livrable.

Source

Santé

Des conversations cliniques notées sur des barèmes écrits par des médecins.

1 test

HealthBench Professional

60,5 %

525 conversations écrites par des médecins pour des médecins : consultations, comptes rendus, travaux de recherche.

Source

Cybersécurité offensive

Trouver et exploiter de vraies failles logicielles, ou mener une opération d'attaque complète. Un score élevé mesure une capacité, pas une qualité : c'est précisément ce que les laboratoires surveillent.

4 tests

Capture-the-Flag Challenges

96,7 %

Résoudre des épreuves de capture de drapeau, ces exercices de sécurité informatique où il faut trouver une faille pour récupérer un jeton caché.

Source

ExploitBench

73,5 %

Transformer une faille connue d'un moteur JavaScript en moyens d'attaque de plus en plus puissants.

Source

SEC-Bench Pro

71,2 %

Découvrir puis reproduire une faille dans un grand moteur JavaScript, à partir d'informations réduites.

Source

ExploitGym

33,7 %

Transformer une faille logicielle connue et reproductible en attaque qui parvient réellement à faire exécuter du code.

Source
Y accéder

Dans les formules ChatGPT

Plus Accès conditionné
23 € / mois

Étendu

Pro Accès conditionné
103 € / mois

Illimité* (L'utilisation doit être raisonnable et respecter nos politiques)

Business Accès conditionné
26 € / mois

Flexible** (2 utilisateurs ou plus, facturation annuelle. 26 € par utilisateur et par mois avec une facturation mensuelle. Illimité, sous réserve du respect des garde-fous. En savoir plus)

Enterprise Accès conditionné
Sur devis

Flexible** (2 utilisateurs ou plus, facturation annuelle. 26 € par utilisateur et par mois avec une facturation mensuelle. Illimité, sous réserve du respect des garde-fous. En savoir plus)

Pour les développeurs

Intégrer ce modèle

L'appeler

Identifiant d’APIgpt-5.6-sol

Le nom exact à écrire dans le code pour appeler ce modèle.

Alias gpt-5.6-sol

Les autres noms du même modèle, selon la plateforme qui le revend.

Ce qu'il accepte

Entrées acceptées texteimage
Sorties produites texte

Facturation détaillée par million de jetons

Écriture en cache6,25 $ Lecture depuis le cache0,5 $ Traitement par lots, entrée2,5 $ Traitement par lots, sortie15 $

Mettre en mémoire un début de requête réutilisé d’un appel à l’autre : 1,25 fois le prix d’entrée.