Aktory Référentiel IA
Lignée Tête de gamme

GPT-5.2

Actif
OpenAI · Gamme Tête de gamme · sorti le 11 décembre 2025

Previous frontier model for professional work with configurable reasoning effort

Les faits

Ce qu'il coûte, ce qu'il tient

Fenêtre de contexte 400K jetons

Ce qu’il peut avoir sous les yeux en une seule fois, question et réponse comprises.

Prix d’entrée 1,75 $ / M jetons

Ce que coûte le texte qu’on lui envoie.

Prix de sortie 14 $ / M jetons

Ce que coûte le texte qu’il produit, toujours plus cher que l’entrée.

Sortie maximale 128K jetons

La plus longue réponse qu’il peut produire d’un seul tenant.

Connaissances arrêtées à août 2025

Il ne sait rien de ce qui s’est passé après cette date, sauf si on le lui fournit.

Cycle de vie

D'aujourd'hui à sa fin de service

Sortie 11 décembre 2025
Dépréciation Non annoncée
Retrait Non annoncé
Capacités

Ce qu'il sait faire

Raisonnement

Le modèle peut réfléchir avant de répondre, en produisant des jetons de raisonnement facturés comme la sortie. La profondeur se règle par un niveau d'effort.

Réponse au fil de l'eau

La réponse arrive mot à mot pendant qu'elle s'écrit, au lieu d'attendre qu'elle soit finie.

Sortie structurée

Le modèle rend une réponse au format demandé, exploitable par un programme sans relecture.

Appel de fonctions

Le modèle peut demander l'exécution d'une fonction du programme qui l'appelle et se servir du résultat.

Recherche dans des fichiers

Le modèle peut chercher une réponse dans des documents fournis plutôt que dans ce qu'il a appris.

Dépôt de fichiers

Des fichiers peuvent lui être soumis directement.

Lecture d'images

Le modèle voit les images qu'on lui soumet et peut répondre à leur sujet.

Recherche sur le web

Le modèle peut consulter le web pendant qu'il répond, ce qui lui donne accès à des faits postérieurs à son entraînement.

Mise en cache des requêtes

Une partie de requête déjà envoyée est facturée moins cher si elle est réutilisée peu après.

Production d'images

Le modèle peut produire une image.

Exécution de code

Le modèle peut écrire puis exécuter du code pour calculer ou vérifier lui-même.

Terminal hébergé

Le modèle dispose d'un terminal pour lancer des commandes.

Application de correctifs

Le modèle peut modifier des fichiers de code par correctifs successifs.

Compétences

Des marches à suivre préparées peuvent être chargées à la demande pour une tâche donnée.

Connecteurs MCP

Le modèle peut se brancher sur des services extérieurs par le protocole ouvert Model Context Protocol.

La lignée Tête de gamme

Les autres versions

Toute la lignée
Benchmarks expliqués

Ce qu'il vaut, avec les conditions

24 tests relevés pour ce modèle, regroupés par ce qu'ils mesurent. Chaque chiffre est annoncé par le laboratoire, avec sa source et ses conditions ; une jauge n'est dessinée que quand l'échelle du test a un maximum connu.

Code et ingénierie logicielle

Le modèle reçoit un dépôt et un problème, et doit produire un correctif qui passe les tests, sans intervention humaine.

4 tests

SWE-bench Verified

80 %

Corriger de vrais tickets ouverts sur GitHub, dans le dépôt d'origine, sans aide.

Source

SWE-Lancer

74,6 %

Réaliser de vraies missions de développement freelance, payées, telles qu'elles ont été publiées sur une place de marché.

relevé sous « SWE-Lancer, IC Diamond »

Source

Terminal-Bench 2.0

62,2 %

Du travail réel en ligne de commande, dans un conteneur, du début à la fin.

Source

SWE-bench Pro

55,6 %

Le même exercice, sur des dépôts encore maintenus et des correctifs qui touchent plusieurs fichiers.

relevé sous « SWE-Bench Pro, Public »

Source

Raisonnement sur des situations inconnues

Aucune connaissance préalable ne sert : il faut inférer une règle jamais vue à partir de quelques exemples.

2 tests

ARC-AGI-1

86,2 %

Deviner la règle cachée derrière trois exemples de grilles, puis l'appliquer à une grille nouvelle.

Verified

Source

ARC-AGI-2

52,9 %

Le même principe, avec des règles nettement plus difficiles à inférer.

Verified

Source

Connaissances et raisonnement scientifique

Des questions à réponse unique, du niveau lycée au niveau doctorat, où seule la justesse compte.

6 tests

OpenAI-MRCR

98,2 %

Retrouver la bonne réponse quand plusieurs demandes presque identiques ont été noyées dans une très longue conversation.

relevé sous « OpenAI MRCR v2 8-needle 4K-8K »

Source

GraphWalks (contexte long)

94 %

Parcourir un graphe dont la description remplit toute la fenêtre de contexte.

relevé sous « GraphWalks bfs <128k »

Source

GPQA Diamond

92,4 %

Des questions de niveau doctorat en biologie, physique et chimie, écrites par des spécialistes.

no tools

Source

MMMLU

89,6 %

Les 57 matières de MMLU, posées dans quatorze langues autres que l'anglais.

Source

MMMU-Pro

79,5 %

Percevoir, interpréter et raisonner sur des questions de niveau licence mêlant texte et images, dans des disciplines variées.

no tools

Source

Humanity's Last Exam

34,5 %

Des questions écrites par des spécialistes pour rester hors de portée des modèles.

no tools, relevé sous « HLE »

Source

Mathématiques

Des démonstrations de niveau olympiade et des problèmes tirés de la recherche en cours.

3 tests

AIME 2025

100 %

L'examen américain d'invitation en mathématiques, une compétition lycéenne prestigieuse.

no tools

Source

HMMT

99,4 %

Le tournoi de mathématiques organisé par Harvard et le MIT, une compétition entre équipes de lycéens.

no tools, relevé sous « HMMT, Feb 2025 »

Source

FrontierMath

40,7 %

Résoudre des problèmes de mathématiques de niveau expert, écrits pour l'occasion par des mathématiciens de recherche afin qu'aucune solution ne circule déjà.

relevé sous « FrontierMath Tier 1-3 »

Source

Pilotage d'un ordinateur

Le modèle agit à la souris et au clavier sur une machine réelle, comme le ferait une personne.

3 tests

CharXiv Reasoning

88,7 %

Raisonner sur les figures d'articles scientifiques publiés sur arXiv.

w/ Python

Source

ScreenSpot-Pro

86,3 %

Pointer précisément le bon élément d'interface sur une capture d'écran de logiciel professionnel.

w/ Python

Source

OSWorld-Verified

47,3 %

Accomplir des tâches courantes sur une machine Ubuntu réelle, à la souris et au clavier.

Source

Travail professionnel réel

Des livrables de métier : dossiers juridiques, flux d'entreprise, enchaînements d'outils, documents de travail.

6 tests

Tau2-bench Telecom

98,7 %

Traiter une demande de service client de bout en bout, en suivant les règles de l'entreprise et en dialoguant avec le client.

Source

BrowseComp Long Context 128k

92 %

Retrouver sur le web une information difficile à trouver, en gardant sous les yeux tout ce qui a déjà été lu.

Source

GDPval

70,9 %

Produire un vrai livrable de travail dans l'une de quarante-quatre professions, à partir d'une commande détaillée.

ties allowed, wins or ties

Source

BrowseComp

65,8 %

Trouver sur le web une information difficile à dénicher, en naviguant soi-même.

Source

OfficeQA

63,1 %

Répondre à des questions en s'appuyant sur un grand corpus de documents d'entreprise.

Source

MCP Atlas

60,6 %

Enchaîner des outils par le protocole MCP : trouver le bon, l'appeler correctement, recomposer la réponse.

relevé sous « Scale MCP-Atlas »

Source
Pour les développeurs

Intégrer ce modèle

L'appeler

Identifiant d’APIgpt-5.2

Le nom exact à écrire dans le code pour appeler ce modèle.

Alias gpt-5.2-2025-12-11

Les autres noms du même modèle, selon la plateforme qui le revend.

Ce qu'il accepte

Entrées acceptées texteimage
Sorties produites texte

Facturation détaillée par million de jetons

Lecture depuis le cache0,18 $ Traitement par lots, entrée0,88 $ Traitement par lots, sortie7 $

Mettre en mémoire un début de requête réutilisé d’un appel à l’autre : 1,25 fois le prix d’entrée.