Aktory Référentiel IA
Lignée Tête de gamme

GPT-4o

Actif
OpenAI · Gamme Tête de gamme · sorti le 13 mai 2024

Fast, intelligent, flexible GPT model

Les faits

Ce qu'il coûte, ce qu'il tient

Fenêtre de contexte 128K jetons

Ce qu’il peut avoir sous les yeux en une seule fois, question et réponse comprises.

Prix d’entrée 2,5 $ / M jetons

Ce que coûte le texte qu’on lui envoie.

Prix de sortie 10 $ / M jetons

Ce que coûte le texte qu’il produit, toujours plus cher que l’entrée.

Sortie maximale 16K jetons

La plus longue réponse qu’il peut produire d’un seul tenant.

Connaissances arrêtées à octobre 2023

Il ne sait rien de ce qui s’est passé après cette date, sauf si on le lui fournit.

Cycle de vie

D'aujourd'hui à sa fin de service

Sortie 13 mai 2024
Dépréciation Non annoncée
Retrait Non annoncé
Capacités

Ce qu'il sait faire

Réponse au fil de l'eau

La réponse arrive mot à mot pendant qu'elle s'écrit, au lieu d'attendre qu'elle soit finie.

Sortie structurée

Le modèle rend une réponse au format demandé, exploitable par un programme sans relecture.

Sortie prédite

Quand on sait déjà à quoi ressemblera l'essentiel de la réponse, la fournir accélère et réduit le coût.

Recherche dans des fichiers

Le modèle peut chercher une réponse dans des documents fournis plutôt que dans ce qu'il a appris.

Dépôt de fichiers

Des fichiers peuvent lui être soumis directement.

Spécialisation

Le modèle peut être réentraîné sur des exemples propres à un usage.

Appel de fonctions

Le modèle peut demander l'exécution d'une fonction du programme qui l'appelle et se servir du résultat.

Lecture d'images

Le modèle voit les images qu'on lui soumet et peut répondre à leur sujet.

Recherche sur le web

Le modèle peut consulter le web pendant qu'il répond, ce qui lui donne accès à des faits postérieurs à son entraînement.

Production d'images

Le modèle peut produire une image.

Exécution de code

Le modèle peut écrire puis exécuter du code pour calculer ou vérifier lui-même.

Connecteurs MCP

Le modèle peut se brancher sur des services extérieurs par le protocole ouvert Model Context Protocol.

La lignée Tête de gamme

Les autres versions

Toute la lignée
Benchmarks expliqués

Ce qu'il vaut, avec les conditions

16 tests relevés pour ce modèle, regroupés par ce qu'ils mesurent. Chaque chiffre est annoncé par le laboratoire, avec sa source et ses conditions ; une jauge n'est dessinée que quand l'échelle du test a un maximum connu.

Code et ingénierie logicielle

Le modèle reçoit un dépôt et un problème, et doit produire un correctif qui passe les tests, sans intervention humaine.

2 tests

SWE-bench Verified

33,2 %

Corriger de vrais tickets ouverts sur GitHub, dans le dépôt d'origine, sans aide.

2024-11-20

Source

Aider's polyglot

30,7 %

Résoudre des exercices de programmation d'Exercism en modifiant des fichiers source, dans plusieurs langages.

2024-11-20, relevé sous « Aider’s polyglot: whole »

Source

Connaissances et raisonnement scientifique

Des questions à réponse unique, du niveau lycée au niveau doctorat, où seule la justesse compte.

6 tests

MMLU

85,7 %

Des questions à choix multiples sur 57 matières, du programme de lycée au niveau professionnel.

2024-11-20

Source

MMMLU

81,4 %

Les 57 matières de MMLU, posées dans quatorze langues autres que l'anglais.

2024-11-20, relevé sous « Multilingual MMLU »

Source

MMMU

68,7 %

Des questions d'examen universitaire qui mêlent texte, schémas, cartes et partitions.

2024-11-20

Source

GPQA Diamond

46 %

Des questions de niveau doctorat en biologie, physique et chimie, écrites par des spécialistes.

2024-11-20

Source

GraphWalks (contexte long)

41,7 %

Parcourir un graphe dont la description remplit toute la fenêtre de contexte.

2024-11-20, relevé sous « Graphwalks bfs <128k »

Source

OpenAI-MRCR

31,9 %

Retrouver la bonne réponse quand plusieurs demandes presque identiques ont été noyées dans une très longue conversation.

2024-11-20, relevé sous « OpenAI-MRCR: 2 needle128k »

Source

Mathématiques

Des démonstrations de niveau olympiade et des problèmes tirés de la recherche en cours.

2 tests

MathVista

61,4 %

Résoudre des problèmes de mathématiques posés sous forme d'image : un graphique, une figure, un schéma.

2024-11-20

Source

AIME 2024

13,1 %

L'examen américain d'invitation en mathématiques, édition 2024 : une compétition lycéenne prestigieuse, quinze problèmes en trois heures.

2024-11-20

Source

Pilotage d'un ordinateur

Le modèle agit à la souris et au clavier sur une machine réelle, comme le ferait une personne.

1 test

CharXiv Reasoning

52,7 %

Raisonner sur les figures d'articles scientifiques publiés sur arXiv.

2024-11-20

Source

Travail professionnel réel

Des livrables de métier : dossiers juridiques, flux d'entreprise, enchaînements d'outils, documents de travail.

4 tests

IFEval

81 %

Obéir à des consignes de forme dont le respect se vérifie par un programme, sans jugement humain.

2024-11-20

Source

COLLIE

50,2 %

Écrire un texte libre en respectant à la lettre des contraintes de forme.

2024-11-20

Source

tau-bench

42,8 %

Traiter un dossier de service client en suivant les règles de l'entreprise, dans le transport aérien ou le commerce de détail.

2024-11-20, relevé sous « Taubench airline »

Source

MultiChallenge

27,8 %

Tenir une conversation à plusieurs tours en se servant correctement de ce qui a été dit avant.

2024-11-20

Source

Préférence des utilisateurs

Ce ne sont pas des exercices notés : des personnes comparent deux réponses à l'aveugle et désignent la meilleure.

1 test

LMArena (overall)

1 287

Des personnes posent leur propre question, reçoivent deux réponses anonymes et désignent celle qu'elles préfèrent.

Source
Pour les développeurs

Intégrer ce modèle

L'appeler

Identifiant d’APIgpt-4o

Le nom exact à écrire dans le code pour appeler ce modèle.

Alias gpt-4o-2024-11-20gpt-4o-2024-08-06gpt-4o-2024-05-13

Les autres noms du même modèle, selon la plateforme qui le revend.

Ce qu'il accepte

Entrées acceptées texteimage
Sorties produites texte

Facturation détaillée par million de jetons

Lecture depuis le cache1,25 $ Traitement par lots, entrée1,25 $ Traitement par lots, sortie5 $

Mettre en mémoire un début de requête réutilisé d’un appel à l’autre : 1,25 fois le prix d’entrée.