SWE-bench Verified
Corriger de vrais tickets ouverts sur GitHub, dans le dépôt d'origine, sans aide.
2024-11-20
Source
Fast, intelligent, flexible GPT model
Ce qu’il peut avoir sous les yeux en une seule fois, question et réponse comprises.
Ce que coûte le texte qu’on lui envoie.
Ce que coûte le texte qu’il produit, toujours plus cher que l’entrée.
La plus longue réponse qu’il peut produire d’un seul tenant.
Il ne sait rien de ce qui s’est passé après cette date, sauf si on le lui fournit.
La réponse arrive mot à mot pendant qu'elle s'écrit, au lieu d'attendre qu'elle soit finie.
Le modèle rend une réponse au format demandé, exploitable par un programme sans relecture.
Quand on sait déjà à quoi ressemblera l'essentiel de la réponse, la fournir accélère et réduit le coût.
Le modèle peut chercher une réponse dans des documents fournis plutôt que dans ce qu'il a appris.
Des fichiers peuvent lui être soumis directement.
Le modèle peut être réentraîné sur des exemples propres à un usage.
Le modèle peut demander l'exécution d'une fonction du programme qui l'appelle et se servir du résultat.
Le modèle voit les images qu'on lui soumet et peut répondre à leur sujet.
Le modèle peut consulter le web pendant qu'il répond, ce qui lui donne accès à des faits postérieurs à son entraînement.
Le modèle peut produire une image.
Le modèle peut écrire puis exécuter du code pour calculer ou vérifier lui-même.
Le modèle peut se brancher sur des services extérieurs par le protocole ouvert Model Context Protocol.
16 tests relevés pour ce modèle, regroupés par ce qu'ils mesurent. Chaque chiffre est annoncé par le laboratoire, avec sa source et ses conditions ; une jauge n'est dessinée que quand l'échelle du test a un maximum connu.
Le modèle reçoit un dépôt et un problème, et doit produire un correctif qui passe les tests, sans intervention humaine.
Corriger de vrais tickets ouverts sur GitHub, dans le dépôt d'origine, sans aide.
2024-11-20
SourceRésoudre des exercices de programmation d'Exercism en modifiant des fichiers source, dans plusieurs langages.
2024-11-20, relevé sous « Aider’s polyglot: whole »
SourceDes questions à réponse unique, du niveau lycée au niveau doctorat, où seule la justesse compte.
Des questions à choix multiples sur 57 matières, du programme de lycée au niveau professionnel.
2024-11-20
SourceLes 57 matières de MMLU, posées dans quatorze langues autres que l'anglais.
2024-11-20, relevé sous « Multilingual MMLU »
SourceDes questions d'examen universitaire qui mêlent texte, schémas, cartes et partitions.
2024-11-20
SourceDes questions de niveau doctorat en biologie, physique et chimie, écrites par des spécialistes.
2024-11-20
SourceParcourir un graphe dont la description remplit toute la fenêtre de contexte.
2024-11-20, relevé sous « Graphwalks bfs <128k »
SourceRetrouver la bonne réponse quand plusieurs demandes presque identiques ont été noyées dans une très longue conversation.
2024-11-20, relevé sous « OpenAI-MRCR: 2 needle128k »
SourceDes démonstrations de niveau olympiade et des problèmes tirés de la recherche en cours.
Résoudre des problèmes de mathématiques posés sous forme d'image : un graphique, une figure, un schéma.
2024-11-20
SourceL'examen américain d'invitation en mathématiques, édition 2024 : une compétition lycéenne prestigieuse, quinze problèmes en trois heures.
2024-11-20
SourceLe modèle agit à la souris et au clavier sur une machine réelle, comme le ferait une personne.
Raisonner sur les figures d'articles scientifiques publiés sur arXiv.
2024-11-20
SourceDes livrables de métier : dossiers juridiques, flux d'entreprise, enchaînements d'outils, documents de travail.
Obéir à des consignes de forme dont le respect se vérifie par un programme, sans jugement humain.
2024-11-20
SourceÉcrire un texte libre en respectant à la lettre des contraintes de forme.
2024-11-20
SourceTraiter un dossier de service client en suivant les règles de l'entreprise, dans le transport aérien ou le commerce de détail.
2024-11-20, relevé sous « Taubench airline »
SourceTenir une conversation à plusieurs tours en se servant correctement de ce qui a été dit avant.
2024-11-20
SourceCe ne sont pas des exercices notés : des personnes comparent deux réponses à l'aveugle et désignent la meilleure.
Des personnes posent leur propre question, reçoivent deux réponses anonymes et désignent celle qu'elles préfèrent.
Sourcegpt-4o
Le nom exact à écrire dans le code pour appeler ce modèle.
gpt-4o-2024-11-20gpt-4o-2024-08-06gpt-4o-2024-05-13 Les autres noms du même modèle, selon la plateforme qui le revend.
Mettre en mémoire un début de requête réutilisé d’un appel à l’autre : 1,25 fois le prix d’entrée.