SWE-Bench Pro (Public)
Le même exercice, sur des dépôts encore maintenus et des correctifs qui touchent plusieurs fichiers.
Source
Our fastest, most cost-effective 3.5 model for high-throughput execution.
Ce qu’il peut avoir sous les yeux en une seule fois, question et réponse comprises.
Ce que coûte le texte qu’on lui envoie.
Ce que coûte le texte qu’il produit, toujours plus cher que l’entrée.
La plus longue réponse qu’il peut produire d’un seul tenant.
En avant-première.
12 tests relevés pour ce modèle, regroupés par ce qu'ils mesurent. Chaque chiffre est annoncé par le laboratoire, avec sa source et ses conditions ; une jauge n'est dessinée que quand l'échelle du test a un maximum connu.
Le modèle reçoit un dépôt et un problème, et doit produire un correctif qui passe les tests, sans intervention humaine.
Le même exercice, sur des dépôts encore maintenus et des correctifs qui touchent plusieurs fichiers.
SourceDu travail réel en ligne de commande, dans un conteneur, du début à la fin.
Terminus-2 harness
SourceMener une compétition d'apprentissage automatique de bout en bout, des données brutes au modèle entraîné.
SourceDes questions à réponse unique, du niveau lycée au niveau doctorat, où seule la justesse compte.
Retrouver la bonne réponse quand huit demandes presque identiques ont été noyées dans un texte très long.
128k (average)
SourceLe modèle agit à la souris et au clavier sur une machine réelle, comme le ferait une personne.
Des livrables de métier : dossiers juridiques, flux d'entreprise, enchaînements d'outils, documents de travail.
220 tâches professionnelles réellement rémunérées, sur 44 métiers et 9 secteurs, rendues sous forme de livrable.
Elo
SourceNon pas ce que le modèle sait faire, mais ce qu'il accepte ou refuse de faire, et comment il se comporte quand on cherche à le détourner.
Vérifier automatiquement que le modèle respecte les règles de contenu sur des échanges écrits.
Écart en points de pourcentage, Gemini 3.5 Flash-Lite vs. Gemini 3.1 Flash-Lite. Plus bas vaut mieux.
SourceLa même vérification, menée dans plusieurs langues.
Écart en points de pourcentage, Gemini 3.5 Flash-Lite vs. Gemini 3.1 Flash-Lite. Plus bas vaut mieux.
SourceLa même vérification, quand la demande part d'une image.
Écart en points de pourcentage, Gemini 3.5 Flash-Lite vs. Gemini 3.1 Flash-Lite. Plus bas vaut mieux.
SourceMesurer le ton d'un refus : dire non sans faire la morale.
Écart en points de pourcentage, Gemini 3.5 Flash-Lite vs. Gemini 3.1 Flash-Lite. Plus haut vaut mieux.
SourceMesurer les refus injustifiés, c'est-à-dire les questions acceptables auxquelles le modèle refuse de répondre.
Écart en points de pourcentage, Gemini 3.5 Flash-Lite vs. Gemini 3.1 Flash-Lite. Plus bas vaut mieux.
Sourcegemini-3.5-flash-lite
Le nom exact à écrire dans le code pour appeler ce modèle.
Mettre en mémoire un début de requête réutilisé d’un appel à l’autre : 1,25 fois le prix d’entrée.