SWE-Bench Pro (Public)
Le même exercice, sur des dépôts encore maintenus et des correctifs qui touchent plusieurs fichiers.
SourceEntreprise américaine fondée en 1998, filiale d'Alphabet depuis 2015. Ses modèles d'intelligence artificielle sont publiés par son laboratoire Google DeepMind, né en 2023 du rapprochement de DeepMind, acquis en 2014, et de l'équipe Google Brain. Le public y accède par l'application Gemini et par l'abonnement Google AI.
Les scores ci-dessous sont ceux de Gemini 3.5 Flash-Lite, sorti le 21 juillet 2026, regroupés par ce qu'ils mesurent : 12 tests relevés, chacun annoncé par le laboratoire avec sa source et ses conditions. Une jauge n'est dessinée que quand l'échelle du test a un maximum connu.
Le modèle reçoit un dépôt et un problème, et doit produire un correctif qui passe les tests, sans intervention humaine.
Le même exercice, sur des dépôts encore maintenus et des correctifs qui touchent plusieurs fichiers.
SourceDu travail réel en ligne de commande, dans un conteneur, du début à la fin.
Terminus-2 harness
SourceMener une compétition d'apprentissage automatique de bout en bout, des données brutes au modèle entraîné.
SourceDes questions à réponse unique, du niveau lycée au niveau doctorat, où seule la justesse compte.
Retrouver la bonne réponse quand huit demandes presque identiques ont été noyées dans un texte très long.
128k (average)
SourceLe modèle agit à la souris et au clavier sur une machine réelle, comme le ferait une personne.
Des livrables de métier : dossiers juridiques, flux d'entreprise, enchaînements d'outils, documents de travail.
220 tâches professionnelles réellement rémunérées, sur 44 métiers et 9 secteurs, rendues sous forme de livrable.
Elo
SourceNon pas ce que le modèle sait faire, mais ce qu'il accepte ou refuse de faire, et comment il se comporte quand on cherche à le détourner.
Vérifier automatiquement que le modèle respecte les règles de contenu sur des échanges écrits.
Écart en points de pourcentage, Gemini 3.5 Flash-Lite vs. Gemini 3.1 Flash-Lite. Plus bas vaut mieux.
SourceLa même vérification, menée dans plusieurs langues.
Écart en points de pourcentage, Gemini 3.5 Flash-Lite vs. Gemini 3.1 Flash-Lite. Plus bas vaut mieux.
SourceLa même vérification, quand la demande part d'une image.
Écart en points de pourcentage, Gemini 3.5 Flash-Lite vs. Gemini 3.1 Flash-Lite. Plus bas vaut mieux.
SourceMesurer le ton d'un refus : dire non sans faire la morale.
Écart en points de pourcentage, Gemini 3.5 Flash-Lite vs. Gemini 3.1 Flash-Lite. Plus haut vaut mieux.
SourceMesurer les refus injustifiés, c'est-à-dire les questions acceptables auxquelles le modèle refuse de répondre.
Écart en points de pourcentage, Gemini 3.5 Flash-Lite vs. Gemini 3.1 Flash-Lite. Plus bas vaut mieux.
Source