Terminal-bench 2.1
Du travail réel en ligne de commande, dans un conteneur, du début à la fin.
Terminus-2 harness
Source
Most intelligent model for sustained frontier performance on agentic and coding tasks.
Ce qu’il peut avoir sous les yeux en une seule fois, question et réponse comprises.
Ce que coûte le texte qu’on lui envoie.
Ce que coûte le texte qu’il produit, toujours plus cher que l’entrée.
La plus longue réponse qu’il peut produire d’un seul tenant.
En avant-première.
18 tests relevés pour ce modèle, regroupés par ce qu'ils mesurent. Chaque chiffre est annoncé par le laboratoire, avec sa source et ses conditions ; une jauge n'est dessinée que quand l'échelle du test a un maximum connu.
Le modèle reçoit un dépôt et un problème, et doit produire un correctif qui passe les tests, sans intervention humaine.
Aucune connaissance préalable ne sert : il faut inférer une règle jamais vue à partir de quelques exemples.
Des questions à réponse unique, du niveau lycée au niveau doctorat, où seule la justesse compte.
Percevoir, interpréter et raisonner sur des questions de niveau licence mêlant texte et images, dans des disciplines variées.
No tools
SourceRetrouver la bonne réponse quand huit demandes presque identiques ont été noyées dans un texte très long.
128k (average)
SourceDes questions écrites par des spécialistes pour rester hors de portée des modèles.
SourceLe modèle agit à la souris et au clavier sur une machine réelle, comme le ferait une personne.
Des livrables de métier : dossiers juridiques, flux d'entreprise, enchaînements d'outils, documents de travail.
Produire des livrables professionnels réels, jugés par comparaison directe avec ceux d'un autre modèle plutôt que notés sur un barème.
Elo
SourceEnchaîner des outils par le protocole MCP : trouver le bon, l'appeler correctement, recomposer la réponse.
SourceAnalyser des données financières et trancher, comme le ferait un analyste.
Source108 tâches d'outillage réel : bureautique, commerce en ligne, analyse de données, recherche web.
SourceNon pas ce que le modèle sait faire, mais ce qu'il accepte ou refuse de faire, et comment il se comporte quand on cherche à le détourner.
Vérifier automatiquement que le modèle respecte les règles de contenu sur des échanges écrits.
Écart en points de pourcentage, Gemini 3.5 Flash vs. Gemini 3 Flash.
SourceLa même vérification, menée dans plusieurs langues.
Écart en points de pourcentage, Gemini 3.5 Flash vs. Gemini 3 Flash.
SourceLa même vérification, quand la demande part d'une image.
Écart en points de pourcentage, Gemini 3.5 Flash vs. Gemini 3 Flash.
SourceMesurer le ton d'un refus : dire non sans faire la morale.
Écart en points de pourcentage, Gemini 3.5 Flash vs. Gemini 3 Flash.
SourceMesurer les refus injustifiés, c'est-à-dire les questions acceptables auxquelles le modèle refuse de répondre.
Écart en points de pourcentage, Gemini 3.5 Flash vs. Gemini 3 Flash. Précision de la source : (non-egregious).
Sourcegemini-3.5-flash
Le nom exact à écrire dans le code pour appeler ce modèle.
Mettre en mémoire un début de requête réutilisé d’un appel à l’autre : 1,25 fois le prix d’entrée.