Terminal-Bench 2.1
Du travail réel en ligne de commande, dans un conteneur, du début à la fin.
Terminal-Bench 2.1.
Source
Ce qu’il peut avoir sous les yeux en une seule fois, question et réponse comprises.
Ce que coûte le texte qu’on lui envoie.
Ce que coûte le texte qu’il produit, toujours plus cher que l’entrée.
La plus longue réponse qu’il peut produire d’un seul tenant.
Il ne sait rien de ce qui s’est passé après cette date, sauf si on le lui fournit.
Toujours actif.
6 tests relevés pour ce modèle, regroupés par ce qu'ils mesurent. Chaque chiffre est annoncé par le laboratoire, avec sa source et ses conditions ; une jauge n'est dessinée que quand l'échelle du test a un maximum connu.
Le modèle reçoit un dépôt et un problème, et doit produire un correctif qui passe les tests, sans intervention humaine.
Du travail réel en ligne de commande, dans un conteneur, du début à la fin.
Terminal-Bench 2.1.
SourceLe même exercice, sur des dépôts encore maintenus et des correctifs qui touchent plusieurs fichiers.
Chiffre annoncé dans la system card, conditions détaillées à la source.
SourceDes tâches de programmation à la frontière de ce que les modèles savent faire, tirées de travaux réels.
Chiffre annoncé dans la system card, conditions détaillées à la source.
SourceAucune connaissance préalable ne sert : il faut inférer une règle jamais vue à partir de quelques exemples.
Reconstituer le plan d'un appartement à partir d'une vingtaine de photos d'intérieur, pour 50 appartements traités l'un après l'autre.
Blueprint-Bench 2.
SourceDes livrables de métier : dossiers juridiques, flux d'entreprise, enchaînements d'outils, documents de travail.
Produire des livrables professionnels réels, jugés par comparaison directe avec ceux d'un autre modèle plutôt que notés sur un barème.
Contre Claude Opus 4.8, GDPval-AA.
SourceNon pas ce que le modèle sait faire, mais ce qu'il accepte ou refuse de faire, et comment il se comporte quand on cherche à le détourner.
Répondre à des demandes contraires à la politique d'usage, posées en un seul tour de conversation, dans toutes les langues testées.
Via l'API, sans invite système.
SourceFable 5 isn't included in your plan's usage limits. You can use Fable 5 with usage credits, which let you pay for usage beyond what your plan includes.
Fable 5 is included as a standard part of your plan. You can use up to 50% of your weekly usage limits on Fable 5 at no extra cost.
Fable 5 is included as a standard part of your plan. You can use up to 50% of your weekly usage limits on Fable 5 at no extra cost.
Sur les sièges premium, « Fable 5 is included as a standard part of your plan », jusqu'à 50 % des limites hebdomadaires. Sur les sièges standard, « Fable 5 isn't included in your plan's usa…
Usage-based Enterprise plans: Access to Fable 5 is billed at standard API rates.
Usage-based Enterprise plans: Access to Fable 5 is billed at standard API rates.
claude-fable-5
Le nom exact à écrire dans le code pour appeler ce modèle.
anthropic.claude-fable-5 (Amazon Bedrock)claude-fable-5 (Google Cloud) Les autres noms du même modèle, selon la plateforme qui le revend.
Multilingue, d’après la documentation officielle.
Plus lente · Sa vitesse comparée aux autres modèles du même laboratoire, pas une mesure absolue.
Mettre en mémoire un début de requête réutilisé d’un appel à l’autre : 1,25 fois le prix d’entrée.