Aktory Référentiel IA
Lignée Mythos

Claude Mythos 5

Actif
Anthropic · Gamme Mythos · sorti le 9 juin 2026
Les faits

Ce qu'il coûte, ce qu'il tient

Fenêtre de contexte 1M jetons

Ce qu’il peut avoir sous les yeux en une seule fois, question et réponse comprises.

Prix d’entrée 10 $ / M jetons

Ce que coûte le texte qu’on lui envoie.

Prix de sortie 50 $ / M jetons

Ce que coûte le texte qu’il produit, toujours plus cher que l’entrée.

Cycle de vie

D'aujourd'hui à sa fin de service

Sortie 9 juin 2026
Dépréciation Non annoncée
Retrait Non annoncé
La lignée Mythos

Les autres versions

Toute la lignée
Claude Mythos 509.06.2026 · celui-ci Claude Mythos Preview07.04.2026 · Déprécié
Benchmarks expliqués

Ce qu'il vaut, avec les conditions

24 tests relevés pour ce modèle, regroupés par ce qu'ils mesurent. Chaque chiffre est annoncé par le laboratoire, avec sa source et ses conditions ; une jauge n'est dessinée que quand l'échelle du test a un maximum connu.

Code et ingénierie logicielle

Le modèle reçoit un dépôt et un problème, et doit produire un correctif qui passe les tests, sans intervention humaine.

2 tests

Terminal-Bench 2.1

88 %

Du travail réel en ligne de commande, dans un conteneur, du début à la fin.

Terminal-Bench 2.1, moyenne sur 5 tentatives, moyenne sur 5 essais.

Source

SWE-bench Pro

80,3 %

Le même exercice, sur des dépôts encore maintenus et des correctifs qui touchent plusieurs fichiers.

Chiffre annoncé dans la system card, conditions détaillées à la source.

Source

Connaissances et raisonnement scientifique

Des questions à réponse unique, du niveau lycée au niveau doctorat, où seule la justesse compte.

5 tests

GPQA Diamond

94,1 %

Des questions de niveau doctorat en biologie, physique et chimie, écrites par des spécialistes.

Moyenne sur 5 essais.

Source

GMMLU

93,2 %

Une version mondiale de MMLU, revue pour ne pas privilégier la culture anglo-saxonne.

Chiffre annoncé dans la system card, conditions détaillées à la source.

Source

MILU

92,9 %

Des questions de connaissance dans les langues de l'Inde.

Chiffre annoncé dans la system card, conditions détaillées à la source.

Source

GraphWalks (contexte long)

91,1 %

Parcourir un graphe dont la description remplit toute la fenêtre de contexte.

BFS, sous-ensemble 256K.

Source

INCLUDE

90,5 %

Des examens réels, dans la langue et le cadre du pays où ils sont passés.

Chiffre annoncé dans la system card, conditions détaillées à la source.

Source

Mathématiques

Des démonstrations de niveau olympiade et des problèmes tirés de la recherche en cours.

1 test

USAMO 2026

99,8 %

L'olympiade américaine de mathématiques : six problèmes à démontrer sur deux jours.

Effort de raisonnement moyen, élevé ou très élevé.

Source

Pilotage d'un ordinateur

Le modèle agit à la souris et au clavier sur une machine réelle, comme le ferait une personne.

4 tests

LAB-Bench FigQA

88,9 %

Interpréter les figures d'articles de biologie.

Sans outils.

Source

ScreenSpot-Pro

87,3 %

Pointer précisément le bon élément d'interface sur une capture d'écran de logiciel professionnel.

Sans outils.

Source

ChartMuseum

85,9 %

Mille cent soixante-deux questions expertes sur des graphiques tirés de 184 sources réelles.

Sans outils.

Source

OSWorld

85 %

Accomplir des tâches courantes sur une machine Ubuntu réelle, à la souris et au clavier.

Taux de réussite au premier essai, moyenne, réussite à la première tentative.

Source

Travail professionnel réel

Des livrables de métier : dossiers juridiques, flux d'entreprise, enchaînements d'outils, documents de travail.

5 tests

BrowseComp

88 %

Trouver sur le web une information difficile à dénicher, en naviguant soi-même.

Effort maximal, réflexion adaptative, limite de 10M jetons.

Source

DRACO

86,4 %

Des questions de recherche complexes, jugées sur l'exactitude, la complétude et l'objectivité.

Chiffre annoncé dans la system card, conditions détaillées à la source.

Source

OfficeQA

79 %

Répondre à des questions en s'appuyant sur un grand corpus de documents d'entreprise.

Chiffre annoncé dans la system card, conditions détaillées à la source.

Source

GDP.pdf

72,7 %

Cent PDF professionnels réels, de la finance au droit en passant par la santé et l'ingénierie.

Sans outils.

Source

Toolathlon Verified

58,3 %

108 tâches d'outillage réel : bureautique, commerce en ligne, analyse de données, recherche web.

Chiffre annoncé dans la system card, conditions détaillées à la source.

Source

Sciences de la vie

Des tâches de laboratoire et de biologie, évaluées avec des chercheurs du domaine.

1 test

BioMysteryBench

46,1 %

Résoudre des énigmes de biologie computationnelle à partir de données expérimentales.

BioMysteryBench, sous-ensemble Human Difficult.

Source

Cybersécurité offensive

Trouver et exploiter de vraies failles logicielles, ou mener une opération d'attaque complète. Un score élevé mesure une capacité, pas une qualité : c'est précisément ce que les laboratoires surveillent.

2 tests

Firefox 147

88,4 %

Développer des exploits pour des failles réelles de Firefox 147, corrigées depuis dans la version 148. Le modèle reçoit 50 catégories de plantage et les plantages correspondants.

Sans garde-fous, 221 essais réussis sur 250.

Source

OSS-Fuzz

80 %

Découvrir seul des failles dans des logiciels libres, puis les exploiter, sans indication de départ.

Chiffre annoncé dans la system card, conditions détaillées à la source.

Source

Sûreté et comportement

Non pas ce que le modèle sait faire, mais ce qu'il accepte ou refuse de faire, et comment il se comporte quand on cherche à le détourner.

4 tests

Malicious use of Claude Code

99,64 %

Trois séries de demandes adressées à l'agent de codage : une clairement interdite par la politique d'usage, deux à la frontière, pour vérifier que le modèle ne refuse pas non plus ce qui est légitime.

Chiffre annoncé dans la system card, conditions détaillées à la source.

Source

Malicious computer use

85,71 %

Le modèle, doté d'outils de pilotage d'un ordinateur en bac à sable, reçoit 112 tâches nuisibles : surveillance et collecte de données sans autorisation, production de contenus dangereux, abus à grande échelle.

Refusal rate.

Source

Refusal rate

85,71 %

Répondre à des demandes parfaitement anodines, pour vérifier que le modèle ne refuse pas à tort.

Chiffre annoncé dans la system card, conditions détaillées à la source.

Source

Attempt-level ASR

0 %

Résister à des instructions malveillantes glissées dans les données que le modèle manipule pendant qu'il code. L'attaquant fait 200 tentatives par scénario.

Chiffre annoncé dans la system card, conditions détaillées à la source.

Source
Pour les développeurs

Intégrer ce modèle

L'appeler

Identifiant d’APIclaude-mythos-5

Le nom exact à écrire dans le code pour appeler ce modèle.

Ce qu'il accepte

Facturation détaillée par million de jetons

Écriture en cache12,5 $ Écriture en cache, 1 heure20 $ Lecture depuis le cache1 $ Traitement par lots, entrée5 $ Traitement par lots, sortie25 $

Mettre en mémoire un début de requête réutilisé d’un appel à l’autre : 1,25 fois le prix d’entrée.