Aktory Référentiel IA
Lignée Mythos

Claude Mythos Preview

Déprécié
Anthropic · Gamme Mythos · sorti le 7 avril 2026
Les faits

Ce qu'il coûte, ce qu'il tient

Cycle de vie

D'aujourd'hui à sa fin de service

Sortie 7 avril 2026
Dépréciation Non annoncée
Retrait Non annoncé

Motif du retrait : Remplacé par Claude Mythos 5.

La lignée Mythos

Les autres versions

Toute la lignée
Claude Mythos 509.06.2026 · Actif Claude Mythos Preview07.04.2026 · celui-ci
Benchmarks expliqués

Ce qu'il vaut, avec les conditions

12 tests relevés pour ce modèle, regroupés par ce qu'ils mesurent. Chaque chiffre est annoncé par le laboratoire, avec sa source et ses conditions ; une jauge n'est dessinée que quand l'échelle du test a un maximum connu.

Code et ingénierie logicielle

Le modèle reçoit un dépôt et un problème, et doit produire un correctif qui passe les tests, sans intervention humaine.

1 test

Terminal-Bench 2.0

82 %

Du travail réel en ligne de commande, dans un conteneur, du début à la fin.

Moyenne sur 5 essais.

Source

Connaissances et raisonnement scientifique

Des questions à réponse unique, du niveau lycée au niveau doctorat, où seule la justesse compte.

4 tests

GPQA Diamond

94,55 %

Des questions de niveau doctorat en biologie, physique et chimie, écrites par des spécialistes.

Moyenne sur 5 essais.

Source

MMMLU

92,67 %

Les 57 matières de MMLU, posées dans quatorze langues autres que l'anglais.

Effort maximal, réflexion adaptative, moyenne sur 5 essais.

Source

GraphWalks (contexte long)

80 %

Parcourir un graphe dont la description remplit toute la fenêtre de contexte.

Chiffre annoncé dans la system card, conditions détaillées à la source.

Source

Humanity's Last Exam

56,8 %

Des questions écrites par des spécialistes pour rester hors de portée des modèles.

Sans outils.

Source

Mathématiques

Des démonstrations de niveau olympiade et des problèmes tirés de la recherche en cours.

1 test

USAMO 2026

97,6 %

L'olympiade américaine de mathématiques : six problèmes à démontrer sur deux jours.

Effort maximal, moyenne sur 10 essais.

Source

Pilotage d'un ordinateur

Le modèle agit à la souris et au clavier sur une machine réelle, comme le ferait une personne.

4 tests

CharXiv Reasoning

93,2 %

Raisonner sur les figures d'articles scientifiques publiés sur arXiv.

Effort maximal, réflexion adaptative.

Source

LAB-Bench FigQA

79,7 %

Interpréter les figures d'articles de biologie.

Sans outils, effort maximal, réflexion adaptative.

Source

OSWorld

79,6 %

Accomplir des tâches courantes sur une machine Ubuntu réelle, à la souris et au clavier.

Réussite à la première tentative.

Source

ScreenSpot-Pro

79,5 %

Pointer précisément le bon élément d'interface sur une capture d'écran de logiciel professionnel.

Sans outils, effort maximal, réflexion adaptative.

Source

Travail professionnel réel

Des livrables de métier : dossiers juridiques, flux d'entreprise, enchaînements d'outils, documents de travail.

1 test

BrowseComp

86,9 %

Trouver sur le web une information difficile à dénicher, en naviguant soi-même.

Effort maximal, réflexion adaptative, limite de 3M jetons.

Source

Sûreté et comportement

Non pas ce que le modèle sait faire, mais ce qu'il accepte ou refuse de faire, et comment il se comporte quand on cherche à le détourner.

1 test

Malicious computer use

93,75 %

Le modèle, doté d'outils de pilotage d'un ordinateur en bac à sable, reçoit 112 tâches nuisibles : surveillance et collecte de données sans autorisation, production de contenus dangereux, abus à grande échelle.

Refusal rate.

Source
Pour les développeurs

Intégrer ce modèle

L'appeler

Identifiant d’APIclaude-mythos-preview

Le nom exact à écrire dans le code pour appeler ce modèle.

Ce qu'il accepte