Aktory Référentiel IA
Lignée Sonnet

Claude Sonnet 4.6

Actif
Anthropic · Gamme Sonnet · sorti le 17 février 2026
Les faits

Ce qu'il coûte, ce qu'il tient

Fenêtre de contexte 1M jetons

Ce qu’il peut avoir sous les yeux en une seule fois, question et réponse comprises.

Prix d’entrée 3 $ / M jetons

Ce que coûte le texte qu’on lui envoie.

Prix de sortie 15 $ / M jetons

Ce que coûte le texte qu’il produit, toujours plus cher que l’entrée.

Sortie maximale 128K jetons

La plus longue réponse qu’il peut produire d’un seul tenant.

Connaissances arrêtées à août 2025

Il ne sait rien de ce qui s’est passé après cette date, sauf si on le lui fournit.

Cycle de vie

D'aujourd'hui à sa fin de service

Sortie 17 février 2026
Dépréciation Non annoncée
Retrait Maintenu au moins jusqu'au 17 février 2027
Capacités

Ce qu'il sait faire

Raisonnement adaptatif
Réflexion étendue

Dépréciée, remplacée par le raisonnement adaptatif.

Vision
La lignée Sonnet

Les autres versions

Toute la lignée
Benchmarks expliqués

Ce qu'il vaut, avec les conditions

15 tests relevés pour ce modèle, regroupés par ce qu'ils mesurent. Chaque chiffre est annoncé par le laboratoire, avec sa source et ses conditions ; une jauge n'est dessinée que quand l'échelle du test a un maximum connu.

Code et ingénierie logicielle

Le modèle reçoit un dépôt et un problème, et doit produire un correctif qui passe les tests, sans intervention humaine.

3 tests

SWE-bench Verified

79,6 %

Corriger de vrais tickets ouverts sur GitHub, dans le dépôt d'origine, sans aide.

Chiffre annoncé dans la system card, conditions détaillées à la source.

Source

Terminal-Bench 2.0

59,1 %

Du travail réel en ligne de commande, dans un conteneur, du début à la fin.

Effort maximal, sans réflexion.

Source

OpenRCA

27,9 %

Trouver la cause première d'une panne logicielle dans 335 incidents réels tirés de trois systèmes d'entreprise (télécoms, banque, place de marché), à partir de 68,5 Go de journaux, de métriques et de traces.

Effort élevé, réflexion adaptative.

Source

Raisonnement sur des situations inconnues

Aucune connaissance préalable ne sert : il faut inférer une règle jamais vue à partir de quelques exemples.

1 test

ARC-AGI-1

86,5 %

Deviner la règle cachée derrière trois exemples de grilles, puis l'appliquer à une grille nouvelle.

Chiffre annoncé dans la system card, conditions détaillées à la source.

Source

Connaissances et raisonnement scientifique

Des questions à réponse unique, du niveau lycée au niveau doctorat, où seule la justesse compte.

2 tests

MMMLU

89,3 %

Les 57 matières de MMLU, posées dans quatorze langues autres que l'anglais.

Effort maximal, réflexion adaptative, moyenne sur 10 essais.

Source

MMMU-Pro

74,5 %

Percevoir, interpréter et raisonner sur des questions de niveau licence mêlant texte et images, dans des disciplines variées.

Sans outils, effort maximal, réflexion adaptative.

Source

Mathématiques

Des démonstrations de niveau olympiade et des problèmes tirés de la recherche en cours.

1 test

AIME 2025

95,6 %

L'examen américain d'invitation en mathématiques, une compétition lycéenne prestigieuse.

Sans outils.

Source

Pilotage d'un ordinateur

Le modèle agit à la souris et au clavier sur une machine réelle, comme le ferait une personne.

2 tests

OSWorld-Verified

72,5 %

Accomplir des tâches courantes sur une machine Ubuntu réelle, à la souris et au clavier.

Réussite à la première tentative.

Source

LAB-Bench FigQA

58,8 %

Interpréter les figures d'articles de biologie.

Sans outils, effort maximal, réflexion adaptative.

Source

Travail professionnel réel

Des livrables de métier : dossiers juridiques, flux d'entreprise, enchaînements d'outils, documents de travail.

2 tests

Multi-agent BrowseComp

82,62 %

Le même test de recherche sur le web que BrowseComp, mais conduit par un agent chef d'orchestre qui délègue à des sous-agents au lieu de chercher lui-même.

Chiffre annoncé dans la system card, conditions détaillées à la source.

Source

Finance Agent

63,3 %

Des recherches financières sur les documents déposés par les sociétés cotées.

Réflexion maximale.

Source

Cybersécurité offensive

Trouver et exploiter de vraies failles logicielles, ou mener une opération d'attaque complète. Un score élevé mesure une capacité, pas une qualité : c'est précisément ce que les laboratoires surveillent.

1 test

Cybench

100 %

Résoudre 40 épreuves de capture de drapeau tirées de quatre compétitions de sécurité informatique.

Réussite en 30 tentatives au plus.

Source

Sûreté et comportement

Non pas ce que le modèle sait faire, mais ce qu'il accepte ou refuse de faire, et comment il se comporte quand on cherche à le détourner.

3 tests

Agentic coding

100 %

Le modèle reçoit 150 demandes de code interdites par les conditions d'usage, avec les mêmes outils que pour les tests de capacité. On regarde s'il accepte.

Refusal rate.

Source

Malicious computer use

99,38 %

Le modèle, doté d'outils de pilotage d'un ordinateur en bac à sable, reçoit 112 tâches nuisibles : surveillance et collecte de données sans autorisation, production de contenus dangereux, abus à grande échelle.

Refusal rate.

Source

Bias Benchmark for Question Answering

97,5 %

Répondre à des questions dont certaines manquent volontairement du contexte nécessaire. La bonne réponse est alors « on ne peut pas savoir ».

Chiffre annoncé dans la system card, conditions détaillées à la source.

Source
Pour les développeurs

Intégrer ce modèle

L'appeler

Identifiant d’APIclaude-sonnet-4-6

Le nom exact à écrire dans le code pour appeler ce modèle.

Alias anthropic.claude-sonnet-4-6 (Amazon Bedrock)claude-sonnet-4-6 (Google Cloud)

Les autres noms du même modèle, selon la plateforme qui le revend.

Disponible sur API ClaudeAmazon BedrockGoogle Cloud Vertex AIMicrosoft Foundry

Ce qu'il accepte

Entrées acceptées texteimage
Sorties produites texte
Langues

Multilingue, d’après la documentation officielle.

Latence

Rapide · Sa vitesse comparée aux autres modèles du même laboratoire, pas une mesure absolue.

Facturation détaillée par million de jetons

Écriture en cache3,75 $ Écriture en cache, 1 heure6 $ Lecture depuis le cache0,3 $ Traitement par lots, entrée1,5 $ Traitement par lots, sortie7,5 $

Mettre en mémoire un début de requête réutilisé d’un appel à l’autre : 1,25 fois le prix d’entrée.