Aktory Référentiel IA
Lignée Sonnet

Claude Sonnet 5

Actif
Anthropic · Gamme Sonnet · sorti le 30 juin 2026
Les faits

Ce qu'il coûte, ce qu'il tient

Fenêtre de contexte 1M jetons

Ce qu’il peut avoir sous les yeux en une seule fois, question et réponse comprises.

Prix d’entrée 3 $ / M jetons

Ce que coûte le texte qu’on lui envoie.

Prix de sortie 15 $ / M jetons

Ce que coûte le texte qu’il produit, toujours plus cher que l’entrée.

Sortie maximale 128K jetons

La plus longue réponse qu’il peut produire d’un seul tenant.

Connaissances arrêtées à janvier 2026

Il ne sait rien de ce qui s’est passé après cette date, sauf si on le lui fournit.

Cycle de vie

D'aujourd'hui à sa fin de service

Sortie 30 juin 2026
Dépréciation Non annoncée
Retrait Maintenu au moins jusqu'au 30 juin 2027
Capacités

Ce qu'il sait faire

Raisonnement adaptatif
Réflexion étendue
Vision
La lignée Sonnet

Les autres versions

Toute la lignée
Benchmarks expliqués

Ce qu'il vaut, avec les conditions

12 tests relevés pour ce modèle, regroupés par ce qu'ils mesurent. Chaque chiffre est annoncé par le laboratoire, avec sa source et ses conditions ; une jauge n'est dessinée que quand l'échelle du test a un maximum connu.

Code et ingénierie logicielle

Le modèle reçoit un dépôt et un problème, et doit produire un correctif qui passe les tests, sans intervention humaine.

2 tests

Terminal-Bench 2.1

80,4 %

Du travail réel en ligne de commande, dans un conteneur, du début à la fin.

Récompense moyenne, moyenne sur 5 essais, effort xhigh.

Source

SWE-bench Pro

63,2 %

Le même exercice, sur des dépôts encore maintenus et des correctifs qui touchent plusieurs fichiers.

Chiffre annoncé dans la system card, conditions détaillées à la source.

Source

Mathématiques

Des démonstrations de niveau olympiade et des problèmes tirés de la recherche en cours.

1 test

USAMO 2026

79,5 %

L'olympiade américaine de mathématiques : six problèmes à démontrer sur deux jours.

Chiffre annoncé dans la system card, conditions détaillées à la source.

Source

Pilotage d'un ordinateur

Le modèle agit à la souris et au clavier sur une machine réelle, comme le ferait une personne.

3 tests

OSWorld-Verified

81,2 %

Accomplir des tâches courantes sur une machine Ubuntu réelle, à la souris et au clavier.

Réussite au premier essai, moyenne sur 5 essais.

Source

OSWorld

81,2 %

Accomplir des tâches courantes sur une machine Ubuntu réelle, à la souris et au clavier.

Effort maximal, réussite à la première tentative.

Source

ChartMuseum

70,1 %

Mille cent soixante-deux questions expertes sur des graphiques tirés de 184 sources réelles.

Sans outils.

Source

Travail professionnel réel

Des livrables de métier : dossiers juridiques, flux d'entreprise, enchaînements d'outils, documents de travail.

4 tests

BrowseComp

84,7 %

Trouver sur le web une information difficile à dénicher, en naviguant soi-même.

Effort maximal, réflexion adaptative, limite de 10M jetons.

Source

OfficeQA

73,3 %

Répondre à des questions en s'appuyant sur un grand corpus de documents d'entreprise.

Chiffre annoncé dans la system card, conditions détaillées à la source.

Source

GDP.pdf

67,5 %

Cent PDF professionnels réels, de la finance au droit en passant par la santé et l'ingénierie.

Sans outils.

Source

Toolathlon

54,3 %

108 tâches d'outillage réel : bureautique, commerce en ligne, analyse de données, recherche web.

Réussite au premier essai, moyenne sur 3 essais.

Source

Sûreté et comportement

Non pas ce que le modèle sait faire, mais ce qu'il accepte ou refuse de faire, et comment il se comporte quand on cherche à le détourner.

2 tests

Malicious computer use

84,68 %

Le modèle, doté d'outils de pilotage d'un ordinateur en bac à sable, reçoit 112 tâches nuisibles : surveillance et collecte de données sans autorisation, production de contenus dangereux, abus à grande échelle.

Refusal rate.

Source

Attempt-level ASR

0,09 %

Résister à des instructions malveillantes glissées dans les données que le modèle manipule pendant qu'il code. L'attaquant fait 200 tentatives par scénario.

Avec garde-fous.

Source
Pour les développeurs

Intégrer ce modèle

L'appeler

Identifiant d’APIclaude-sonnet-5

Le nom exact à écrire dans le code pour appeler ce modèle.

Alias anthropic.claude-sonnet-5 (Amazon Bedrock)claude-sonnet-5 (Google Cloud)

Les autres noms du même modèle, selon la plateforme qui le revend.

Disponible sur API ClaudeAmazon BedrockGoogle Cloud Vertex AIMicrosoft Foundry

Ce qu'il accepte

Entrées acceptées texteimage
Sorties produites texte
Langues

Multilingue, d’après la documentation officielle.

Latence

Rapide · Sa vitesse comparée aux autres modèles du même laboratoire, pas une mesure absolue.