Aktory Référentiel IA
Lignée Opus

Claude Opus 4.5

Actif
Anthropic · Gamme Opus · sorti le 24 novembre 2025
Les faits

Ce qu'il coûte, ce qu'il tient

Fenêtre de contexte 200K jetons

Ce qu’il peut avoir sous les yeux en une seule fois, question et réponse comprises.

Prix d’entrée 5 $ / M jetons

Ce que coûte le texte qu’on lui envoie.

Prix de sortie 25 $ / M jetons

Ce que coûte le texte qu’il produit, toujours plus cher que l’entrée.

Sortie maximale 64K jetons

La plus longue réponse qu’il peut produire d’un seul tenant.

Connaissances arrêtées à mai 2025

Il ne sait rien de ce qui s’est passé après cette date, sauf si on le lui fournit.

Cycle de vie

D'aujourd'hui à sa fin de service

Sortie 24 novembre 2025
Dépréciation Non annoncée
Retrait Maintenu au moins jusqu'au 24 novembre 2026
Capacités

Ce qu'il sait faire

Raisonnement adaptatif
Réflexion étendue
Vision
La lignée Opus

Les autres versions

Toute la lignée
Benchmarks expliqués

Ce qu'il vaut, avec les conditions

14 tests relevés pour ce modèle, regroupés par ce qu'ils mesurent. Chaque chiffre est annoncé par le laboratoire, avec sa source et ses conditions ; une jauge n'est dessinée que quand l'échelle du test a un maximum connu.

Raisonnement sur des situations inconnues

Aucune connaissance préalable ne sert : il faut inférer une règle jamais vue à partir de quelques exemples.

2 tests

ARC-AGI-1

80 %

Deviner la règle cachée derrière trois exemples de grilles, puis l'appliquer à une grille nouvelle.

Chiffre annoncé dans la system card, conditions détaillées à la source.

Source

ARC-AGI

37,6 %

Inférer une règle jamais vue à partir de quelques grilles d'exemples.

Chiffre annoncé dans la system card, conditions détaillées à la source.

Source

Connaissances et raisonnement scientifique

Des questions à réponse unique, du niveau lycée au niveau doctorat, où seule la justesse compte.

3 tests

MMMLU

90,77 %

Les 57 matières de MMLU, posées dans quatorze langues autres que l'anglais.

Chiffre annoncé dans la system card, conditions détaillées à la source.

Source

GPQA Diamond

86,95 %

Des questions de niveau doctorat en biologie, physique et chimie, écrites par des spécialistes.

Moyenne sur 5 essais.

Source

MMMU

80,72 %

Des questions d'examen universitaire qui mêlent texte, schémas, cartes et partitions.

Chiffre annoncé dans la system card, conditions détaillées à la source.

Source

Mathématiques

Des démonstrations de niveau olympiade et des problèmes tirés de la recherche en cours.

1 test

AIME 2025

92,77 %

L'examen américain d'invitation en mathématiques, une compétition lycéenne prestigieuse.

Sans outils.

Source

Pilotage d'un ordinateur

Le modèle agit à la souris et au clavier sur une machine réelle, comme le ferait une personne.

2 tests

OSWorld

66,26 %

Accomplir des tâches courantes sur une machine Ubuntu réelle, à la souris et au clavier.

Chiffre annoncé dans la system card, conditions détaillées à la source.

Source

LAB-Bench FigQA

54,9 %

Interpréter les figures d'articles de biologie.

Sans outils, réflexion étendue.

Source

Travail professionnel réel

Des livrables de métier : dossiers juridiques, flux d'entreprise, enchaînements d'outils, documents de travail.

3 tests

SpreadsheetBench

64,25 %

Naviguer dans des tableurs complexes et les modifier, sur 912 problèmes tirés de fichiers réels.

Réflexion étendue.

Source

MCP Atlas

62,3 %

Enchaîner des outils par le protocole MCP : trouver le bon, l'appeler correctement, recomposer la réponse.

Chiffre annoncé dans la system card, conditions détaillées à la source.

Source

Finance Agent

55,2 %

Des recherches financières sur les documents déposés par les sociétés cotées.

Moyenne sur 8 essais.

Source

Sûreté et comportement

Non pas ce que le modèle sait faire, mais ce qu'il accepte ou refuse de faire, et comment il se comporte quand on cherche à le détourner.

3 tests

Agentic coding

100 %

Le modèle reçoit 150 demandes de code interdites par les conditions d'usage, avec les mêmes outils que pour les tests de capacité. On regarde s'il accepte.

Refusal rate.

Source

Malicious computer use

88,39 %

Le modèle, doté d'outils de pilotage d'un ordinateur en bac à sable, reçoit 112 tâches nuisibles : surveillance et collecte de données sans autorisation, production de contenus dangereux, abus à grande échelle.

Refusal rate.

Source

SHADE-Arena

7,7 %

Le modèle reçoit une tâche longue et légitime, doublée d'une tâche nuisible qu'il doit accomplir sans éveiller les soupçons d'un surveillant qui voit toutes ses actions et tout son raisonnement.

Chiffre annoncé dans la system card, conditions détaillées à la source.

Source
Pour les développeurs

Intégrer ce modèle

L'appeler

Identifiant d’APIclaude-opus-4-5-20251101

Le nom exact à écrire dans le code pour appeler ce modèle.

Alias anthropic.claude-opus-4-5-20251101-v1:0 (Amazon Bedrock)claude-opus-4-5@20251101 (Google Cloud)

Les autres noms du même modèle, selon la plateforme qui le revend.

Disponible sur API ClaudeAmazon BedrockGoogle Cloud Vertex AIMicrosoft Foundry

Ce qu'il accepte

Entrées acceptées texteimage
Sorties produites texte
Langues

Multilingue, d’après la documentation officielle.

Latence

Moyenne · Sa vitesse comparée aux autres modèles du même laboratoire, pas une mesure absolue.

Facturation détaillée par million de jetons

Écriture en cache6,25 $ Écriture en cache, 1 heure10 $ Lecture depuis le cache0,5 $ Traitement par lots, entrée2,5 $ Traitement par lots, sortie12,5 $

Mettre en mémoire un début de requête réutilisé d’un appel à l’autre : 1,25 fois le prix d’entrée.