Aktory Référentiel IA
Lignée Flash

Gemini 3.5 Flash

Actif
Google · Gamme Flash · sorti le 19 mai 2026

Most intelligent model for sustained frontier performance on agentic and coding tasks.

Les faits

Ce qu'il coûte, ce qu'il tient

Fenêtre de contexte 1M jetons

Ce qu’il peut avoir sous les yeux en une seule fois, question et réponse comprises.

Prix d’entrée 1,5 $ / M jetons

Ce que coûte le texte qu’on lui envoie.

Prix de sortie 9 $ / M jetons

Ce que coûte le texte qu’il produit, toujours plus cher que l’entrée.

Sortie maximale 66K jetons

La plus longue réponse qu’il peut produire d’un seul tenant.

Cycle de vie

D'aujourd'hui à sa fin de service

Sortie 19 mai 2026
Dépréciation Non annoncée
Retrait Non annoncé
Capacités

Ce qu'il sait faire

Génération de parole
Mise en cache du contexte
Exécution de code
Usage de l'ordinateur

En avant-première.

Recherche dans les fichiers fournis
Appel de fonctions
Ancrage dans Google Maps
Génération d'images
API Live, dialogue en temps réel
Ancrage dans la recherche Google
Sorties structurées
Réflexion avant réponse
Lecture d'une adresse web fournie
Traitement par lots
Inférence souple
Inférence prioritaire
La lignée Flash

Les autres versions

Toute la lignée
Benchmarks expliqués

Ce qu'il vaut, avec les conditions

18 tests relevés pour ce modèle, regroupés par ce qu'ils mesurent. Chaque chiffre est annoncé par le laboratoire, avec sa source et ses conditions ; une jauge n'est dessinée que quand l'échelle du test a un maximum connu.

Code et ingénierie logicielle

Le modèle reçoit un dépôt et un problème, et doit produire un correctif qui passe les tests, sans intervention humaine.

2 tests

Terminal-bench 2.1

76,2 %

Du travail réel en ligne de commande, dans un conteneur, du début à la fin.

Terminus-2 harness

Source

SWE-Bench Pro (Public)

55,1 %

Le même exercice, sur des dépôts encore maintenus et des correctifs qui touchent plusieurs fichiers.

Single attempt

Source

Raisonnement sur des situations inconnues

Aucune connaissance préalable ne sert : il faut inférer une règle jamais vue à partir de quelques exemples.

2 tests

ARC-AGI-2

72,1 %

Le même principe, avec des règles nettement plus difficiles à inférer.

Source

Blueprint-Bench 2

33,6 %

Reconstituer le plan d'un appartement à partir d'une vingtaine de photos d'intérieur, pour 50 appartements traités l'un après l'autre.

Normalized score

Source

Connaissances et raisonnement scientifique

Des questions à réponse unique, du niveau lycée au niveau doctorat, où seule la justesse compte.

3 tests

MMMU-Pro

83,6 %

Percevoir, interpréter et raisonner sur des questions de niveau licence mêlant texte et images, dans des disciplines variées.

No tools

Source

MRCR v2 (8-needle)

77,3 %

Retrouver la bonne réponse quand huit demandes presque identiques ont été noyées dans un texte très long.

128k (average)

Source

Humanity’s Last Exam

40,2 %

Des questions écrites par des spécialistes pour rester hors de portée des modèles.

Source

Pilotage d'un ordinateur

Le modèle agit à la souris et au clavier sur une machine réelle, comme le ferait une personne.

2 tests

CharXiv Reasoning

84,2 %

Raisonner sur les figures d'articles scientifiques publiés sur arXiv.

No tools

Source

OSWorld-Verified

78,4 %

Accomplir des tâches courantes sur une machine Ubuntu réelle, à la souris et au clavier.

Source

Travail professionnel réel

Des livrables de métier : dossiers juridiques, flux d'entreprise, enchaînements d'outils, documents de travail.

4 tests

GDPval-AA

1 656

Produire des livrables professionnels réels, jugés par comparaison directe avec ceux d'un autre modèle plutôt que notés sur un barème.

Elo

Source

MCP Atlas

83,6 %

Enchaîner des outils par le protocole MCP : trouver le bon, l'appeler correctement, recomposer la réponse.

Source

Finance Agent v2

57,9 %

Analyser des données financières et trancher, comme le ferait un analyste.

Source

Toolathlon

56,5 %

108 tâches d'outillage réel : bureautique, commerce en ligne, analyse de données, recherche web.

Source

Sûreté et comportement

Non pas ce que le modèle sait faire, mais ce qu'il accepte ou refuse de faire, et comment il se comporte quand on cherche à le détourner.

5 tests

Text to Text Safety

-3,9 point de pourcentage

Vérifier automatiquement que le modèle respecte les règles de contenu sur des échanges écrits.

Écart en points de pourcentage, Gemini 3.5 Flash vs. Gemini 3 Flash.

Source

Multilingual Safety

-2,6 point de pourcentage

La même vérification, menée dans plusieurs langues.

Écart en points de pourcentage, Gemini 3.5 Flash vs. Gemini 3 Flash.

Source

Image to Text Safety

0 point de pourcentage

La même vérification, quand la demande part d'une image.

Écart en points de pourcentage, Gemini 3.5 Flash vs. Gemini 3 Flash.

Source

Tone 1

8,9 point de pourcentage

Mesurer le ton d'un refus : dire non sans faire la morale.

Écart en points de pourcentage, Gemini 3.5 Flash vs. Gemini 3 Flash.

Source

Unjustified-refusals

0,8 point de pourcentage

Mesurer les refus injustifiés, c'est-à-dire les questions acceptables auxquelles le modèle refuse de répondre.

Écart en points de pourcentage, Gemini 3.5 Flash vs. Gemini 3 Flash. Précision de la source : (non-egregious).

Source
Pour les développeurs

Intégrer ce modèle

L'appeler

Identifiant d’APIgemini-3.5-flash

Le nom exact à écrire dans le code pour appeler ce modèle.

Ce qu'il accepte

Entrées acceptées pdftexteimagevidéoaudio
Sorties produites texte

Facturation détaillée par million de jetons

Mettre en mémoire un début de requête réutilisé d’un appel à l’autre : 1,25 fois le prix d’entrée.