Aktory Référentiel IA
Toutes les entreprises

Google

Vérifiée
Est. 1998 · Mountain View · MAJ 03.08.2026
Site officiel

Entreprise américaine fondée en 1998, filiale d'Alphabet depuis 2015. Ses modèles d'intelligence artificielle sont publiés par son laboratoire Google DeepMind, né en 2023 du rapprochement de DeepMind, acquis en 2014, et de l'équipe Google Brain. Le public y accède par l'application Gemini et par l'abonnement Google AI.

Benchmarks expliqués

Ce que valent les modèles, avec les conditions

Les scores ci-dessous sont ceux de Gemini 3.5 Flash-Lite, sorti le 21 juillet 2026, regroupés par ce qu'ils mesurent : 12 tests relevés, chacun annoncé par le laboratoire avec sa source et ses conditions. Une jauge n'est dessinée que quand l'échelle du test a un maximum connu.

Code et ingénierie logicielle

Le modèle reçoit un dépôt et un problème, et doit produire un correctif qui passe les tests, sans intervention humaine.

3 tests

SWE-Bench Pro (Public)

54,2 %

Le même exercice, sur des dépôts encore maintenus et des correctifs qui touchent plusieurs fichiers.

Source

Terminal-bench 2.1

54 %

Du travail réel en ligne de commande, dans un conteneur, du début à la fin.

Terminus-2 harness

Source

MLE-Bench

39,2 %

Mener une compétition d'apprentissage automatique de bout en bout, des données brutes au modèle entraîné.

Source

Connaissances et raisonnement scientifique

Des questions à réponse unique, du niveau lycée au niveau doctorat, où seule la justesse compte.

1 test

GDM-MRCR v2 (8-needle)

72,2 %

Retrouver la bonne réponse quand huit demandes presque identiques ont été noyées dans un texte très long.

128k (average)

Source

Pilotage d'un ordinateur

Le modèle agit à la souris et au clavier sur une machine réelle, comme le ferait une personne.

2 tests

CharXiv Reasoning

74,5 %

Raisonner sur les figures d'articles scientifiques publiés sur arXiv.

No tools

Source

OSWorld-Verified

74 %

Accomplir des tâches courantes sur une machine Ubuntu réelle, à la souris et au clavier.

Source

Travail professionnel réel

Des livrables de métier : dossiers juridiques, flux d'entreprise, enchaînements d'outils, documents de travail.

1 test

GDPVal-AA v2

1 140

220 tâches professionnelles réellement rémunérées, sur 44 métiers et 9 secteurs, rendues sous forme de livrable.

Elo

Source

Sûreté et comportement

Non pas ce que le modèle sait faire, mais ce qu'il accepte ou refuse de faire, et comment il se comporte quand on cherche à le détourner.

5 tests

Text to Text Safety

-8,14 point de pourcentage

Vérifier automatiquement que le modèle respecte les règles de contenu sur des échanges écrits.

Écart en points de pourcentage, Gemini 3.5 Flash-Lite vs. Gemini 3.1 Flash-Lite. Plus bas vaut mieux.

Source

Multilingual Safety

-0,92 point de pourcentage

La même vérification, menée dans plusieurs langues.

Écart en points de pourcentage, Gemini 3.5 Flash-Lite vs. Gemini 3.1 Flash-Lite. Plus bas vaut mieux.

Source

Image to Text Safety

0 point de pourcentage

La même vérification, quand la demande part d'une image.

Écart en points de pourcentage, Gemini 3.5 Flash-Lite vs. Gemini 3.1 Flash-Lite. Plus bas vaut mieux.

Source

Tone 1

3,04 point de pourcentage

Mesurer le ton d'un refus : dire non sans faire la morale.

Écart en points de pourcentage, Gemini 3.5 Flash-Lite vs. Gemini 3.1 Flash-Lite. Plus haut vaut mieux.

Source

Unjustified-refusals

5,32 point de pourcentage

Mesurer les refus injustifiés, c'est-à-dire les questions acceptables auxquelles le modèle refuse de répondre.

Écart en points de pourcentage, Gemini 3.5 Flash-Lite vs. Gemini 3.1 Flash-Lite. Plus bas vaut mieux.

Source