Aktory Référentiel IA
Toutes les entreprises

DeepSeek

Vérifiée
Est. 2023 · Hangzhou · MAJ 03.08.2026
Site officiel

Entreprise chinoise fondée en 2023 à Hangzhou, adossée au fonds spéculatif High-Flyer. Elle publie ses modèles en poids ouverts, sous licence MIT depuis janvier 2025, et pratique sur son API des tarifs très inférieurs à ceux des laboratoires américains. Son assistant, gratuit sur le web et sur mobile, s'appelle comme elle.

Benchmarks expliqués

Ce que valent les modèles, avec les conditions

Les scores ci-dessous sont ceux de DeepSeek-V4-Flash-0731, sorti le 31 juillet 2026, regroupés par ce qu'ils mesurent : 9 tests relevés, chacun annoncé par le laboratoire avec sa source et ses conditions. Une jauge n'est dessinée que quand l'échelle du test a un maximum connu.

Code et ingénierie logicielle

Le modèle reçoit un dépôt et un problème, et doit produire un correctif qui passe les tests, sans intervention humaine.

5 tests

Terminal Bench 2.1

82,7

Du travail réel en ligne de commande, dans un conteneur, du début à la fin.

Relevé par DeepSeek en mode minimal du DeepSeek Harness, niveau d'effort maximal, topp = 0,95, température = 1,0.

Source

DSBench-FullStack

68,7

Un jeu de tests interne de DeepSeek, portant sur le développement complet d'une application.

Relevé par DeepSeek en mode minimal du DeepSeek Harness, niveau d'effort maximal, topp = 0,95, température = 1,0. Jeu de tests in…

Source

DSBench-Hard

59,6

Un jeu de tests interne de DeepSeek, réservé aux problèmes difficiles pour un agent de programmation.

Relevé par DeepSeek en mode minimal du DeepSeek Harness, niveau d'effort maximal, topp = 0,95, température = 1,0. Jeu de tests in…

Source

DeepSWE

54,4 %

113 tâches de développement de longue haleine, écrites de zéro pour n'avoir jamais été vues à l'entraînement.

Relevé par DeepSeek en mode minimal du DeepSeek Harness, niveau d'effort maximal, topp = 0,95, température = 1,0.

Source

NL2Repo

54,2

Construire un dépôt de code entier à partir d'un cahier des charges écrit en langage courant.

Relevé par DeepSeek en mode minimal du DeepSeek Harness, niveau d'effort maximal, topp = 0,95, température = 1,0. La source ne di…

Source

Travail professionnel réel

Des livrables de métier : dossiers juridiques, flux d'entreprise, enchaînements d'outils, documents de travail.

3 tests

Toolathlon verified

70,3 %

108 tâches d'outillage réel : bureautique, commerce en ligne, analyse de données, recherche web.

Relevé par DeepSeek en mode minimal du DeepSeek Harness, niveau d'effort maximal, topp = 0,95, température = 1,0.

Source

Agent Last Exam

25,2

Mener jusqu'au bout des tâches professionnelles longues, qui demandent de garder le fil sur de nombreuses étapes.

Relevé par DeepSeek en mode minimal du DeepSeek Harness, niveau d'effort maximal, topp = 0,95, température = 1,0.

Source

Automation Bench (Public)

25,1

Mener un flux de travail d'entreprise de bout en bout, d'une seule instruction en langage courant.

Relevé par DeepSeek en mode minimal du DeepSeek Harness, niveau d'effort maximal, topp = 0,95, température = 1,0.

Source

Cybersécurité offensive

Trouver et exploiter de vraies failles logicielles, ou mener une opération d'attaque complète. Un score élevé mesure une capacité, pas une qualité : c'est précisément ce que les laboratoires surveillent.

1 test

Cybergym

76,7 %

Mener une attaque informatique complète en contournant les protections du modèle, sur des centaines d'appels d'outils.

Relevé par DeepSeek en mode minimal du DeepSeek Harness, niveau d'effort maximal, topp = 0,95, température = 1,0.

Source