LiveCodeBench
Écrire un programme qui résout un exercice de concours publié après l'entraînement du modèle.
La source donne la progression « 39.2 vers 49.2 ». La valeur retenue est celle d'arrivée.
Source
Ce qu’il peut avoir sous les yeux en une seule fois, question et réponse comprises.
Motif du retrait : Remplacé sur le point d'accès deepseek-chat par DeepSeek-V3.1, le journal des versions datant la bascule.
4 tests relevés pour ce modèle, regroupés par ce qu'ils mesurent. Chaque chiffre est annoncé par le laboratoire, avec sa source et ses conditions ; une jauge n'est dessinée que quand l'échelle du test a un maximum connu.
Le modèle reçoit un dépôt et un problème, et doit produire un correctif qui passe les tests, sans intervention humaine.
Écrire un programme qui résout un exercice de concours publié après l'entraînement du modèle.
La source donne la progression « 39.2 vers 49.2 ». La valeur retenue est celle d'arrivée.
SourceDes questions à réponse unique, du niveau lycée au niveau doctorat, où seule la justesse compte.
La version durcie de MMLU : mêmes matières, questions plus exigeantes et dix réponses possibles au lieu de quatre.
La source donne la progression depuis DeepSeek-V3 : « 75.9 vers 81.2 ». La valeur retenue est celle d'arrivée.
SourceDes questions de niveau doctorat en biologie, physique et chimie, écrites par des spécialistes.
La source donne la progression « 59.1 vers 68.4 » et la valeur retenue est celle d'arrivée. Elle écrit « GPQA » sans dire quel so…
SourceDes démonstrations de niveau olympiade et des problèmes tirés de la recherche en cours.
L'examen américain d'invitation en mathématiques, une compétition lycéenne prestigieuse.
La source écrit « AIME » sans préciser le millésime, et donne la progression « 39.6 vers 59.4 ». La valeur retenue est celle d'ar…
Sourcedeepseek-chat
Le nom exact à écrire dans le code pour appeler ce modèle.