Méthodologie · AI

Comment le AI Models Top 10 est calculé

Le classement officiel porte sur la qualité globale, une moyenne pondérée de six capacités. Mais cette moyenne cache plus qu'elle ne montre : la page permet donc de trier par chaque critère, et la fiche de chaque modèle détaille tous les benchmarks utilisés.

Dernière mise à jour : · semaine 41 · 16 semaines d’historique

D’où viennent les chiffres

Sources

SourceCe qu’on en tireStatut
SWE-bench (nouvel onglet)Coding : résolution de tickets GitHub réels (SWE-bench Verified).À brancher
LiveCodeBench (nouvel onglet)Coding : problèmes de programmation récents.À brancher
GPQA Diamond (nouvel onglet)Reasoning : questions de sciences de niveau doctorat.À brancher
Humanity's Last Exam (nouvel onglet)Reasoning : questions expertes (Humanity's Last Exam).À brancher
Epoch AI (nouvel onglet)Maths : concours AIME.À brancher
Terminal-Bench (nouvel onglet)Agents : tâches dans un terminal.À brancher
τ-bench (nouvel onglet)Agents : usage d'outils face à un utilisateur simulé.À brancher
MMMU (nouvel onglet)Multimodal : compréhension d'images et de texte.À brancher
OpenAI MRCR (nouvel onglet)Long context : retrouver l'information dans un long contexte.À brancher
Artificial Analysis (nouvel onglet)Fenêtre de contexte, vitesse de sortie et prix des API.À brancher

Ce qui entre dans la note

Critères et pondérations

  • Global (classement officiel)

    Coding 25 %, reasoning 22 %, agents 20 %, maths 13 %, multimodal 10 %, long context 10 %. La vitesse et le prix n'y entrent pas : un modèle rapide et bon marché n'est pas pour autant un meilleur modèle.

  • Coding

    SWE-bench Verified (60 %) et LiveCodeBench (40 %). Les scores en pourcentage sont repris tels quels.

  • Reasoning

    GPQA Diamond (60 %) et Humanity's Last Exam (40 %, échelle de 0 à 50 % ramenée à 100).

  • Maths

    AIME 2025, repris tel quel.

  • Agents

    Terminal-Bench (55 %, échelle de 0 à 70 % ramenée à 100) et τ-bench (45 %).

  • Multimodal

    MMMU. Les modèles texte seul n'ont pas de score multimodal : ils ne sont pas pénalisés dans le Global, mais n'apparaissent pas dans ce tri.

  • Long context

    MRCR (60 %) et taille de la fenêtre (40 %, échelle logarithmique de 32 000 tokens à 2 millions).

  • Speed et Price

    Vitesse en tokens par seconde (échelle logarithmique de 30 à 400). Prix mixte avec 3 parts d'entrée pour 1 de sortie (échelle logarithmique de 0,2 $ à 20 $ le million de tokens, inversée).

  • Value (rapport qualité/prix)

    60 % qualité globale, 40 % score de prix. C'est un choix éditorial, assumé, qui peut se discuter.

  • Départage

    À score égal, le meilleur résultat SWE-bench Verified passe devant.

Générée à partir du code, donc toujours à jour

La formule, ligne par ligne

Coding

Résoudre de vrais tickets et écrire du code correct.

SWE-bench Verified60 %valeur telle quelle (déjà sur 100)
LiveCodeBench40 %valeur telle quelle (déjà sur 100)

Reasoning

Raisonnement scientifique et questions expertes.

GPQA Diamond60 %valeur telle quelle (déjà sur 100)
Humanity's Last Exam40 %échelle linéaire entre 0 (0) et 50 (100)

Maths

Mathématiques de concours.

AIME 2025100 %valeur telle quelle (déjà sur 100)

Agents

Enchaîner des actions avec des outils sans dérailler.

Terminal-Bench55 %échelle linéaire entre 0 (0) et 70 (100)
τ-bench45 %valeur telle quelle (déjà sur 100)

Multimodal

Comprendre les images en plus du texte. Absente pour les modèles texte seul.

MMMU100 %valeur telle quelle (déjà sur 100)

Long context

Taille de la fenêtre et capacité à y retrouver l'information.

MRCR60 %valeur telle quelle (déjà sur 100)
Fenêtre de contexte40 %échelle logarithmique entre 32 (0) et 2000 (100)

Speed

Vitesse de génération, échelle logarithmique de 30 à 400 tokens par seconde.

Vitesse de sortie100 %échelle logarithmique entre 30 (0) et 400 (100)

Price

Prix mixte (3 parts d'entrée pour 1 de sortie), inversé : moins cher = score plus haut.

Prix mixte100 %échelle logarithmique entre 0.2 (0) et 20 (100), inversée (plus bas = mieux)

Global Note principale

Qualité globale : coding 25 %, reasoning 22 %, agents 20 %, maths 13 %, multimodal 10 %, long context 10 %. La vitesse et le prix n'y entrent pas.

Coding25 %sous-score composite
Reasoning22 %sous-score composite
Agents20 %sous-score composite
Maths13 %sous-score composite
Multimodal10 %sous-score composite
Long context10 %sous-score composite

Value

Rapport qualité/prix : 60 % qualité globale, 40 % score de prix.

Global60 %sous-score composite
Price40 %sous-score composite

Ce qu’on ne sait pas faire

Limites

  • Un benchmark mesure une tâche, pas votre usage. Aucun score ne remplace un essai sur vos propres données.

  • Les scores peuvent venir de l'éditeur ou d'un évaluateur indépendant, avec des protocoles différents. Nous privilégions les évaluations indépendantes et le précisons dès qu'une valeur vient d'ailleurs.

  • La contamination (un benchmark qui fuit dans les données d'entraînement) gonfle certains scores. C'est une raison de plus de ne pas résumer un modèle à un seul chiffre.

  • Vitesse et prix dépendent du fournisseur, de la région et de l'heure. Nous reprenons la médiane des fournisseurs.

  • Les pondérations du Global sont un choix éditorial. Elles sont publiées pour pouvoir être contestées.