Méthodologie · OS
Comment le Open Source AI Top 10 est calculé
Mêmes données et mêmes pondérations que l'AI Models Top 10, restreintes aux modèles dont les poids sont téléchargeables. Un modèle présent dans les deux classements a le même score ; seul le rang change, parce que le pool est différent.
Dernière mise à jour : · semaine 41 · 16 semaines d’historique
D’où viennent les chiffres
Sources
| Source | Ce qu’on en tire | Statut |
|---|---|---|
| Hugging Face Hub (nouvel onglet) | Disponibilité des poids, licence et taille du modèle. Un modèle sans poids téléchargeables ne peut pas entrer. | À brancher |
| SWE-bench (nouvel onglet) | Coding : résolution de tickets GitHub réels (SWE-bench Verified). | À brancher |
| LiveCodeBench (nouvel onglet) | Coding : problèmes de programmation récents. | À brancher |
| GPQA Diamond (nouvel onglet) | Reasoning : questions de sciences de niveau doctorat. | À brancher |
| Humanity's Last Exam (nouvel onglet) | Reasoning : questions expertes. | À brancher |
| Epoch AI (nouvel onglet) | Maths : concours AIME. | À brancher |
| Terminal-Bench (nouvel onglet) | Agents : tâches dans un terminal. | À brancher |
| τ-bench (nouvel onglet) | Agents : usage d'outils face à un utilisateur simulé. | À brancher |
| MMMU (nouvel onglet) | Multimodal : compréhension d'images et de texte. | À brancher |
| OpenAI MRCR (nouvel onglet) | Long context : retrouver l'information dans un long contexte. | À brancher |
| Artificial Analysis (nouvel onglet) | Fenêtre de contexte, vitesse de sortie et prix des API d'hébergement. | À brancher |
Ce qui entre dans la note
Critères et pondérations
Open weights
Critère d'entrée : les poids doivent être téléchargeables. Nous ne jugeons pas la licence : elle est affichée sur chaque fiche, car « open weights » ne veut pas dire « libre ».
Score
Identique à l'AI Models Top 10 : coding 25 %, reasoning 22 %, agents 20 %, maths 13 %, multimodal 10 %, long context 10 %.
Vitesse et prix
Pour un modèle ouvert, la vitesse et le prix sont ceux des fournisseurs qui l'hébergent (médiane). Auto-hébergé, votre coût dépendra de votre matériel.
Générée à partir du code, donc toujours à jour
La formule, ligne par ligne
Coding
Résoudre de vrais tickets et écrire du code correct.
| SWE-bench Verified | 60 % | valeur telle quelle (déjà sur 100) |
| LiveCodeBench | 40 % | valeur telle quelle (déjà sur 100) |
Reasoning
Raisonnement scientifique et questions expertes.
| GPQA Diamond | 60 % | valeur telle quelle (déjà sur 100) |
| Humanity's Last Exam | 40 % | échelle linéaire entre 0 (0) et 50 (100) |
Maths
Mathématiques de concours.
| AIME 2025 | 100 % | valeur telle quelle (déjà sur 100) |
Agents
Enchaîner des actions avec des outils sans dérailler.
| Terminal-Bench | 55 % | échelle linéaire entre 0 (0) et 70 (100) |
| τ-bench | 45 % | valeur telle quelle (déjà sur 100) |
Multimodal
Comprendre les images en plus du texte. Absente pour les modèles texte seul.
| MMMU | 100 % | valeur telle quelle (déjà sur 100) |
Long context
Taille de la fenêtre et capacité à y retrouver l'information.
| MRCR | 60 % | valeur telle quelle (déjà sur 100) |
| Fenêtre de contexte | 40 % | échelle logarithmique entre 32 (0) et 2000 (100) |
Speed
Vitesse de génération, échelle logarithmique de 30 à 400 tokens par seconde.
| Vitesse de sortie | 100 % | échelle logarithmique entre 30 (0) et 400 (100) |
Price
Prix mixte (3 parts d'entrée pour 1 de sortie), inversé : moins cher = score plus haut.
| Prix mixte | 100 % | échelle logarithmique entre 0.2 (0) et 20 (100), inversée (plus bas = mieux) |
Global Note principale
Qualité globale : coding 25 %, reasoning 22 %, agents 20 %, maths 13 %, multimodal 10 %, long context 10 %. La vitesse et le prix n'y entrent pas.
| Coding | 25 % | sous-score composite |
| Reasoning | 22 % | sous-score composite |
| Agents | 20 % | sous-score composite |
| Maths | 13 % | sous-score composite |
| Multimodal | 10 % | sous-score composite |
| Long context | 10 % | sous-score composite |
Value
Rapport qualité/prix : 60 % qualité globale, 40 % score de prix.
| Global | 60 % | sous-score composite |
| Price | 40 % | sous-score composite |
Ce qu’on ne sait pas faire
Limites
Les licences varient beaucoup : Apache-2.0, MIT, licences maison avec restrictions. Lisez la licence avant de bâtir un produit dessus.
Les scores de certains modèles viennent de l'éditeur tant qu'aucune évaluation indépendante n'existe. Ils sont signalés comme tels sur la fiche.
Les modèles texte seul n'ont pas de score multimodal ; ils ne sont pas pénalisés dans le Global.
Le coût réel d'un modèle auto-hébergé n'est pas mesuré ici.

