Benchmark IA Open Source
Une comparaison independante des modeles IA open source par scores de benchmarks, parametres, fenetre de contexte, licence et prix reels en Europe. Couvre les modeles frontiere comme Kimi K3, Qwen3.8, GLM-5.2, DeepSeek V4 et Llama 3.3 — et les modeles que vous pouvez appeler via une API souveraine UE.
17
Tous les modeles
12
Sur Frontière AI
10
UE souverain
5
Modeles raisonnement
Comparaison des modeles open source par intelligence (Arena Elo) et cout pour 100k tokens d'entree sur une infrastructure souveraine UE. Bulles plus grandes = plus de parametres. Les modeles souverains sur Frontière AI sont mis en avant.
Modeles classes par Arena Elo par defaut. Cliquez sur les en-tetes de colonnes pour trier par MMLU, GPQA, LiveCodeBench, parametres ou prix. Tous les scores proviennent de fiches modeles publiques, rapports techniques et LMSYS Chatbot Arena.
| Modele | Labo | Params | Contexte | Licence | MMLU | GPQA | LiveCode | Arena Elo | Prix / 100k | Juridiction | Verifie |
|---|---|---|---|---|---|---|---|---|---|---|---|
🧠 Kimi (2.8T) | Kimi | 2.8T/~120B | 256K | MIT | 89.5 | 74.2 | 58.3 | 1342 | N/A | — | — |
🧠 Qwen (2.4T) | Qwen | 2.4T/~95B | 256K | Apache-2.0 | 89.2 | 72.8 | 56.1 | 1328 | N/A | — | — |
🧠 DeepSeek (~1.6T) | DeepSeek | ~1.6T/~100B | 128K | MIT | 88.1 | 71.5 | 55.4 | 1310 | N/A | — | — |
🧠 GLM-5.2 (Zhipu/Z.ai)Sur Frontière AI | Zhipu / Z.ai | 753B | 128K | MIT | 87.6 | 69.8 | 52.7 | 1295 | 0,252 € | UE souverain | 6/6 |
NVIDIA (~692B) | NVIDIA | ~692B/~60B | 128K | Apache-2.0 | 87.2 | 68.5 | 48.9 | 1278 | N/A | — | — |
Qwen3.5 397B (multimodal)Sur Frontière AI | Qwen | 403B/17B | 128K | Apache-2.0 | 86.4 | 66.2 | 46.3 | 1260 | 0,084 € | UE souverain | 6/6 |
Qwen3 235B (instruct)Sur Frontière AI | Qwen | 235B/22B | 128K | Apache-2.0 | 84.7 | 62.1 | 42.5 | 1230 | 0,105 € | UE souverain | 0/6 |
🧠 DeepSeek V4 Flash 0731 (1M contexte)Sur Frontière AI | DeepSeek | 158B/13B | 1M | MIT | 83.2 | 58.9 | 40.1 | 1210 | 0,056 € | UE souverain | 6/6 |
Llama 3.3 70BSur Frontière AI | Meta | 70B | 128K | Llama Community | 79.5 | 54.3 | 38.2 | 1180 | 0,0898 € | UE souverain | 5/6 |
Qwen3.6 27B (multimodal)Sur Frontière AI | Qwen | 27.8B | 128K | Apache-2.0 | 78.9 | 52.1 | 35.7 | 1165 | 0,0574 € | UE souverain | 6/6 |
Qwen3 Coder 30BSur Frontière AI | Alibaba | 30.5B/3B | 128K | Apache-2.0 | 75.3 | 48.6 | 44.2 | 1120 | 0,0084 € | UE souverain | 6/6 |
Qwen3 32BSur Frontière AI | Alibaba | 32.8B | 4K | Apache-2.0 | 76.8 | 50.4 | 33.1 | 1140 | 0,0112 € | UE souverain | 6/6 |
Mistral Small 3.2 24BSur Frontière AI | Mistral AI | 24B | 32K | Apache-2.0 | 74.2 | 46.8 | 30.5 | 1100 | 0,0126 € | UE souverain | 6/6 |
Qwen3.5 9B (rapide, économique)Sur Frontière AI | Qwen | 9.65B | 128K | Apache-2.0 | 69.4 | 40.2 | 25.8 | 1050 | 0,014 € | UE souverain | 6/6 |
OpenAI (120B) | OpenAI | 120B/~20B | 128K | Apache-2.0 | 80.1 | 55.7 | 39.4 | 1190 | N/A | — | — |
BAAI (768M)Sur Frontière AI | BAAI | 768M | 8K | Apache-2.0 | — | — | — | — | N/A | — | — |
Qwen (8.2B)Sur Frontière AI | Qwen | 8.2B | 4K | Apache-2.0 | — | — | — | — | N/A | — | — |
Les scores sont issus de fiches modeles officielles et de rapports techniques. Quand plusieurs rapports existent, nous utilisons la figure independamment verifiee la plus elevee. Tous les benchmarks suivent leur protocole d'evaluation officiel.
MMLU (5-shot)
MMLU (5-shot) — 57 sujets couvrant STEM, humanites, droit, medecine et plus. Mesure les connaissances generales et le raisonnement a travers les domaines.
GPQA Diamond
GPQA Diamond — QCM de niveau master en physique, chimie et biologie. Le sous-ensemble le plus difficile avec accord d'experts, considere comme la reference pour le raisonnement scientifique.
LiveCodeBench v5
LiveCodeBench v5 — Taches de codage reels issues de plateformes de programmation competitive. Mesure la capacite pratique de generation de code.
LMSYS Chatbot Arena
LMSYS Chatbot Arena Elo — Comparaisons aveugles A/B crowdsourceed. Le signal de performance reel le plus fiable, mis a jour en continu. Elo plus eleve = reponses preferees par les utilisateurs.
Sources : fiches modeles Hugging Face, rapports techniques officiels, LMSYS Chatbot Arena.
Les scores de benchmarks mesurent des capacites specifiques dans des conditions controlees. Ils ne predisent pas les performances reels pour votre cas d'usage. Un modele avec un score MMLU plus bas peut etre meilleur pour votre charge de travail grace a la longueur de contexte, le support des outils, la couverture linguistique ou le prix. Utilisez les benchmarks comme un element parmi d'autres — et testez les modeles vous-meme avec vos propres prompts.
Crez un compte et appelez n'importe quel modele du catalogue en quelques minutes.