Benchmark IA Open Source

Benchmark IA Open Source — Comparaison des modeles 2026

Une comparaison independante des modeles IA open source par scores de benchmarks, parametres, fenetre de contexte, licence et prix reels en Europe. Couvre les modeles frontiere comme Kimi K3, Qwen3.8, GLM-5.2, DeepSeek V4 et Llama 3.3 — et les modeles que vous pouvez appeler via une API souveraine UE.

17

Tous les modeles

12

Sur Frontière AI

10

UE souverain

5

Modeles raisonnement

Scores de benchmarks en un coup d'oeil

MMLU
GPQA
Souverain (Frontière AI)
Pas sur Frontière AI
Kimi 2.8T
89.5
Qwen 2.4T
89.2
DeepSeek ~1.6T
88.1
GLM-5.2 (Zhipu/Z.ai)
87.6
NVIDIA ~692B
87.2
Qwen3.5 397B (multimodal)
86.4
Qwen3 235B (instruct)
84.7
DeepSeek V4 Flash 0731 (1M context)
83.2
Llama 3.3 70B
79.5
Qwen3.6 27B (multimodal)
78.9
Qwen3 Coder 30B
75.3
Qwen3 32B
76.8
Mistral Small 3.2 24B
74.2
Qwen3.5 9B (fast, budget)
69.4
OpenAI 120B
80.1
0255075100

Capacite vs. prix

Comparaison des modeles open source par intelligence (Arena Elo) et cout pour 100k tokens d'entree sur une infrastructure souveraine UE. Bulles plus grandes = plus de parametres. Les modeles souverains sur Frontière AI sont mis en avant.

13601245113010159000.000.060.120.170.230.29Prix pour 100k tokens d'entree (€)Arena EloGLM-5.2 (Zhipu/Z.ai)GLM-5.2 (Zhipu/Z.ai) Arena Elo: 1295 Price / 100k: €0.2520 Params: 753BQwen3.5 397B (multimodal)Qwen3.5 397B (multimodal) Arena Elo: 1260 Price / 100k: €0.0840 Params: 403BQwen3 235B (instruct)Qwen3 235B (instruct) Arena Elo: 1230 Price / 100k: €0.1050 Params: 235BDeepSeek V4 Flash 0731 (1M context)DeepSeek V4 Flash 0731 (1M context) Arena Elo: 1210 Price / 100k: €0.0560 Params: 158BLlama 3.3 70BLlama 3.3 70B Arena Elo: 1180 Price / 100k: €0.0898 Params: 70BQwen3.6 27B (multimodal)Qwen3.6 27B (multimodal) Arena Elo: 1165 Price / 100k: €0.0574 Params: 28BQwen3 Coder 30BQwen3 Coder 30B Arena Elo: 1120 Price / 100k: €0.0084 Params: 31BQwen3 32BQwen3 32B Arena Elo: 1140 Price / 100k: €0.0112 Params: 33BMistral Small 3.2 24BMistral Small 3.2 24B Arena Elo: 1100 Price / 100k: €0.0126 Params: 24BQwen3.5 9B (fast, budget)Qwen3.5 9B (fast, budget) Arena Elo: 1050 Price / 100k: €0.0140 Params: 10BSouverain (Frontière AI)Pas sur Frontière AI

Modeles classes par Arena Elo par defaut. Cliquez sur les en-tetes de colonnes pour trier par MMLU, GPQA, LiveCodeBench, parametres ou prix. Tous les scores proviennent de fiches modeles publiques, rapports techniques et LMSYS Chatbot Arena.

ModeleLaboParamsContexteLicenceMMLUGPQALiveCodeArena EloPrix / 100kJuridictionVerifie
🧠
Kimi (2.8T)
Kimi2.8T/~120B256KMIT89.574.258.31342N/A
🧠
Qwen (2.4T)
Qwen2.4T/~95B256KApache-2.089.272.856.11328N/A
🧠
DeepSeek (~1.6T)
DeepSeek~1.6T/~100B128KMIT88.171.555.41310N/A
🧠
GLM-5.2 (Zhipu/Z.ai)Sur Frontière AI
Zhipu / Z.ai753B128KMIT87.669.852.712950,252 €UE souverain6/6
NVIDIA (~692B)
NVIDIA~692B/~60B128KApache-2.087.268.548.91278N/A
Qwen3.5 397B (multimodal)Sur Frontière AI
Qwen403B/17B128KApache-2.086.466.246.312600,084 €UE souverain6/6
Qwen3 235B (instruct)Sur Frontière AI
Qwen235B/22B128KApache-2.084.762.142.512300,105 €UE souverain0/6
DeepSeek158B/13B1MMIT83.258.940.112100,056 €UE souverain6/6
Llama 3.3 70BSur Frontière AI
Meta70B128KLlama Community79.554.338.211800,0898 €UE souverain5/6
Qwen3.6 27B (multimodal)Sur Frontière AI
Qwen27.8B128KApache-2.078.952.135.711650,0574 €UE souverain6/6
Qwen3 Coder 30BSur Frontière AI
Alibaba30.5B/3B128KApache-2.075.348.644.211200,0084 €UE souverain6/6
Qwen3 32BSur Frontière AI
Alibaba32.8B4KApache-2.076.850.433.111400,0112 €UE souverain6/6
Mistral Small 3.2 24BSur Frontière AI
Mistral AI24B32KApache-2.074.246.830.511000,0126 €UE souverain6/6
Qwen9.65B128KApache-2.069.440.225.810500,014 €UE souverain6/6
OpenAI (120B)
OpenAI120B/~20B128KApache-2.080.155.739.41190N/A
BAAI (768M)Sur Frontière AI
BAAI768M8KApache-2.0N/A
Qwen (8.2B)Sur Frontière AI
Qwen8.2B4KApache-2.0N/A

Methodologie des benchmarks

Les scores sont issus de fiches modeles officielles et de rapports techniques. Quand plusieurs rapports existent, nous utilisons la figure independamment verifiee la plus elevee. Tous les benchmarks suivent leur protocole d'evaluation officiel.

MMLU (5-shot)

MMLU (5-shot) — 57 sujets couvrant STEM, humanites, droit, medecine et plus. Mesure les connaissances generales et le raisonnement a travers les domaines.

GPQA Diamond

GPQA Diamond — QCM de niveau master en physique, chimie et biologie. Le sous-ensemble le plus difficile avec accord d'experts, considere comme la reference pour le raisonnement scientifique.

LiveCodeBench v5

LiveCodeBench v5 — Taches de codage reels issues de plateformes de programmation competitive. Mesure la capacite pratique de generation de code.

LMSYS Chatbot Arena

LMSYS Chatbot Arena Elo — Comparaisons aveugles A/B crowdsourceed. Le signal de performance reel le plus fiable, mis a jour en continu. Elo plus eleve = reponses preferees par les utilisateurs.

Sources : fiches modeles Hugging Face, rapports techniques officiels, LMSYS Chatbot Arena.

Comment lire les scores de benchmarks

Les scores de benchmarks mesurent des capacites specifiques dans des conditions controlees. Ils ne predisent pas les performances reels pour votre cas d'usage. Un modele avec un score MMLU plus bas peut etre meilleur pour votre charge de travail grace a la longueur de contexte, le support des outils, la couverture linguistique ou le prix. Utilisez les benchmarks comme un element parmi d'autres — et testez les modeles vous-meme avec vos propres prompts.

Questions frequentes

Quel est le meilleur modele IA open source en 2026 ?
Kimi K3 et Qwen3.8 2.4T sont en tete en intelligence brute (Arena Elo 1340+), suivis de pres par DeepSeek V4 Pro et GLM-5.2. Pour un usage pratique, GLM-5.2 est le modele le plus puissant disponible via une API souveraine UE — avec 87,6 % sur MMLU et 69,8 % sur GPQA Diamond, servi par Scaleway a partir de 0,25 € pour 100k tokens d'entree.
Puis-je heberger moi-meme des modeles IA open source ?
Oui — tous les modeles listes ici ont des poids telechargeables. Les exigences vont d'un seul GPU pour les petits modeles (Qwen3.5 9B, ~20 Go VRAM) a des configurations multi-GPU pour les modeles frontiere (Kimi K3 necessite 8xH100 minimum). Alternativement, Frontière AI offre un acces instantane par API a des modeles heberges de facon souveraine a partir de 10 € prepayes.
Les modeles IA open source sont-ils conformes au RGPD ?
Le modele en lui-meme n'est jamais le probleme — c'est son hebergement. Un modele heberge sur OVHcloud ou Scaleway en France reste sous juridiction UE. Le meme modele heberge sur un cloud US est soumis au CLOUD Act. Frontière AI etiquette chaque modele comme 'UE souverain' ou 'acces rapide' pour que vous le sachiez avant d'appeler.
Pourquoi les scores de benchmarks diffèrent entre sources ?
Les differents fournisseurs de benchmarks utilisent des prompts, des temperatures et des echantillons d'evaluation differents. Nous puisons nos scores dans les fiches modeles officielles et les rapports techniques pour garantir la coherence. Meme alors, un modele declare a 87,6 % MMLU par son createur peut score 86 % dans une evaluation independante — les deux sont des mesures legitimes du meme modele.
Quelle difference entre modeles de raisonnement et modeles classiques ?
Les modeles de raisonnement (marques avec un indicateur) realisent une chaine de pensee interne avant de repondre. Ils scorent generalement mieux sur les benchmarks de mathematiques, de code et de raisonnement complexe — mais peuvent etre plus lents et plus chers a cause des tokens supplementaires de reflexion. Les modeles classiques sont plus rapides et moins chers pour des taches simples.
Comment Frontière AI tarife-t-elle les modeles open source ?
Frontière AI applique une marge plate de 40 % au-dessus des couts d'infrastructure. Les providers souverains (OVHcloud, Scaleway) sont les moins chers — a partir de 0,0045 € pour 100k tokens d'entree pour Qwen3.5 9B. Les modeles frontiere comme GLM-5.2 debutent a 0,25 € pour 100k tokens d'entree. Pas d'abonnement, uniquement prepaye.

Testez ces modeles vous-meme

Crez un compte et appelez n'importe quel modele du catalogue en quelques minutes.

Créer un compte