Modèles & catalogue

Meilleurs modèles IA open-source en Europe, 2026

Publié 2026-08-03 · Mis à jour 2026-09-08 · 8 min de lecture

Les modèles à poids ouverts ont comblé la majeure partie de l'écart avec les labos fermés en 2026, mais « open-source » ne dit rien sur la licence exacte, la VRAM nécessaire, ou si vous pouvez le faire tourner sur une infrastructure qui échappe à la juridiction américaine. Voici une liste pratique des modèles vers lesquels nous routons réellement du trafic, ce à quoi ils excellent, et — quand c'est pertinent — leur coût par million de tokens sur une infrastructure souveraine UE.

Si vous ne devez retenir qu'une chose : GLM-5.2 reste le généraliste à poids ouverts le plus performant servi sur infrastructure souveraine UE et celui vers lequel on orienterait la plupart des cas d'usage professionnels ; Qwen3.5 397B est le seul modèle de cette liste servi simultanément par deux clouds souverains UE distincts, ce qui compte si la redondance de fournisseur est un vrai impératif pour le déploiement de modèles ; et Mistral Small 3.2 mérite un regard particulier si le fait que le labo lui-même soit européen, pas seulement l'hébergement, entre dans votre évaluation. Voici le tableau complet, modèle par modèle, avec de vrais tarifs et de vraies licences — pas des arguments marketing. Pour la plupart des charges de travail d'IA générative, le coût d'inférence par token est le chiffre qui compte à grande échelle.

GLM-5.2 et GLM-5.3 — les généralistes

Fiche complète, licence et tarif →

Construit par Zhipu AI / Z.ai, GLM-5.2 est un modèle à mélange d'experts de 753 milliards de paramètres, publié sous licence MIT — l'une des licences open-source les plus permissives, sans restriction sur l'usage commercial ou le fine-tuning. Il est largement considéré comme le modèle généraliste entièrement à poids ouverts le plus performant disponible mi-2026, compétitif face aux modèles fermés de pointe sur les benchmarks de codage et de raisonnement à long horizon. Sur Frontière AI, il est servi via les Generative APIs de Scaleway à 2,52 € par million de tokens en entrée et 7,70 € en sortie — un tarif premium pour un modèle premium, celui vers lequel on orienterait la plupart des équipes en premier si le budget n'est pas la contrainte principale.

Zhipu a depuis publié la ligne GLM-5.3 : GLM-5.3 et la version allégée GLM-5.3 Flash, tous deux sous licence MIT et multimodaux, avec environ 1,3M tokens de contexte. Ils prolongent le profil de codage et de raisonnement à long horizon de la famille, mais ils sont aujourd'hui routés en accès rapide via des fournisseurs sous contrôle non-UE : GLM-5.2 chez Scaleway reste donc le choix GLM sur la voie souveraine. Fiche GLM-5.3 → Fiche GLM-5.3 Flash →

La famille Qwen — de Qwen3 à Qwen3.8

Fiche complète, licence et tarif →

La famille Qwen d'Alibaba est la gamme à poids ouverts la plus complète disponible, et le catalogue de Frontière AI couvre six de ses modèles sous licence Apache sur trois paliers de prix — plus la ligne Qwen3.8 ci-dessous, dont le 27B vient de rejoindre la voie souveraine :

  • Qwen3.5 397B (403 milliards de paramètres au total, 17 milliards actifs — une architecture à mélange d'experts) est le porte-drapeau : multimodal, sous licence Apache-2.0, et — fait rare — disponible à la fois sur OVHcloud et Scaleway, le seul modèle de notre catalogue avec cette redondance. 0,84 € / 5,04 € par million de tokens (entrée/sortie) chez Scaleway.
  • Qwen3 235B est le porte-drapeau de la génération précédente, toujours pleinement capable et sensiblement moins cher : 1,05 € / 3,15 € par million de tokens.
  • Qwen3.6 27B est un modèle multimodal plus récent et plus petit — Apache-2.0, et le seul modèle Qwen de notre catalogue exclusif à OVHcloud plutôt qu'à Scaleway.
  • Qwen3 32B est un modèle dense (pas MoE) de milieu de gamme, bien tarifé et stable depuis sa sortie mi-2025.
  • Qwen3 Coder 30B est spécialisé code — le modèle à privilégier si la charge de travail concerne des pipelines CI, de la revue de code, ou de l'outillage développeur plutôt que du chat généraliste.
  • Qwen3.5 9B est le palier économique : petit, rapide, et assez peu cher pour tourner à fort volume sur de la classification simple ou du chat léger.
  • Qwen3.8 Max est le nouveau porte-drapeau de la famille : environ 2,4 billions de paramètres dont 95 milliards actifs, un contexte de 1M tokens et un profil raisonnement solide — mais ses poids portent la licence propriétaire de Qwen, à vérifier avant toute redistribution commerciale. Il n'arrive dans le catalogue qu'en accès rapide.
  • Qwen3.8 27B est la surprise de la ligne : ses poids sont en réalité sous Apache-2.0 (vérifié sur son dépôt Hugging Face, contrairement au reste de la famille 3.8 — Qwen3.8 Flash reste sous licence propriétaire autant qu'on a pu le vérifier, et son dépôt n'est pas public). Mieux : il vient de passer sur infrastructure souveraine UE — OVHcloud l'a ajouté au catalogue le 2026-09-08, c'est un modèle à raisonnement avec 256k de contexte, et il y coûte 0,56 € / 3,78 € par million de tokens (entrée/sortie).

Les modèles Qwen servis par OVHcloud y sont tarifés en dollars et convertis en euros pour la facturation. Des entrées Qwen3.8 plus récentes, seul le 27B passe aujourd'hui par un fournisseur souverain — le Max reste sur des voies en accès rapide.

Mistral Small 3.2 — l'option européenne

Fiche complète, licence et tarif →

Mistral AI est un labo basé à Paris, ce qui fait de Mistral Small 3.2 (24 milliards de paramètres, Apache-2.0) le seul modèle de cette liste où l'argument de souveraineté s'étend à l'origine même du modèle, pas seulement à son hébergement. Il prend en charge un éventail de langues inhabituellement large — 26 sont listées sur sa fiche modèle, plus que tout autre modèle de notre catalogue — ce qui compte si votre entreprise opère réellement sur plusieurs marchés européens plutôt qu'en anglais d'abord avec une couche de traduction ajoutée par-dessus.

gpt-oss 120B/20B — les poids ouverts d'OpenAI

Fiche complète, licence et tarif →

OpenAI a publié deux modèles à poids ouverts, gpt-oss-120b et gpt-oss-20b, en août 2025 sous licence Apache-2.0. Ce ne sont pas les modèles les plus récents de cette liste, mais ils sont peu chers, bien documentés, et portent une reconnaissance de marque qui compte dans les discussions d'achat où « quelle société a construit ça » fait partie de la validation interne. Les deux sont disponibles sur OVHcloud, à 0,112 € / 0,574 € par million de tokens pour le 120B et 0,056 € / 0,224 € pour le 20B — le point d'entrée le moins cher du catalogue.

DeepSeek V4, Kimi K3 et R1 — le palier frontière

Fiche complète, licence et tarif →

Le palier frontière a vite bougé depuis la première publication de ce guide. DeepSeek V4 Flash 0731 (158 milliards de paramètres au total, 13 milliards actifs, MIT, contexte 1M tokens) a franchi le pas : il est désormais servi chez Scaleway, ce qui en fait une option souveraine UE et non plus un compromis d'accès rapide — la première variante V4 à obtenir ce statut. DeepSeek V4 Pro 0813 (345 milliards de paramètres au total, 44 milliards actifs, MIT) et DeepSeek R1 (671 milliards MoE, 39 milliards actifs, MIT) restent en accès rapide, avec des distillations R1 plus légères (Qwen 32B et 14B) en options de raisonnement économiques. Kimi K3, de Moonshot AI, reste le plus gros modèle à poids ouverts disponible au monde avec 2,8 billions de paramètres, une prise en charge native de la vision et un contexte de 1M tokens ; une variante souveraine UE dédiée de K3 est prévue sur notre propre infrastructure mais n'est pas encore appelable.

La leçon pratique de ces sorties : un modèle peut passer de l'accès rapide au souverain en l'espace d'un mois, dès qu'un cloud géré souverain le reprend. Vérifiez l'étiquette sur la fiche du modèle avant d'appeler — la souveraineté est par modèle et par fournisseur, pas une propriété de la famille.

Au-delà des familles d'origine

Plusieurs familles à poids ouverts capables se situent hors du regroupement GLM/Qwen/DeepSeek/Mistral de la première édition de ce guide. Llama 3.3 70B de Meta est servi chez OVHcloud, ce qui en fait l'un des rares grands généralistes disponibles sur une infrastructure souveraine UE venant d'un labo non chinois. Les modèles de raisonnement Muse Spark 1.1 et 1.2 de Meta (contexte 1M tokens, multimodaux) ne sont aujourd'hui accessibles qu'en accès rapide. Gemma 3 27B de Google est sous licence Apache-2.0 et peu coûteux, également en accès rapide aujourd'hui. Des sorties plus récentes comme Mistral Small 4 119B, Llama 4 Maverick ou Gemma 4 existent publiquement mais ne figurent pas encore au catalogue de Frontière AI : aucune affirmation de tarif ou d'hébergement n'est donc faite ici à leur sujet.

Les licences en un coup d'œil

ModèleLicenceÀ noter
GLM-5.2MITAucune restriction sur l'usage commercial
Qwen3.5 397B / Qwen3 235B / Qwen3.6 27B / Qwen3 32B / Qwen3 Coder 30B / Qwen3.5 9BApache-2.0Permissive, licence de brevet incluse
Mistral Small 3.2Apache-2.026 langues documentées
gpt-oss 120B / 20BApache-2.0Première publication à poids ouverts d'OpenAI depuis GPT-2
DeepSeek V4 (Pro/Flash)MITContexte 1M tokens
Qwen2.5-VL 72BLicence propre à Qwen (« other »)Ni Apache ni MIT — vérifier les conditions avant redistribution commerciale
GLM-5.3 / GLM-5.3 FlashMITSuccesseurs de GLM-5.2, servis en accès rapide aujourd'hui
Qwen3.8 Max / FlashLicence propriétaire QwenNi Apache ni MIT — vérifier les conditions avant redistribution commerciale
Qwen3.8 27BApache-2.0Vérifié sur le dépôt Hugging Face (2026-09-08) ; servi chez OVHcloud à 0,56 € / 3,78 € par million de tokens (entrée/sortie)
DeepSeek R1 (et distillations)MITLignée raisonnement, en accès rapide aujourd'hui
Gemma 3 27BApache-2.0Gamme open-weight de Google, en accès rapide aujourd'hui

FAQ

Lequel de ces modèles choisir si je veux juste la meilleure option généraliste ?

GLM-5.2 pour la capacité, si le budget le permet. Qwen3.5 397B si vous voulez spécifiquement un modèle disponible en redondance sur deux fournisseurs souverains UE distincts. Qwen3 32B si vous voulez une option par défaut solide et peu chère pour un usage quotidien.

DeepSeek V4 et Kimi K3 sont-ils disponibles dès aujourd'hui via Frontière AI ?

Ils le sont. DeepSeek V4 Flash 0731 est désormais servi chez Scaleway et étiqueté souverain UE. Kimi K3 reste en accès rapide pendant qu'une variante souveraine UE dédiée est préparée sur notre propre infrastructure. DeepSeek V4 Pro 0813 et DeepSeek R1 sont en accès rapide à ce jour.

Quels modèles de ce guide sont souverains UE aujourd'hui ?

Tout ce qui est hébergé chez OVHcloud, Scaleway ou sur nos propres serveurs UE : GLM-5.2, Qwen3.5 397B, Qwen3 235B, Qwen3.6 27B, Qwen3 32B, Qwen3 Coder 30B, Qwen3.5 9B, Qwen2.5-VL 72B, Mistral Small 3.2, gpt-oss 120B/20B, Llama 3.3 70B et DeepSeek V4 Flash 0731. GLM-5.3, Qwen3.8 Max et Flash, DeepSeek V4 Pro, DeepSeek R1, Muse Spark et Gemma 3 27B sont en accès rapide à ce jour — Qwen3.8 27B a rejoint la liste souveraine le 2026-09-08.

Pourquoi le même modèle coûte-t-il parfois des prix différents selon le fournisseur ?

OVHcloud facture en dollars, Scaleway en euros, et chacun négocie sa propre économie d'hébergement — donc un même modèle à poids ouverts peut porter des prix différents selon le cloud qui le sert. Quand un modèle est disponible chez les deux (actuellement seulement Qwen3.5 397B), on route vers le fournisseur nativement en euros pour éviter d'introduire une conversion de devise dans la facturation.

Apache-2.0 ou MIT, laquelle est préférable pour un produit commercial ?

Les deux sont très permissives et autorisent l'usage commercial, la modification et la redistribution avec des obligations minimales (attribution, généralement). Apache-2.0 inclut en plus une licence de brevet explicite, que certaines équipes juridiques préfèrent pour cette raison. Aucune des deux n'impose de copyleft obligeant à ouvrir le code de votre propre produit.

Que signifie « mélange d'experts » (MoE) pour des modèles comme GLM-5.2 ou Qwen3.5 397B ?

Cela signifie que le modèle a beaucoup plus de paramètres au total qu'il n'en utilise réellement par token — Qwen3.5 397B a 403 milliards de paramètres au total mais n'en active qu'environ 17 milliards par passe. Cela rapproche le coût et la latence d'inférence de ceux d'un modèle dense bien plus petit, tout en conservant la capacité d'un modèle bien plus grand.

Prêt à essayer ?

Créez un compte et appelez n'importe quel modèle du catalogue en quelques minutes.

Créer un compte