Modèles & catalogue

DeepSeek V4.1 Flash : benchs, prix, API

Publié 2026-09-11 · 8 min de lecture

DeepSeek V4.1 Flash est le plus récent modèle de la famille Flash de DeepSeek, publié sur Hugging Face le 2026-09-10 sous licence MIT. C'est un mixture-of-experts multimodal de 552B de paramètres, avec une fenêtre de contexte d'un million de tokens, une entrée texte et images native, et un effort de raisonnement réglable en continu (1 à 100). Le chiffre central du technical report n'est pas un score de classement mais un coût : une architecture causal encoder-décodeur combinée au KV cache en FP4 ne laisse que 8B de paramètres actifs par token au prefill et 16B au décodage, et ramène le KV cache à 890 octets par token — environ un quart de DeepSeek V4 Flash. Sur le catalogue Frontière AI, il est live sous le slug deepseek-v4.1-flash sur une lane accès rapide (Modal, pas souveraine), à 0,182 € par million de tokens d'entrée et 0,728 € par million de tokens de sortie, marge comprise.

Qu'est-ce que DeepSeek V4.1 Flash

DeepSeek V4.1 Flash a été publié sur Hugging Face le 2026-09-10 sous licence MIT (deepseek-ai/DeepSeek-V4.1-Flash), avec un technical report intitulé « Pushing the Limits of KV Cache Compression ». C'est un mixture-of-experts multimodal avec un backbone de 552B, une fenêtre de contexte d'un million de tokens, une entrée texte et images native, et un effort de raisonnement réglable en entier de 1 à 100 par appel.

Il n'est pas le plus gros modèle de la famille DeepSeek. Sa position est différente : c'est le modèle qui sert des contextes agents très longs — grands dépôts, longues boucles d'outils, RAG sur un corpus — pour une fraction du coût habituel. Le chiffre central du rapport n'est pas un score, c'est 890 octets de KV cache par token : environ un quart du DeepSeek V4 Flash précédent, et environ 1/437 du DeepSeek V1, avec 8B de paramètres actifs par token au prefill et 16B au décodage.

SpécificationValeur
ArchitectureCausal Encoder-Decoder, 40 couches (20 encoder causal + 20 décodeur)
Paramètres du backbone552B — MoE : 384 experts routés (6 actifs par token) + 1 expert partagé + 196B de mémoire conditionnelle Engram
Actifs par token8B au prefill / 16B au décodage
Contexte1M tokens
Modalitéstexte + image en entrée, texte en sortie
Effort de raisonnementrégulable en continu, entier 1–100
LicenceMIT
Publication2026-09-10

L'architecture derrière la promesse de coût

Quatre choix de conception font le travail. D'abord le Causal Encoder-Decoder (CED) : le transformer de 40 couches est découpé en un encoder causal de 20 couches et un décodeur de 20 couches, et le KV cache global du décodeur est projeté depuis les derniers états cachés de l'encoder au lieu d'être reconstruit depuis chaque couche du décodeur. La conséquence pratique, c'est la découpe 8B/16B de paramètres actifs — une requête chargée en prompt (long prompt système, un dépôt complet, un corpus RAG) coûte une fraction du coût de prefill d'un modèle de même taille.

Ensuite la Compressed Sparse Attention 2 (CSA2) : chaque couche d'attention reçoit un mode statique parmi trois — Full, Reindex ou Reuse — qui partagent le KV principal et le K de l'indexeur entre les couches et réutilisent les indices Top-K de l'attention sparse, et un indexeur sparse hiérarchique borne le coût des indexeurs profonds indépendamment de la longueur du contexte. Puis le cache KV principal en FP4 (format E2M1, une échelle E4M3 par 16 canaux) combiné au SWA Bounded Replay, qui reconstruit les états KV manquants de la fenêtre glissante en rejouant seulement les tokens les plus récents — il n'y a donc jamais rien à persister sur disque, et l'empreinte KV persistante tombe à environ 1/8 du DeepSeek V4 Flash. Ensemble, ces designs ramènent le KV cache global à 890 octets par token.

Le reste de la pile : Single-Pass mHC (révision du mélange du flux résiduel), DSpark (décodage spéculatif semi-autorégressif avec vérification à planification par confiance), et Engram, une mémoire conditionnelle de 196B de paramètres accédée de façon creuse par recherche de token. Côté vision, un encoder DeepSeek-ViT entraîné de zéro (2D-RoPE, downsampling par pixel-unshuffle 3×3) et un projecteur MLP de deux couches convertissent les images en embeddings visuels, traités conjointement avec le texte depuis le début du pré-entraînement. Le modèle a été entraîné de zéro sur un corpus multimodal de 45T tokens, l'attention sparse entraînée à 64K et le contexte étendu à 1M sur 34T tokens.

Pourquoi un acheteur devrait-il s'en soucier ? Dans les workloads agents à long contexte, le KV cache est le coût de service dominant : il croît avec la longueur du contexte et le nombre de requêtes concurrentes. Un modèle qui a besoin d'un quart de mémoire par token met soit plus de sessions concurrentes à 1M de contexte sur le même matériel, soit sert la même charge pour moins cher — et c'est cette différence de coût que le « Flash » de cette release vise.

Benchmarks : ce que le technical report affirme

Tous les résultats du modèle instruct ci-dessous proviennent du technical report DeepSeek, à l'effort de raisonnement maximal (temperature 1.0, top_p 0.95). La convention de DeepSeek, énoncée dans le rapport : deux scores à moins de 0,3 l'un de l'autre sont considérés équitables.

BenchmarkOpus-5.0GPT-5.6 SolK3GLM-5.3V4 ProV4 FlashV4.1 Flash
GPQA Diamond (Pass@1)93,494,192,988,192,489,990,9
Codeforces (rating)334832893471
Terminal-Bench 2.1 (Pass@1)89,188,888,388,287,982,790,6
Terminal-Bench 3.0 (Pass@1)43,334,417,728,311,87,630,0
DeepSWE v1.1 (Résolu)74,073,067,566,962,754,474,2
CyberGym (Pass@1)84,580,084,583,376,788,1
HLE avec outils (Pass@1)63,659,862,560,051,563,9
AutomationBench (Pass@1)50,345,846,748,843,237,754,8
Agent's Last Exam (Pass@1)28,626,727,628,525,725,231,8

Le pattern est cohérent. Sur les benchmarks agents — terminal, génie logiciel, sécurité, automatisation — V4.1 Flash se place au niveau du haut du tableau, au-dessus de son propre V4 Pro, et est le seul open-weight de la colonne à dépasser les frontières fermées sur plusieurs lignes. Sur le raisonnement pur (GPQA Diamond) il est dans le cluster de la frontière mais derrière GPT-5.6 Sol, Opus-5.0 et K3. Les résultats multimodaux sont nouveaux pour la famille : sur le modèle base, DocVQA 95,6, MMMU-Pro 56,5, CVBench 77,9, RefCOCO 86,0.

La mise en garde habituelle s'applique, et nous la formulons sur chaque page de modèle : un score de classement est un point de départ, pas un verdict. Prenez vos prompts difficiles, exécutez-les, et mesurez le quotient de raisonnement — combien de tokens de réflexion le modèle brûle par réponse utile — parce que c'est ce qui figure sur la facture.

Ce que nous avons mesuré sur la gateway (2026-09-11)

Nous avons branché le modèle sur la gateway Frontière AI le jour de sa sortie et nous l'avons mesuré avec notre suite standard, plutôt que de faire confiance au rapport :

  • Surface API confirmée par appels réels : contexte de 1 048 576 tokens, entrée texte + image, outils, mode JSON, sorties structurées, et raisonnement — avec un réglage d'effort de raisonnement exposé sur l'endpoint (none / low / high / xhigh / max).
  • Appel d'outils mesuré par un appel réel : une requête avec un outil get_weather a renvoyé un tool_call valide avec des arguments JSON corrects.
  • Latence et débit (notre suite de benchmarks, exécutée le 2026-09-11) : 65 ms de temps moyen au premier token, environ 106 tokens par seconde de vitesse moyenne de génération, et 88 % de précision sur un jeu QA factuel de 25 items.
  • Comportement de raisonnement : le modèle renvoie un canal reasoning_content séparé ; les tokens de réflexion sont comptés dans completion_tokens et facturés au tarif de sortie, comme tous les modèles de raisonnement que nous servons.
  • Audit de sécurité : 12 contrôles sur 15 passent. Les trois ratés sont les artefacts documentés du canal de raisonnement — le prompt système écho dans le canal de réflexion, un marqueur injecté écho avant le refus — que nous lisons comme des faux positifs des regex du test, pas de vraies violations.

Les paramètres d'échantillonnage recommandés par le technical report : temperature 1.0, top_p 0.95 ou 1.0, et max_tokens d'au moins 256K pour ne pas couper une longue chaîne de pensée en pleine réflexion.

Prix et disponibilité

V4.1 Flash est live sur notre catalogue sous le slug deepseek-v4.1-flash, appelé avec la même requête compatible OpenAI en deux lignes que tous les autres modèles. Prix client (notre marge comprise, solde prépayé) : 0,182 € par million de tokens d'entrée, 0,728 € par million de tokens de sortie, 0,014 € par million de tokens d'entrée en cache.

ModèleLaneEntrée €/M (client)Sortie €/M (client)
DeepSeek V4.1 Flash (552B, multimodal, nouveau)Accès rapide · Modal0,182 €0,728 €
DeepSeek V4 Flash 0731 (158B, génération précédente)Souverain UE · Scaleway0,56 €1,12 €

Deux notes honnêtes. D'abord, ce sont deux modèles différents, pas un même modèle sous deux hébergements : V4.1 Flash est la nouvelle génération 552B multimodale, V4 Flash 0731 est la génération précédente 158B. Ensuite, notre base de coût pour V4.1 Flash aujourd'hui est le prix marché public du même modèle (0.15/0.60 USD par million sur sa fenêtre de base), converti au taux EUR du jour et majoré comme tout le reste du catalogue — un point de départ que nous ré-éclaircirons depuis le vrai coût de service de l'endpoint dédié une fois qu'il porte un trafic soutenu.

Deux conséquences pratiques. Parce que les tokens de raisonnement sont facturés au tarif de sortie, l'effort de raisonnement réglable (1–100) est un vrai levier de coût : effort bas pour l'extraction et le travail routinier, effort haut pour les problèmes qui méritent une longue chaîne de pensée. Et parce que l'endpoint dédié peut cold-starter après une période de calme, le premier appel d'une session peut être lent — les suivants reviennent en quelques secondes.

Souveraineté : ce que ça veut vraiment dire

Sur notre catalogue, V4.1 Flash tourne sur un endpoint Modal — une lane accès rapide, explicitement étiquetée ainsi dans l'interface et dans la réponse API (x-sovereign: false). C'est le prix à payer pour servir une release day-zero avant que les catalogues souverains ne rattrapent : vous obtenez les poids les plus récents aujourd'hui, sur une lane sous contrôle non-UE.

Les poids eux-mêmes sont MIT et ouverts, donc un déploiement UE souverain de ce modèle est techniquement ouvert — il n'existe simplement pas encore dans notre catalogue. Si la juridiction UE est une exigence dure aujourd'hui, le DeepSeek souverain du catalogue est le V4 Flash 0731 de génération précédente sur Scaleway. L'article GDPR vs CLOUD Act explique pourquoi c'est l'opérateur — pas le modèle — qui décide de la juridiction.

FAQ

Quand DeepSeek V4.1 Flash a-t-il été publié ?

Le 2026-09-10, sur Hugging Face (deepseek-ai/DeepSeek-V4.1-Flash) sous licence MIT, avec le technical report « Pushing the Limits of KV Cache Compression ». Il est live sur le catalogue Frontière AI depuis le 2026-09-11.

Quelle est la différence entre DeepSeek V4.1 Flash et DeepSeek V4 Flash ?

Ce sont des générations différentes, pas un même modèle hébergé deux fois. V4 Flash (0731) est un MoE 158B avec 13B de paramètres actifs, texte seul. V4.1 Flash est un MoE multimodal 552B avec une architecture causal encoder-décodeur, 8B de paramètres actifs au prefill et 16B au décodage, une entrée image native, et un KV cache environ quatre fois plus petit (890 octets par token). Il est très loin devant V4 Flash sur les benchmarks agents. Les deux coexistent sur le catalogue parce que V4 Flash 0731 est l'option souveraine et V4.1 Flash l'option accès rapide la plus récente.

Combien coûte DeepSeek V4.1 Flash sur l'API ?

Sur la gateway Frontière AI : 0,182 € par million de tokens d'entrée, 0,728 € par million de tokens de sortie, 0,014 € par million de tokens d'entrée en cache — prix client avec marge, solde prépayé, pas d'abonnement. Les tokens de raisonnement sont facturés au tarif de sortie. Le prix marché public du même modèle (sa fenêtre de base) est 0.15/0.60 USD par million.

DeepSeek V4.1 Flash est-il un modèle de raisonnement ?

Oui. Il streame un canal de raisonnement séparé (reasoning_content) et expose un effort de raisonnement réglable en continu, un entier de 1 à 100 (l'endpoint expose none / low / high / xhigh / max). Les tokens de réflexion sont de vrais tokens de sortie et sont facturés comme tels — donc le réglage d'effort est aussi un levier de coût.

DeepSeek V4.1 Flash peut-il traiter des images ?

Oui — il est nativement multimodal : entrée texte et image, sortie texte, avec un encoder de vision (DeepSeek-ViT) entraîné de zéro. Il est listé comme modèle multimodal dans le catalogue, avec une fenêtre de contexte d'un million de tokens partagée entre texte et images.

DeepSeek V4.1 Flash est-il conforme RGPD ou souverain UE ?

Le modèle est en poids ouverts licence MIT, mais la souveraineté est décidée par qui le sert, pas par les poids. Sur le catalogue Frontière AI, il tourne sur une lane accès rapide (un endpoint Modal sous contrôle non-UE) et est explicitement étiqueté ainsi. Aucune lane souveraine pour ce modèle n'existe encore dans le catalogue ; si la juridiction UE est exigée aujourd'hui, le DeepSeek souverain est le V4 Flash 0731 de génération précédente sur Scaleway.

Combien de paramètres a DeepSeek V4.1 Flash ?

Un backbone de 552B : un mixture-of-experts avec 384 experts routés (6 actifs par token) plus 1 expert partagé, et une mémoire conditionnelle Engram de 196B accédée de façon creuse par recherche de token. En pratique, seulement 8B de paramètres sont actifs par token pendant le prefill et 16B pendant le décodage — c'est pourquoi le prefill sur de longs prompts est beaucoup moins cher que dans un modèle de même taille.

Comment essayer DeepSeek V4.1 Flash ?

Créez un compte, rechargez à partir de 10 €, et appelez /chat/completions avec model « deepseek-v4.1-flash » — le même appel compatible OpenAI en deux lignes que tous les autres modèles de la gateway. Quelques appels de test coûtent une fraction d'euro ; le premier appel après une période de calme peut être lent pendant que l'endpoint se préchauffe.

Prêt à essayer ?

Créez un compte et appelez n'importe quel modèle du catalogue en quelques minutes.

Créer un compte