Qwen3.8-Flash-Next, qu'est-ce que c'est exactement ?

Qwen3.8-Flash-Next est un modèle de langage ouvert publié le 26 août 2026 par l'équipe Qwen d'Alibaba Cloud, présenté comme un avant-goût de l'architecture Qwen4. Ses poids (les paramètres du modèle, téléchargeables et exécutables sur votre propre matériel) sont disponibles sur Hugging Face et ModelScope. C'est donc un modèle que vous pouvez héberger, pas seulement interroger.

La fiche technique tient en quelques chiffres, et ce sont eux qui expliquent l'intérêt de la sortie.

  • Taille réelle : 180 milliards de paramètres sur disque, répartis entre un modèle principal de 125 milliards, une table de n-grammes de 51 milliards et un module de prédiction multi-tokens de 4 milliards.
  • Paramètres activés : 6 milliards seulement à chaque token produit, soit environ 3 % du total.
  • Contexte : 262 144 tokens en natif, extensible jusqu'à 1 000 000 de tokens via la technique YaRN, qui étire la fenêtre de contexte d'un modèle sans le réentraîner de zéro.
  • Prix API : 0,14 € le million de tokens en entrée et 0,40 € en sortie sur QwenCloud.
  • Coût d'entraînement : environ un neuvième de celui de Qwen3.7-Plus, d'après Alibaba.
  • Licence : qwen-community-1.0, et non Apache 2.0, ce qui impose de lire les conditions avant tout usage commercial.

Le modèle est multimodal, c'est-à-dire qu'il traite le texte, l'image et la vidéo dans le même réseau. Bloomberg a présenté cette sortie comme la réponse d'Alibaba aux modèles compacts de DeepSeek et d'Anthropic, sur un segment où la bataille ne se joue plus sur la puissance brute mais sur le rapport entre qualité et coût.

180 milliards de paramètres, 6 activés : comment est-ce possible ?

Qwen3.8-Flash-Next n'active qu'une fraction de son réseau à chaque token grâce à une architecture mixture of experts (MoE) à 512 experts, dont 10 experts routés et 1 expert partagé sont sollicités par token. Un « expert » est ici un sous-réseau spécialisé : le modèle choisit lesquels réveiller selon le contenu à traiter, et laisse les autres au repos. C'est ce mécanisme, que nous détaillons dans notre article sur l'architecture Mixture of Experts, qui permet de stocker un très gros modèle tout en payant le prix de calcul d'un petit.

Alibaba y ajoute une couche d'attention hybride. Trois couches sur quatre utilisent Gated DeltaNet, une attention dite linéaire qui conserve un état récurrent au lieu de comparer chaque mot à tous les autres. La quatrième utilise Qwen Sparse Attention, une attention « creuse » qui limite volontairement le nombre de blocs consultés, avec un budget de 512 blocs ou 2 048 tokens.

Le gain annoncé porte surtout sur les longs documents. Sur un contexte d'un million de tokens, Alibaba revendique jusqu'à 7,6 fois plus de vitesse en prefill (la phase où le modèle lit votre requête) et 4,9 fois en decode (la phase où il écrit sa réponse). Avec un cache de préfixe rempli à 90 %, le débit de lecture atteindrait 8,6 fois celui de Qwen3.7-Plus.

Ces chiffres sont ceux de l'éditeur. Ils n'ont pas été reproduits par un laboratoire tiers indépendant à la date de publication de cet article, et c'est un réflexe à garder pour toutes les annonces de ce type, quel que soit l'éditeur.

ACTUALITÉ IA/LLM · SEPTEMBRE 2026

Qwen3.8-Flash-Next en chiffres : un très gros modèle qui coûte comme un petit

  • 180 Md paramètres stockés sur disque
  • 6 Md paramètres activés par token
  • 262 144 tokens de contexte natif
  • 0,14 € le million de tokens en entrée

Des scores de code et d'agent au niveau des modèles propriétaires

Scores annoncés par Alibaba le 26 août 2026, sur 100. Test maison, non reproduit par un tiers indépendant. Barres proportionnelles à la valeur la plus élevée.

  • LiveCodeBench v6 91,9
  • SWE-bench Multilingual 81,0
  • CoWorkBench 73,9
  • DeepSWE 1.1 58,7
  • JobBench 55,7

Ce qui est réellement ouvert

  • Poids sur Hugging Face
  • Poids sur ModelScope
  • Servi par vLLM et SGLang
  • Checkpoint FP8 de 172,78 Gio

Ce qui reste à vérifier

  • Licence qwen-community-1.0
  • Pas de licence Apache 2.0
  • Benchmarks non reproduits
  • 335,28 Gio en BF16

À retenir : Qwen3.8-Flash-Next occupe la place d'un modèle massif sur le disque mais coûte à l'usage comme un petit modèle, ce qui rapproche l'automatisation par IA du budget d'une TPE. Pour votre visibilité, plus l'inférence est bon marché, plus les moteurs génératifs multiplient les réponses citant des sources, donc plus votre contenu a d'occasions d'être repris.

Sources : MarkTechPost, DataCamp. Infographie Digital-m, septembre 2026. digital-m.fr

Combien coûte Qwen3.8-Flash-Next en euros ?

Qwen3.8-Flash-Next est facturé 0,16 $ le million de tokens en entrée et 0,47 $ en sortie, soit 0,14 € et 0,40 € au taux de référence de la Banque centrale européenne du 28 août 2026 (1 € = 1,1643 $). Rappelons qu'un token correspond à peu près à trois quarts de mot en français : le sujet est détaillé dans notre article sur la façon dont les LLM découpent et facturent le texte.

Le contraste avec le modèle haut de gamme du même éditeur est l'information la plus parlante de cette sortie.

ModèleEntrée (1 M de tokens)Sortie (1 M de tokens)Licence
Qwen3.8-Flash-Next0,14 €0,40 €qwen-community-1.0
GLM-5.3-Flash0,13 € (0,03 € en cache)0,43 €MIT
Qwen3.8-Max1,72 €5,15 €propriétaire

Le rapport est de 1 à 12 en entrée entre Qwen3.8-Flash-Next et Qwen3.8-Max. Concrètement, une PME qui pousse 10 millions de tokens par mois dans un assistant interne, soit environ 7,5 millions de mots, paie 1,40 € d'entrée avec le modèle Flash contre 17,20 € avec le modèle Max. À ce niveau de prix, ce n'est plus le coût du modèle qui décide d'un projet, c'est le temps humain passé à le brancher correctement.

Chez Digital-m, nous auditons régulièrement des automatisations facturées au modèle le plus cher du catalogue alors que 80 % des requêtes traitées (résumés, reformulations, classement de messages) tournent parfaitement sur un modèle Flash. Le premier gain n'est presque jamais technique, il est dans le routage des requêtes vers le bon modèle.

Le même jour, Z.ai publiait GLM-5.3-Flash

Le 26 août 2026, Z.ai a publié GLM-5.3-Flash, un modèle multimodal de 320 milliards de paramètres dont 18 milliards sont activés par token, avec une fenêtre de 1 048 576 tokens et une licence MIT. La coïncidence de calendrier n'est probablement pas un hasard : les deux laboratoires visent le même segment, celui des modèles ouverts assez bons pour le travail quotidien et assez peu chers pour tourner en continu.

GLM-5.3-Flash compte 45 couches et 288 experts, dont 8 activés par token. Z.ai y introduit IndexPool, un mécanisme de compression des vecteurs clés qui divise par environ 3 le calcul d'attention et réduit de 4,4 fois la taille du cache mémoire par rapport à GLM-5.3. Sur Terminal-Bench 2.1, l'éditeur annonce 84,3, à comparer aux 85,0 revendiqués pour Claude Opus 4.8 et aux 87,4 de GPT-5.6 Terra. Là encore, ce sont des scores maison. Ceux qui ont suivi la sortie de GLM-5.2 retrouveront la même logique d'itérations rapprochées.

Deux stratégies de licence très différentes

La licence est le point où les deux modèles divergent le plus. GLM-5.3-Flash sort sous MIT, l'une des licences les plus permissives qui soient : usage commercial, modification et redistribution sont autorisés sans contrepartie notable. Qwen3.8-Flash-Next sort sous qwen-community-1.0, une licence maison qui impose ses propres conditions.

Cette nuance n'est pas cosmétique. « Open weight » signifie que les poids sont téléchargeables, pas que le modèle est libre au sens juridique, et encore moins que les données d'entraînement sont publiques. Nous avons consacré un article entier à ce que veut vraiment dire open source pour un LLM, et c'est une lecture utile avant d'engager un projet.

Une vague de modèles compacts en août 2026

Ces deux sorties ne sont pas isolées. Le mois d'août 2026 a vu se succéder Gemini 3.7 Flash chez Google le 13 août, Qwen3.8 27B et GLM-5.3 le 14 août, GLM-5.2 Turbo le 17 août, puis DeepSeek V4 Flash Vision Exp le 21 août, avant les deux annonces du 26. Après Kimi K3 et sa course au plus gros modèle ouvert, la tendance de l'été s'est nettement inversée : on ne cherche plus à impressionner par la taille, on cherche à réduire le coût par requête. Le positionnement de Gemini 3.7 Flash sur le code à prix réduit répondait déjà à cette logique.

Faut-il croire les benchmarks annoncés ?

Tous les scores publiés le 26 août 2026 pour Qwen3.8-Flash-Next et GLM-5.3-Flash sont des résultats communiqués par les éditeurs eux-mêmes, non reproduits par un laboratoire indépendant. C'est une limite structurelle du secteur, pas un procès d'intention : chaque éditeur choisit ses tests, sa configuration et parfois sa méthode de comptage.

Deux détails méritent d'être notés, parce qu'ils vont dans l'autre sens et rendent l'annonce plus crédible. Sur Humanity's Last Exam, Claude Opus 4.6 Max reste devant avec 40,0 contre 35,9 pour Qwen3.8-Flash-Next. Sur NL2Repo-Bench, DeepSeek-V4-Flash-0731 devance également le modèle d'Alibaba, 54,2 contre 48,1. Un éditeur qui publie ses défaites en même temps que ses victoires envoie un signal plutôt sain.

La bonne méthode reste la même depuis trois ans : constituez votre propre jeu de tests, avec vos vraies requêtes métier, et mesurez. Un modèle qui écrase les classements publics peut se révéler médiocre sur votre terminologie sectorielle, vos formats de documents ou votre langue de travail.

Ce que ça change pour une PME française

Pour une PME, l'intérêt de Qwen3.8-Flash-Next n'est pas de remplacer ChatGPT ou Gemini au quotidien, mais de rendre rentables des automatisations qui ne l'étaient pas. Traitement de milliers de fiches produits, classement de demandes entrantes, extraction de données dans des PDF, génération de premiers jets : ces usages consomment énormément de tokens et supportaient mal les tarifs des modèles haut de gamme.

L'auto-hébergement, en revanche, reste réservé à ceux qui ont l'infrastructure. Le checkpoint FP8 pèse 172,78 Gio et la version BF16 monte à 335,28 Gio, avant même le cache mémoire nécessaire au contexte long. Autrement dit, ces modèles « ouverts » ne tournent pas sur un poste de travail : dans la pratique, la grande majorité des entreprises y accédera via une API.

La question de la souveraineté se pose alors immédiatement, et elle est légitime. Sur ce terrain, Mistral AI a annoncé le 11 août 2026 des points d'inférence régionaux permettant de choisir l'exécution en Europe plutôt qu'aux États-Unis, un palier de service avec engagement de disponibilité, et un programme d'European Compute Units visant jusqu'à 1 GW de capacité d'ici 2030. Pour un dossier soumis à des exigences de localisation des données, le prix affiché par un modèle chinois n'est pas le seul critère de décision.

  • Volume élevé, enjeu faible : un modèle Flash ouvert suffit largement, et divise la facture par cinq à dix.
  • Données sensibles ou réglementées : privilégiez un hébergement européen et vérifiez la localisation contractuelle de l'inférence.
  • Tâches critiques et raisonnement long : gardez un modèle haut de gamme, en le réservant aux requêtes qui le justifient.
  • Dans tous les cas : mesurez le coût réel par requête avant et après, pas le prix affiché au million de tokens.

Pourquoi cette actualité compte pour votre visibilité

Chaque baisse du coût d'inférence augmente mécaniquement le nombre de réponses générées par les IA, donc le nombre d'occasions où votre site peut être cité ou ignoré. Quand une requête coûte dix fois moins cher à traiter, les moteurs génératifs peuvent se permettre d'interroger plus de sources, de reformuler davantage et de multiplier les réponses enrichies.

Cette mécanique déplace le centre de gravité du référencement. Être bien positionné sur une page de résultats ne suffit plus : il faut être structuré de façon à être repris dans une réponse. Notre étude sur les citations de ChatGPT montre que 44,2 % d'entre elles proviennent du premier tiers des articles, ce qui impose de placer les définitions, les chiffres et les réponses directes tout en haut, pas dans la conclusion.

L'arrivée de modèles ouverts performants ajoute une dimension supplémentaire. Des entreprises vont brancher ces modèles sur leurs propres assistants internes et sur des outils de recherche maison, avec des sources qu'elles choisissent. Autant y figurer. C'est exactement le travail que nous menons dans nos missions d'accompagnement GEO, et que nous transmettons dans notre formation GEO certifiée Qualiopi.

Ce qu'il faut retenir

Le 26 août 2026 restera comme une date de bascule discrète mais réelle. Qwen3.8-Flash-Next stocke 180 milliards de paramètres et n'en active que 6 milliards par token, pour 0,14 € le million de tokens en entrée. GLM-5.3-Flash propose 320 milliards de paramètres, 18 milliards actifs, un million de tokens de contexte et une licence MIT pour 0,13 €. Les benchmarks sont ceux des éditeurs et méritent d'être vérifiés sur vos propres cas. La licence de Qwen n'est pas Apache 2.0 et demande une lecture attentive avant tout usage commercial. Et l'auto-hébergement reste hors de portée sans infrastructure sérieuse.

Pour une entreprise, la question utile n'est pas « quel est le meilleur modèle », mais « quelle requête envoyer à quel modèle, à quel prix, et hébergée où ». C'est un arbitrage à faire une fois, puis à réviser tous les trimestres tant le rythme des sorties s'accélère. Vous voulez y voir clair sur votre stack IA et sur votre visibilité dans les réponses génératives ? Demandez un audit GEO à Digital-m et repartez avec un plan d'action chiffré plutôt qu'une liste de modèles à tester.

Et vous, avez-vous déjà comparé le coût réel de vos automatisations IA entre un modèle Flash et un modèle haut de gamme ? Dites-le nous en commentaire !