Un LLM à diffusion, c'est quoi exactement ?

Un LLM à diffusion est un modèle de langage qui génère son texte en parallèle, par raffinements successifs, au lieu de le produire un mot après l'autre. Il démarre avec une séquence entièrement masquée, des cases vides notées [MASK], puis remplit et corrige ces cases en quelques passes de calcul jusqu'à obtenir un texte cohérent. Le nom vient des modèles de diffusion qui génèrent des images : eux partent d'un bruit aléatoire et le « débruitent » progressivement jusqu'à faire apparaître une photo.

Le vocabulaire technique parle de débruitage itératif (« iterative denoising » en anglais) : chaque passe du modèle réduit le désordre de la séquence et rapproche le brouillon du texte final. L'article de référence sur le sujet, A Survey on Diffusion Language Models publié sur arXiv, décrit deux phases : une phase d'apprentissage où l'on corrompt volontairement des phrases en masquant des mots, et une phase de génération où le modèle apprend à remonter le courant.

  • Étape 1, le masquage : à l'entraînement, on cache une partie des mots d'une phrase correcte et le modèle apprend à deviner ce qui manque, en s'appuyant sur ce qui se trouve avant ET après le trou.
  • Étape 2, le débruitage : à l'usage, le modèle reçoit une séquence 100 % masquée et propose une première version complète, souvent bancale.
  • Étape 3, le raffinement : il repasse plusieurs fois sur sa propre production, garde les tokens dont il est sûr et redevine les autres, jusqu'à stabilisation.

Autorégressif contre diffusion : deux façons d'écrire une phrase

La différence tient dans une image très simple. Un modèle autorégressif, c'est-à-dire la quasi-totalité des LLM que vous utilisez aujourd'hui (GPT-5.6, Gemini 3, Claude, Mistral, Llama, Qwen, DeepSeek), écrit « a », puis « ab », puis « abc » : chaque token dépend de celui d'avant, la génération est séquentielle par construction. Un LLM à diffusion écrit « xycz », puis « aycd », puis « abcd » : la séquence entière existe dès la première passe et se corrige en bloc.

Cette différence a une conséquence majeure sur l'attention, le mécanisme par lequel un modèle décide sur quels mots se concentrer. Dans un modèle autorégressif, un token ne voit que le passé. Dans un LLM à diffusion, l'attention est bidirectionnelle : chaque token voit tous les autres, y compris ceux placés après lui. Google indique que DiffusionGemma génère 256 tokens en parallèle à chaque passe avant, et que chacun peut « regarder » les 255 autres. Si la notion de découpage du texte en unités vous échappe encore, notre article sur la façon dont les tokens LLM découpent et facturent le texte pose les bases, et celui consacré à l'architecture transformeur explique d'où vient ce mécanisme d'attention.

Concrètement, l'attention bidirectionnelle débloque des usages que l'autorégressif traite mal : compléter un trou au milieu d'un fichier de code, réécrire un paragraphe sans régénérer tout ce qui suit, ou résoudre un problème dont la fin contraint le début. Google cite d'ailleurs la résolution de grilles de Sudoku comme démonstration.

COMPRENDRE LES LLM · SEPTEMBRE 2026

La diffusion textuelle écrit 15 fois plus vite que l'autorégressif

  • 1 107 tokens/seconde revendiqués par Mercury 2.5 (test Inception)
  • 256 tokens générés en parallèle par passe (DiffusionGemma)
  • 4x accélération annoncée par Google le 10 juin 2026
  • 0,17 € le million de tokens en entrée sur l'API Mercury 2.5

Vitesse de génération, diffusion contre autorégressif

Tokens produits par seconde en sortie, septembre 2026. Chiffres constructeurs pour les modèles à diffusion, mesure indépendante Artificial Analysis pour GPT-5.6 Sol et pour la médiane du marché.

  • DiffusionGemma sur H100 1 000
  • DiffusionGemma sur RTX 5090 700
  • Médiane du marché LLM 70
  • GPT-5.6 Sol (medium) 61,9

Là où la diffusion prend l'avantage

  • Complétion de code
  • Édition en ligne
  • Agents à faible latence
  • Remplissage de trous
  • Traduction

Là où l'autorégressif reste devant

  • Raisonnement en chaîne
  • Contextes très longs
  • Réponses très courtes
  • Qualité maximale

À retenir : la diffusion textuelle ne rend pas les modèles plus intelligents, elle les rend beaucoup plus rapides sur les tâches où la vitesse fait le produit. Pour un site, cela annonce des assistants et des agents qui répondent en moins d'une seconde, donc davantage de requêtes posées aux IA, donc davantage d'occasions d'être cité ou ignoré.

Télécharger l'infographie (PNG)

Sources : Google, TestingCatalog, Artificial Analysis. Infographie Digital-m, septembre 2026. digital-m.fr

Pourquoi c'est beaucoup plus rapide, et ce que ça coûte

Un LLM à diffusion va plus vite parce qu'il produit plusieurs dizaines de tokens par passe de calcul, là où un modèle autorégressif en produit un seul. La fiche technique de DiffusionGemma annonce 15 à 20 tokens par passe avant, ce qui permet de dépasser 1 000 tokens par seconde sur un GPU NVIDIA H100 et plus de 700 tokens par seconde sur une carte grand public RTX 5090. Google parle d'une accélération allant jusqu'à 4 fois par rapport à ses propres modèles autorégressifs.

Pour situer l'ordre de grandeur, Artificial Analysis mesure 61,9 tokens par seconde en sortie pour GPT-5.6 Sol en effort moyen, et place la médiane du marché à 70 tokens par seconde. Un facteur 15 à 18 sépare donc les deux familles sur ce seul critère. Attention toutefois : les chiffres de vitesse des modèles à diffusion sont pour l'essentiel des tests maison publiés par les éditeurs, non vérifiés par un tiers indépendant, et mesurés sur du matériel choisi par eux.

Côté tarif, Inception affiche Mercury 2.5 à 0,17 € le million de tokens en entrée et 0,66 € en sortie (0,20 et 0,75 dollars, convertis au taux du 22 septembre 2026, 1 euro pour 1,1448 dollar), avec une promotion de lancement à 80 % de remise qui descend à 0,03 € et 0,13 €. L'entreprise revendique des gains clients spectaculaires : chez Augment Code, une latence réduite de 82 % (de 150 secondes à 27 secondes) et un coût divisé par dix ; chez OpenCall, une latence médiane de 170 millisecondes. Ces retours proviennent d'Inception et de ses clients, pas d'un audit externe.

Chez Digital-m, nous auditons régulièrement des assistants installés sur des sites de PME, et le constat est presque toujours le même : ce n'est pas la qualité de la réponse qui fait fuir le visiteur, c'est le temps d'attente. Un agent conversationnel qui met huit secondes à démarrer perd son utilisateur avant d'avoir répondu. C'est précisément le problème que la diffusion attaque.

DiffusionGemma, Mercury, LLaDA : où en est-on en septembre 2026 ?

Trois familles coexistent aujourd'hui : un modèle ouvert signé Google, une offre commerciale signée Inception, et une base de modèles académiques. Aucune ne domine encore le marché, mais l'écosystème est sorti du laboratoire en moins de deux ans.

DiffusionGemma, le pari open-weights de Google

Annoncé le 10 juin 2026, DiffusionGemma est présenté par Google comme le premier modèle de diffusion textuelle à poids ouverts d'envergure, publié sous licence Apache 2.0 et téléchargeable sur Hugging Face, Kaggle et Vertex AI. C'est un modèle Mixture of Experts de 26 milliards de paramètres au total dont seulement 3,8 milliards sont activés à chaque inférence, une technique que nous détaillons dans notre article sur l'architecture Mixture of Experts. Il accepte texte, image et vidéo en entrée, avec une fenêtre de contexte pouvant atteindre 256 000 tokens. Google le qualifie explicitement d'expérimental et le destine aux chercheurs et développeurs, pas aux applications de production exigeant la meilleure qualité possible. Sur les benchmarks publiés : 77,6 % sur MMLU Pro, 73,2 % sur GPQA Diamond, 69,1 % sur LiveCodeBench v6. La notion de poids ouverts et ses nuances juridiques sont détaillées dans notre dossier sur les LLM open-weights et le vrai sens du mot open source.

Mercury 2.5, la vitesse vendue comme un produit

Inception a lancé Mercury 2.5 le 9 septembre 2026, avec 1 107 tokens par seconde revendiqués, une fenêtre de contexte de 260 000 tokens et une intelligence annoncée en hausse de 40 % par rapport à Mercury 2. L'éditeur positionne la qualité du modèle au niveau de GPT-5.6 Luna en raisonnement bas, de Gemini 3.5 Flash-Lite et de Claude Haiku 4.5, sans publier le détail des benchmarks. La cible est claire : les agents, la complétion de code et la voix, c'est-à-dire tous les usages où chaque milliseconde compte.

LLaDA et Dream, les modèles venus de la recherche

LLaDA-8B et Dream-7B sont les deux références académiques les plus citées. Le premier a été entraîné intégralement en diffusion et affiche des performances comparables à celles d'un LLaMA 3 8B autorégressif ; le second a été initialisé à partir d'un modèle autorégressif existant, une astuce qui réduit fortement le coût d'entraînement. ByteDance a également publié Seed Diffusion. Ces modèles ne visent pas le grand public, mais ils prouvent que l'approche tient debout à taille égale.

Ce que la diffusion ne sait pas encore bien faire

La diffusion textuelle paie sa vitesse sur trois terrains précis : le raisonnement long, les contextes étendus et les réponses très courtes. Sur le benchmark de mathématiques AIME, DiffusionGemma obtient 69,1 % contre 88,3 % pour Gemma 4, son cousin autorégressif de génération équivalente. L'écart n'est pas anecdotique, il dit exactement où se situe le compromis.

  • Le raisonnement pas à pas : la chaîne de pensée, qui consiste à laisser le modèle dérouler son raisonnement token par token, s'accommode mal d'une génération par blocs qui se corrige elle-même. C'est un sujet de recherche ouvert.
  • Les contextes très longs : un modèle à diffusion profite difficilement du cache clé-valeur, ce mécanisme qui évite de recalculer l'attention à chaque nouveau token. Il recalcule beaucoup, donc il coûte cher quand le contexte grossit.
  • Les réponses de deux mots : la diffusion exécute toutes ses passes quelle que soit la longueur demandée. Pour répondre « oui », un modèle autorégressif reste plus économique.
  • La fraîcheur des données : la coupure d'entraînement de DiffusionGemma est fixée à janvier 2025, ce qui limite ses connaissances factuelles sans recours à une source externe.

Un point technique intéressant : la diffusion permet d'arbitrer entre qualité et vitesse à la demande. Arrêter le débruitage plus tôt donne un texte moins abouti mais disponible immédiatement. Ce curseur n'existe pas dans un modèle autorégressif, où le seul réglage comparable reste la température qui pilote le choix des mots.

Faut-il s'en servir aujourd'hui dans une PME ?

Pour la très grande majorité des entreprises, la réponse en septembre 2026 est non, sauf sur trois cas d'usage précis. La diffusion n'est pas un remplacement de ChatGPT ou de Gemini pour rédiger, analyser ou décider : elle est un accélérateur pour des briques applicatives bien identifiées.

  • L'agent vocal : un standard téléphonique automatisé où une latence supérieure à une seconde casse la conversation.
  • La complétion de code dans l'éditeur : suggestion instantanée pendant la frappe, sur des blocs courts et bien contraints.
  • La transformation de masse : traduire, reformater ou résumer plusieurs milliers de fiches produits, où le prix au million de tokens et le débit priment sur la finesse.

Le bon réflexe est de tester avant d'industrialiser. DiffusionGemma étant sous licence Apache 2.0, une PME peut l'évaluer sur son propre matériel sans engagement contractuel, et Mercury dispose d'une API compatible avec les usages courants. Notre agence GEO accompagne ce type d'arbitrage en partant d'un chiffrage réel du coût par requête plutôt que d'une promesse commerciale.

Ce que ça change pour votre visibilité dans les moteurs génératifs

Un LLM à diffusion ne change rien à la façon dont votre contenu est sélectionné, mais il change beaucoup le volume de requêtes posées aux IA. Quand une réponse coûte dix fois moins cher et arrive quinze fois plus vite, les éditeurs multiplient les appels au modèle : reformulations, sous-questions, vérifications croisées. C'est exactement le mécanisme du query fan-out, où une seule question utilisateur déclenche une dizaine de recherches en coulisses.

La conséquence est directe : plus il y a de requêtes internes, plus il y a d'occasions pour votre page d'être retenue comme source, et plus la structure de votre contenu compte. Notre étude interne montre que 44,2 % des citations de ChatGPT proviennent du premier tiers d'un article. Un moteur qui interroge davantage de sources, plus vite, avec des passes plus courtes, aura encore moins de patience pour une information enterrée en conclusion.

Trois réflexes restent valables quel que soit le type de modèle en face : placer la définition et le chiffre clé haut dans la page, écrire des paragraphes autonomes et compréhensibles hors contexte, et nommer explicitement les entités (modèles, versions, dates, entreprises). Ce sont les fondamentaux que nous transmettons dans notre formation GEO certifiée Qualiopi.

Ce qu'il faut retenir

Un LLM à diffusion génère son texte en parallèle par raffinements successifs, au lieu de l'écrire mot après mot. Cela lui donne un avantage de vitesse considérable : plus de 1 000 tokens par seconde pour DiffusionGemma sur H100, 1 107 revendiqués pour Mercury 2.5, contre une médiane de marché à 70 tokens par seconde. En échange, il perd du terrain sur le raisonnement long, les contextes étendus et les réponses très courtes, et l'écart de 19 points sur AIME entre DiffusionGemma et Gemma 4 le montre noir sur blanc.

Pour une PME, l'intérêt immédiat se concentre sur les agents vocaux, la complétion de code et les traitements de masse. Pour votre visibilité, la vraie nouvelle n'est pas l'architecture mais son effet de bord : des moteurs génératifs qui interrogent plus de sources, plus souvent, et qui récompensent encore davantage les contenus clairs, structurés et citables dès les premiers paragraphes.

Vous voulez savoir si vos pages sont réellement citables par ChatGPT, Gemini, Perplexity ou Mistral ? Demandez un audit GEO personnalisé à notre équipe : nous analysons votre contenu, vos citations existantes et les corrections à prioriser.

Et vous, avez-vous déjà testé un modèle à diffusion sur un cas concret ? Dites-le nous en commentaire !