Le constat chiffré : l'indice des prix ne bouge plus

L'indice des prix des tokens des modèles frontier (les modèles de tout premier plan) s'établit à 16 points en septembre 2026, contre une base 100 en mars 2023. La baisse cumulée atteint donc 84 % en trois ans et demi. Mais sur le dernier mois, la variation est de 0 %. C'est la première fois depuis le lancement de GPT-4 que l'indice reste totalement plat sur une période mensuelle.

Le prix médian d'un modèle phare s'établit à 5,18 euros par million de tokens en tarif mixte entrée-sortie, soit 6 dollars convertis au cours du 2 septembre 2026 (1 euro pour 1,1587 dollar). Les mouvements récents vont d'ailleurs dans les deux sens.

  • À la hausse : Claude Sonnet 5 est passé de 3,45 à 5,18 euros par million de tokens en tarif mixte, soit une progression de 50 %.
  • À l'entrée de gamme haute : Claude Fable 5.1, arrivé en septembre 2026, se positionne à 17,26 euros par million de tokens en tarif mixte.
  • À la baisse : le modèle o3 d'OpenAI a vu son tarif de sortie chuter de 34,52 à 6,90 euros par million de tokens en juillet 2026, soit une réduction de 80 %.

Autrement dit, les remises spectaculaires existent encore, mais elles portent désormais sur des modèles en fin de cycle, pas sur les nouveautés. Nous avions anticipé ce basculement dans notre analyse du marché des LLM en 2026 et de ses équilibres économiques.

Huit remises expirent d'ici janvier 2027

C'est l'information la plus concrète de cette rentrée : huit tarifs promotionnels arrivent à échéance à des dates publiées, entre le 7 septembre 2026 et le 1er janvier 2027. Certains multiplient la facture par deux, un par dix. Tous les montants ci-dessous sont convertis en euros au cours du 2 septembre 2026.

DateModèleTarif actuel (entrée / sortie par million)Nouveau tarifFacteur
7 septembre 2026Doubao-Seedance 2.0 mini40 % du tarif catalogueTarif cataloguex 2,5
7 septembre 2026Doubao-Seedance 2.0 fast75 % du tarif catalogueTarif cataloguex 1,33
9 septembre 2026GLM-5.3-Flash0,065 € / 0,22 €0,13 € / 0,43 €x 2
10 septembre 2026Solar Pro 40,026 € / 0,10 €0,26 € / 1,04 €x 10
17 septembre 2026Doubao-Seedance 2.572 % du tarif catalogueTarif cataloguex 1,39
23 septembre 2026Wan 3.00,12 € la seconde0,17 € la secondex 1,43
25 septembre 2026Ling 3.0 Flash FinGratuit0,05 € / 0,16 €fin de la gratuité
1er janvier 2027Gemini 3.6 et 3.7 Flash0,65 € / 3,24 €1,29 € / 6,47 €x 2

Le détail qui compte : la moitié de ces hausses concerne des modèles vidéo que presque personne ne suit dans les tableaux de bord. Et l'échéance la plus lourde est aussi la moins commentée. Le doublement des tarifs Gemini Flash au 1er janvier 2027 représente à lui seul 92,6 % de l'impact financier total de ces huit expirations, très loin devant celle de GLM-5.3-Flash qui a pourtant capté l'essentiel de l'attention.

ACTUALITÉ IA / LLM · SEPTEMBRE 2026

Le calendrier des hausses de prix des IA

  • 16 points d'indice des prix des modèles frontier, base 100 en mars 2023
  • 0 % d'évolution de cet indice sur un mois, en septembre 2026
  • 8 remises datées expirent entre le 7 septembre 2026 et le 1er janvier 2027

Par combien la facture est multipliée à l'expiration de la remise

Facteur de hausse programmé, par modèle et par date publiée. Le doublement Gemini Flash du 1er janvier 2027 concentre à lui seul 92,6 % de l'impact financier total. Source : TokenCost, septembre 2026.

  • Solar Pro 4, 10 sept. x 10
  • Doubao-Seedance 2.0 mini, 7 sept. x 2,5
  • GLM-5.3-Flash, 9 sept. x 2
  • Wan 3.0, 23 sept. x 1,43

Ce qui augmente

  • Solar Pro 4
  • GLM-5.3-Flash
  • Gemini 3.6 et 3.7 Flash
  • Doubao-Seedance
  • Wan 3.0
  • Ling 3.0 Flash Fin

Ce qui baisse ou reste stable

  • o3, sortie -80 % en juillet
  • Lecture de cache Claude
  • Cache Muse Spark à 0,13 €
  • Prix affiché Gemini 3.8 Flash

Télécharger l'infographie (PNG)

Sources : TokenCost, BenchLM. Infographie Digital-m, septembre 2026. digital-m.fr

Gemini 3.8 Flash : même tarif affiché, facture plus lourde

Le cas est exemplaire de la nouvelle mécanique. Sorti le 2 septembre 2026, Gemini 3.8 Flash est facturé 0,65 euro par million de tokens en entrée et 3,24 euros en sortie, exactement le tarif de la génération précédente. Ce tarif d'introduction court jusqu'au 31 décembre 2026, puis double le 1er janvier 2027 pour passer à 1,29 euro et 6,47 euros.

Mais le prix au token n'est qu'une moitié de l'équation. Selon les mesures indépendantes d'Artificial Analysis, le modèle obtient 59 points sur leur indice d'intelligence en mode raisonnement élevé, soit trois points de plus que Gemini 3.7 Flash, au prix d'environ 30 % de tokens de sortie supplémentaires par tâche. Résultat : le coût réel par tâche grimpe d'environ 40 %, alors que rien n'a bougé sur la grille tarifaire.

Google, de son côté, annonce 54,9 % sur le benchmark HLE-Verified. Ce chiffre provient d'un test réalisé par l'éditeur lui-même et n'a pas été vérifié par un tiers indépendant, contrairement aux mesures d'Artificial Analysis. La distinction mérite d'être faite systématiquement quand on compare des modèles.

Ce phénomène a un nom simple : un modèle qui raisonne davantage consomme davantage. Pour comprendre pourquoi la longueur de contexte et le volume de tokens générés pèsent autant sur la facture, notre article sur le contexte dans les LLM et son importance en 2026 pose les bases.

La bataille se joue désormais sur le cache

Puisque le prix au token ne bouge plus, les éditeurs déplacent la concurrence ailleurs : sur le coût de relecture du contexte déjà envoyé. Le cache permet de ne pas repayer plein tarif pour un long document ou un historique de conversation transmis à chaque requête. C'est devenu le principal levier d'optimisation.

  • Anthropic : Claude Fable 5.1 et Mythos 5.1, sortis le 1er septembre 2026, conservent un tarif de 8,63 euros en entrée et 43,15 euros en sortie par million de tokens, mais réduisent le coût de lecture du cache.
  • Meta : Muse Spark 1.3, sorti le 2 septembre 2026, affiche 1,08 euro en entrée et 3,67 euros en sortie, avec un tarif de cache à 0,13 euro par million de tokens.
  • OpenAI : le tarif promotionnel de GPT-5.6 Sol est garanti « au moins jusqu'au 21 novembre » 2026, sans date d'expiration publiée ni tarif de remplacement annoncé.

Pour une entreprise qui envoie systématiquement le même corpus de référence (catalogue produit, base de connaissance, conditions générales), la différence entre un fournisseur qui facture le cache 10 % du tarif d'entrée et un autre qui le facture 50 % pèse plus lourd que trois centimes d'écart sur le prix affiché. C'est le premier calcul à refaire.

Ce que les sorties du 1er et 2 septembre disent du marché

Trois lancements en quarante-huit heures, et aucune guerre des prix. Anthropic sort Claude Fable 5.1 et Mythos 5.1 le 1er septembre, Google publie Gemini 3.8 Flash et sa variante Cyber le 2, Meta livre Muse Spark 1.3 le même jour. Aucun de ces modèles n'arrive avec un tarif cassé.

  • Segmentation par l'accès : Gemini 3.8 Flash Cyber n'est ouvert qu'aux gouvernements et aux opérateurs d'infrastructures critiques, via un programme d'accès contrôlé. Mythos 5.1 exige de passer par les programmes de vérification d'Anthropic.
  • Segmentation par le prix : de 1,08 euro pour Muse Spark 1.3 à 8,63 euros pour Claude Fable 5.1 en entrée, l'écart entre gammes se creuse au lieu de se resserrer.
  • Segmentation par la durée : les tarifs d'introduction avec date de fin publiée se généralisent, ce qui transforme un prix en engagement temporaire.

Ce durcissement s'inscrit dans un contexte d'investissements massifs que nous avions détaillé dans notre point sur la course aux milliards du mois d'août 2026. Quand les capitaux se raréfient ou exigent un retour, les prix d'appel deviennent moins tenables.

Pourquoi la baisse s'est arrêtée : trois explications

La compression tarifaire de 2023 à 2025 reposait sur trois moteurs qui s'essoufflent tous en même temps. Aucune de ces explications n'est officielle : ce sont des lectures de marché, à prendre comme telles.

  • Les gains d'efficacité arrivent à maturité : la quantization, la distillation et les architectures Mixture of Experts ont déjà donné l'essentiel de ce qu'elles pouvaient donner sur le coût d'inférence.
  • Le coût du calcul ne baisse plus assez vite : la demande en cartes accélératrices reste supérieure à l'offre, et l'énergie nécessaire aux centres de données pèse de plus en plus lourd dans l'équation.
  • La phase de conquête se termine : les prix d'appel servaient à capter des développeurs. Une fois les intégrations en place, le coût de changement de fournisseur devient un levier de marge.

Il reste un contre-feu puissant : les modèles à poids ouverts, de Mistral en Europe à Qwen, DeepSeek et GLM en Chine, souvent dix à cinquante fois moins chers, qui empêchent les tarifs haut de gamme de dériver librement. La comparaison avec Gemini 3.7 Flash et son positionnement tarifaire montre bien que la pression concurrentielle n'a pas disparu, elle a changé de terrain.

Ce que vous devez vérifier dans votre budget IA cette semaine

Trois vérifications suffisent, et elles prennent moins d'une heure. La première est la plus urgente : listez les modèles que vos outils appellent réellement et confrontez-les au calendrier d'expiration ci-dessus.

  • Repérez vos dates d'expiration : si un de vos modèles figure dans le tableau, vous connaissez la date exacte à laquelle votre facture change, et de combien.
  • Mesurez le coût par tâche, pas le coût par token : c'est la leçon Gemini 3.8 Flash. Un modèle plus intelligent qui écrit plus long peut coûter plus cher à prix affiché identique.
  • Activez le cache : si vous renvoyez le même contexte à chaque appel, c'est le poste d'économie le plus immédiat, souvent sans aucune modification de votre code métier.
  • Gardez une porte de sortie : une couche d'abstraction qui vous permet de changer de modèle en une ligne de configuration vaut cher le jour où un fournisseur double ses tarifs.

Chez Digital-m, nous avons pris l'habitude de dater chaque tarif dans les recommandations que nous remettons à nos clients, précisément parce qu'un prix d'API n'est plus une donnée stable mais une donnée périssable. C'est un réflexe simple qui évite de bâtir un modèle économique sur une promotion.

Ce qu'il faut retenir

Le prix des LLM a cessé de baisser en septembre 2026 : l'indice des modèles frontier stagne à 16 points, soit 0 % d'évolution mensuelle, après une chute de 84 % depuis mars 2023. Huit remises datées expirent entre le 7 septembre 2026 et le 1er janvier 2027, dont le doublement des tarifs Gemini Flash au 1er janvier 2027, qui concentre 92,6 % de l'impact financier. La concurrence se déplace du prix au token vers le coût du cache et la durée des tarifs d'introduction.

La conséquence pratique est simple : un budget IA établi sur les tarifs de juin 2026 est déjà faux. Le bon réflexe est de raisonner en coût par tâche, de dater chaque tarif dans vos calculs et de vérifier votre exposition aux échéances de septembre. Vous voulez un état des lieux de votre consommation IA et des économies atteignables sans perte de qualité ? Demandez-nous un audit, ou faites monter vos équipes en compétence avec notre accompagnement GEO sur mesure.

Votre budget IA a-t-il augmenté cette année sans que vos usages changent ? Dites-le nous en commentaire !