Puces IA : pourquoi le monde en manque en 2026 ?
Douze mois. C'est le délai d'attente que certaines entreprises acceptent aujourd'hui pour recevoir un lot de puces IA, d'après les analystes interrogés par Le Monde Informatique en novembre 2025. Un an pour un composant qui tient dans une main. Pendant ce temps, le prix de la mémoire vive grimpe de 20 à 30 % par trimestre et les fabricants de PC révisent leurs tarifs. La cause est la même partout : l'intelligence artificielle absorbe désormais près de 70 % des livraisons mondiales de mémoire. Comprendre cette pénurie, c'est comprendre pourquoi votre prochain serveur, votre prochain ordinateur et même votre abonnement cloud vont coûter plus cher. Voici ce qui se joue vraiment dans les usines de Taïwan et de Corée.
- Dernière modification
25 septembre 2026 - 9 minutes de lecture
Une puce IA, c'est quoi exactement ?
Une puce IA est un processeur conçu pour effectuer, très vite et en parallèle, les milliards de multiplications de matrices dont un modèle de langage a besoin pour produire chaque mot. Là où un processeur classique (CPU) exécute quelques dizaines de calculs à la fois, un accélérateur comme le Nvidia Blackwell B200 en enchaîne des dizaines de milliers simultanément.
Trois éléments font la valeur d'une puce IA, et tous les trois sont en tension aujourd'hui. Le premier est la finesse de gravure, exprimée en nanomètres : plus le trait est fin, plus on loge de transistors sur la même surface. Le deuxième est la mémoire embarquée, dite HBM (High Bandwidth Memory, mémoire à très haut débit empilée directement à côté du calculateur). Le troisième est le packaging, c'est-à-dire l'assemblage de ces éléments sur un même support.
- La gravure : en 2025, la production mondiale de puces gravées en 7 nanomètres ou moins plafonne à 2,2 millions de plaques de silicium par mois, toutes applications confondues, selon les données compilées par LeMagIT. C'est le goulot d'étranglement principal.
- La mémoire HBM : elle est produite par trois acteurs seulement, SK Hynix, Samsung et Micron. Sa fabrication est lente et son taux de rebut élevé.
- Le packaging avancé : la technologie CoWoS de TSMC, qui colle le calculateur et sa mémoire sur un même interposeur, est aussi rare que la gravure fine elle-même.
Résultat : même si une usine décide demain de doubler sa production, il faut compter trois à quatre ans entre la décision d'investissement et la première plaque commercialisable. Une usine de semi-conducteurs coûte plusieurs dizaines de milliards d'euros et se construit à un rythme qui n'a rien à voir avec celui des annonces de modèles IA.
Pourquoi la planète manque de puces IA en 2026
La pénurie de 2026 n'est pas un accident industriel, c'est un décalage arithmétique entre une demande qui double tous les deux ans et une offre qui progresse de moins de 10 % par an. Le cabinet IDC prévoit une croissance de la production de semi-conducteurs de 8 % en 2026 et de 9 % en 2027, après un rebond de 19,8 % en 2025. En face, les ventes de GPU pour centres de données sont passées de 2,67 millions d'unités en 2022 à environ 4,9 millions en 2024, dont 2,5 millions de puces strictement dédiées à l'IA.
À cette dynamique s'ajoutent les plans d'investissement publics et privés, qui réservent d'avance des volumes colossaux. Le programme américain Stargate vise 2 millions de GPU d'ici 2029 pour un budget annoncé d'environ 440 milliards d'euros. La France a annoncé 109 milliards d'euros, soit de l'ordre d'un million de GPU d'ici 2030, et le plan européen InvestAI pèse 200 milliards d'euros. Nous avions détaillé le volet français dans notre article sur les nouveaux investissements de la France dans l'IA.
Ces engagements sont des réservations fermes. Quand un État ou un hyperscaler préempte plusieurs centaines de milliers de cartes, les acteurs plus petits reculent mécaniquement dans la file d'attente. C'est exactement ce que décrivent les analystes de Gartner et Forrester cités par Le Monde Informatique : les entreprises doivent désormais commander douze mois à l'avance ou accepter de revoir leurs projets à la baisse.
Qui rafle les puces IA, et ce que ça coûte à tout le monde
- 98 % part de Nvidia sur les GPU de centre de données
- 2,2 M plaques/mois gravées en 7 nm ou moins (2025, tous usages)
- 70 % des livraisons mondiales de mémoire absorbées par l'IA
- 12 mois de délai pour commander des GPU en 2026
Six acheteurs concentrent l'essentiel des puces Nvidia
Nombre de GPU Nvidia H100 et H200 achetés en 2024, en milliers d'unités. Estimations Omdia relayées par LeMagIT.
À retenir : six entreprises ont absorbé plus de 1,5 million de GPU Nvidia sur la seule année 2024, pendant que la production mondiale de puces fines ne progressait que de quelques pour cent. Pour une PME, la conséquence concrète n'est pas l'absence de GPU, c'est la hausse du coût de l'hébergement, du poste de travail et des abonnements IA.
Télécharger l'infographie (PNG)
GPU, TPU, NPU : les trois familles de puces IA
Toutes les puces IA ne se ressemblent pas, et la confusion des sigles coûte cher en décision d'achat. Trois familles cohabitent, avec des usages et des disponibilités très différents.
Le GPU, le couteau suisse devenu rare
Le GPU (Graphics Processing Unit) a été inventé pour le jeu vidéo avant de devenir le cheval de bataille de l'IA. Il est polyvalent : il entraîne un modèle, le fait tourner en production et sert aussi au calcul scientifique. C'est ce qui le rend indispensable, et introuvable. Nvidia contrôle plus de 98 % de ce marché dans les centres de données. AMD et Intel proposent des alternatives crédibles, mais leur écosystème logiciel reste moins mature que CUDA, la couche de programmation de Nvidia.
Le TPU et les ASIC, la réponse des géants
Le TPU (Tensor Processing Unit) de Google est un ASIC, autrement dit une puce gravée pour une tâche unique. Moins souple qu'un GPU, il est plus efficace par watt sur ce qu'il sait faire. Google, Amazon avec Trainium et Meta développent leurs propres ASIC pour échapper à la dépendance envers Nvidia. Cette course à l'efficacité énergétique rejoint un sujet que nous avons traité en détail dans notre article sur la consommation énergétique de l'IA.
Le NPU, l'IA dans votre poche
Le NPU (Neural Processing Unit) est une petite unité de calcul intégrée aux processeurs de smartphones et d'ordinateurs portables. Il ne sert pas à entraîner un modèle mais à en faire tourner un localement, sans passer par le cloud. C'est ce qui permet de faire tourner un modèle IA sur son propre PC, une option de plus en plus intéressante quand le cloud devient cher.
Comment la pénurie arrive jusqu'à votre facture
La pénurie de puces IA touche d'abord les composants que vous achetez tous les jours, bien avant les GPU eux-mêmes. Les centres de données IA absorbent près de 70 % des livraisons mondiales de mémoire, ce qui assèche le marché grand public. Le président d'ADATA, Li-Pai Chen, a alerté publiquement le 9 juillet 2026 sur une hausse attendue de 20 à 30 % sur la DRAM et de 35 à 40 % sur la mémoire NAND des SSD au troisième trimestre 2026.
Trois effets se propagent en cascade jusqu'aux petites entreprises :
- Le matériel : un poste de travail, un serveur ou un NAS acheté fin 2026 coûte sensiblement plus cher qu'un an plus tôt, à configuration identique, à cause de la mémoire et du stockage.
- L'hébergement : les fournisseurs de cloud répercutent le coût de leurs machines. Les offres avec GPU dédié sont les premières concernées, mais les instances classiques suivent.
- Les abonnements IA : les éditeurs arbitrent entre leur capacité de calcul et leurs promesses commerciales. Les files d'attente, les quotas et les suspensions d'offres deviennent des outils de gestion de la rareté.
Chez Digital-m, nous auditons régulièrement les contrats d'hébergement de nos clients PME et artisans, et nous voyons depuis le printemps 2026 des renouvellements en hausse à prestation égale. Le réflexe utile n'est pas de changer de prestataire dans l'urgence, mais de vérifier ce que vous payez réellement : beaucoup de sites vitrines tournent sur des configurations trois fois surdimensionnées par rapport à leur trafic réel.
La DDR4 est-elle vraiment plus touchée que la DDR5 ?
Oui, et c'est contre-intuitif. La DDR4, pourtant plus ancienne, subit des hausses plus violentes que la DDR5 récente, parce que les fabricants arrêtent progressivement ses lignes de production pour libérer de la capacité au profit de la mémoire HBM destinée à l'IA. Une technologie qui disparaît devient chère avant de disparaître.
Concrètement, si votre parc informatique repose sur des machines de la génération 2018 à 2022, une extension ou un remplacement de barrette coûte aujourd'hui davantage qu'un composant plus moderne. Pour une TPE, cela déplace le calcul : remplacer un poste devient parfois moins cher que le réparer. Ce type d'arbitrage mérite d'être posé noir sur blanc avant le prochain budget informatique.
Les parades réalistes pour une PME
Aucune PME ne va acheter de GPU, mais toutes peuvent réduire leur exposition à la hausse des coûts IA. Les analystes cités par Le Monde Informatique donnent quatre pistes, transposables à une petite structure.
- Choisir des modèles plus petits : un modèle compact bien choisi répond à 90 % des besoins bureautiques d'une PME. Les techniques de quantization des LLM permettent de faire tourner un modèle utile sur du matériel modeste.
- Diversifier les fournisseurs : ne pas dépendre d'un seul éditeur d'IA ni d'un seul hébergeur. Les écarts de tarif entre plateformes dépassent parfois un facteur dix pour une qualité comparable.
- Anticiper les renouvellements : planifier les achats matériels douze à dix-huit mois à l'avance plutôt que dans l'urgence d'une panne.
- Mesurer avant d'acheter : suivre l'usage réel de vos outils IA pendant un trimestre avant de souscrire une offre supérieure.
C'est typiquement le genre d'arbitrage que nous abordons dans nos formations certifiées Qualiopi : choisir le bon outil IA pour le bon usage coûte souvent moins cher que d'empiler des abonnements.
Quand la tension va-t-elle retomber ?
Aucune des sources consultées ne table sur un retour à la normale avant 2028. Samsung et SK Hynix ont annoncé de nouvelles usines, mais leur effet sur les volumes disponibles n'est pas attendu avant cette date. Du côté de la gravure fine, TSMC monte en puissance sur le 2 nanomètres dans sa Fab 20 de Hsinchu, avec une capacité de 120 000 à 130 000 plaques par mois, quand sa Fab 18 de Tainan stagne à 100 000 plaques mensuelles depuis 2021.
L'écart entre l'offre et la demande reste large sur la période 2024-2029 : la demande cumulée de GPU est estimée entre 15 et 24 millions d'unités, pour une offre projetée par IDC autour de 14,7 millions. Même dans l'hypothèse la plus favorable, la production ne rattrape pas le bas de la fourchette de la demande.
Une précision d'honnêteté : ces projections sont des estimations de cabinets, pas des faits acquis. Elles reposent sur des hypothèses de croissance comprises entre 14 % et 31 % par an qui peuvent être démenties par un ralentissement des investissements ou par une rupture technologique. À la date de publication de cet article, aucun élément public ne permet d'affirmer que la tension se résorbera plus tôt.
Ce qu'il faut retenir
La pénurie de puces IA de 2026 tient à trois verrous physiques : la gravure fine, la mémoire HBM et le packaging avancé. Aucun ne se desserre en moins de trois ans. Six acheteurs seulement ont absorbé plus de 1,5 million de GPU Nvidia en 2024, et les plans publics réservent des millions d'unités supplémentaires jusqu'en 2030. Pour une PME, l'effet visible n'est pas l'absence de matériel mais la hausse du prix de la RAM (20 à 30 % au troisième trimestre 2026), des SSD (35 à 40 %) et de l'hébergement.
Les leviers existent et ils sont tous du côté de la sobriété : modèles plus petits, quantization, diversification des fournisseurs, anticipation des achats. Vous vous demandez si votre infrastructure et vos abonnements IA sont dimensionnés correctement ? Demandez-nous un audit : nous regardons votre hébergement, vos outils et vos usages réels, et nous vous disons où vous payez pour du vide.
Et vous, avez-vous constaté une hausse sur votre facture d'hébergement ou sur vos achats de matériel cette année ? Dites-le nous en commentaire !Sources et références
- LeMagIT - Puces pour l'IA : la production menace de ne pas suivre la demande
- Le Monde Informatique - Pénurie de GPU Nvidia : réduisez vos projets IA ou cherchez ailleurs (25 novembre 2025)
- Génération-NT - Les prix de la RAM et des SSD vont encore violemment augmenter à cause de l'IA (9 juillet 2026)
- Hardware Cooking - La pénurie de GPU s'aggrave : l'IA détourne AMD et NVIDIA du marché gaming
- IDC - Prévisions de croissance de la production de semi-conducteurs 2025-2028, citées par LeMagIT
Questions fréquentes sur la pénurie de puces IA
Quelle est la différence entre un GPU et un NPU ?
Un GPU est un processeur graphique puissant et polyvalent, installé dans les serveurs, capable aussi bien d'entraîner un modèle IA que de le faire tourner. Un NPU est une petite unité de calcul intégrée à un smartphone ou à un ordinateur portable, qui sert uniquement à exécuter localement des modèles déjà entraînés. Le GPU est rare et cher, le NPU est présent dans la quasi-totalité des appareils récents.
Pourquoi le prix de la RAM augmente-t-il à cause de l'IA ?
Les centres de données IA absorbent près de 70 % des livraisons mondiales de mémoire, selon l'alerte lancée par le président d'ADATA en juillet 2026. Les fabricants réorientent leurs lignes vers la mémoire HBM destinée aux accélérateurs, ce qui réduit l'offre de DRAM et de NAND grand public. La hausse attendue au troisième trimestre 2026 est de 20 à 30 % sur la RAM et de 35 à 40 % sur les SSD.
Nvidia est-il vraiment en situation de monopole ?
Nvidia dépasse 98 % de part de marché sur les GPU de centre de données, une position dominante qui tient autant au matériel qu'à CUDA, sa couche logicielle adoptée par la quasi-totalité des développeurs IA. AMD, Intel et les ASIC maison de Google, Amazon et Meta grignotent des parts, mais aucun n'a encore atteint la maturité logicielle de l'écosystème Nvidia.
Une petite entreprise doit-elle reporter ses projets IA ?
Non. La pénurie touche l'achat de matériel de calcul, pas l'usage d'outils IA en ligne, qui reste largement accessible. Le bon réflexe est de dimensionner l'usage : choisir des modèles compacts, comparer les tarifs entre plateformes et mesurer la consommation réelle avant de souscrire une offre supérieure. Reporter un projet IA pour cause de pénurie de puces reviendrait à confondre la contrainte des fabricants avec la vôtre.
Quand les prix des composants vont-ils redescendre ?
Aucune source publique ne table sur une détente avant 2028. Samsung et SK Hynix ont annoncé de nouvelles capacités de production, mais leur effet sur les volumes n'est pas attendu avant cette échéance. Ces projections restent des estimations de cabinets d'analyse et peuvent évoluer si les investissements dans l'IA ralentissent.