IA en local : faire tourner un modèle sur son PC en 2026
24 gigaoctets de mémoire. C'est le ticket d'entrée que Perplexity a fixé le 1er septembre 2026 pour faire tourner une partie de son assistant directement sur un Mac, sans passer par le cloud. Le chiffre dit beaucoup : l'IA en local n'est plus un bricolage de passionnés, elle devient une fonctionnalité vendue par les grands acteurs. Un modèle de 7 à 8 milliards de paramètres tient aujourd'hui dans 8 Go de mémoire vidéo et répond plus vite qu'un humain ne lit. Pour une PME qui manipule des données clients, des devis ou des dossiers RH, la question n'est plus « est-ce possible » mais « qu'est-ce que je fais tourner chez moi, et qu'est-ce que je laisse au cloud ». Voici comment trancher.
- Dernière modification
5 septembre 2026 - 10 minutes de lecture
Faire tourner une IA en local, ça veut dire quoi exactement ?
Faire tourner une IA en local, c'est exécuter le modèle sur votre propre machine, ordinateur ou serveur, au lieu d'envoyer vos requêtes vers les serveurs d'OpenAI, de Google ou de Mistral. Aucune donnée ne sort du réseau. Le modèle est un fichier que vous téléchargez une fois, puis qui fonctionne même sans connexion internet.
Concrètement, vous installez un logiciel (Ollama, LM Studio ou Jan), vous téléchargez un modèle en poids ouverts comme Gemma 4, Qwen 3.6, Mistral ou Llama, et vous discutez avec lui dans une interface qui ressemble à ChatGPT. La différence tient en une phrase : la question de savoir où partent vos données ne se pose plus, puisqu'elles ne partent nulle part.
- Ce que vous gagnez : confidentialité totale, coût marginal nul par requête, fonctionnement hors ligne, aucune limite d'usage imposée par un abonnement.
- Ce que vous perdez : l'accès au web en temps réel, une partie de la finesse de raisonnement, et le confort d'une infrastructure entretenue par quelqu'un d'autre.
- Ce que ça coûte : un investissement matériel unique, de quelques centaines à quelques milliers d'euros, contre un abonnement mensuel qui court indéfiniment.
Cette possibilité existe uniquement grâce aux modèles à poids ouverts publiés par Google, Alibaba, Mistral AI, Meta ou DeepSeek. Nous avons détaillé ce que recouvre vraiment cette notion dans notre article sur les LLM open-weights et le vrai sens du mot « open source ».
De quel matériel avez-vous vraiment besoin ?
La règle est simple et tient en un mot : la mémoire. La VRAM (la mémoire de la carte graphique) ou la mémoire unifiée sur un Mac Apple Silicon détermine à elle seule la taille du modèle que vous pouvez charger. Un modèle de 70 milliards de paramètres en précision complète réclame environ 140 Go de mémoire, ce qui le met hors de portée d'une machine grand public. Compressé en 4 bits (le format Q4_K_M, aujourd'hui standard), le même modèle tient dans 48 Go.
| Mémoire disponible | Taille de modèle jouable (Q4) | Exemples de modèles |
|---|---|---|
| 4 Go | environ 3 milliards | Qwen3 0.6B, Llama 3.2 1B |
| 8 Go | 7 à 8 milliards | Llama 3.1 8B, DeepSeek-R1 8B |
| 12 Go | 12 à 14 milliards | Gemma 4 12B, Qwen3 14B |
| 16 Go | environ 20 milliards | Mistral 22B |
| 24 Go | environ 32 milliards | Qwen3 32B |
| 48 Go | environ 70 milliards | Llama 3.1 70B |
| 128 Go et plus | 120 à 235 milliards en MoE | Qwen3 235B MoE |
Côté vitesse, comptez 30 à 60 tokens par seconde pour un modèle de 7 à 8 milliards sur une carte graphique récente, et jusqu'à 95 tokens par seconde sur une RTX 5090 d'après les mesures publiées par SitePoint en 2026. Sur processeur seul, sans carte graphique, la chute est brutale : 2 à 10 tokens par seconde, soit un rythme de frappe pénible mais utilisable pour des tâches en arrière-plan.
Les prix indicatifs des cartes NVIDIA, convertis au cours du 2 septembre 2026 (1 euro pour 1,1587 dollar) et hors taxes françaises, donnent l'ordre de grandeur : environ 258 euros pour une RTX 4060 de 8 Go, 388 euros pour une 4060 Ti de 16 Go, 1 380 euros pour une RTX 4090 de 24 Go et 1 725 euros pour une RTX 5090 de 32 Go. Les tarifs constatés en France sont généralement supérieurs.
IA en local : ce qui tient sur votre machine en 2026
- 8 Go de mémoire vidéo suffisent pour un modèle de 7 à 8 milliards de paramètres en 4 bits
- 24 Go de mémoire unifiée exigés par Perplexity pour son mode local sur Mac, le 1er septembre 2026
- 95 t/s de vitesse mesurée pour un modèle 7B sur une carte RTX 5090
Ce qui tourne bien en local
Ce qui reste meilleur dans le cloud
À retenir : la mémoire de votre machine décide seule de ce que vous pouvez faire tourner. Pour une PME, l'enjeu n'est pas de tout rapatrier, mais d'isoler en local les traitements qui touchent des données clients ou des documents confidentiels.
Télécharger l'infographie (PNG)
Quels modèles installer en 2026 ?
Le choix se fait d'abord par la taille, ensuite par la spécialité. Quatre familles dominent l'usage local en septembre 2026 : Gemma 4, Qwen 3.6, Mistral et Llama, toutes disponibles en poids ouverts et toutes déclinées en plusieurs tailles.
- Gemma 4 (Google) : excellent rapport qualité-taille sur les petites configurations. La variante E4B est l'un des trois modèles retenus par Perplexity pour son mode local. Un bon défaut pour démarrer.
- Qwen 3.6 et 3.8 (Alibaba) : très solides en multilingue et en code. La version 35B-A3B utilise une architecture Mixture of Experts qui n'active qu'une fraction des paramètres, ce qui la rend étonnamment rapide pour sa taille.
- Mistral (Mistral AI) : le choix naturel pour un usage francophone, avec un ancrage européen qui simplifie les discussions de conformité en interne.
- Llama et DeepSeek : Llama 3.1 en 8B pour les machines modestes, DeepSeek-R1 dans ses versions compactes quand vous avez besoin de raisonnement structuré.
Un point de vocabulaire utile : ces modèles compacts appartiennent à la catégorie des SLM, les « small language models ». Nous avons comparé les deux mondes dans notre article sur les différences entre SLM et LLM en 2026. Retenez qu'un modèle de 12 milliards de paramètres bien choisi bat souvent un modèle de 70 milliards mal quantifié.
Ollama, LM Studio ou Jan : par quel outil commencer ?
LM Studio, Ollama et Jan couvrent la quasi-totalité des besoins, et le bon choix dépend de votre aisance avec un terminal. Aucun des trois ne demande de compétence en développement pour un usage simple.
- LM Studio : interface graphique complète, catalogue de modèles intégré, installation en quelques clics. C'est l'outil à recommander à un dirigeant ou à une équipe non technique.
- Ollama : une seule commande pour télécharger et lancer un modèle. Simplicité imbattable pour qui n'a pas peur d'une ligne de commande, et une API locale que vos outils internes peuvent appeler.
- Jan : entièrement open source sous licence AGPLv3, pour les organisations qui veulent auditer le code qu'elles exécutent.
- vLLM : réservé aux serveurs, quand plusieurs personnes interrogent le même modèle en même temps.
Combien de temps pour être opérationnel ?
Comptez une heure pour un premier modèle fonctionnel, téléchargement compris. La séquence tient en quatre étapes : installer le logiciel, choisir un modèle adapté à votre mémoire d'après le tableau ci-dessus, lancer une première conversation, puis brancher vos propres documents.
Cette dernière étape est celle qui change tout en entreprise. Elle repose sur le RAG, la génération augmentée par récupération, qui permet au modèle de répondre à partir de vos fichiers internes sans qu'ils quittent votre disque. LM Studio et Jan proposent tous deux cette fonction en natif.
Perplexity Hybrid Compute : le signal de septembre 2026
Le 1er septembre 2026, Perplexity a annoncé Hybrid Compute, une fonction qui répartit automatiquement le travail entre le cloud et un modèle installé sur le Mac de l'utilisateur. La logique est inversée par rapport aux approches précédentes : la tâche démarre dans le cloud, où les grands modèles gèrent la recherche web et la planification, puis bascule en local dès qu'une donnée sensible apparaît.
Le mécanisme repose sur un petit classificateur de 0,6 milliard de paramètres baptisé PII-Tracer, qui inspecte chaque élément avant transmission et applique l'une de quatre décisions : garder en local, masquer, refuser, ou demander l'accord de l'utilisateur. Perplexity annonce un score F1 de 0,629 au niveau caractère et la détection de 79,4 % des identifiants récurrents, en avance sur onze autres détecteurs testés. Ce sont des mesures réalisées par l'éditeur lui-même, non vérifiées à ce jour par un tiers indépendant.
- Configuration requise : Mac Apple Silicon, macOS 15 ou plus récent, 24 Go de mémoire unifiée au minimum, 32 Go recommandés.
- Modèles locaux proposés : Gemma 4 E4B, Qwen3.6 35B-A3B et un modèle maison, avec un téléchargement en un clic de PPLX Qwen 3.8 27B.
- Disponibilité : abonnés Pro, Max et Enterprise uniquement.
L'intérêt de cette annonce dépasse Perplexity. Elle valide un modèle d'architecture hybride que beaucoup d'entreprises réclamaient : la puissance du cloud pour ce qui est public, la machine locale pour ce qui ne doit pas sortir.
Confidentialité et RGPD : le vrai argument pour une PME
C'est la raison numéro un qui pousse les entreprises françaises vers l'IA locale, avant même le coût. Quand le modèle tourne sur un matériel que vous contrôlez, la question « où partent mes données » n'a plus d'objet, et le transfert hors Union européenne disparaît du dossier de conformité.
La CNIL a inscrit l'IA au cœur de son programme de travail 2026, avec des guides sectoriels sur le déploiement de l'IA au travail et dans la santé, des travaux sur les outils de transcription automatique des centres d'appels et de la visioconférence, et une clarification des responsabilités de chaque acteur de la chaîne. Elle se prépare en parallèle à son rôle d'autorité de surveillance du marché au titre du règlement européen sur l'IA.
Chez Digital-m, la question revient dans presque tous nos audits : un cabinet comptable ou une agence immobilière qui colle des documents clients dans un chatbot grand public prend un risque qu'aucune clause contractuelle ne couvre vraiment. Basculer ces traitements précis sur un modèle local règle le problème à la racine, et le reste de l'usage peut continuer dans le cloud sans état d'âme.
Ce que l'IA locale ne remplacera pas
Un modèle local n'a pas accès au web, ne connaît pas l'actualité postérieure à son entraînement, et plafonne rapidement sur les tâches de raisonnement long. Sur ces terrains, l'écart avec GPT-5.6, Gemini 3.8 ou Claude Opus 5 reste considérable et ne se comblera pas en installant une carte graphique de plus.
- La maintenance vous incombe : mises à jour de modèles, gestion des versions, sauvegardes. Personne ne le fait à votre place.
- Le confort d'usage est inférieur : pas d'application mobile synchronisée, pas de recherche web intégrée sans configuration supplémentaire.
- La rentabilité dépend du volume : SitePoint estime qu'une équipe consommant un million de tokens par jour paie plusieurs milliers d'euros mensuels en API, et qu'un investissement dans une carte haut de gamme s'amortit alors en un à trois mois. En dessous de ce volume, l'abonnement reste plus économique.
La bonne comparaison n'est d'ailleurs pas locale contre cloud, mais quel usage pour quel canal. Si vous hésitez encore sur la valeur d'un abonnement payant, notre analyse de ce que change réellement l'abonnement ChatGPT payant donne des points de comparaison chiffrés.
Ce qu'il faut retenir
L'IA en local est accessible en 2026 à toute machine disposant de 8 Go de mémoire vidéo, ce qui couvre la majorité des ordinateurs de travail récents. Un modèle de 7 à 8 milliards de paramètres en 4 bits y répond entre 30 et 60 tokens par seconde, largement assez pour résumer, classer, reformuler ou interroger vos propres documents. Les outils grand public existent : LM Studio pour une prise en main immédiate, Ollama pour l'intégration, Jan pour l'auditabilité.
Le mouvement est en train de se normaliser : quand Perplexity embarque un modèle local dans son produit payant le 1er septembre 2026 avec un filtre de données personnelles intégré, c'est que le sujet a quitté la sphère des passionnés. La bonne stratégie pour une PME n'est pas de tout rapatrier, mais de cartographier ses traitements et d'isoler ceux qui touchent des données sensibles. Vous voulez savoir lesquels, dans votre cas ? Parlons-en lors d'un échange de cadrage, ou formez vos équipes aux usages de l'IA avec nos formations certifiées Qualiopi.
Avez-vous déjà installé un modèle sur votre propre machine, et sur quel usage vous a-t-il surpris ? Dites-le nous en commentaire !Sources et références
- Perplexity - Introducing Hybrid Compute on Mac (1er septembre 2026)
- MarkTechPost - Perplexity Releases Hybrid Compute on Mac (1er septembre 2026)
- SitePoint - Guide to Local LLMs in 2026: Privacy, Tools and Hardware (2026)
- Kunal Ganglani - 2026 Local LLM Hardware Guide: VRAM Tiers and GPUs (2026)
- CNIL - Accompagnement des professionnels : le programme de travail de la CNIL pour 2026 (2026)
- 9to5Mac - Perplexity launches privacy-minded hybrid compute AI feature for Mac (1er septembre 2026)
Questions fréquentes sur l'IA en local
Faut-il une carte graphique pour faire tourner une IA en local ?
Non, mais c'est fortement conseillé. Sur processeur seul, la vitesse tombe à 2 à 10 tokens par seconde, ce qui reste utilisable pour des traitements en arrière-plan mais frustrant en conversation. Un Mac Apple Silicon fait exception : sa mémoire unifiée lui permet de faire tourner de gros modèles sans carte graphique dédiée.
Une IA locale est-elle conforme au RGPD par défaut ?
Elle supprime la question du transfert de données vers un tiers, ce qui simplifie considérablement le dossier. Elle ne dispense pas des autres obligations : base légale du traitement, information des personnes, durée de conservation, sécurité du poste. La CNIL publie en 2026 des guides sectoriels précisément sur ces points.
Quel modèle local choisir pour du français ?
Les modèles de Mistral AI sont entraînés avec une forte proportion de français et restent le réflexe le plus naturel. Gemma 4 et Qwen 3.6 s'en sortent également très bien en français à taille équivalente. Le test décisif reste le vôtre : lancez la même consigne métier sur deux ou trois modèles et comparez.
Combien coûte réellement une configuration IA locale ?
Zéro euro si votre machine actuelle dispose de 8 Go de mémoire vidéo ou d'un Mac récent : les logiciels et les modèles sont gratuits. Pour une configuration confortable, comptez de 400 à 1 700 euros de carte graphique selon la taille de modèle visée, prix indicatifs hors taxes convertis au cours de septembre 2026. À comparer au cumul de vos abonnements sur trois ans.
Une IA locale peut-elle lire mes documents d'entreprise ?
Oui, c'est même l'usage le plus rentable. LM Studio et Jan intègrent une fonction de recherche dans vos fichiers qui s'appuie sur le RAG : le modèle retrouve les passages pertinents dans vos documents et répond en s'appuyant dessus, sans que rien ne quitte votre disque dur.