Faire tourner une IA en local, ça veut dire quoi exactement ?

Faire tourner une IA en local, c'est exécuter le modèle sur votre propre machine, ordinateur ou serveur, au lieu d'envoyer vos requêtes vers les serveurs d'OpenAI, de Google ou de Mistral. Aucune donnée ne sort du réseau. Le modèle est un fichier que vous téléchargez une fois, puis qui fonctionne même sans connexion internet.

Concrètement, vous installez un logiciel (Ollama, LM Studio ou Jan), vous téléchargez un modèle en poids ouverts comme Gemma 4, Qwen 3.6, Mistral ou Llama, et vous discutez avec lui dans une interface qui ressemble à ChatGPT. La différence tient en une phrase : la question de savoir où partent vos données ne se pose plus, puisqu'elles ne partent nulle part.

  • Ce que vous gagnez : confidentialité totale, coût marginal nul par requête, fonctionnement hors ligne, aucune limite d'usage imposée par un abonnement.
  • Ce que vous perdez : l'accès au web en temps réel, une partie de la finesse de raisonnement, et le confort d'une infrastructure entretenue par quelqu'un d'autre.
  • Ce que ça coûte : un investissement matériel unique, de quelques centaines à quelques milliers d'euros, contre un abonnement mensuel qui court indéfiniment.

Cette possibilité existe uniquement grâce aux modèles à poids ouverts publiés par Google, Alibaba, Mistral AI, Meta ou DeepSeek. Nous avons détaillé ce que recouvre vraiment cette notion dans notre article sur les LLM open-weights et le vrai sens du mot « open source ».

De quel matériel avez-vous vraiment besoin ?

La règle est simple et tient en un mot : la mémoire. La VRAM (la mémoire de la carte graphique) ou la mémoire unifiée sur un Mac Apple Silicon détermine à elle seule la taille du modèle que vous pouvez charger. Un modèle de 70 milliards de paramètres en précision complète réclame environ 140 Go de mémoire, ce qui le met hors de portée d'une machine grand public. Compressé en 4 bits (le format Q4_K_M, aujourd'hui standard), le même modèle tient dans 48 Go.

Mémoire disponibleTaille de modèle jouable (Q4)Exemples de modèles
4 Goenviron 3 milliardsQwen3 0.6B, Llama 3.2 1B
8 Go7 à 8 milliardsLlama 3.1 8B, DeepSeek-R1 8B
12 Go12 à 14 milliardsGemma 4 12B, Qwen3 14B
16 Goenviron 20 milliardsMistral 22B
24 Goenviron 32 milliardsQwen3 32B
48 Goenviron 70 milliardsLlama 3.1 70B
128 Go et plus120 à 235 milliards en MoEQwen3 235B MoE

Côté vitesse, comptez 30 à 60 tokens par seconde pour un modèle de 7 à 8 milliards sur une carte graphique récente, et jusqu'à 95 tokens par seconde sur une RTX 5090 d'après les mesures publiées par SitePoint en 2026. Sur processeur seul, sans carte graphique, la chute est brutale : 2 à 10 tokens par seconde, soit un rythme de frappe pénible mais utilisable pour des tâches en arrière-plan.

Les prix indicatifs des cartes NVIDIA, convertis au cours du 2 septembre 2026 (1 euro pour 1,1587 dollar) et hors taxes françaises, donnent l'ordre de grandeur : environ 258 euros pour une RTX 4060 de 8 Go, 388 euros pour une 4060 Ti de 16 Go, 1 380 euros pour une RTX 4090 de 24 Go et 1 725 euros pour une RTX 5090 de 32 Go. Les tarifs constatés en France sont généralement supérieurs.

COMPRENDRE L'IA · SEPTEMBRE 2026

IA en local : ce qui tient sur votre machine en 2026

  • 8 Go de mémoire vidéo suffisent pour un modèle de 7 à 8 milliards de paramètres en 4 bits
  • 24 Go de mémoire unifiée exigés par Perplexity pour son mode local sur Mac, le 1er septembre 2026
  • 95 t/s de vitesse mesurée pour un modèle 7B sur une carte RTX 5090

Ce qui tourne bien en local

  • Résumé de documents
  • Classement d'e-mails
  • Extraction de données
  • Reformulation
  • Traduction courante
  • Assistance au code
  • Questions sur vos fichiers

Ce qui reste meilleur dans le cloud

  • Recherche web en direct
  • Raisonnement long
  • Génération de vidéo
  • Agents multi-étapes
  • Analyse d'images complexes

À retenir : la mémoire de votre machine décide seule de ce que vous pouvez faire tourner. Pour une PME, l'enjeu n'est pas de tout rapatrier, mais d'isoler en local les traitements qui touchent des données clients ou des documents confidentiels.

Télécharger l'infographie (PNG)

Sources : SitePoint, Perplexity. Infographie Digital-m, septembre 2026. digital-m.fr

Quels modèles installer en 2026 ?

Le choix se fait d'abord par la taille, ensuite par la spécialité. Quatre familles dominent l'usage local en septembre 2026 : Gemma 4, Qwen 3.6, Mistral et Llama, toutes disponibles en poids ouverts et toutes déclinées en plusieurs tailles.

  • Gemma 4 (Google) : excellent rapport qualité-taille sur les petites configurations. La variante E4B est l'un des trois modèles retenus par Perplexity pour son mode local. Un bon défaut pour démarrer.
  • Qwen 3.6 et 3.8 (Alibaba) : très solides en multilingue et en code. La version 35B-A3B utilise une architecture Mixture of Experts qui n'active qu'une fraction des paramètres, ce qui la rend étonnamment rapide pour sa taille.
  • Mistral (Mistral AI) : le choix naturel pour un usage francophone, avec un ancrage européen qui simplifie les discussions de conformité en interne.
  • Llama et DeepSeek : Llama 3.1 en 8B pour les machines modestes, DeepSeek-R1 dans ses versions compactes quand vous avez besoin de raisonnement structuré.

Un point de vocabulaire utile : ces modèles compacts appartiennent à la catégorie des SLM, les « small language models ». Nous avons comparé les deux mondes dans notre article sur les différences entre SLM et LLM en 2026. Retenez qu'un modèle de 12 milliards de paramètres bien choisi bat souvent un modèle de 70 milliards mal quantifié.

Ollama, LM Studio ou Jan : par quel outil commencer ?

LM Studio, Ollama et Jan couvrent la quasi-totalité des besoins, et le bon choix dépend de votre aisance avec un terminal. Aucun des trois ne demande de compétence en développement pour un usage simple.

  • LM Studio : interface graphique complète, catalogue de modèles intégré, installation en quelques clics. C'est l'outil à recommander à un dirigeant ou à une équipe non technique.
  • Ollama : une seule commande pour télécharger et lancer un modèle. Simplicité imbattable pour qui n'a pas peur d'une ligne de commande, et une API locale que vos outils internes peuvent appeler.
  • Jan : entièrement open source sous licence AGPLv3, pour les organisations qui veulent auditer le code qu'elles exécutent.
  • vLLM : réservé aux serveurs, quand plusieurs personnes interrogent le même modèle en même temps.

Combien de temps pour être opérationnel ?

Comptez une heure pour un premier modèle fonctionnel, téléchargement compris. La séquence tient en quatre étapes : installer le logiciel, choisir un modèle adapté à votre mémoire d'après le tableau ci-dessus, lancer une première conversation, puis brancher vos propres documents.

Cette dernière étape est celle qui change tout en entreprise. Elle repose sur le RAG, la génération augmentée par récupération, qui permet au modèle de répondre à partir de vos fichiers internes sans qu'ils quittent votre disque. LM Studio et Jan proposent tous deux cette fonction en natif.

Perplexity Hybrid Compute : le signal de septembre 2026

Le 1er septembre 2026, Perplexity a annoncé Hybrid Compute, une fonction qui répartit automatiquement le travail entre le cloud et un modèle installé sur le Mac de l'utilisateur. La logique est inversée par rapport aux approches précédentes : la tâche démarre dans le cloud, où les grands modèles gèrent la recherche web et la planification, puis bascule en local dès qu'une donnée sensible apparaît.

Le mécanisme repose sur un petit classificateur de 0,6 milliard de paramètres baptisé PII-Tracer, qui inspecte chaque élément avant transmission et applique l'une de quatre décisions : garder en local, masquer, refuser, ou demander l'accord de l'utilisateur. Perplexity annonce un score F1 de 0,629 au niveau caractère et la détection de 79,4 % des identifiants récurrents, en avance sur onze autres détecteurs testés. Ce sont des mesures réalisées par l'éditeur lui-même, non vérifiées à ce jour par un tiers indépendant.

  • Configuration requise : Mac Apple Silicon, macOS 15 ou plus récent, 24 Go de mémoire unifiée au minimum, 32 Go recommandés.
  • Modèles locaux proposés : Gemma 4 E4B, Qwen3.6 35B-A3B et un modèle maison, avec un téléchargement en un clic de PPLX Qwen 3.8 27B.
  • Disponibilité : abonnés Pro, Max et Enterprise uniquement.

L'intérêt de cette annonce dépasse Perplexity. Elle valide un modèle d'architecture hybride que beaucoup d'entreprises réclamaient : la puissance du cloud pour ce qui est public, la machine locale pour ce qui ne doit pas sortir.

Confidentialité et RGPD : le vrai argument pour une PME

C'est la raison numéro un qui pousse les entreprises françaises vers l'IA locale, avant même le coût. Quand le modèle tourne sur un matériel que vous contrôlez, la question « où partent mes données » n'a plus d'objet, et le transfert hors Union européenne disparaît du dossier de conformité.

La CNIL a inscrit l'IA au cœur de son programme de travail 2026, avec des guides sectoriels sur le déploiement de l'IA au travail et dans la santé, des travaux sur les outils de transcription automatique des centres d'appels et de la visioconférence, et une clarification des responsabilités de chaque acteur de la chaîne. Elle se prépare en parallèle à son rôle d'autorité de surveillance du marché au titre du règlement européen sur l'IA.

Chez Digital-m, la question revient dans presque tous nos audits : un cabinet comptable ou une agence immobilière qui colle des documents clients dans un chatbot grand public prend un risque qu'aucune clause contractuelle ne couvre vraiment. Basculer ces traitements précis sur un modèle local règle le problème à la racine, et le reste de l'usage peut continuer dans le cloud sans état d'âme.

Ce que l'IA locale ne remplacera pas

Un modèle local n'a pas accès au web, ne connaît pas l'actualité postérieure à son entraînement, et plafonne rapidement sur les tâches de raisonnement long. Sur ces terrains, l'écart avec GPT-5.6, Gemini 3.8 ou Claude Opus 5 reste considérable et ne se comblera pas en installant une carte graphique de plus.

  • La maintenance vous incombe : mises à jour de modèles, gestion des versions, sauvegardes. Personne ne le fait à votre place.
  • Le confort d'usage est inférieur : pas d'application mobile synchronisée, pas de recherche web intégrée sans configuration supplémentaire.
  • La rentabilité dépend du volume : SitePoint estime qu'une équipe consommant un million de tokens par jour paie plusieurs milliers d'euros mensuels en API, et qu'un investissement dans une carte haut de gamme s'amortit alors en un à trois mois. En dessous de ce volume, l'abonnement reste plus économique.

La bonne comparaison n'est d'ailleurs pas locale contre cloud, mais quel usage pour quel canal. Si vous hésitez encore sur la valeur d'un abonnement payant, notre analyse de ce que change réellement l'abonnement ChatGPT payant donne des points de comparaison chiffrés.

Ce qu'il faut retenir

L'IA en local est accessible en 2026 à toute machine disposant de 8 Go de mémoire vidéo, ce qui couvre la majorité des ordinateurs de travail récents. Un modèle de 7 à 8 milliards de paramètres en 4 bits y répond entre 30 et 60 tokens par seconde, largement assez pour résumer, classer, reformuler ou interroger vos propres documents. Les outils grand public existent : LM Studio pour une prise en main immédiate, Ollama pour l'intégration, Jan pour l'auditabilité.

Le mouvement est en train de se normaliser : quand Perplexity embarque un modèle local dans son produit payant le 1er septembre 2026 avec un filtre de données personnelles intégré, c'est que le sujet a quitté la sphère des passionnés. La bonne stratégie pour une PME n'est pas de tout rapatrier, mais de cartographier ses traitements et d'isoler ceux qui touchent des données sensibles. Vous voulez savoir lesquels, dans votre cas ? Parlons-en lors d'un échange de cadrage, ou formez vos équipes aux usages de l'IA avec nos formations certifiées Qualiopi.

Avez-vous déjà installé un modèle sur votre propre machine, et sur quel usage vous a-t-il surpris ? Dites-le nous en commentaire !