Définition, fonctionnement, matériel nécessaire, outils (Ollama, LM Studio) et limites de l'IA locale — la fiche de référence pour tout comprendre en 2026.
Il faut environ 16 Go de RAM ou de VRAM pour Gemma 4 12B ou gpt-oss-20b
Ollama (ligne de commande et application de bureau) et LM Studio (interface et serveur) sont les deux portes d'entrée les plus courantes
Les modèles locaux restent généralement moins puissants que le cloud : d'où l'essor des approches hybrides
01Définition
Qu'est-ce que IA locale, au juste ?
L’IA locale (on parle aussi d’IA « embarquée » ou « on-device ») désigne un modèle d’intelligence artificielle qui tourne directement sur votre propre machine — PC, Mac, smartphone, mini-PC ou même Raspberry PiLe Raspberry Pi est un ordinateur monocarte britannique, né en 2012 pour rendre la programmation accessible à tous : aujourd'hui de 4 à 305 dollars selon le modèle, il sert aussi bien à apprendre le code qu'à faire tourner un serveur personnel, une borne industrielle ou, depuis peu, de petits modèles d'IA entièrement hors ligne.Lire la fiche — au lieu d’être interrogé sur les serveurs d’un fournisseur comme ChatGPT ou Google Gemini. Les requêtes et les documents ne quittent pas l’appareil, et l’assistant continue de répondre sans connexion : Google a ainsi présenté avec Gemma Translator un traducteur vocal entièrement hors ligne, bâti sur un Raspberry Pi 5.
Publicité
Trois briques suffisent. D’abord un modèle « open-weight », dont les poids se téléchargent librement : Gemma 4 de Google, Qwen3.5 d’Alibaba, gpt-oss-20b d’OpenAI, Muse Glimmer de Meta ou les versions distillées de DeepSeek R1. Ensuite un logiciel qui l’exécute : Ollama, en ligne de commande et, depuis la version 0.10, avec une application de bureau officielle ; LM Studio, une interface de chat qui sait aussi fonctionner comme serveur sans interface ; ou encore KoboldCpp. Enfin un appareil doté d’assez de mémoire.
La mémoire est en effet le vrai plafond. Un modèle doit tenir en RAM ou en VRAM : Google annonce 16 Go pour Gemma 4 12B, et gpt-oss-20b réclame 16 Go de VRAM. Pour réduire cette empreinte, on « quantifie » le modèle : selon Meta, Muse Glimmer (30 milliards de paramètres) dépasserait 55 Go en pleine précision mais passe sous les 20 Go en 4 bits. Les Mac profitent de leur mémoire unifiée — Ollama a ajouté en préversion le framework MLX d’Apple, réservé aux Apple Silicon avec au moins 32 Go — et la vitesse progresse : les MTP drafters de Gemma 4 promettent jusqu’à trois fois plus de tokens générés selon le matériel.
Dans la foulée du choc DeepSeek, un tutoriel montre comment exécuter R1 sur PC ou Mac avec LM Studio et Ollama : les versions distillées vont de 1,5 milliard de paramètres (1,1 Go de mémoire) à 7 milliards (4,7 Go).
Août 2025
Ollama 0.10 et gpt-oss-20b
Ollama 0.10 lance une application de bureau officielle. Quelques jours plus tard, Microsoft intègre gpt-oss-20b, modèle open source d’OpenAI, à Windows AI Foundry (16 Go de VRAM requis).
Janv. 2026
LM Studio 0.4.0
LM Studio se réinvente en serveur : cœur « llmster » sans interface graphique, requêtes parallèles (continuous batching) et API REST native.
Google officialise Gemma 4 (E2B, E4B, 26B A4B, 31B) et passe à la licence Apache 2.0 ; les variantes E2B et E4B visent explicitement les appareils mobiles.
Mai-juin 2026
Gemma 4 plus rapide, puis 12B
Google publie des MTP drafters (jusqu’à environ trois fois plus rapide selon le matériel), puis Gemma 4 12B, taillé pour 16 Go de mémoire.
Août 2026
Muse Glimmer
Meta dévoile Muse Glimmer : 30 milliards de paramètres sous licence Apache 2.0, pensé pour faire tourner des agents IA sur un PC ou un Mac équipé d’une seule carte graphique grand public.
Sept. 2026
Mac mini M6
Apple présente le Mac mini M6 (dès 1 049 euros, 16 Go de mémoire unifiée, premières livraisons prévues le 22 septembre), quelques mois après avoir reconnu une pénurie portée par l’IA locale.
7 oct. 2026
À venir : Microsoft
Microsoft donne rendez-vous à San Francisco pour son premier grand événement Windows depuis plus de deux ans, consacré à la manière dont « l’IA locale façonnera le prochain chapitre du PC », avec Satya Nadella, Pavan Davuluri et Jensen Huang.
03Prix & formules
Combien ça coûte ?
Modèles ouverts
Licence Apache 2.0
Gratuit
Gemma 4, Qwen3.5 (séries Small) et Muse Glimmer publiés sous licence Apache 2.0
gpt-oss-20b : gratuit et open source
Aucun abonnement, aucune limite de jetons
Logiciels d'exécution
Ollama est open source
À installer
Ollama : ligne de commande et application de bureau officielle (macOS, Windows, Linux)
LM Studio : interface de chat et serveur sans interface (llmster)
KoboldCpp : autre outil d'exécution d'IA locale
Matériel
Le vrai coût
Dès 16 Gode mémoire
16 Go : Gemma 4 12B, gpt-oss-20b
24 à 32 Go : Muse Glimmer quantifié en 4 bits
Mac mini M6 dès 1 049 euros (16 Go) ; Raspberry Pi AI HAT+ 2 : 145 euros
L’IA locale n’a pas d’abonnement : les modèles ouverts se téléchargent gratuitement et des logiciels comme Ollama sont open source. Le vrai coût est celui du matériel, et surtout de la mémoire, sous tension avec la demande des datacenters IA (Apple évoque des composants tendus en expliquant la pénurie de Mac mini).
04Comment y accéder
Où et comment l'utiliser
Ligne de commande
Ollama
Une commande comme ollama run deepseek-r1:7b suffit ; application de bureau officielle depuis la version 0.10 (macOS, Windows, Linux)
Interface de chat
LM Studio
Recherche et téléchargement des modèles dans l'application ; mode serveur sans interface (llmster) depuis la version 0.4.0
Windows
Windows AI Foundry et Windows ML
Foundry pour déployer des modèles comme gpt-oss-20b ; Windows ML pour les apps, sur Windows 11 24H2 et suivants
Navigateur
Chrome (Gemini Nano)
Certaines fonctions IA téléchargent un modèle d'environ 4 Go ; l'option « On-device AI » des réglages Système permet de le désactiver
Petit matériel
Raspberry Pi
Petits modèles sur CPU avec Ollama (2 Go de RAM minimum recommandés) ; carte AI HAT+ 2 à 145 euros pour les modèles génératifs
05Fonctionnalités
Ce que ça permet de faire
Données gardées sur l'appareil
Les documents et les requêtes sont traités sur votre machine : un atout majeur pour les données sensibles, financières, médicales ou professionnelles.
Fonctionnement hors connexion
Le modèle répond sans Internet, en avion, en zone blanche ou sur un réseau isolé, comme le traducteur Gemma Translator bâti sur un Raspberry Pi 5.
Pas d'abonnement ni de limite de jetons
Les modèles ouverts sont gratuits : on ne paie pas à l’usage, et aucun quota ne vient interrompre une longue session.
Automatisation et intégration
Ollama et LM Studio exposent une API locale (compatible OpenAI pour Ollama) pour brancher le modèle à ses scripts et applications.
Choix et personnalisation du modèle
Fine-tunes, versions quantifiées, modèles spécialisés : Google dénombre plus de 100 000 variantes de Gemma créées par la communauté.
Agents exécutés en local
Des modèles comme Muse Glimmer sont conçus pour piloter des agents (fichiers, outils, code) sans dépendre d’une connexion permanente aux serveurs de l’éditeur.
06Limites & risques
Ce qu'il faut garder en tête
Une barrière matérielle
Il faut de la mémoire : 16 Go pour Gemma 4 12B ou gpt-oss-20b, 24 à 32 Go pour Muse Glimmer, 32 Go pour MLX dans Ollama. La mémoire est de plus sous tension avec la demande des datacenters.
Moins puissant que les meilleurs modèles cloud
Les modèles locaux ont beaucoup progressé mais restent généralement moins puissants que les plus grands modèles hébergés, d’où l’essor des approches hybrides.
Plus lent sur du matériel modeste
Sur un Raspberry Pi, la génération de texte est relativement lente ; sur un PC, tout dépend de la carte graphique et de la mémoire disponibles.
Le coût est déplacé chez l'utilisateur
Stockage, ressources système, consommation d’énergie : le modèle Gemini Nano de Chrome pèse environ 4 Go, et cette taille n’apparaît pas clairement au moment d’activer les fonctions IA.
Des outils encore orientés développeurs
Ligne de commande, quantification, choix du modèle : l’application Ollama a été pensée par des développeurs, pour des développeurs, même si LM Studio simplifie l’accès.
07Conseils par profil
Faut-il utiliser IA locale ?
Curieux qui veut essayer
Commencez petit avec Ollama ou LM Studio : une version distillée de DeepSeek R1 en 1,5 milliard de paramètres n’occupe que 1,1 Go, la 7B environ 4,7 Go.
Développeurs
Ollama et LM Studio (serveur sans interface, API REST, MCP) permettent de brancher un modèle local à vos applications, sans facturation au jeton.
Utilisateurs de Mac
La mémoire unifiée des Apple Silicon est un atout : Ollama y ajoute MLX (préversion, 32 Go minimum) et le Mac mini M6 démarre à 1 049 euros avec 16 Go. Apple a évoqué des délais rallongés sur ces machines.
PC Windows
Prévoyez 16 Go de VRAM pour gpt-oss-20b via Windows AI Foundry ; les Copilot+ PC misent sur le NPU pour les fonctions système. Microsoft fait de l’IA locale le thème de son événement Windows du 7 octobre.
Données sensibles ou confidentielles
Gardez en local ce qui ne doit pas sortir ; quand la puissance manque, un modèle hybride ou un cloud confidentiel (Private Cloud Compute, Private AI Compute) limite l’exposition.
Bricoleurs
Un Raspberry Pi 5 exécute déjà de petits modèles sur CPU ; le maker Jeff Geerling relève qu’un Pi 5 16 Go peut surpasser la carte AI HAT+ 2 (145 euros), à peser avant d’acheter.
Accès aux modèles les plus puissants et aucun matériel à acheter, mais les données quittent l’appareil et l’usage passe par un abonnement ou des limites de jetons.
Private Cloud Compute (Apple) et Private AI Compute (Google) prolongent les garanties de l’appareil dans le cloud : la puissance des grands modèles avec des protections techniques sur les données.
Présenté au Computex 2026, l’orchestrateur décide seul de ce qui reste sur la machine (documents sensibles) et de ce qui part vers le cloud (raisonnement lourd).
09FAQ
Questions fréquentes
Qu'est-ce que l'IA locale ?
C’est l’exécution d’un modèle d’intelligence artificielle directement sur votre propre appareil (PC, Mac, smartphone, Raspberry Pi) plutôt que sur les serveurs d’un fournisseur : vos données restent chez vous et le modèle fonctionne sans connexion.
Quelle configuration faut-il pour faire tourner un modèle en local ?
Tout dépend de la taille du modèle : environ 16 Go de RAM ou de VRAM pour Gemma 4 12B ou gpt-oss-20b, 24 à 32 Go pour Muse Glimmer quantifié en 4 bits, mais seulement 1,1 Go pour un DeepSeekDeepSeek est une startup chinoise d'IA et une famille de modèles de langage open source, réputée pour son rapport performance/prix très agressif.Lire la fiche R1 distillé en 1,5 milliard de paramètres.
Ollama ou LM Studio : lequel choisir ?
Ollama s’utilise en ligne de commande et dispose depuis la version 0.10 d’une application de bureau officielle, pensée pour les développeurs. LM Studio offre une interface de chat presque grand public et peut aussi tourner comme serveur sans interface depuis la version 0.4.0. KoboldCpp est une autre option.
L'IA locale est-elle vraiment privée ?
Le traitement reste sur votre machine, ce qui limite l’exposition des données. Mais « local » ne veut pas dire « transparent » : Chrome peut par exemple télécharger un modèle Gemini Nano de 4 Go sans alerte évidente. Les approches hybrides ne gardent en local que les fichiers sensibles.
Un modèle local est-il aussi bon que ChatGPT ?
Pas toujours : les modèles locaux ont beaucoup progressé mais restent généralement moins puissants que les plus grands modèles du cloud. Google affirme toutefois que Gemma 4 12B se rapproche du comportement de son modèle 26B sur de nombreux benchmarks, avec deux fois moins de mémoire.
Peut-on faire de l'IA locale sur un smartphone ou un Raspberry Pi ?
Oui : Gemma 4 E2B et E4B visent explicitement les appareils mobiles, Gemini Nano 4 en dérive, et un Raspberry Pi exécute de petits modèles comme TinyLlama (environ 638 Mo de RAM) sur CPU avec Ollama, plus lentement.
L'IA locale est-elle gratuite ?
Il n’y a ni abonnement ni limite de jetons : les modèles ouverts sont gratuits et Ollama est open source. Le coût réel est celui du matériel (surtout la mémoire) et de la consommation d’énergie.
Peut-on utiliser DeepSeek en local ?
Oui, avec les versions distillées de DeepSeek R1 disponibles dans LM Studio ou Ollama (par exemple ollama run deepseek-r1:7b, environ 4,7 Go), ce qui évite d’envoyer ses données au service hébergé.
Publicité
Ne manquez plus rien
Retrouvez BlogNT en priorité sur Google
Ajoutez-nous à vos sources préférées : nos analyses et tests remontent en tête de votre fil Google Actualités et de la recherche.
Pour offrir les meilleures expériences, nous et nos partenaires utilisons des technologies telles que les cookies pour stocker et/ou accéder aux informations de l’appareil. Consentir à ces technologies nous permet, ainsi qu’à nos partenaires, de traiter des données personnelles telles que le comportement de navigation ou des identifiants uniques sur ce site, et d’afficher des publicités (non) personnalisées. Ne pas consentir ou retirer son consentement peut altérer certaines fonctionnalités.
Cliquez ci-dessous pour consentir à ce qui précède ou pour faire des choix détaillés. Vos choix s’appliquent à ce site uniquement. Vous pouvez modifier vos choix à tout moment, y compris retirer votre consentement, avec les curseurs de la politique de cookies ou via le lien « Gérer mes cookies » en bas de chaque page.
Fonctionnel
Toujours activé
L’accès ou le stockage technique est strictement nécessaire dans la finalité d’intérêt légitime de permettre l’utilisation d’un service spécifique explicitement demandé par l’abonné ou l’utilisateur, ou dans le seul but d’effectuer la transmission d’une communication sur un réseau de communications électroniques.
Préférences
L’accès ou le stockage technique est nécessaire dans la finalité d’intérêt légitime de stocker des préférences qui ne sont pas demandées par l’abonné ou l’internaute.
Statistiques
Le stockage ou l’accès technique qui est utilisé exclusivement à des fins statistiques.Le stockage ou l’accès technique qui est utilisé exclusivement dans des finalités statistiques anonymes. En l’absence d’une assignation à comparaître, d’une conformité volontaire de la part de votre fournisseur d’accès à internet ou d’enregistrements supplémentaires provenant d’une tierce partie, les informations stockées ou extraites à cette seule fin ne peuvent généralement pas être utilisées pour vous identifier.
Marketing
L’accès ou le stockage technique est nécessaire pour créer des profils d’internautes afin d’envoyer des publicités, ou pour suivre l’utilisateur sur un site web ou sur plusieurs sites web ayant des finalités marketing similaires.