Aller au contenu principal
BlogNT

Comprendre

Qu'est-ce que l'IA locale ?

Définition, fonctionnement, matériel nécessaire, outils (Ollama, LM Studio) et limites de l'IA locale — la fiche de référence pour tout comprendre en 2026.

L'ESSENTIEL
  • Il faut environ 16 Go de RAM ou de VRAM pour Gemma 4 12B ou gpt-oss-20b
  • Ollama (ligne de commande et application de bureau) et LM Studio (interface et serveur) sont les deux portes d'entrée les plus courantes
  • Les modèles locaux restent généralement moins puissants que le cloud : d'où l'essor des approches hybrides
01 Définition

Qu'est-ce que IA locale, au juste ?

L’IA locale (on parle aussi d’IA « embarquée » ou « on-device ») désigne un modèle d’intelligence artificielle qui tourne directement sur votre propre machine — PC, Mac, smartphone, mini-PC ou même Raspberry PiLe Raspberry Pi est un ordinateur monocarte britannique, né en 2012 pour rendre la programmation accessible à tous : aujourd'hui de 4 à 305 dollars selon le modèle, il sert aussi bien à apprendre le code qu'à faire tourner un serveur personnel, une borne industrielle ou, depuis peu, de petits modèles d'IA entièrement hors ligne. Lire la fiche — au lieu d’être interrogé sur les serveurs d’un fournisseur comme ChatGPT ou Google Gemini. Les requêtes et les documents ne quittent pas l’appareil, et l’assistant continue de répondre sans connexion : Google a ainsi présenté avec Gemma Translator un traducteur vocal entièrement hors ligne, bâti sur un Raspberry Pi 5.

Publicité

Trois briques suffisent. D’abord un modèle « open-weight », dont les poids se téléchargent librement : Gemma 4 de Google, Qwen3.5 d’Alibaba, gpt-oss-20b d’OpenAI, Muse Glimmer de Meta ou les versions distillées de DeepSeek R1. Ensuite un logiciel qui l’exécute : Ollama, en ligne de commande et, depuis la version 0.10, avec une application de bureau officielle ; LM Studio, une interface de chat qui sait aussi fonctionner comme serveur sans interface ; ou encore KoboldCpp. Enfin un appareil doté d’assez de mémoire.

La mémoire est en effet le vrai plafond. Un modèle doit tenir en RAM ou en VRAM : Google annonce 16 Go pour Gemma 4 12B, et gpt-oss-20b réclame 16 Go de VRAM. Pour réduire cette empreinte, on « quantifie » le modèle : selon Meta, Muse Glimmer (30 milliards de paramètres) dépasserait 55 Go en pleine précision mais passe sous les 20 Go en 4 bits. Les Mac profitent de leur mémoire unifiée — Ollama a ajouté en préversion le framework MLX d’Apple, réservé aux Apple Silicon avec au moins 32 Go — et la vitesse progresse : les MTP drafters de Gemma 4 promettent jusqu’à trois fois plus de tokens générés selon le matériel.

En 2026, l’IA locale sort de sa niche d’initiés. Elle se glisse dans les systèmes — Chrome peut télécharger un modèle Gemini Nano de 4 Go, Apple ouvre son modèle embarqué aux apps iOS, Windows ML répartit le travail entre GPU, NPU et CPU — et elle pèse sur le matériel : Apple a reconnu plusieurs mois de pénurie sur les Mac mini et Mac Studio, prisés pour cet usage. Le modèle de référence devient souvent hybride : Perplexity garde les données sensibles sur la machine et envoie le raisonnement lourd vers le cloud, tandis qu’Apple (Private Cloud Compute) et Google (Private AI Compute) prolongent dans leurs serveurs la confidentialité de l’appareil.

Publicité

Microsoft, lui, fait de l’IA locale le thème de son événement Windows du 7 octobre.

02 Évolution & versions

Des origines à aujourd'hui

  1. Janv. 2025

    DeepSeek R1 en local

    Dans la foulée du choc DeepSeek, un tutoriel montre comment exécuter R1 sur PC ou Mac avec LM Studio et Ollama : les versions distillées vont de 1,5 milliard de paramètres (1,1 Go de mémoire) à 7 milliards (4,7 Go).

  2. Août 2025

    Ollama 0.10 et gpt-oss-20b

    Ollama 0.10 lance une application de bureau officielle. Quelques jours plus tard, Microsoft intègre gpt-oss-20b, modèle open source d’OpenAI, à Windows AI Foundry (16 Go de VRAM requis).

  3. Janv. 2026

    LM Studio 0.4.0

    LM Studio se réinvente en serveur : cœur « llmster » sans interface graphique, requêtes parallèles (continuous batching) et API REST native.

  4. 30 mars 2026

    Ollama adopte MLX

    Ollama annonce en préversion la prise en charge de MLX, le framework d’Apple (Ollama 0.19), réservée aux Mac Apple Silicon avec au moins 32 Go de mémoire.

  5. 31 mars 2026

    Gemma 4 sous Apache 2.0

    Google officialise Gemma 4 (E2B, E4B, 26B A4B, 31B) et passe à la licence Apache 2.0 ; les variantes E2B et E4B visent explicitement les appareils mobiles.

  6. Mai-juin 2026

    Gemma 4 plus rapide, puis 12B

    Google publie des MTP drafters (jusqu’à environ trois fois plus rapide selon le matériel), puis Gemma 4 12B, taillé pour 16 Go de mémoire.

  7. Août 2026

    Muse Glimmer

    Meta dévoile Muse Glimmer : 30 milliards de paramètres sous licence Apache 2.0, pensé pour faire tourner des agents IA sur un PC ou un Mac équipé d’une seule carte graphique grand public.

  8. Sept. 2026

    Mac mini M6

    Apple présente le Mac mini M6 (dès 1 049 euros, 16 Go de mémoire unifiée, premières livraisons prévues le 22 septembre), quelques mois après avoir reconnu une pénurie portée par l’IA locale.

  9. 7 oct. 2026

    À venir : Microsoft

    Microsoft donne rendez-vous à San Francisco pour son premier grand événement Windows depuis plus de deux ans, consacré à la manière dont « l’IA locale façonnera le prochain chapitre du PC », avec Satya Nadella, Pavan Davuluri et Jensen Huang.

03 Prix & formules

Combien ça coûte ?

Modèles ouverts

Licence Apache 2.0
Gratuit
  • Gemma 4, Qwen3.5 (séries Small) et Muse Glimmer publiés sous licence Apache 2.0
  • gpt-oss-20b : gratuit et open source
  • Aucun abonnement, aucune limite de jetons

Logiciels d'exécution

Ollama est open source
À installer
  • Ollama : ligne de commande et application de bureau officielle (macOS, Windows, Linux)
  • LM Studio : interface de chat et serveur sans interface (llmster)
  • KoboldCpp : autre outil d'exécution d'IA locale

Matériel

Le vrai coût
Dès 16 Go de mémoire
  • 16 Go : Gemma 4 12B, gpt-oss-20b
  • 24 à 32 Go : Muse Glimmer quantifié en 4 bits
  • Mac mini M6 dès 1 049 euros (16 Go) ; Raspberry Pi AI HAT+ 2 : 145 euros

L’IA locale n’a pas d’abonnement : les modèles ouverts se téléchargent gratuitement et des logiciels comme Ollama sont open source. Le vrai coût est celui du matériel, et surtout de la mémoire, sous tension avec la demande des datacenters IA (Apple évoque des composants tendus en expliquant la pénurie de Mac mini).

04 Comment y accéder

Où et comment l'utiliser

Ligne de commande
Ollama
Une commande comme ollama run deepseek-r1:7b suffit ; application de bureau officielle depuis la version 0.10 (macOS, Windows, Linux)
Interface de chat
LM Studio
Recherche et téléchargement des modèles dans l'application ; mode serveur sans interface (llmster) depuis la version 0.4.0
Windows
Windows AI Foundry et Windows ML
Foundry pour déployer des modèles comme gpt-oss-20b ; Windows ML pour les apps, sur Windows 11 24H2 et suivants
Navigateur
Chrome (Gemini Nano)
Certaines fonctions IA téléchargent un modèle d'environ 4 Go ; l'option « On-device AI » des réglages Système permet de le désactiver
Petit matériel
Raspberry Pi
Petits modèles sur CPU avec Ollama (2 Go de RAM minimum recommandés) ; carte AI HAT+ 2 à 145 euros pour les modèles génératifs
05 Fonctionnalités

Ce que ça permet de faire

Données gardées sur l'appareil

Les documents et les requêtes sont traités sur votre machine : un atout majeur pour les données sensibles, financières, médicales ou professionnelles.

Fonctionnement hors connexion

Le modèle répond sans Internet, en avion, en zone blanche ou sur un réseau isolé, comme le traducteur Gemma Translator bâti sur un Raspberry Pi 5.

Pas d'abonnement ni de limite de jetons

Les modèles ouverts sont gratuits : on ne paie pas à l’usage, et aucun quota ne vient interrompre une longue session.

Automatisation et intégration

Ollama et LM Studio exposent une API locale (compatible OpenAI pour Ollama) pour brancher le modèle à ses scripts et applications.

Choix et personnalisation du modèle

Fine-tunes, versions quantifiées, modèles spécialisés : Google dénombre plus de 100 000 variantes de Gemma créées par la communauté.

Agents exécutés en local

Des modèles comme Muse Glimmer sont conçus pour piloter des agents (fichiers, outils, code) sans dépendre d’une connexion permanente aux serveurs de l’éditeur.

06 Limites & risques

Ce qu'il faut garder en tête

Une barrière matérielle

Il faut de la mémoire : 16 Go pour Gemma 4 12B ou gpt-oss-20b, 24 à 32 Go pour Muse Glimmer, 32 Go pour MLX dans Ollama. La mémoire est de plus sous tension avec la demande des datacenters.

Moins puissant que les meilleurs modèles cloud

Les modèles locaux ont beaucoup progressé mais restent généralement moins puissants que les plus grands modèles hébergés, d’où l’essor des approches hybrides.

Plus lent sur du matériel modeste

Sur un Raspberry Pi, la génération de texte est relativement lente ; sur un PC, tout dépend de la carte graphique et de la mémoire disponibles.

Le coût est déplacé chez l'utilisateur

Stockage, ressources système, consommation d’énergie : le modèle Gemini Nano de Chrome pèse environ 4 Go, et cette taille n’apparaît pas clairement au moment d’activer les fonctions IA.

Des outils encore orientés développeurs

Ligne de commande, quantification, choix du modèle : l’application Ollama a été pensée par des développeurs, pour des développeurs, même si LM Studio simplifie l’accès.

07 Conseils par profil

Faut-il utiliser IA locale ?

Curieux qui veut essayer

Commencez petit avec Ollama ou LM Studio : une version distillée de DeepSeek R1 en 1,5 milliard de paramètres n’occupe que 1,1 Go, la 7B environ 4,7 Go.

Développeurs

Ollama et LM Studio (serveur sans interface, API REST, MCP) permettent de brancher un modèle local à vos applications, sans facturation au jeton.

Utilisateurs de Mac

La mémoire unifiée des Apple Silicon est un atout : Ollama y ajoute MLX (préversion, 32 Go minimum) et le Mac mini M6 démarre à 1 049 euros avec 16 Go. Apple a évoqué des délais rallongés sur ces machines.

PC Windows

Prévoyez 16 Go de VRAM pour gpt-oss-20b via Windows AI Foundry ; les Copilot+ PC misent sur le NPU pour les fonctions système. Microsoft fait de l’IA locale le thème de son événement Windows du 7 octobre.

Données sensibles ou confidentielles

Gardez en local ce qui ne doit pas sortir ; quand la puissance manque, un modèle hybride ou un cloud confidentiel (Private Cloud Compute, Private AI Compute) limite l’exposition.

Bricoleurs

Un Raspberry Pi 5 exécute déjà de petits modèles sur CPU ; le maker Jeff Geerling relève qu’un Pi 5 16 Go peut surpasser la carte AI HAT+ 2 (145 euros), à peser avant d’acheter.

08 Concurrents

Les principales alternatives

Alternative Éditeur Ce qui la distingue
IA dans le cloud OpenAI, Google, Anthropic

Accès aux modèles les plus puissants et aucun matériel à acheter, mais les données quittent l’appareil et l’usage passe par un abonnement ou des limites de jetons.

Cloud confidentiel Apple, Google

Private Cloud Compute (Apple) et Private AI Compute (Google) prolongent les garanties de l’appareil dans le cloud : la puissance des grands modèles avec des protections techniques sur les données.

IA hybride Perplexity

Présenté au Computex 2026, l’orchestrateur décide seul de ce qui reste sur la machine (documents sensibles) et de ce qui part vers le cloud (raisonnement lourd).

09 FAQ

Questions fréquentes

Qu'est-ce que l'IA locale ?

C’est l’exécution d’un modèle d’intelligence artificielle directement sur votre propre appareil (PC, Mac, smartphone, Raspberry Pi) plutôt que sur les serveurs d’un fournisseur : vos données restent chez vous et le modèle fonctionne sans connexion.

Quelle configuration faut-il pour faire tourner un modèle en local ?

Tout dépend de la taille du modèle : environ 16 Go de RAM ou de VRAM pour Gemma 4 12B ou gpt-oss-20b, 24 à 32 Go pour Muse Glimmer quantifié en 4 bits, mais seulement 1,1 Go pour un DeepSeekDeepSeek est une startup chinoise d'IA et une famille de modèles de langage open source, réputée pour son rapport performance/prix très agressif. Lire la fiche R1 distillé en 1,5 milliard de paramètres.

Ollama ou LM Studio : lequel choisir ?

Ollama s’utilise en ligne de commande et dispose depuis la version 0.10 d’une application de bureau officielle, pensée pour les développeurs. LM Studio offre une interface de chat presque grand public et peut aussi tourner comme serveur sans interface depuis la version 0.4.0. KoboldCpp est une autre option.

L'IA locale est-elle vraiment privée ?

Le traitement reste sur votre machine, ce qui limite l’exposition des données. Mais « local » ne veut pas dire « transparent » : Chrome peut par exemple télécharger un modèle Gemini Nano de 4 Go sans alerte évidente. Les approches hybrides ne gardent en local que les fichiers sensibles.

Un modèle local est-il aussi bon que ChatGPT ?

Pas toujours : les modèles locaux ont beaucoup progressé mais restent généralement moins puissants que les plus grands modèles du cloud. Google affirme toutefois que Gemma 4 12B se rapproche du comportement de son modèle 26B sur de nombreux benchmarks, avec deux fois moins de mémoire.

Peut-on faire de l'IA locale sur un smartphone ou un Raspberry Pi ?

Oui : Gemma 4 E2B et E4B visent explicitement les appareils mobiles, Gemini Nano 4 en dérive, et un Raspberry Pi exécute de petits modèles comme TinyLlama (environ 638 Mo de RAM) sur CPU avec Ollama, plus lentement.

L'IA locale est-elle gratuite ?

Il n’y a ni abonnement ni limite de jetons : les modèles ouverts sont gratuits et Ollama est open source. Le coût réel est celui du matériel (surtout la mémoire) et de la consommation d’énergie.

Peut-on utiliser DeepSeek en local ?

Oui, avec les versions distillées de DeepSeek R1 disponibles dans LM Studio ou Ollama (par exemple ollama run deepseek-r1:7b, environ 4,7 Go), ce qui évite d’envoyer ses données au service hébergé.

Publicité

Retrouvez BlogNT en priorité sur Google

Ajoutez-nous à vos sources préférées : nos analyses et tests remontent en tête de votre fil Google Actualités et de la recherche.

Ajouter BlogNT comme source préférée
Sujets abordés