● RÉCEMMENT MIS À JOUR Nano Banana 2 noté 8/10Beehiiv noté 7,5/10Llama Chatbots & assistants IAQwen noté 7/10Google Gemini noté 8/10Grok noté 7/10GLM (Z.ai) noté 6,5/10Manus Agents IADeepSeek noté 7/10Mistral AI noté 8,5/10 ● RÉCEMMENT MIS À JOUR Nano Banana 2 noté 8/10Beehiiv noté 7,5/10Llama Chatbots & assistants IAQwen noté 7/10Google Gemini noté 8/10Grok noté 7/10GLM (Z.ai) noté 6,5/10Manus Agents IADeepSeek noté 7/10Mistral AI noté 8,5/10
Tuto · pas à pas

Comment installer une IA en local sur ton PC ou ton Mac

21 août 2026 · 8 min de lecture · par Hasnen
Comment installer une IA en local sur ton PC ou ton Mac
SommaireMasquer

    À la fin de ce tutoriel, tu auras une IA qui tourne entièrement sur ton ordinateur : pas d’abonnement, pas de connexion internet obligatoire, et surtout aucune de tes données qui part sur un serveur américain. Tu poses une question, la réponse se calcule dans ta machine, point.

    J’utilise cette approche pour tout ce qui touche à des documents confidentiels, et le plus surprenant, c’est à quel point c’est devenu simple : trois clics dans une seule application, zéro ligne de commande.

    Tout ce qui suit a été vérifié le 21 août 2026, avec les versions et les modèles disponibles à cette date.

    1. Prérequis : ta machine peut-elle le faire ?

    C’est LA question, alors réglons-la d’abord. La mémoire disponible détermine la taille du modèle que tu peux faire tourner. La règle simple : compte environ 0,5 à 1 Go de mémoire par milliard de paramètres pour un modèle compressé au format standard (la quantization Q4, on y revient plus bas).

    Ta machine Ce que tu peux faire tourner
    Mac Apple Silicon 8 Go, ou PC sans GPU dédié Petits modèles de 2 à 4 milliards de paramètres. Ça fonctionne, sans plus.
    16 Go de RAM, GPU de 8 Go Modèles de 7 à 8 milliards de paramètres, confortablement.
    GPU de 12 à 16 Go, ou Mac 16-24 Go Modèles de 12 à 20 milliards de paramètres, dont gpt-oss-20b.
    GPU 24 Go, ou Mac 32 Go et plus Les meilleurs modèles locaux du moment (~27-30 milliards de paramètres).

    Un avantage structurel pour les Mac : sur Apple Silicon, la RAM et la mémoire graphique sont un seul et même pool (la « mémoire unifiée »). Un Mac avec 32 Go peut donc charger un modèle qui exigerait un GPU dédié à 24 Go sur PC.

    Côté logiciel, on va utiliser LM Studio. Ses exigences officielles : sur Mac, une puce Apple Silicon (M1 ou plus récent) et macOS 14 minimum, les Mac Intel ne sont pas supportés. Sur Windows, un processeur 64 bits et au moins 4 Go de mémoire vidéo dédiée. Sur Linux, Ubuntu 20.04 ou plus récent. Dans tous les cas, 16 Go de RAM recommandés.

    Et le prix : LM Studio est gratuit, y compris pour un usage professionnel, depuis juillet 2025. C’est officiel et sans formulaire. Pour une entreprise qui veut faire de l’IA sur des données clients sans rien envoyer dans le cloud, c’est un argument sérieux.

    2. Installer LM Studio

    1. Va sur lmstudio.ai et télécharge la version pour ton système (au moment où j’écris : la 0.4.21, sortie le 12 août 2026).
    2. Installe l’application comme n’importe quel logiciel : glisser dans Applications sur Mac, assistant d’installation sur Windows.
    3. Ouvre LM Studio. Au premier lancement, l’application te propose de choisir un niveau d’interface : prends le mode simple, tu pourras toujours activer les options avancées plus tard.

    Tu sais que c’est réussi quand : LM Studio s’ouvre sur son écran d’accueil, sans message d’erreur.

    3. Télécharger ton premier modèle

    1. Ouvre l’onglet de découverte des modèles (l’icône loupe, « Discover »).
    2. Cherche le modèle adapté à ta machine (mes recommandations par profil sont au point 5). Pour un premier test sur une machine moyenne, un modèle de 4 à 8 milliards de paramètres est parfait.
    3. Un point qui rend LM Studio très pédagogique : le catalogue t’indique si un modèle est compatible avec ta machine avant de le télécharger. Si l’application te dit qu’il est trop gros, crois-la.
    4. Clique sur Download et attends : un modèle pèse entre 2 et 20 Go selon sa taille.

    Tu sais que c’est réussi quand : le téléchargement affiche 100 % et le modèle apparaît dans ta bibliothèque locale.

    4. Ton premier chat en local

    1. Ouvre l’onglet Chat.
    2. En haut de la fenêtre, ouvre le sélecteur de modèle et choisis celui que tu viens de télécharger. Le chargement prend de quelques secondes à une minute selon la taille.
    3. Écris ton premier message. La réponse se génère mot à mot, entièrement sur ta machine.
    4. Le test qui fait comprendre : coupe ton wifi et repose une question. Ça répond toujours. Voilà, c’est ça, une IA locale.

    Tu sais que c’est réussi quand : le modèle répond hors ligne, à une vitesse acceptable. Si la génération est très lente (plusieurs secondes par mot), le modèle est trop gros pour ta machine : reprends le point 3 avec un modèle plus petit.

    5. Quel modèle choisir en août 2026

    C’est là que la plupart des guides sont périmés : ils recommandent encore des modèles de 2024. Voici ce qui vaut le coup aujourd’hui, uniquement des modèles en licence Apache 2.0 (usage commercial libre, sans conditions cachées).

    • Machine modeste (8-16 Go) : Gemma 4 E4B de Google, environ 4,5 milliards de paramètres effectifs, qui accepte le texte, les images et même l’audio. Sur 8 Go, prends son petit frère E2B.
    • Machine intermédiaire (GPU 12-16 Go, Mac 16-24 Go) : gpt-oss-20b, le modèle ouvert d’OpenAI. Grâce à son architecture (21 milliards de paramètres au total, mais ~3,6 milliards actifs à chaque calcul) et à sa compression native, il tient dans 12 à 16 Go tout en étant rapide.
    • Machine confortable (GPU 24 Go, Mac 32 Go+) : Qwen3.8-27B, sorti le 14 août 2026. Environ 17 Go en version compressée, multimodal (il comprend les images et les vidéos), fenêtre de contexte de 262 000 tokens. C’est le meilleur modèle local du moment pour une machine grand public. L’alternative : Muse Glimmer 30B de Meta, même gabarit, pensé pour les usages agentiques.

    Un piège à connaître : le nom d’un modèle ne dit pas sa taille réelle. « Mistral Small 4 », malgré son nom, pèse 119 milliards de paramètres et exige officiellement au minimum quatre GPU H100 de datacenter. « Small » désigne ses paramètres actifs, pas son empreinte mémoire. Vérifie toujours la taille du fichier à télécharger, pas le nom marketing.

    Dernier mot de vocabulaire : les modèles se téléchargent en version « quantizée », c’est-à-dire compressée. Le format standard s’appelle Q4_K_M : la majorité des poids du modèle passent en 4 bits, ce qui divise la taille par quatre par rapport à l’original, pour une perte de qualité marginale en usage courant. C’est le choix par défaut, et c’est le bon.

    6. Et Ollama dans tout ça ?

    Tu croiseras forcément le nom d’Ollama, l’autre grand outil du domaine. La plupart des comparatifs répètent qu’Ollama se pilote en ligne de commande : c’est faux depuis juillet 2025, il a une application de bureau avec interface graphique, chat intégré et glisser-déposer de fichiers PDF.

    La vraie différence en 2026 est ailleurs. LM Studio s’adresse à celui qui veut utiliser une IA locale sans rien configurer. Ollama s’adresse à celui qui veut scripter, intégrer l’IA à ses propres outils (il expose une API compatible OpenAI, pratique pour n8n ou un script maison) ou tourner sur un serveur Linux. Pour ce tutoriel, LM Studio est le bon choix ; si un jour tu automatises, regarde Ollama.

    Erreurs fréquentes

    • « Le modèle ne se charge pas » ou l’app plante : modèle trop gros pour ta mémoire. Reprends une taille en dessous, ou une quantization plus agressive.
    • « C’est d’une lenteur insupportable » : sur PC sans GPU dédié, l’inférence tourne sur le processeur, et c’est lent par nature. Reste sur des modèles de 4 milliards de paramètres ou moins.
    • « Le modèle raconte n’importe quoi sur l’actualité » : normal. Un modèle local nu ne va pas sur internet et ne sait rien après sa date d’entraînement. Ne l’utilise pas comme moteur de recherche.
    • « Mon disque est plein » : chaque modèle pèse 5 à 20 Go. Supprime ceux que tu n’utilises plus depuis la bibliothèque de LM Studio.

    Ce qu’une IA locale ne fera pas (soyons honnêtes)

    Un modèle de 27 milliards de paramètres sur ton Mac ne rivalise pas avec les plus gros modèles cloud sur les tâches les plus exigeantes : raisonnement complexe, code pointu, très longs documents. Pour l’essentiel des usages quotidiens (résumer, rédiger, reformuler, analyser un document), la différence est devenue faible ; pour le reste, le cloud garde l’avantage.

    Et « gratuit » mérite une nuance : c’est gratuit si ta machine existe déjà. Si tu pars de zéro, un GPU de 24 Go représente plusieurs centaines d’euros. La bonne nouvelle : commence avec la machine que tu as, les modèles de 4 à 8 milliards de paramètres d’aujourd’hui font déjà beaucoup.

    FAQ

    C’est quoi, une IA locale ?

    Un modèle d’intelligence artificielle qui s’exécute entièrement sur ton ordinateur, sans envoyer tes données à un serveur distant. Tu télécharges le modèle une fois, puis tout fonctionne hors ligne, gratuitement et en privé.

    Faut-il un GPU pour faire tourner une IA en local ?

    Non, mais ça aide beaucoup. Sans GPU dédié, le calcul passe par le processeur : ça fonctionne avec les petits modèles (2 à 4 milliards de paramètres), mais lentement. Sur Mac Apple Silicon, la mémoire unifiée fait office de mémoire graphique, ce qui rend les Mac récents étonnamment capables.

    Quelle IA locale installer sur Mac ?

    LM Studio (gratuit, Apple Silicon, macOS 14 minimum) avec un modèle adapté à ta mémoire : Gemma 4 E4B sur 8-16 Go, gpt-oss-20b sur 16-24 Go, Qwen3.8-27B à partir de 32 Go de mémoire unifiée.

    Est-ce vraiment gratuit ?

    Oui. LM Studio est gratuit, y compris en usage professionnel, et les modèles recommandés ici sont publiés en licence Apache 2.0, libre pour un usage commercial. Le seul coût réel, c’est le matériel si ta machine est trop juste.

    Une IA locale est-elle aussi bonne que ChatGPT ?

    Pas sur les tâches les plus difficiles, où les gros modèles cloud gardent l’avantage. Mais pour résumer, rédiger, reformuler ou analyser des documents au quotidien, un bon modèle local récent fait le travail, avec une confidentialité que le cloud ne peut pas offrir par construction.

    Quelle est la différence entre LM Studio et Ollama ?

    Les deux font tourner les mêmes modèles. LM Studio mise tout sur la simplicité (une application, trois clics), Ollama sur l’intégration (API compatible OpenAI, scripts, serveurs). Commence par LM Studio ; passe à Ollama si tu veux automatiser.

    Continue avec ces tutos