Workstation Logo
Produits
Labs IAAgents OpenAIAgents ClaudeGrok BotWorkstation CRM (WSL CRM)MarketingTous les Produits
Solutions IA
Stations de Travail IAAI SME PackagesIA PrivéeClusters GPUIA EdgeLaboratoire IA EntrepriseIA par Industrie
Services
Modernisation de plateformeIngénierie numériqueDonnées et activation IAOpérations autonomesConseil IAAutomatisation DevOpsCybersécuritéDéveloppement logicielCréation d'agentsMise en place MLOps
À Propos
PartenairesTémoignages Clients
Articles
Documentation
WSL ProxyRing PromoterWSL VaultJobshoutSysOps 24/7
Blog
Nous ContacterLogin
Workstation

Stations de travail IA, logiciels multi-agents IA, infrastructure GPU et solutions d'agents intelligents pour les entreprises modernes.

Nous Contacter

Solutions IA

Stations de Travail IAAI SME PackagesIA PrivéeClusters GPUIA EdgeLaboratoire IA EntrepriseIA par Industrie

Produits

Tous les ProduitsWSL CRM & ERPMarketingAgents OpenAIWSL ProxyRing PromoterWSL VaultJobshoutSysOps 24/7

Entreprise

À ProposPourquoi WorkstationPartenairesTémoignages ClientsTarificationContact

Ressources

ArticlesDocumentationBlogRechercherPlan du Site
Bureau Royaume-Uni
77-79 Marlowes, Hemel Hempstead HP1 1LFItinéraire : prenez la sortie 20 de la M25, Outer LondonN° d'entreprise: 11641870Lun - Ven : 9h00 - 18h00 GMT
+44 7515 356 146
Bureau Belgique
Workstation SRL, Rue Vanderkindere 34, 1180 Uccle, BrusselsBE 0751.518.683Lun - Ven : 9h00 - 18h00 CET
+32 492 45 67 46
Bureau Inde
#159 Sector 9, Pocket 1, DDA Flats, 110077 Dwarka, New Delhi
+91 98881 98841

© 2026 Workstation AI. Tous droits réservés.

ConfidentialitéCookiesConditions d'UtilisationPlan du site web

Loading blog...

Home / Blog
AILLMApple SiliconMac StudioOllamaRagLocal AIHardware

Déballage du Mac Studio M4 et exécution de votre premier LLM

Lectures réelles de mactop sur une nouvelle installation M4 Max, Ollama, Llama 3 localement et un pipeline RAG privé en un après-midi

Balinder Walia15 mai 20265 min read

Un compagnon court et lisible pour la plongée profonde longue. Pour la procédure complète, accédez à le long article.

La boîte sur le bureau est désormais un appareil IA

J'ai déballé un nouveau Mac Studio avec la puce M4 Max, 128 GB de mémoire unifiée, 40 cœurs GPU, 16 cœurs CPU et un SSD de 2 To. En un après-midi, il exécutait Llama 3.1 8B localement via Ollama, intégrait mes propres documents et répondait aux questions via un petit pipeline RAG. Pas de facture cloud, pas de clé API, pas de données sortant de la pièce.

Ce blog est la version courte. L’article complet décrit en profondeur le même flux de travail.

Mac Studio M4 + couverture IA locale

Le déballage en 60 secondes

Regardez le court métrage de déballage sur YouTube : https://youtube.com/shorts/HUlUoHNsyNM

Déballage Apple classique : carton minimal, la machine dans un évidement moulé, un câble d'alimentation. Le boîtier Mac Studio mesure environ 7,7 pouces carrés et est dense ; vous ressentez la qualité de construction dès que vous le récupérez. La configuration est vraiment rapide - identifiant Apple, langue, FileVault, c'est fait.

Premier démarrage - vraies lectures de mactop

Tableau de bord mactop sur le nouveau Mac Studio M4 Max : 128 mémoire unifiée GB, 40 cœurs GPU, inactif à 6,48 W
mactop sur Mac Studio M4 Max frais - 128 mémoire unifiée GB, 40 cœurs GPU, inactifs à 6,48 W. C'est la solution de repli SVG ; déposez un vrai PNG sur /img/mac-studio-mactop-firstboot.png pour l'échanger plus tard.

Les chiffres ci-dessus sont les seuls chiffres concrets que je citerai. Ils sont la vérité terrain de mactop sur ma machine à 37 minutes de disponibilité :

  • M4 Max - 16 cœurs (4 E + 12 P), 40 cœurs GPU à 784 MHz, 16 cœurs ANE.
  • 128 mémoire unifiée GB - 16,62 GB en utilisation au ralenti (environ 13%).
  • 6,48 W puissance totale au ralenti, 46,33 W max observé. Thermiques : nominales.
  • SSD de 2 To, 1,9 To gratuits après la configuration initiale.

6,48 W au repos pour un ordinateur de bureau avec 128 GB de mémoire utilisable est pour moi le chiffre principal. Ce boîtier est véritablement un appareil d’IA à faible consommation et toujours allumé que vous pouvez laisser fonctionner 24h/24 et 7j/7 sans penser à la facture d’électricité.

Pourquoi ce matériel est spécial - mémoire unifiée en un seul paragraphe

Sur un PC traditionnel, votre CPU dispose d'une RAM système et votre GPU d'une VRAM séparée. Un modèle doit être copié sur PCIe avant que le GPU puisse l'exécuter ; si le modèle est plus grand que la VRAM, il ne rentre pas. Sur Apple Silicon, les moteurs CPU, GPU, Neural Engine et multimédia partagent un Piscine 128 GB. Rien n'est copié. Un LLM avec un paramètre 70B au Q4_K_M (environ 40 GB sur disque, estimation publique) se charge avec environ 80 GB toujours gratuits pour le contexte, les applications et les outils. C'est pourquoi les LLM locaux se sentent différents sur un Mac.

De la boîte au premier LLM en trois commandes

brew install ollama
ollama serve &
ollama run llama3.1:8b "Explain unified memory in 3 sentences."

C’est vraiment tout le sujet. La première exécution télécharge le modèle (Llama 3.1 8B Q4_K_M fait environ 4,7 GB sur disque, estimation publique) et le charge dans la mémoire unifiée. Après cela, le streaming conversationnel est fluide, avec un délai notable au premier jeton et une sortie constante tout au long de la réponse. Je ne publie délibérément pas ici de chiffres de jetons par seconde sans une méthodologie de référence appropriée ; le long article entre dans le raisonnement.

RAG local en moins de 60 lignes de Python

La chose la plus utile que vous puissiez faire avec un LLM local est de le pointer vers vos propres documents. La pile minimale viable est :

  • PyMuPDF ou unstructured pour l'analyse
  • nomic-embed-text via Ollama pour les intégrations
  • ChromaDB pour le magasin vectoriel
  • Llama 3.1 8B via Ollama pour la génération

Le code complet est dans le long article. Le titre est le suivant : tout fonctionne sur le Mac Studio, pas de clés API externes, pas de facturation par jeton, aucune donnée ne quitte la machine.

Mac Studio vs cloud : la matrice de décision honnête

Mac Studio gagne pour : l'inférence privée permanente, RAG sur vos propres données, les copilotes IDE, le prototypage d'agent, l'apprentissage de la pile et les laboratoires à domicile. Le cloud gagne pour : les tâches de formation en rafale, la production >70 B à grande échelle, le trafic mondial imprévisible et les charges de travail qui nécessitent un parallélisme 8x A100/H100. La plupart des équipes finiront par utiliser les deux. Le long article contient une matrice de décision complète au format SVG.

Cinq leçons après une semaine

  1. La confidentialité ouvre la voie à de nouveaux cas d’utilisation. Lorsque le modèle est local, je colle sans hésiter les logs de production, les documents internes et les emails des clients. Cela change ma façon de travailler.
  2. Le coût par requête est à la fois psychologique et financier. Aucune facture signifie plus de requêtes, plus d’expériences, plus de curiosité.
  3. 128 GB est le point idéal. 64 GB est le sol idéal pour un travail sérieux. 128 GB vous donne une marge pour exécuter 70B au Q4_K_M et avoir encore de la place pour tout le reste.
  4. Ollama est la rampe d'accès facile. LM Studio est excellent en tant que navigateur de modèles, MLX est idéal si vous débutez avec Python, llama.cpp sous-tend tout.
  5. Le cloud n'est pas mort. Il s'agit toujours de l'outil idéal pour la formation, le service évolutif et les charges de travail à charge inconnue.

Quelle est la prochaine étape

Les prochains articles couvriront le réglage fin de MLX sur Apple Silicon, les clusters d'inférence multi-Mac avec EXO, les piles d'agents (LangGraph + Ollama) et un élément méthodologique de référence plus approfondi. Si vous voulez la version longue avec tous les diagrammes, le code et la matrice de décision, lisez le long article. Si vous voulez la version visuelle, regardez le Court métrage YouTube. Quoi qu'il en soit, abonnez-vous pour le reste de la série.