Workstation Logo
Producten
AI LabsOpenAI AgentsClaude AgentsGrok BotWorkstation CRM (WSL CRM)MarketingAlle Producten
AI-Oplossingen
AI-WerkstationsAI SME PackagesPrivé AIGPU-ClustersEdge AIEnterprise AI LabAI per Industrie
Diensten
PlatformmoderniseringDigitale engineeringDatafundamenten & AIAutonome operatiesAI-adviesDevOps-automatiseringCybersecuritySoftwareontwikkelingAgentontwikkelingMLOps-opzet
Over Ons
PartnersKlantverhalen
Artikelen
Documentatie
WSL ProxyRing PromoterWSL VaultJobshoutSysOps 24/7
Blog
ContactLogin
Workstation

AI-werkstations, AI multi-agent software, GPU-infrastructuur en intelligente agentoplossingen voor moderne bedrijven.

Contact

AI-oplossingen

AI-WerkstationsAI SME PackagesPrivé AIGPU-ClustersEdge AIEnterprise AI LabAI per Industrie

Producten

Alle ProductenWSL CRM & ERPMarketingOpenAI AgentsWSL ProxyRing PromoterWSL VaultJobshoutSysOps 24/7

Bedrijf

Over OnsWaarom WorkstationPartnersKlantverhalenPrijzenContact

Bronnen

ArtikelenDocumentatieBlogZoekenSitemap
UK-kantoor
77-79 Marlowes, Hemel Hempstead HP1 1LFRoute: neem afrit 20 van de M25, Outer LondonBedrijfsnummer: 11641870Ma - Vr: 9:00 - 18:00 GMT
+44 7515 356 146
België-kantoor
Workstation SRL, Rue Vanderkindere 34, 1180 Uccle, BrusselsBE 0751.518.683Ma - Vr: 9:00 - 18:00 CET
+32 492 45 67 46
India-kantoor
#159 Sector 9, Pocket 1, DDA Flats, 110077 Dwarka, New Delhi
+91 98881 98841

© 2026 Workstation AI. Alle rechten voorbehouden.

PrivacyCookiesServicevoorwaardenWebsite-sitemap

Loading blog...

Home / Blog
AILLMApple SiliconMac StudioOllamaRagLocal AIHardware

Mac Studio M4 uitpakken en uw eerste LLM uitvoeren

Echte metingen van mactop op een nieuwe M4 Max, Ollama-installatie, Llama 3 lokaal en een privé RAG-pijplijn in één middag

Balinder Walia15 mei 20264 min read

Een korte, vlot leesbare metgezel voor de diepe duik in lange vorm. Voor de volledige uitleg, ga naar het lange artikel.

De doos op het bureau is nu een AI-apparaat

Ik heb een nieuwe Mac Studio uitgepakt met de M4 Max-chip, 128 GB verenigd geheugen, 40 GPU-cores, 16 CPU-cores en een SSD van 2 TB. Binnen een middag draaide het Llama 3.1 8B lokaal via Ollama, integreerde mijn eigen documenten en beantwoordde vragen erover via een kleine RAG-pijplijn. Geen cloudrekening, geen API-sleutel, geen gegevens die de kamer verlaten.

Deze blog is de korte versie. Het volledige artikel doorloopt dezelfde workflow diepgaand.

Mac Studio M4 + lokale AI-dekking

Het uitpakken in 60 seconden

Bekijk de unboxing-short op YouTube: https://youtube.com/shorts/HUlUoHNsyNM

Klassieke Apple-unboxing: minimaal karton, de machine in een gegoten uitsparing, een stroomkabel. De Mac Studio-behuizing is ongeveer 19,7 cm vierkant en compact; je voelt de bouwkwaliteit zodra je hem oppakt. De installatie is werkelijk snel: Apple ID, taal, FileVault, klaar.

Eerste keer opstarten - echte metingen van mactop

mactop-dashboard op nieuwe Mac Studio M4 Max: 128 GB verenigd geheugen, 40 GPU-cores, inactief op 6,48 W
mactop op nieuwe Mac Studio M4 Max - 128 GB verenigd geheugen, 40 GPU cores, inactief bij 6,48 W. Dit is de SVG-fallback; plaats een echte PNG op /img/mac-studio-mactop-firstboot.png om het later in te wisselen.

Bovenstaande cijfers zijn de enige harde cijfers die ik zal noemen. Zij komen uit de grondwaarheid mactop op mijn machine bij 37 minuten uptime:

  • M4 Max - 16 kernen (4 E + 12 P), 40 GPU-kernen op 784 MHz, 16-kern ANE.
  • 128 GB verenigd geheugen - 16,62 GB in gebruik bij inactiviteit (ongeveer 13%).
  • 6,48 W totaal stationair vermogen, maximaal 46,33 W waargenomen. Thermiek: Nominaal.
  • 2TB SSD, 1,9 TB vrij na de eerste installatie.

6,48 W bij inactiviteit voor een desktop met 128 GB bruikbaar geheugen is voor mij het belangrijkste getal. Deze box is echt een energiezuinig, altijd ingeschakeld AI-apparaat dat u 24x7 kunt laten draaien zonder aan de elektriciteitsrekening te denken.

Waarom deze hardware speciaal is: verenigd geheugen in één paragraaf

Op een traditionele pc heeft uw CPU systeem-RAM en heeft uw GPU afzonderlijk VRAM. Een model moet over PCIe worden gekopieerd voordat de GPU het kan uitvoeren; als het model groter is dan VRAM, past het niet. Op Apple Silicon delen de CPU, GPU, Neural Engine en media-engines een 128 GB-zwembad. Er wordt niets gekopieerd. Een LLM met 70B-parameters op Q4_K_M (ongeveer 40 GB op schijf, publieke schatting) wordt geladen met ongeveer 80 GB die nog steeds vrij zijn voor context, applicaties en tools. Dit is de reden waarom lokale LLM's anders aanvoelen op een Mac.

Van box naar eerste LLM in drie commando's

brew install ollama
ollama serve &
ollama run llama3.1:8b "Explain unified memory in 3 sentences."

Dat is eigenlijk de hele opvoeding. Bij de eerste run wordt het model gedownload (Llama 3.1 8B Q4_K_M is ongeveer 4,7 GB op schijf, publieke schatting) en wordt het in het uniforme geheugen geladen. Daarna verloopt het streamen van gesprekken soepel, met een merkbare vertraging van de eerste token en een stabiele output via de respons. Ik publiceer hier bewust geen tokens-per-seconde-cijfers zonder een goede benchmarkmethodologie; het lange artikel gaat in op de redenering.

Lokale RAG in minder dan 60 regels Python

Het handigste dat u met een lokale LLM kunt doen, is deze naar uw eigen documenten verwijzen. De minimaal haalbare stapel is:

  • PyMuPDF of unstructured voor parseren
  • nomic-embed-text via Ollama voor insluitingen
  • ChromaDB voor de vectoropslag
  • Llama 3.1 8B via Ollama voor generatie

De volledige code staat in de lang artikel. De kop is: alles draait op de Mac Studio, geen externe API-sleutels, geen facturering per token, geen gegevens die de machine verlaten.

Mac Studio versus cloud - de eerlijke beslissingsmatrix

Mac Studio wint voor: altijd actieve privé-inferentie, RAG op uw eigen gegevens, IDE-copiloten, prototyping van agenten, het leren van de stapel en thuislabs. De cloud wint voor: burst-trainingstaken, >70 miljard productie op schaal, onvoorspelbaar mondiaal verkeer en workloads waarvoor 8x A100/H100-parallellisme nodig is. De meeste teams zullen beide gebruiken. Het lange artikel heeft een volledige beslissingsmatrix als SVG.

Vijf lessen na een week

  1. Privacy ontgrendelt nieuwe gebruiksscenario's. Als het model lokaal is, plak ik er zonder aarzelen productielogboeken, interne documenten en e-mails van klanten in. Dat verandert de manier waarop ik werk.
  2. De kosten per zoekopdracht zijn zowel psychologisch als financieel. Geen rekening betekent meer vragen, meer experimenten, meer nieuwsgierigheid.
  3. 128 GB is de goede plek. 64 GB is de vloer voor serieus werk. 128 GB geeft je ruimte om 70B uit te voeren op Q4_K_M en toch ruimte te hebben voor al het andere.
  4. Ollama is de makkelijke oprit. LM Studio is geweldig als modelbrowser, MLX is geweldig als je net begint met Python, llama.cpp ondersteunt het allemaal.
  5. De wolk is niet dood. Het is nog steeds de juiste tool voor training, schaalvergroting en workloads met onbekende belastingen.

Wat is het volgende

Toekomstige artikelen zullen betrekking hebben op de verfijning van MLX op Apple Silicon, multi-Mac-inferentieclusters met EXO, agentstacks (LangGraph + Ollama) en een dieper stuk benchmarkmethodologie. Als je de lange versie met alle diagrammen, code en beslissingsmatrix wilt, lees dan dit het lange artikel. Als je de visuele versie wilt, bekijk dan de YouTube Kort. Hoe dan ook: abonneer je op de rest van de serie.