Mac Studio M4 uitpakken en uw eerste LLM uitvoeren
Echte metingen van mactop op een nieuwe M4 Max, Ollama-installatie, Llama 3 lokaal en een privé RAG-pijplijn in één middag
Een korte, vlot leesbare metgezel voor de diepe duik in lange vorm. Voor de volledige uitleg, ga naar het lange artikel.
De doos op het bureau is nu een AI-apparaat
Ik heb een nieuwe Mac Studio uitgepakt met de M4 Max-chip, 128 GB verenigd geheugen, 40 GPU-cores, 16 CPU-cores en een SSD van 2 TB. Binnen een middag draaide het Llama 3.1 8B lokaal via Ollama, integreerde mijn eigen documenten en beantwoordde vragen erover via een kleine RAG-pijplijn. Geen cloudrekening, geen API-sleutel, geen gegevens die de kamer verlaten.
Deze blog is de korte versie. Het volledige artikel doorloopt dezelfde workflow diepgaand.
Het uitpakken in 60 seconden
Bekijk de unboxing-short op YouTube: https://youtube.com/shorts/HUlUoHNsyNM
Klassieke Apple-unboxing: minimaal karton, de machine in een gegoten uitsparing, een stroomkabel. De Mac Studio-behuizing is ongeveer 19,7 cm vierkant en compact; je voelt de bouwkwaliteit zodra je hem oppakt. De installatie is werkelijk snel: Apple ID, taal, FileVault, klaar.
Eerste keer opstarten - echte metingen van mactop
/img/mac-studio-mactop-firstboot.png om het later in te wisselen.Bovenstaande cijfers zijn de enige harde cijfers die ik zal noemen. Zij komen uit de grondwaarheid mactop op mijn machine bij 37 minuten uptime:
- M4 Max - 16 kernen (4 E + 12 P), 40 GPU-kernen op 784 MHz, 16-kern ANE.
- 128 GB verenigd geheugen - 16,62 GB in gebruik bij inactiviteit (ongeveer 13%).
- 6,48 W totaal stationair vermogen, maximaal 46,33 W waargenomen. Thermiek: Nominaal.
- 2TB SSD, 1,9 TB vrij na de eerste installatie.
6,48 W bij inactiviteit voor een desktop met 128 GB bruikbaar geheugen is voor mij het belangrijkste getal. Deze box is echt een energiezuinig, altijd ingeschakeld AI-apparaat dat u 24x7 kunt laten draaien zonder aan de elektriciteitsrekening te denken.
Waarom deze hardware speciaal is: verenigd geheugen in één paragraaf
Op een traditionele pc heeft uw CPU systeem-RAM en heeft uw GPU afzonderlijk VRAM. Een model moet over PCIe worden gekopieerd voordat de GPU het kan uitvoeren; als het model groter is dan VRAM, past het niet. Op Apple Silicon delen de CPU, GPU, Neural Engine en media-engines een 128 GB-zwembad. Er wordt niets gekopieerd. Een LLM met 70B-parameters op Q4_K_M (ongeveer 40 GB op schijf, publieke schatting) wordt geladen met ongeveer 80 GB die nog steeds vrij zijn voor context, applicaties en tools. Dit is de reden waarom lokale LLM's anders aanvoelen op een Mac.
Van box naar eerste LLM in drie commando's
brew install ollama
ollama serve &
ollama run llama3.1:8b "Explain unified memory in 3 sentences."
Dat is eigenlijk de hele opvoeding. Bij de eerste run wordt het model gedownload (Llama 3.1 8B Q4_K_M is ongeveer 4,7 GB op schijf, publieke schatting) en wordt het in het uniforme geheugen geladen. Daarna verloopt het streamen van gesprekken soepel, met een merkbare vertraging van de eerste token en een stabiele output via de respons. Ik publiceer hier bewust geen tokens-per-seconde-cijfers zonder een goede benchmarkmethodologie; het lange artikel gaat in op de redenering.
Lokale RAG in minder dan 60 regels Python
Het handigste dat u met een lokale LLM kunt doen, is deze naar uw eigen documenten verwijzen. De minimaal haalbare stapel is:
- PyMuPDF of
unstructuredvoor parseren - nomic-embed-text via Ollama voor insluitingen
- ChromaDB voor de vectoropslag
- Llama 3.1 8B via Ollama voor generatie
De volledige code staat in de lang artikel. De kop is: alles draait op de Mac Studio, geen externe API-sleutels, geen facturering per token, geen gegevens die de machine verlaten.
Mac Studio versus cloud - de eerlijke beslissingsmatrix
Mac Studio wint voor: altijd actieve privé-inferentie, RAG op uw eigen gegevens, IDE-copiloten, prototyping van agenten, het leren van de stapel en thuislabs. De cloud wint voor: burst-trainingstaken, >70 miljard productie op schaal, onvoorspelbaar mondiaal verkeer en workloads waarvoor 8x A100/H100-parallellisme nodig is. De meeste teams zullen beide gebruiken. Het lange artikel heeft een volledige beslissingsmatrix als SVG.
Vijf lessen na een week
- Privacy ontgrendelt nieuwe gebruiksscenario's. Als het model lokaal is, plak ik er zonder aarzelen productielogboeken, interne documenten en e-mails van klanten in. Dat verandert de manier waarop ik werk.
- De kosten per zoekopdracht zijn zowel psychologisch als financieel. Geen rekening betekent meer vragen, meer experimenten, meer nieuwsgierigheid.
- 128 GB is de goede plek. 64 GB is de vloer voor serieus werk. 128 GB geeft je ruimte om 70B uit te voeren op Q4_K_M en toch ruimte te hebben voor al het andere.
- Ollama is de makkelijke oprit. LM Studio is geweldig als modelbrowser, MLX is geweldig als je net begint met Python, llama.cpp ondersteunt het allemaal.
- De wolk is niet dood. Het is nog steeds de juiste tool voor training, schaalvergroting en workloads met onbekende belastingen.
Wat is het volgende
Toekomstige artikelen zullen betrekking hebben op de verfijning van MLX op Apple Silicon, multi-Mac-inferentieclusters met EXO, agentstacks (LangGraph + Ollama) en een dieper stuk benchmarkmethodologie. Als je de lange versie met alle diagrammen, code en beslissingsmatrix wilt, lees dan dit het lange artikel. Als je de visuele versie wilt, bekijk dan de YouTube Kort. Hoe dan ook: abonneer je op de rest van de serie.