Workstation Logo
ผลิตภัณฑ์
AI LabsOpenAI AgentsClaude AgentsGrok BotWorkstation CRM (WSL CRM)การตลาดผลิตภัณฑ์ทั้งหมด
โซลูชัน AI
เวิร์กสเตชัน AIAI SME PackagesAI ส่วนตัวคลัสเตอร์ GPUEdge AIแล็บ AI องค์กรAI ตามอุตสาหกรรม
บริการ
Platform ModernisationDigital EngineeringData Foundations & AIAutonomous Operationsที่ปรึกษา AIระบบอัตโนมัติ DevOpsความมั่นคงปลอดภัยไซเบอร์การพัฒนาซอฟต์แวร์การสร้างเอเจนต์การตั้งค่า MLOps
เกี่ยวกับเรา
พาร์ทเนอร์เรื่องราวลูกค้า
บทความ
เอกสาร
WSL ProxyRing PromoterWSL VaultJobshoutSysOps 24/7
บล็อก
ติดต่อเราLogin
Workstation

เวิร์กสเตชัน AI ซอฟต์แวร์มัลติเอเจนต์ AI โครงสร้างพื้นฐาน GPU และโซลูชันเอเจนต์อัจฉริยะสำหรับธุรกิจยุคใหม่

ติดต่อเรา

โซลูชัน AI

เวิร์กสเตชัน AIAI SME PackagesAI ส่วนตัวคลัสเตอร์ GPUEdge AIแล็บ AI องค์กรAI ตามอุตสาหกรรม

ผลิตภัณฑ์

ผลิตภัณฑ์ทั้งหมดWSL CRM และ ERPการตลาดOpenAI AgentsWSL ProxyRing PromoterWSL VaultJobshoutSysOps 24/7

บริษัท

เกี่ยวกับเราทำไมต้อง Workstationพาร์ทเนอร์เรื่องราวลูกค้าราคาติดต่อ

แหล่งข้อมูล

บทความเอกสารประกอบบล็อกค้นหาแผนผังเว็บไซต์
สำนักงานสหราชอาณาจักร
77-79 Marlowes, Hemel Hempstead HP1 1LFเส้นทาง - ออกทางแยกที่ 20 จาก M25 Outer Londonเลขทะเบียนบริษัท: 11641870จ. - ศ.: 9:00 - 18:00 น. GMT
+44 7515 356 146
สำนักงานเบลเยียม
Workstation SRL, Rue Vanderkindere 34, 1180 Uccle, BrusselsBE 0751.518.683จ. - ศ.: 9:00 - 18:00 น. CET
+32 492 45 67 46
สำนักงานอินเดีย
#159 Sector 9, Pocket 1, DDA Flats, 110077 Dwarka, New Delhi
+91 98881 98841

© 2026 Workstation AI สงวนลิขสิทธิ์

ความเป็นส่วนตัวคุกกี้ข้อกำหนดการให้บริการแผนผังเว็บไซต์

Loading blog...

Home / Blog
AILLMApple SiliconMac StudioOllamaRagLocal AIHardware

แกะกล่อง Mac Studio M4 และใช้งาน LLM ตัวแรกของคุณ

การอ่านค่าจริงจาก Mactop บนการติดตั้ง M4 Max, Ollama ใหม่, Llama 3 ภายในเครื่อง และไปป์ไลน์ RAG ส่วนตัวในบ่ายวันหนึ่ง

Balinder Walia15 พฤษภาคม 25692 min read

เนื้อหาสั้นๆ ที่อ่านง่ายสำหรับการดำน้ำลึกในรูปแบบยาว สำหรับคำแนะนำแบบเต็ม ให้ข้ามไปที่ บทความยาว.

กล่องที่อยู่บนโต๊ะตอนนี้กลายเป็นอุปกรณ์ AI แล้ว

ฉันแกะกล่อง Mac Studio ใหม่พร้อมชิป M4 Max, หน่วยความจำรวม 128 GB, GPU คอร์ 40 คอร์, CPU คอร์ 16 คอร์ และ SSD ความจุ 2 TB ภายในช่วงบ่าย มีการเรียกใช้ Llama 3.1 8B ภายในเครื่องผ่าน Ollama โดยฝังเอกสารของฉันเอง และตอบคำถามเหล่านั้นผ่านไปป์ไลน์ RAG ขนาดเล็ก ไม่มีค่าบริการคลาวด์ ไม่มีคีย์ API ไม่มีข้อมูลออกจากห้อง

บล็อกนี้เป็นเวอร์ชันสั้น บทความฉบับเต็มจะอธิบายขั้นตอนการทำงานเดียวกันในเชิงลึก

Mac Studio M4 + ปก AI ท้องถิ่น

แกะกล่องภายใน 60 วินาที

ชมการแกะกล่องขนาดสั้นบน YouTube: https://youtube.com/shorts/HUlUoHNsyNM

การแกะกล่อง Apple แบบคลาสสิก: กระดาษแข็งแบบมินิมอล, ตัวเครื่องอยู่ในช่องขึ้นรูป, สายไฟ กล่อง Mac Studio มีขนาดประมาณ 7.7 นิ้วเป็นสี่เหลี่ยมจัตุรัสและมีความหนาแน่น คุณรู้สึกถึงคุณภาพงานสร้างทันทีที่คุณหยิบมันขึ้นมา การตั้งค่ารวดเร็วอย่างแท้จริง - Apple ID, ภาษา, FileVault เสร็จสิ้น

การบูตครั้งแรก - การอ่านจริงจาก mactop

แดชบอร์ด mactop บน Mac Studio M4 Max ใหม่: หน่วยความจำรวม 128 GB, 40 GPU คอร์, ไม่ได้ใช้งานที่ 6.48 W
mactop บน Mac Studio M4 Max สด - หน่วยความจำรวม 128 GB, 40 GPU คอร์, ว่างที่ 6.48 W. นี่คือทางเลือก SVG วาง PNG จริงได้ที่ /img/mac-studio-mactop-firstboot.png เพื่อเปลี่ยนในภายหลัง

ตัวเลขข้างต้นเป็นเพียงตัวเลขที่ยากเท่านั้นที่ฉันจะยกมาอ้างอิง พวกเขาเป็นความจริงภาคพื้นดินจาก mactop บนเครื่องของฉันที่เวลาทำงาน 37 นาที:

  • M4 Max - 16 คอร์ (4 E + 12 P), 40 GPU คอร์ ที่ 784 MHz, 16-คอร์ ANE
  • หน่วยความจำรวม 128 GB - 16.62 GB ใช้งานขณะไม่ได้ใช้งาน (ประมาณ 13%)
  • 6.48 วัตต์ กำลังเดินเบาทั้งหมด สังเกตสูงสุด 46.33 W ความร้อน: เล็กน้อย
  • 2TB SSDฟรี 1.9 TB หลังจากการตั้งค่าครั้งแรก

6.48 W ที่ไม่ได้ใช้งานสำหรับเดสก์ท็อปที่มีหน่วยความจำที่ใช้งานได้ 128 GB คือหมายเลขพาดหัวสำหรับฉัน กล่องนี้เป็นอุปกรณ์ AI ที่ใช้พลังงานต่ำและทำงานตลอดเวลาอย่างแท้จริง ซึ่งคุณสามารถเปิดทำงานตลอด 24 ชั่วโมงทุกวันโดยไม่ต้องคำนึงถึงค่าไฟ

เหตุใดฮาร์ดแวร์นี้จึงมีความพิเศษ - หน่วยความจำแบบรวมในหนึ่งย่อหน้า

บนพีซีแบบเดิม CPU ของคุณมี RAM ระบบ และ GPU ของคุณมี VRAM แยกต่างหาก ต้องคัดลอกโมเดลข้าม PCIe ก่อน GPU จึงจะสามารถรันได้ ถ้ารุ่นใหญ่กว่า VRAM ก็ไม่พอดี บน Apple Silicon นั้น CPU, GPU, Neural Engine และเอ็นจิ้นมีเดียจะแชร์กัน หนึ่ง สระน้ำ 128 GB ไม่มีอะไรถูกคัดลอก LLM พารามิเตอร์ 70B ที่ Q4_K_M (ประมาณ 40 GB บนดิสก์ การประมาณการสาธารณะ) โหลดโดยที่ GB ประมาณ 80 ตัวยังคงว่างสำหรับบริบท แอปพลิเคชัน และเครื่องมือ นี่คือสาเหตุที่ทำให้ LLM ในเครื่องรู้สึกแตกต่างบน Mac

จากกล่องถึง LLM แรกในสามคำสั่ง

brew install ollama
ollama serve &
ollama run llama3.1:8b "Explain unified memory in 3 sentences."

นั่นคือการนำขึ้นมาทั้งหมดอย่างแท้จริง การดำเนินการครั้งแรกจะดาวน์โหลดโมเดล (Llama 3.1 8B Q4_K_M อยู่ที่ประมาณ 4.7 GB บนดิสก์ การประมาณการสาธารณะ) และโหลดลงในหน่วยความจำแบบรวม หลังจากนั้นการสตรีมการสนทนาจะราบรื่น โดยมีความล่าช้าของโทเค็นแรกที่เห็นได้ชัดเจนและเอาต์พุตที่สม่ำเสมอผ่านการตอบกลับ ฉันจงใจไม่เผยแพร่ตัวเลขโทเค็นต่อวินาทีที่นี่โดยไม่มีวิธีการวัดประสิทธิภาพที่เหมาะสม บทความยาว ๆ เข้าสู่การให้เหตุผล

RAG ท้องถิ่นใน Python ต่ำกว่า 60 บรรทัด

สิ่งที่มีประโยชน์ที่สุดที่คุณสามารถทำได้กับ LLM ในเครื่องคือการชี้ไปที่เอกสารของคุณเอง สแต็กขั้นต่ำที่ใช้งานได้คือ:

  • PyMuPDF หรือ unstructured สำหรับการแยกวิเคราะห์
  • nomic-embed-text ผ่าน Ollama สำหรับการฝัง
  • ChromaDB สำหรับร้านเวกเตอร์
  • Llama 3.1 8B ผ่าน Ollama สำหรับรุ่น

รหัสเต็มอยู่ใน บทความยาว. พาดหัวคือ: ทุกอย่างทำงานบน Mac Studio, ไม่มีคีย์ API ภายนอก, ไม่มีการเรียกเก็บเงินต่อโทเค็น, ไม่มีข้อมูลออกจากเครื่อง

Mac Studio กับคลาวด์ - เมทริกซ์การตัดสินใจที่ซื่อสัตย์

Mac Studio ชนะในด้าน: การอนุมานส่วนตัวตลอดเวลา, RAG บนข้อมูลของคุณเอง, โคไพล็อต IDE, การสร้างต้นแบบเอเจนต์, การเรียนรู้สแต็ก และโฮมแล็บ คลาวด์ชนะในด้าน: งานฝึกอบรมที่ระเบิดออกมา, การให้บริการการผลิตมากกว่า 70 พันล้านรายการในวงกว้าง, การรับส่งข้อมูลทั่วโลกที่คาดเดาไม่ได้ และปริมาณงานที่ต้องการการทำงานแบบขนาน A100/H100 ถึง 8 เท่า ทีมส่วนใหญ่จะใช้ทั้งสองอย่าง บทความขนาดยาวมีเมทริกซ์การตัดสินใจแบบเต็มในรูปแบบ SVG

ห้าบทเรียนหลังจากหนึ่งสัปดาห์

  1. ความเป็นส่วนตัวจะปลดล็อกกรณีการใช้งานใหม่ๆ เมื่อโมเดลอยู่ในเครื่อง ฉันจะวางบันทึกการผลิต เอกสารภายใน และอีเมลของลูกค้าโดยไม่ลังเล นั่นเปลี่ยนวิธีการทำงานของฉัน
  2. ต้นทุนต่อการสืบค้นขึ้นอยู่กับจิตวิทยาและการเงิน การไม่มีการเรียกเก็บเงินหมายถึงการสืบค้นมากขึ้น การทดลองมากขึ้น และความอยากรู้อยากเห็นมากขึ้น
  3. 128 GB คือจุดที่น่าสนใจ 64 GB เป็นพื้นสำหรับงานจริงจัง 128 GB ช่วยให้คุณวิ่งได้ 70B ที่ Q4_K_M และยังมีที่ว่างสำหรับอย่างอื่น
  4. Ollama เป็นทางลาดที่ใช้งานง่าย LM Studio นั้นยอดเยี่ยมในฐานะเบราว์เซอร์แบบจำลอง ส่วน MLX นั้นยอดเยี่ยมหากคุณเริ่มต้นใหม่ใน Python llama.cpp จะสนับสนุนทุกอย่าง
  5. เมฆยังไม่ตาย ยังคงเป็นเครื่องมือที่เหมาะสมสำหรับการฝึกอบรม การขยายขนาดการให้บริการ และปริมาณงานที่ไม่ทราบจำนวน

อะไรต่อไป

บทความในอนาคตจะครอบคลุมถึงการปรับแต่ง MLX อย่างละเอียดบน Apple Silicon, คลัสเตอร์การอนุมาน multi-Mac ที่มี EXO, Agent Stacks (LangGraph + Ollama) และชิ้นส่วนวิธีการวัดประสิทธิภาพที่เจาะลึกยิ่งขึ้น หากคุณต้องการเวอร์ชันยาวที่มีไดอะแกรม โค้ด และเมทริกซ์การตัดสินใจทั้งหมด โปรดอ่าน บทความยาว. หากคุณต้องการเวอร์ชั่นภาพโปรดดูที่ YouTube แบบสั้น. ไม่ว่าจะด้วยวิธีใดก็ตาม - สมัครรับข้อมูลซีรีส์ที่เหลือ