Workstation Logo
产品
AI 实验室OpenAI代理Claude 代理Grok BotWorkstation CRM (WSL CRM)营销全部产品
AI 解决方案
AI 工作站AI SME Packages私有 AIGPU 集群边缘 AI企业 AI 实验室按行业分类的 AI
服务
Platform ModernisationDigital EngineeringData Foundations & AIAutonomous OperationsAI 咨询DevOps 自动化网络安全软件开发智能体构建MLOps 搭建
关于我们
合作伙伴客户案例
文章
文档
WSL ProxyRing PromoterWSL VaultJobshoutSysOps 24/7
博客
联系我们Login
Workstation

面向现代企业的 AI 工作站、AI 多智能体软件、GPU 基础设施和智能代理解决方案。

联系我们

AI 解决方案

AI 工作站AI SME Packages私有 AIGPU 集群边缘 AI企业 AI 实验室按行业分类的 AI

产品

全部产品WSL CRM 与 ERP营销OpenAI代理WSL ProxyRing PromoterWSL VaultJobshoutSysOps 24/7

公司

关于我们为什么选择Workstation合作伙伴客户案例价格联系

资源

文章文档博客搜索网站地图
英国办公室
77-79 Marlowes, Hemel Hempstead HP1 1LF路线指引 — 从 M25 外环伦敦 20 号出口驶出公司编号: 11641870周一至周五:上午 9:00 - 下午 6:00 GMT
+44 7515 356 146
比利时办公室
Workstation SRL, Rue Vanderkindere 34, 1180 Uccle, BrusselsBE 0751.518.683周一至周五:上午 9:00 - 下午 6:00 CET
+32 492 45 67 46
印度办公室
#159 Sector 9, Pocket 1, DDA Flats, 110077 Dwarka, New Delhi
+91 98881 98841

© 2026 Workstation AI。保留所有权利。

隐私Cookie服务条款网站地图

Loading blog...

Home / Blog
AILLMApple SiliconMac StudioOllamaRagLocal AIHardware

拆箱 Mac Studio M4 并运行您的第一个 LLM

一下午从 mactop 在新的 M4 Max、Ollama 安装、本地 Llama 3 以及专用 RAG 管道上的真实读数

Balinder Walia2026年5月15日1 min read

简短、略读的内容,是长篇深度剖析的姊妹篇。如需完整演练,请跳至 长篇文章.

桌子上的盒子现在是一个AI设备

我拆箱了一台新的 Mac Studio,它配备 M4 Max 芯片、128 个 GB 统一内存、40 个 GPU 核心、16 个 CPU 核心和 2 TB SSD。一个下午之内,它就通过 Ollama 在本地运行 Llama 3.1 8B,嵌入我自己的文档,并通过小型 RAG 管道回答有关它们的问题。没有云账单,没有 API 密钥,没有数据离开房间。

该博客是简短版本。整篇文章深入探讨了相同的工作流程。

Mac Studio M4+本地AI覆盖

60秒开箱

在 YouTube 上观看拆箱短片: https://youtube.com/shorts/HUlUoHNsyNM

经典的苹果拆箱:最小的纸板、模制凹槽中的机器、电源线。 Mac Studio 外壳大约为 7.7 英寸见方且密集;当你拿起它的那一刻,你就能感受到它的构建质量。设置确实非常快 - Apple ID、语言、FileVault,全部完成。

首次启动 - 来自 mactop 的真实读数

全新 Mac Studio M4 Max 上的 mactop 仪表板:128 个 GB 统一内存,40 个 GPU 内核,空闲功耗为 6.48 W
全新 Mac Studio M4 Max 上的 mactop - 128 个 GB 统一内存,40 个 GPU 核心,空闲时功耗为 6.48 W。这是 SVG 后备;放置一个真正的 PNG /img/mac-studio-mactop-firstboot.png 稍后再更换。

上面的数字是我唯一引用的硬性数字。它们是来自的基本事实 mactop 在我的机器上,正常运行时间为 37 分钟:

  • M4 Max - 16 个核心(4 E + 12 P)、40 个 GPU 核心(784 MHz)、16 核 ANE。
  • 128 GB统一内存 - 16.62 GB 闲置时使用(约 13%)。
  • 6.48瓦 观察到的最大总空闲功率为 46.33 W。热量:标称。
  • 2TB 固态硬盘, 初始设置后有 1.9 TB 可用空间。

对于我来说,对于具有 128 GB 可用内存的台式机来说,空闲时的功耗为 6.48 W。这个盒子确实是一个低功耗、永远在线的人工智能设备,你可以让它 24x7 运行,而无需考虑电费。

为什么这个硬件很特别——一段统一内存

在传统 PC 上,CPU 具有系统 RAM,GPU 具有独立的 VRAM。必须先通过 PCIe 复制模型,然后 GPU 才能运行该模型;如果模型大于 VRAM,则不适合。在 Apple Silicon 上,CPU、GPU、神经引擎和媒体引擎共享 一 128 GB 池。没有任何内容被复制。 Q4_K_M 处的 70B 参数 LLM(磁盘上大约有 40 个 GB,公开估计)加载了大约 80 个仍可用于上下文、应用程序和工具的 GB。这就是本地 LLM 在 Mac 上感觉不同的原因。

只需三个命令即可从盒子到第一个 LLM

brew install ollama
ollama serve &
ollama run llama3.1:8b "Explain unified memory in 3 sentences."

这就是真正的整个培养过程。第一次运行下载模型(公开估计,磁盘上的 Llama 3.1 8B Q4_K_M 约为 4.7 GB)并将其加载到统一内存中。之后,对话流变得流畅,具有明显的第一个令牌延迟,并且通过响应输出稳定。如果没有适当的基准方法,我故意不在这里发布每秒令牌数;长篇文章进入推理。

不到 60 行 Python 的本地 RAG

使用本地 LLM 可以做的最有用的事情就是将其指向您自己的文档。最小可行堆栈是:

  • PyMuPDF 或者 unstructured 用于解析
  • nomic-embed-text 通过 Ollama 进行嵌入
  • ChromaDB 对于矢量存储
  • Llama 3.1 8B 通过Ollama进行生成

完整的代码位于 长文章。标题是:一切都在 Mac Studio 上运行,没有外部 API 密钥,没有按令牌计费,没有数据离开机器。

Mac Studio 与云 - 诚实的决策矩阵

Mac Studio 的优势在于:始终在线的私有推理、基于您自己的数据的 RAG、IDE 副驾驶、代理原型设计、学习堆栈和家庭实验室。云的优势在于:突发训练作业、>70B 规模的生产服务、不可预测的全球流量以及需要 8 倍 A100/H100 并行度的工作负载。大多数团队最终都会同时使用两者。这篇长文章有一个完整的决策矩阵作为 SVG。

一周后五节课

  1. 隐私解锁新的用例。 当模型是本地的时,我会毫不犹豫地粘贴生产日志、内部文档和客户电子邮件。这改变了我的工作方式。
  2. 每次查询的成本既包括心理成本,也包括财务成本。 没有账单意味着更多的疑问、更多的实验、更多的好奇心。
  3. 128 GB 是最佳选择。 64 GB 是适合严肃工作的地板。 128 GB 为您提供了在 Q4_K_M 运行 70B 的空间,并且仍然有空间用于其他一切。
  4. Ollama 是轻松的入口。 LM Studio 作为模型浏览器非常出色,如果您刚开始使用 Python,MLX 非常出色,llama.cpp 是这一切的基础。
  5. 云并没有死。 它仍然是训练、横向扩展服务和未知负载工作负载的正确工具。

接下来是什么

未来的文章将涵盖 Apple Silicon 上的 MLX 微调、带有 EXO 的多 Mac 推理集群、代理堆栈 (LangGraph + Ollama) 以及更深入的基准测试方法部分。如果您想要包含所有图表、代码和决策矩阵的长版本,请阅读 长篇文章。如果您想要视觉版本,请观看 YouTube 短片。无论哪种方式 - 订阅该系列的其余部分。