拆箱 Mac Studio M4 并运行您的第一个 LLM
一下午从 mactop 在新的 M4 Max、Ollama 安装、本地 Llama 3 以及专用 RAG 管道上的真实读数
简短、略读的内容,是长篇深度剖析的姊妹篇。如需完整演练,请跳至 长篇文章.
桌子上的盒子现在是一个AI设备
我拆箱了一台新的 Mac Studio,它配备 M4 Max 芯片、128 个 GB 统一内存、40 个 GPU 核心、16 个 CPU 核心和 2 TB SSD。一个下午之内,它就通过 Ollama 在本地运行 Llama 3.1 8B,嵌入我自己的文档,并通过小型 RAG 管道回答有关它们的问题。没有云账单,没有 API 密钥,没有数据离开房间。
该博客是简短版本。整篇文章深入探讨了相同的工作流程。
60秒开箱
在 YouTube 上观看拆箱短片: https://youtube.com/shorts/HUlUoHNsyNM
经典的苹果拆箱:最小的纸板、模制凹槽中的机器、电源线。 Mac Studio 外壳大约为 7.7 英寸见方且密集;当你拿起它的那一刻,你就能感受到它的构建质量。设置确实非常快 - Apple ID、语言、FileVault,全部完成。
首次启动 - 来自 mactop 的真实读数
/img/mac-studio-mactop-firstboot.png 稍后再更换。上面的数字是我唯一引用的硬性数字。它们是来自的基本事实 mactop 在我的机器上,正常运行时间为 37 分钟:
- M4 Max - 16 个核心(4 E + 12 P)、40 个 GPU 核心(784 MHz)、16 核 ANE。
- 128 GB统一内存 - 16.62 GB 闲置时使用(约 13%)。
- 6.48瓦 观察到的最大总空闲功率为 46.33 W。热量:标称。
- 2TB 固态硬盘, 初始设置后有 1.9 TB 可用空间。
对于我来说,对于具有 128 GB 可用内存的台式机来说,空闲时的功耗为 6.48 W。这个盒子确实是一个低功耗、永远在线的人工智能设备,你可以让它 24x7 运行,而无需考虑电费。
为什么这个硬件很特别——一段统一内存
在传统 PC 上,CPU 具有系统 RAM,GPU 具有独立的 VRAM。必须先通过 PCIe 复制模型,然后 GPU 才能运行该模型;如果模型大于 VRAM,则不适合。在 Apple Silicon 上,CPU、GPU、神经引擎和媒体引擎共享 一 128 GB 池。没有任何内容被复制。 Q4_K_M 处的 70B 参数 LLM(磁盘上大约有 40 个 GB,公开估计)加载了大约 80 个仍可用于上下文、应用程序和工具的 GB。这就是本地 LLM 在 Mac 上感觉不同的原因。
只需三个命令即可从盒子到第一个 LLM
brew install ollama
ollama serve &
ollama run llama3.1:8b "Explain unified memory in 3 sentences."
这就是真正的整个培养过程。第一次运行下载模型(公开估计,磁盘上的 Llama 3.1 8B Q4_K_M 约为 4.7 GB)并将其加载到统一内存中。之后,对话流变得流畅,具有明显的第一个令牌延迟,并且通过响应输出稳定。如果没有适当的基准方法,我故意不在这里发布每秒令牌数;长篇文章进入推理。
不到 60 行 Python 的本地 RAG
使用本地 LLM 可以做的最有用的事情就是将其指向您自己的文档。最小可行堆栈是:
- PyMuPDF 或者
unstructured用于解析 - nomic-embed-text 通过 Ollama 进行嵌入
- ChromaDB 对于矢量存储
- Llama 3.1 8B 通过Ollama进行生成
完整的代码位于 长文章。标题是:一切都在 Mac Studio 上运行,没有外部 API 密钥,没有按令牌计费,没有数据离开机器。
Mac Studio 与云 - 诚实的决策矩阵
Mac Studio 的优势在于:始终在线的私有推理、基于您自己的数据的 RAG、IDE 副驾驶、代理原型设计、学习堆栈和家庭实验室。云的优势在于:突发训练作业、>70B 规模的生产服务、不可预测的全球流量以及需要 8 倍 A100/H100 并行度的工作负载。大多数团队最终都会同时使用两者。这篇长文章有一个完整的决策矩阵作为 SVG。
一周后五节课
- 隐私解锁新的用例。 当模型是本地的时,我会毫不犹豫地粘贴生产日志、内部文档和客户电子邮件。这改变了我的工作方式。
- 每次查询的成本既包括心理成本,也包括财务成本。 没有账单意味着更多的疑问、更多的实验、更多的好奇心。
- 128 GB 是最佳选择。 64 GB 是适合严肃工作的地板。 128 GB 为您提供了在 Q4_K_M 运行 70B 的空间,并且仍然有空间用于其他一切。
- Ollama 是轻松的入口。 LM Studio 作为模型浏览器非常出色,如果您刚开始使用 Python,MLX 非常出色,llama.cpp 是这一切的基础。
- 云并没有死。 它仍然是训练、横向扩展服务和未知负载工作负载的正确工具。
接下来是什么
未来的文章将涵盖 Apple Silicon 上的 MLX 微调、带有 EXO 的多 Mac 推理集群、代理堆栈 (LangGraph + Ollama) 以及更深入的基准测试方法部分。如果您想要包含所有图表、代码和决策矩阵的长版本,请阅读 长篇文章。如果您想要视觉版本,请观看 YouTube 短片。无论哪种方式 - 订阅该系列的其余部分。