Workstation Logo
Продукты
AI LabsАгенты OpenAIАгенты ClaudeGrok BotWorkstation CRM (WSL CRM)МаркетингВсе продукты
Решения ИИ
Рабочие станции ИИAI SME PackagesЧастный ИИКластеры GPUПограничный ИИЛаборатория корпоративного ИИИИ по отраслям
Услуги
Platform ModernisationDigital EngineeringData Foundations & AIAutonomous OperationsИИ-консалтингАвтоматизация DevOpsКибербезопасностьРазработка ПОСоздание агентовНастройка MLOps
О нас
ПартнёрыИстории клиентов
Статьи
Документация
WSL ProxyRing PromoterWSL VaultJobshoutSysOps 24/7
Блог
Связаться с намиLogin
Workstation

AI-рабочие станции, мультиагентное AI-ПО, GPU-инфраструктура и решения на базе интеллектуальных агентов для современного бизнеса.

Связаться с нами

AI-решения

Рабочие станции ИИAI SME PackagesЧастный ИИКластеры GPUПограничный ИИЛаборатория корпоративного ИИИИ по отраслям

Продукты

Все продуктыWSL CRM и ERPМаркетингАгенты OpenAIWSL ProxyRing PromoterWSL VaultJobshoutSysOps 24/7

Компания

О насПочему WorkstationПартнёрыИстории клиентовЦеныКонтакты

Ресурсы

СтатьиДокументацияБлогПоискКарта сайта
Офис в Великобритании
77-79 Marlowes, Hemel Hempstead HP1 1LFКак добраться: съезд 20 с трассы M25, Внешний ЛондонРег. номер компании: 11641870Пн - Пт: 9:00 - 18:00 GMT
+44 7515 356 146
Офис в Бельгии
Workstation SRL, Rue Vanderkindere 34, 1180 Uccle, BrusselsBE 0751.518.683Пн - Пт: 9:00 - 18:00 CET
+32 492 45 67 46
Офис в Индии
#159 Sector 9, Pocket 1, DDA Flats, 110077 Dwarka, New Delhi
+91 98881 98841

© 2026 Workstation AI. Все права защищены.

КонфиденциальностьФайлы cookieУсловия использованияКарта сайта

Loading blog...

Home / Blog
AILLMApple SiliconMac StudioOllamaRagLocal AIHardware

Распаковка Mac Studio M4 и запуск вашего первого LLM

Реальные показания с mactop на свежеустановленном M4 Max, установленном Ollama, локальном Llama 3 и частном конвейере RAG за один день

Balinder Walia15 мая 2026 г.4 min read

Короткое, легко читаемое дополнение к подробному глубокому погружению. Для полного прохождения перейдите к длинная статья.

Коробка на столе теперь является устройством искусственного интеллекта.

Я распаковал новый Mac Studio с чипом M4 Max, 128 унифицированной памяти GB, 40 ядрами GPU, 16 ядрами CPU и твердотельным накопителем емкостью 2 ТБ. В течение дня он запускал Llama 3.1 8B локально через Ollama, встраивал мои собственные документы и отвечал на вопросы по ним через небольшой конвейер RAG. Никаких счетов за облако, никаких ключей API, никаких данных, покидающих комнату.

Этот блог представляет собой короткую версию. В полной статье подробно рассматривается тот же рабочий процесс.

Mac Studio M4 + местная AI-защита

Распаковка за 60 секунд.

Посмотрите короткометражку о распаковке на YouTube: https://youtube.com/shorts/HUlUoHNsyNM

Классическая распаковка Apple: минимум картона, аппарат в отформованном углублении, кабель питания. Корпус Mac Studio имеет квадратную форму примерно 7,7 дюйма и плотный; качество сборки ощущается в тот момент, когда вы берете его в руки. Установка действительно быстрая: Apple ID, язык, FileVault, готово.

Первая загрузка - реальные показания с Mactop

Панель управления mactop на новом Mac Studio M4 Max: 128 унифицированных памяти GB, 40 ядер GPU, потребление в режиме ожидания 6,48 Вт
mactop на свежем Mac Studio M4 Max - 128 унифицированных памяти GB, 40 ядер GPU, мощность в режиме ожидания 6,48 Вт. Это запасной вариант SVG; бросьте настоящий PNG в /img/mac-studio-mactop-firstboot.png чтобы заменить его позже.

Приведенные выше цифры — единственные точные цифры, которые я могу привести. Они являются основной истиной из mactop на моей машине при 37 минутах безотказной работы:

  • M4 Max — 16 ядер (4 E + 12 P), 40 ядер GPU по 784 МГц, 16-ядерный ANE.
  • 128 унифицированной памяти GB - 16,62 GB используется на холостом ходу (около 13%).
  • 6,48 Вт общая мощность в режиме ожидания: максимальная наблюдаемая мощность 46,33 Вт. Термические характеристики: Номинальные.
  • SSD-накопитель емкостью 2 ТБ, 1,9 ТБ свободно после первоначальной настройки.

6,48 Вт в режиме ожидания для настольного компьютера со 128 GB полезной памяти — это для меня главный показатель. Этот блок действительно представляет собой маломощное, постоянно включенное устройство искусственного интеллекта, которое вы можете оставить работающим 24 часа в сутки, 7 дней в неделю, не думая о счетах за электроэнергию.

Чем это железо особенное — унифицированная память в одном абзаце

На традиционном ПК ваш CPU имеет системную оперативную память, а ваш GPU — отдельную видеопамять. Модель необходимо скопировать через PCIe, прежде чем GPU сможет ее запустить; если модель больше VRAM, она не подойдет. В Apple Silicon CPU, GPU, Neural Engine и медиа-движки совместно используют один 128 пулов GB. Ничего не копируется. LLM с 70B параметрами в Q4_K_M (около 40 GB на диске, по общедоступной оценке) загружается, при этом примерно 80 GB все еще свободны для контекста, приложений и инструментов. Вот почему местные LLM по-другому ощущаются на Mac.

От коробки до первого LLM за три команды

brew install ollama
ollama serve &
ollama run llama3.1:8b "Explain unified memory in 3 sentences."

В этом, собственно, и состоит все воспитание. При первом запуске модель загружается (по общедоступной оценке, Llama 3.1 8B Q4_K_M на диске составляет около 4,7 GB) и загружается в унифицированную память. После этого потоковая передача разговора становится плавной, с заметной задержкой первого токена и стабильным выводом ответа. Я намеренно не публикую здесь цифры количества токенов в секунду без надлежащей методологии тестирования; длинная статья посвящена рассуждениям.

Локальный RAG менее чем в 60 строках Python

Самое полезное, что вы можете сделать с локальным LLM, — это направить его на свои документы. Минимальный жизнеспособный стек:

  • PyMuPDF или unstructured для разбора
  • nomic-embed-text через Ollama для встраивания
  • ChromaDB для векторного магазина
  • Llama 3.1 8B через Ollama для генерации

Полный код находится в длинная статья. Заголовок таков: все работает на Mac Studio, никаких внешних ключей API, никакой оплаты по токенам, никаких данных, покидающих машину.

Mac Studio против облака: матрица честных решений

Mac Studio выигрывает за: постоянный частный логический вывод, RAG для ваших собственных данных, вторые пилоты IDE, прототипирование агентов, изучение стека и домашние лаборатории. Облако выигрывает за: пакетное обучение, масштабируемое производство >70 млрд, непредсказуемый глобальный трафик и рабочие нагрузки, требующие 8-кратного параллелизма A100/H100. Большинство команд в конечном итоге будут использовать оба. В длинной статье есть полная матрица решений в формате SVG.

Пять уроков через неделю

  1. Конфиденциальность открывает новые варианты использования. Если модель локальная, я без колебаний вставляю производственные журналы, внутреннюю документацию и электронные письма клиентов. Это меняет то, как я работаю.
  2. Стоимость каждого запроса является как психологической, так и финансовой. Отсутствие законопроекта означает больше запросов, больше экспериментов, больше любопытства.
  3. 128 GB — это золотая середина. 64 GB — это площадка для серьезной работы. 128 GB дает вам запас для запуска 70B на Q4_K_M и при этом остается место для всего остального.
  4. Ollama — это легкий путь к успеху. LM Studio отлично подходит в качестве браузера моделей, MLX отлично подходит, если вы начинаете с нуля в Python, а llama.cpp лежит в основе всего этого.
  5. Облако не умерло. Это по-прежнему подходящий инструмент для обучения, масштабируемого обслуживания и рабочих нагрузок с неизвестной нагрузкой.

Что дальше

В будущих статьях будет рассмотрена тонкая настройка MLX на Apple Silicon, кластеры вывода для нескольких Mac с EXO, стеки агентов (LangGraph + Ollama), а также более детальная методология тестирования. Если вам нужна длинная версия со всеми диаграммами, кодом и матрицей решений, прочитайте длинная статья. Если вам нужна визуальная версия, посмотрите Короткометражка на YouTube. В любом случае — подписывайтесь на остальные серии.