Workstation Logo
المنتجات
مختبرات الذكاء الاصطناعيوكلاء OpenAIوكلاء ClaudeGrok BotWorkstation CRM (WSL CRM)التسويقجميع المنتجات
حلول الذكاء الاصطناعي
محطات عمل الذكاء الاصطناعيAI SME Packagesذكاء اصطناعي خاصمجموعات GPUذكاء اصطناعي طرفيمختبر الذكاء الاصطناعي للمؤسساتالذكاء الاصطناعي حسب الصناعة
الخدمات
Platform ModernisationDigital EngineeringData Foundations & AIAutonomous Operationsاستشارات الذكاء الاصطناعيأتمتة DevOpsالأمن السيبرانيتطوير البرمجياتبناء الوكلاءإعداد MLOps
من نحن
الشركاءقصص العملاء
المقالات
الوثائق
WSL ProxyRing PromoterWSL VaultJobshoutSysOps 24/7
المدونة
اتصل بناLogin
Workstation

محطات عمل الذكاء الاصطناعي وبرمجيات الوكلاء المتعددة والبنية التحتية لوحدات GPU وحلول الوكلاء الأذكياء للشركات الحديثة.

اتصل بنا

حلول الذكاء الاصطناعي

محطات عمل الذكاء الاصطناعيAI SME Packagesذكاء اصطناعي خاصمجموعات GPUذكاء اصطناعي طرفيمختبر الذكاء الاصطناعي للمؤسساتالذكاء الاصطناعي حسب الصناعة

المنتجات

جميع المنتجاتWSL CRM و ERPالتسويقوكلاء OpenAIWSL ProxyRing PromoterWSL VaultJobshoutSysOps 24/7

الشركة

من نحنلماذا Workstationالشركاءقصص العملاءالأسعاراتصل

الموارد

المقالاتالتوثيقالمدونةبحثخريطة الموقع
مكتب المملكة المتحدة
77-79 Marlowes, Hemel Hempstead HP1 1LFالاتجاهات - اسلك المخرج 20 من الطريق M25 في لندن الخارجيةرقم الشركة: 11641870الاثنين - الجمعة: 9:00 ص - 6:00 م بتوقيت GMT
+44 7515 356 146
مكتب بلجيكا
Workstation SRL, Rue Vanderkindere 34, 1180 Uccle, BrusselsBE 0751.518.683الاثنين - الجمعة: 9:00 ص - 6:00 م بتوقيت CET
+32 492 45 67 46
مكتب الهند
#159 Sector 9, Pocket 1, DDA Flats, 110077 Dwarka, New Delhi
+91 98881 98841

© 2026 Workstation AI. جميع الحقوق محفوظة.

الخصوصيةملفات تعريف الارتباطشروط الخدمةخريطة الموقع الإلكتروني
Home / Articles / Technology
الذكاء الاصطناعيApple SiliconLLMالأجهزة

فتح علبة Mac Studio M4 وتشغيل أول LLM

جولة كاملة من التمهيد الأول إلى مسار RAG الخاص على Apple Silicon: 128 ذاكرة موحدة GB، وOllama، وLlama 3، وContinue.dev، وChromaDB، ومصفوفة قرار سحابية صادقة مقابل محلية

May 15, 2026Technology22 min read

هذا هو الغوص العميق الطويل. للحصول على نسخة أسرع وقابلة للقراءة، راجع مشاركة مدونة مصاحبة.

1. المقدمة: لماذا Mac Studio للذكاء الاصطناعي المحلي؟

لم يعد الذكاء الاصطناعي المحلي موضع فضول الهاوي. بفضل نماذج الأوزان المفتوحة من Meta وMistral وQwen وMicrosoft التي تنضج بسرعة، والذاكرة الموحدة لـ Apple Silicon التي تتجاوز عتبة 128 GB، يمكنك الآن تشغيل نماذج لغة كبيرة قادرة، وخطوط أنابيب التضمين، ومكدسات RAG الكاملة على جهاز واحد بجانب المكتب - بهدوء، وفي جزء صغير من ميزانية الطاقة لمحطة عمل نموذجية GPU.

تتناول هذه المقالة فتح علبة أ Mac Studio مع شريحة M4 Max، التمهيد الأول، القراءات الحقيقية على الجهاز من mactopومسار عملي من "الصندوق موجود على مكتبي" إلى "أتحدث مع Llama 3 الذي يعمل محليًا وأستفسر عن المستندات الخاصة بي باستخدام RAG". كل توصية هنا ترتكز على ما لاحظته بالفعل على الجهاز. لا توجد أرقام قياسية مخترعة، ولا زغب تسويقي - فقط سير العمل.

إذا كنت مهندسًا، أو منشئ الذكاء الاصطناعي، أو SRE، أو قائدًا تقنيًا تقرر ما إذا كان Mac Studio ينتمي إلى مزيج الأجهزة الخاص بفريقك، فهذا الدليل مناسب لك.

Mac Studio M4 Max + غطاء AI محلي

2. فتح علبة Mac Studio M4 Max

تجربة فتح العلبة هي تجربة كلاسيكية من Apple: الحد الأدنى من الورق المقوى، والجهاز موضوع في تجويف مقولب، وكابل طاقة أسود قصير، وهذا كل شيء. لا توجد حزمة ملحقات منتفخة. إن Mac Studio نفسه هو نفس هيكل الألمنيوم المدمج الذي تم تقديمه مع M1 Ultra الأصلي: حوالي 7.7 بوصة مربعة، كثيفة في اليد، مع مدخل شرائحي مألوف على الجانب السفلي ومجموعة من المنافذ على طول الجزء الخلفي.

شاهد مقطع فتح العلبة القصير على YouTube: https://youtube.com/shorts/HUlUoHNsyNM

لقد قمت بتصوير مقطع قصير من عملية فتح العلبة - شاهد مقطع YouTube القصير أعلاه. السبب الذي يجعل الفيديوهات القصيرة تعمل بشكل جيد مع هذا التنسيق هو أن الإعداد الفعلي سريع جدًا. قم أولاً بالمكونات الإضافية، وتنشيط الشاشة، وتسجيل الدخول باستخدام معرف Apple، واللغة والمنطقة، وFileVault، وستكون على سطح مكتب قابل للاستخدام في غضون بضع دقائق.

2.1 التمهيد الأول - قراءات حقيقية من mactop

أول شيء فعلته بعد انتهاء النظام من المزامنة الأولية هو التثبيت mactop - لوحة معلومات TUI ممتازة مفتوحة المصدر تعرض عدادات Apple Silicon الداخلية في الوقت الفعلي. إليك ما تبدو عليه لوحة التحكم الخاصة بالتثبيت الجديد بعد 37 دقيقة من وقت التشغيل:

لوحة أجهزة القياس mactop على Mac Studio M4 Max الطازجة: 128 ذاكرة موحدة GB، 40 نواة GPU، خاملة عند 6.48 وات
mactop على Mac Studio M4 Max الطازجة - 128 ذاكرة GB موحدة، 40 نواة GPU، خاملة عند 6.48 وات. هذا هو SVG الاحتياطي؛ قم بإسقاط PNG حقيقي على /img/mac-studio-mactop-firstboot.png لتبديلها في وقت لاحق.

الأرقام الموجودة في لقطة الشاشة هذه هي الأرقام الثابتة الوحيدة التي سأذكرها في هذه المقالة. إنها الحقيقة الأساسية لجهازي في وضع الخمول في إعداد جديد:

  • Apple Silicon: M4 Max
  • CPU: إجمالي 16 مركزًا - 4 مراكز كفاءة + 12 مركزًا للأداء؛ المجموعة الإلكترونية عند 1.6 جيجا هرتز، المجموعة P عند 0.2 جيجا هرتز؛ الحزمة عند 37 درجة مئوية
  • GPU: 40 نواة بتردد 784 ميجاهرتز، 30 درجة مئوية
  • المحرك العصبي (ANE): 16 نواة، تستهلك 0.00 وات في وضع الخمول
  • الذاكرة الموحدة: إجمالي 128.00 GB، 16.62 GB قيد الاستخدام (حوالي 13%) في وضع الخمول
  • قوة: إجمالي 6.48 واط - CPU 0.10 واط، GPU 0.02 واط، ANE 0 واط، DRAM 0.36 واط، النظام 6.01 واط. الحد الأقصى الذي لوحظ في الجلسة كان 46.33 واط.
  • تخزين: 2.0 تيرابايت ماك إتش دي، 1.9 تيرابايت مجانًا؛ 53.9 GB يستخدمه نظام التشغيل والإعداد الأولي
  • شبكة: Wi-Fi 6، مع عينة قراءة تبلغ 19.0 كيلو بايت/ثانية تحميل و156.8 كيلو بايت/ثانية تنزيل أثناء مزامنة الخلفية

شيئان يبرزان. أولاً، 6.48 واط في وضع الخمول يعد الكمبيوتر المكتبي الذي يحتوي على 128 GB من الذاكرة القابلة للاستخدام أمرًا رائعًا - وهذا أقل مما ترسمه العديد من أجهزة الكمبيوتر المحمولة والشاشة مغلقة. ثانيًا، يعمل GPU بتردد 784 ميجاهرتز مع توفر 40 نواة؛ هذا التجمع جاهز للقيام بعمل حقيقي بمجرد وضع LLM أمامه.

3. لماذا يعد Mac Studio M4 Max رائعًا للذكاء الاصطناعي المحلي

لفهم سبب ملاءمة هذا الجهاز للذكاء الاصطناعي المحلي - ولماذا تعد "الذاكرة الموحدة" أكثر من مجرد خط تسويقي - من المفيد مقارنتها مباشرة بالبديل الأساسي: بطاقة GPU المنفصلة في جهاز الكمبيوتر، والتي تتواصل مع ذاكرة الوصول العشوائي للنظام عبر PCIe.

الذاكرة الموحدة Apple Silicon مقابل طراز GPU المنفصل: 128 مجموعة GB مشتركة مقابل ذاكرة VRAM محدودة مع اختناق نسخة PCIe

3.1 الذاكرة الموحدة بلغة واضحة

على جهاز كمبيوتر شخصي تقليدي يعمل بالذكاء الاصطناعي، لديك مجموعتان للذاكرة. تحتوي ذاكرة الوصول العشوائي للنظام (عادةً 64-256 GB من DDR5) على نظام التشغيل والتطبيق وأوزان النموذج عند تحميلها من القرص. يحتوي GPU على VRAM خاص به - 24 GB على RTX 4090، و32 GB على 5090، و80 GB على A100. قبل أن يتمكن GPU من تشغيل matmul واحد، يجب أن يكون النموذج كذلك منقول من ذاكرة الوصول العشوائي للنظام إلى VRAM عبر ناقل PCIe. إذا كان النموذج أكبر من VRAM، فإما أنه لا يتم تحميله على الإطلاق، أو يتم ترحيله عبر PCIe بتكلفة باهظة (غالبًا ما يكون أبطأ بمقدار 10 إلى 100 مرة من التشغيل الكامل في VRAM).

يقوم Apple Silicon بدمج هاتين المجموعتين في مجموعة واحدة. ترى كل من CPU وGPU والمحرك العصبي ومحركات الوسائط نفس الذاكرة الجسدية. لا توجد نسخة. لا يوجد عنق الزجاجة PCIe. النموذج الذي يحتوي على 40 GB على القرص هو 40 GB في الذاكرة الموحدة، ويمكن لـ GPU قراءته مباشرة.

بالنسبة لطرازات LLM المحلية، هذه هي الميزة الرائعة. نموذج 70B معلمة مكمما إلى Q4_K_M هو حوالي 40 GB على القرص (الرقم المذكور علنًا لأوزان فئة Llama عند هذا المستوى الكمي - يتم التعامل معه على أنه تقريبي). على 24 GB للمستهلك GPU، هذا النموذج ببساطة غير مناسب. في الذاكرة الموحدة 128 GB، يتم تحميل حوالي 80 GB لا تزال خالية من السياق ورمز التطبيق والأدوات.

3.2 كفاءة الطاقة التي يصعب تصديقها

تُظهر لقطة شاشة mactop 6.48 واط في وضع الخمول بحد أقصى 46.33 واط أثناء الجلسة. لوضع ذلك في الاعتبار: يعمل جهاز RTX 4090 واحد في وضع الخمول عند 15-25 واط مع بقية النظام في الأعلى، ويسحب ما يصل إلى 450 واط تحت الحمل. Mac Studio عبارة عن صندوق AI بجانب المكتب يمكنك تركه يعمل على مدار الساعة طوال أيام الأسبوع دون ملاحظة ذلك على فاتورة الكهرباء. إنه صامت. لا تدور المراوح أبدًا تقريبًا أثناء أعباء عمل الاستدلال. وهذا ما يجعلها قابلة للحياة باعتبارها صندوق التطوير الذي يعمل دائمًا بطريقة نادرًا ما تكون موجودة في كمبيوتر GPU المنفصل.

3.3 ما يفعله محرك Apple العصبي فعليًا

ANE عبارة عن مسرع ذو وظيفة ثابتة مكون من 16 نواة تم تحسينه لأنواع عمليات الموتر التي ينتجها CoreML. بالنسبة لمعظم أحمال عمل LLM ذات الأوزان المفتوحة في عام 2026 (تنسيق GGUF الذي يعمل عبر llama.cpp أو Ollama)، فإن ANE ليس في المسار الساخن - GPU موجود عبر Metal Performance Shaders. يتألق ANE في النماذج المحولة إلى CoreML، والتعرف على الكلام على الجهاز، وتجزئة الصور، وأحمال العمل المماثلة ذات الشكل الثابت. كما أنها موفرة للطاقة للغاية عند تشغيلها. من المفيد أن نعرف أنه موجود؛ لا تتوقع أن يستخدمه كل مكدس LLM.

4. إعداد Mac Studio لعمل الذكاء الاصطناعي

بعد الإعداد القياسي لنظام التشغيل macOS، إليك العرض الدقيق الذي أتبعه لجهاز Mac Studio الجديد الذي أريد استخدامه كمربع تطوير محلي للذكاء الاصطناعي.

4.1 قم بتثبيت Homebrew وXcode CLT والأساسيات

/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"

xcode-select --install

brew install git wget jq python@3.12 node pyenv
brew install --cask iterm2 visual-studio-code

تقدم Homebrew أدوات Unix، وتوفر Xcode Command Line Tools المترجمين والروابط، وتمنحك Python وNode وقت تشغيل لرمز التطبيق، وiTerm2 + VS Code هما المحرر + زوج المحطة الطرفية الذي أستخدمه افتراضيًا.

4.2 تثبيت Ollama

Ollama هي أسهل طريقة لتنزيل وتشغيل وتقديم LLMs ذات الأوزان المفتوحة على نظام التشغيل macOS. تحت غطاء محرك السيارة يلتف llama.cpp مع تسريع معدني ويوفر HTTP API بسيطًا على المنفذ 11434.

brew install ollama

ollama serve &

ollama --version

يمكنك أيضًا التثبيت عبر المسؤول .dmg من ollama.com، الذي يقوم بإعداد تطبيق شريط القوائم. يعمل أي من المسارين. أفضل تثبيت الشراب للصناديق مقطوعة الرأس وdmg لأجهزة Mac ذات التشغيل اليومي.

4.3 تثبيت LM Studio (اختياري ولكنه يستحق ذلك)

ستوديو إل إم هي واجهة مستخدم لسطح المكتب للتصفح والتنزيل والدردشة مع نماذج GGUF. كما أنه يعرض API المتوافق مع OpenAI. لقد قمت بتثبيته جنبًا إلى جنب مع Ollama لأن متصفح الطراز ممتاز وواجهة المستخدم لضبط الأداء لكل نموذج سهلة الاستخدام عندما تقرر بين Q4_K_M وQ5_K_M.

4.4 قم بتثبيت Continue.dev في رمز VS

يمنحك Continue.dev مساعدة بأسلوب ChatGPT داخل VS Code، ولكنه يشير إلى Ollama المحلي. بعد تثبيت الإضافة، قم بإسقاط هذا في جهازك ~/.continue/config.json:

{
  "models": [
    {
      "title": "Llama 3.1 8B (local)",
      "provider": "ollama",
      "model": "llama3.1:8b",
      "apiBase": "http://localhost:11434"
    },
    {
      "title": "Qwen 2.5 Coder 14B (local)",
      "provider": "ollama",
      "model": "qwen2.5-coder:14b",
      "apiBase": "http://localhost:11434"
    }
  ],
  "tabAutocompleteModel": {
    "title": "Codestral (local)",
    "provider": "ollama",
    "model": "codestral:latest",
    "apiBase": "http://localhost:11434"
  }
}

الآن لديك دردشة مضمنة، وتحرير، وإكمال تلقائي - وكلها نماذج ناجحة تعيش على نفس مكتب محررك. صفر بيانات يترك الجهاز.

5. تشغيل LLM الأول

مكدس الذكاء الاصطناعي المحلي على Mac Studio: النماذج، ووقت التشغيل، والتسريع، والتطبيقات

حان وقت لحظة الحقيقة. سحب نموذج وتشغيله.

5.1 سحب Llama 3.1 8B

ollama pull llama3.1:8b

ollama list

ollama run llama3.1:8b "Explain unified memory architecture to me in 3 sentences."

يؤدي السحب إلى تنزيل Q4_K_M GGUF (يبلغ Llama 3.1 8B في Q4_K_M حوالي 4.7 GB على القرص - وهو رقم تم الاستشهاد به علنًا، ويتم التعامل معه على أنه تقريبي). على اتصال Wi-Fi 6 مثل اتصالي، يستغرق التنزيل بضع دقائق؛ على جيجابت السلكية يكون أسرع. بمجرد هبوطه، الأول ollama run يتضمن تحميل النموذج لمرة واحدة في الذاكرة الموحدة - ستلاحظ توقفًا قصيرًا قبل تدفقات الرمز المميز الأولى - ومن ثم تكون عمليات التشغيل اللاحقة سريعة.

أنا هنا عمدًا لن أقتبس أرقام الرموز المميزة في الثانية لجهازي الخاص، لأنني لم أقم بتشغيل مجموعة قياس أداء خاضعة للرقابة باستخدام منهجية مقترنة. ما سأقوله هو أنه في هذه الفئة من الأجهزة (M4 Max مع 40 نواة GPU) يجب أن تتوقع تدفق سلس للمحادثة من طراز 8B في Q4_K_M، مع تأخير ملحوظ في التحميل الأولي وإخراج ثابت طوال فترة الاستجابة. إذا كنت قد قرأت ادعاءات مثل "أحصل على 60 رمزًا مميزًا في الثانية على جهاز Mac الخاص بي" في مكان آخر، فتعامل معها كإرشادات عامة؛ ستختلف أرقامك الفعلية باختلاف طول المطالبة، ونافذة السياق، ومستوى القياس الكمي، وبنية النموذج، وما هو قيد التشغيل أيضًا.

5.2 اختيار القياس الكمي - Q4_K_M، Q5_K_M، Q8_0

يقلل التكميم من دقة أوزان النموذج لتقليصها على القرص وفي الذاكرة. المقايضة هي الجودة. فيما يلي النموذج العقلي التقريبي الذي أستخدمه عند اختيار كمية للاستدلال المحلي:

الكميةالحجم التقريبي لـ 8Bالجودة مقابل FP16متى تستخدم
س4_ك_م~4.7 إكس بي آر0 إكسجيد جدًا، قطرة صغيرةتقصير. أفضل توازن بين السرعة والجودة للدردشة والرمز.
س5_ك_م~5.7 إكس بي آر0إكسأقرب إلى FP16عندما تحتاج إلى لمسة أكثر دقة ولديك ذاكرة احتياطية.
س8_0~8.5 إكس بي آر 0 إكسشبه ضياععندما تحتاج إلى أقصى قدر من الجودة والحد الأدنى من الضوضاء في الموديلات الصغيرة.

جميع الأحجام تقريبية، وتم الاستشهاد بها علنًا لأوزان فئة Llama 8B. الترتيب النسبي هو ما يهم.

5.3 ما يناسب 32 و64 و128 GB

الذاكرة الموحدةمنطقة الراحة الواقعية (Q4_K_M)تمتد (مع الرعاية)
32 إكس بي آر0 إكس7 ب / 8 ب / 13 ب20-22B في سياق ضيق
64 إكس بي آر0 إكس13 ب / 20 ب / 34 ب40-50B في سياق ضيق
128 إكس بي آر0 إكس34B / 70B / متغيرات خليط الخبراء100-120B في سياق ضيق

"منطقة الراحة" تعني أن النموذج يتم تحميله بمساحة كافية لنافذة سياق واسعة وذاكرة تخزين مؤقت KV وتطبيقات أخرى قيد التشغيل. يعني "التمدد" أنه يتم تحميله ولكنك تبدأ في التوفيق بين طول السياق وأعباء العمل الأخرى. في صندوق 128 GB الخاص بي، يمكنني تشغيل 70B في Q4_K_M ولا يزال لدي ما يقرب من 80 GB من المساحة الرأسية لـ VS Code وChrome واثنين من عمليات Python - وهو، بصراحة، شعور فاخر.

5.4 استدعاء Ollama من Node وPython

يعرض Ollama HTTP API في http://localhost:11434. يبدو جلب العقدة الصغيرة كما يلي:

// node 20+
const res = await fetch("http://localhost:11434/api/generate", {
  method: "POST",
  headers: { "Content-Type": "application/json" },
  body: JSON.stringify({
    model: "llama3.1:8b",
    prompt: "Write a one-paragraph summary of unified memory architecture.",
    stream: false
  })
});

const data = await res.json();
console.log(data.response);

ومن بايثون:

import requests

r = requests.post(
    "http://localhost:11434/api/generate",
    json={
        "model": "llama3.1:8b",
        "prompt": "Explain HNSW indexes briefly.",
        "stream": False,
    },
    timeout=120,
)
print(r.json()["response"])

هذا هو كل ما تحتاجه لتوصيل LLM المحلي بأداة CLI، أو برنامج Slack bot، أو اختصار، أو خدمة صغيرة، أو أتمتة داخلية. لا توجد مفاتيح، ولا حدود للمعدلات، ولا حصص.

6. أفضل الموديلات للتشغيل على Mac Studio

اختيار النموذج هو جزء من الأداء، وجزء من الترخيص، وجزء من الحيوية. إليكم ما أقوم بتشغيله بالفعل على الصندوق، مجمعًا حسب مستوى الحجم.

6.1 صغير (أقل من 10 ب): قوة عمل يومية سريعة

  • Llama 3.1 8B - محادثة واستدلال ممتاز للأغراض العامة؛ ترخيص ميتا متساهل مع التحذيرات.
  • ميسترال 7ب/منسترال 8ب - منطق قوي، المتغيرات المرخصة من Apache متاحة.
  • كوين 2.5 7 ب - أداء قوي جدًا متعدد اللغات والأكواد.
  • فاي-3.5 ميني - صغير الحجم، وقادر بشكل مدهش، ومثالي عندما تحتاج إلى إنتاجية وزمن وصول منخفض.
  • كودسترال/كوين 2.5 كودر 7 ب - الإكمال التلقائي السريع لعمل IDE.

6.2 منتصف (10B-40B): النقطة المثالية في 64-128 GB

  • Llama 3.1 / 3.3 70B (Q4_K_M) - إذا كان لديك 128 GB، فهذا هو النموذج الرئيسي؛ جودة قريبة من الحدود، تعمل بشكل مريح.
  • كوين 2.5 32 ب - نسبة الجودة إلى الحجم ممتازة؛ أزواج بشكل جيد مع RAG.
  • ديب سيك-كودر 33 ب - قوي في مهام إنشاء التعليمات البرمجية.
  • ميكسترال 8x7B - مزيج من الخبراء، ينشط خبيرين فقط في كل مرة، ويناسب بشكل مريح.

6.3 كبير (70B وما فوق): فقط على 96-128 GB وفي Q4 فقط

عند 128 GB، الباب مفتوح لنماذج فئة 70B في Q4_K_M. هم أبطأ مقارنة بنماذج 8B، إلا أن القفزة النوعية مهمة بالنسبة للمهام التي تستفيد من المعرفة العالمية الأوسع والتفكير الأطول. توقع أن يكون زمن الاستجابة للرمز الأول أطول وأن تنخفض وتيرة البث، لكن التجربة الفعلية تظل قابلة للاستخدام في العديد من عمليات سير العمل.

7. بناء خط أنابيب RAG محلي

بمجرد حصولك على LLM محلي، فإن الشيء الأكثر فائدة الذي يمكنك القيام به به هو توجيهه إلى مستنداتك الخاصة. هذا هو الجيل المعزز للاسترجاع، وهو عبء العمل حيث يتألق Mac Studio حقًا كبديل خاص لسحابة API.

خط أنابيب RAG المحلي على Mac Studio: تحويل ملفات PDF إلى أجزاء التضمين إلى ChromaDB إلى المسترد إلى LLM المحلي للإجابة

7.1 المكدس

  • محلل المستندات - PyMuPDF لملفات PDF، unstructured للتناول بتنسيق مختلط.
  • تشانكر - لانجشين RecursiveCharacterTextSplitter أو مقسم يتعرف على الرمز المميز. حجم القطعة النموذجي 512-1024 رمزًا مع 64-128 رمزًا للتداخل.
  • التضمين - nomic-embed-text أو mxbai-embed-largeوكلاهما متاح من خلال Ollama. كلاهما يعمل على GPU المحلي.
  • متجر المتجهات -ChromaDB بشكل افتراضي. SQLite-VSS لخيار الخادم الصفري. LanceDB إذا كنت تريد خيارًا مضمنًا لملف واحد يمكن تغيير حجمه.
  • مولد - Llama 3.1 8B للتنفيذ السريع، أو 70B إذا كنت تريد الحصول على إجابات عالية الجودة.

7.2 مثال بايثون البسيط - من النهاية إلى النهاية

pip install chromadb requests pypdf

import os, glob, requests, chromadb
from chromadb.utils import embedding_functions
from pypdf import PdfReader

OLLAMA = "http://localhost:11434"
EMBED_MODEL = "nomic-embed-text"
GEN_MODEL   = "llama3.1:8b"

def embed(text: str) -> list[float]:
    r = requests.post(f"{OLLAMA}/api/embeddings", json={
        "model": EMBED_MODEL, "prompt": text,
    }, timeout=60)
    return r.json()["embedding"]

def generate(prompt: str) -> str:
    r = requests.post(f"{OLLAMA}/api/generate", json={
        "model": GEN_MODEL, "prompt": prompt, "stream": False,
    }, timeout=300)
    return r.json()["response"]

def chunk(text: str, size: int = 1000, overlap: int = 150):
    out, i = [], 0
    while i < len(text):
        out.append(text[i:i+size])
        i += size - overlap
    return out

client = chromadb.PersistentClient(path="./rag-db")
col = client.get_or_create_collection("docs")

for path in glob.glob("./docs/**/*.pdf", recursive=True):
    reader = PdfReader(path)
    full = "\n".join(p.extract_text() or "" for p in reader.pages)
    for j, c in enumerate(chunk(full)):
        col.add(
            ids=[f"{os.path.basename(path)}::{j}"],
            documents=[c],
            embeddings=[embed(c)],
            metadatas=[{"source": path, "chunk": j}],
        )

def ask(q: str, k: int = 5) -> str:
    qe = embed(q)
    res = col.query(query_embeddings=[qe], n_results=k)
    ctx = "\n\n".join(res["documents"][0])
    prompt = (
        "Answer the question using only the context below. "
        "If the answer is not in the context, say you do not know.\n\n"
        f"Context:\n{ctx}\n\nQuestion: {q}\nAnswer:"
    )
    return generate(prompt)

print(ask("What is unified memory and why does it matter for LLMs?"))

هذا خط أنابيب RAG محلي كامل في أقل من 60 سطرًا من Python. كل شيء يعمل على Mac Studio. لا توجد مفاتيح API خارجية، ولا توجد فواتير لكل رمز، ولا توجد بيانات تغادر الجهاز. سيستغرق الاستيعاب الأول لمجموعة PDF كبيرة بضع دقائق؛ الاستعلامات اللاحقة سريعة.

7.3 ضبط الملاحظات

  • حجم القطعة - البدء بـ 1000 حرف و150 حرفًا متداخلاً؛ يمكنك الارتقاء إذا كانت مصادرك تحتوي على أقسام منظمة طويلة (المواصفات القانونية والفنية) ويقوم المسترد بتجزئة الإجابات.
  • توب ك - 4-8 هو النطاق العملي. يؤدي الارتفاع إلى مستوى أعلى بكثير إلى تضخيم السرعة وإبطاء التوليد دون تحقيق مكاسب واضحة.
  • إعادة الترتيب - للحصول على أعلى جودة، قم باسترداد أعلى 20 وأعد التصنيف باستخدام برنامج تشفير متقاطع (على سبيل المثال. bge-reranker). على Mac Studio هذا رخيص.
  • تصفية البيانات الوصفية - وضع علامات على القطع بمسار المصدر والتاريخ والقسم؛ التصفية في وقت الاستعلام قبل البحث عن المتجهات. هذا هو أكبر فوز فردي للدقة.
  • جاري - يُحوّل stream ل true في استدعاء Ollama وتدفق الرموز المميزة إلى العميل للحصول على تجربة مستخدم سريعة.

8. حلقة المطور اليومية

بعد بضعة أسابيع على Mac Studio، تبدو حلقتي اليومية كما يلي:

  1. افتح رمز VS، يستيقظ Continue.dev على Ollama.
  2. افتح محادثة في Open WebUI (أو LM Studio) للحصول على أسئلة وأجوبة محادثة أطول مقابل ملاحظاتي.
  3. بالنسبة للعمل البرمجي: الإكمال التلقائي لعلامة التبويب على نموذج Codestral أو Qwen Coder، ومحادثات أطول على Llama 3.1 8B، وجلسات تفكير عميقة على 70B عندما تتطلب المهمة ذلك.
  4. بالنسبة إلى RAG الداخلي، وهو برنامج نصي بلغة Python يشير إلى مجلد المستندات/المشروع وقاعدة بيانات Chroma.
  5. بالنسبة للنماذج الأولية للوكيل، LangGraph أو حلقة مخصصة صغيرة تستدعي نقطة نهاية Ollama - نفس النمط، وغراء مختلف.

الشيء الذي يتغير حقًا عندما يكون جهاز LLM محليًا هو الطريقة التي تستخدمه بها. لا توجد تكلفة إضافية للاستعلام، لذا يمكنك طرح المزيد من الأسئلة على النموذج. لا داعي للقلق بشأن الخصوصية، لذلك يمكنك لصق سجلات الإنتاج والمستندات الداخلية ورسائل البريد الإلكتروني للعملاء. تكتب نصوص سطر الأوامر الصغيرة التي تمر عبر 200 مستند لاستخراج ملخص منظم، ولا تفكر مرتين في الفاتورة لكل رمز مميز، لأنه لا توجد فاتورة.

9. المقاييس والمقارنة الصادقة مقابل السحابة

اسمحوا لي أن أكون مباشرًا جدًا: لن أنشر أرقامًا مميزة في الثانية لم أنتجها باستخدام منهجية مرجعية خاضعة لرقابة مشددة. إن الإنترنت مليء بمثل هذه الأرقام، وغالبًا ما تقارن مستويات القياس الكمي المختلفة وأطوال السياق والأشكال الفورية، وهي تربك أكثر مما توضح. ما سأفعله بدلاً من ذلك هو نشر مصفوفة القرار التي تلتقطها ما هو نوع عبء العمل الذي يفوز به Mac Studio بالفعل؟، حيث لا يحدث ذلك، وحيث تكون الإجابة الصحيحة هي "استخدم كليهما".

مصفوفة القرار: Mac Studio M4 Max مقابل AWS g5 وAWS p4d والسحابة LLM APIs فيما يتعلق بالتكلفة والخصوصية وزمن الوصول والتخصيص والتوسع والتأمين والتعادل

9.1 رياضيات التعادل

يقع جهاز Mac Studio M4 Max المزود بذاكرة موحدة تبلغ 128 GB ومحرك أقراص SSD سعة 2 تيرابايت في نفس نطاق السعر تقريبًا مثل بضعة أشهر من مثيل GPU السحابي الذي يعمل دائمًا. تعامل مع جميع الأرقام المحددة بالدولار على أنها تقريبية وكدالة للمنطقة والخصم:

  • Mac Studio M4 Max واحد، تم تكوينه بشكل جيد: ما يقرب من 4000 دولار - 6000 دولار لمرة واحدة (تقريبي؛ تختلف التكوينات).
  • خدمة AWS واحدة g5.xlarge (A10G فردي، 24 GB VRAM) تعمل على مدار 24 ساعة طوال أيام الأسبوع حسب الطلب: في حدود 700 إلى 900 دولار شهريًا (حسب المنطقة).
  • خدمة AWS واحدة p4d.24xlarge (8x A100): طلب بقيمة 20.000 دولار - 30.000 دولار شهريًا عند الطلب إذا تركته قيد التشغيل بطريقة أو بأخرى (لن تفعل ذلك، ولكنه يجعل التباين واضحًا).

تشير الحسابات الحسابية إلى أنه بالنسبة لصندوق التطوير الذي يعمل دائمًا، فإن Mac Studio يدفع ثمن نفسه في غضون بضعة أشهر مقابل مثيل سحابي مماثل يعمل دائمًا، ويستمر في دفع ثمن نفسه من حيث الكهرباء لسنوات. بالنسبة لوظائف التدريب المتواصل، تنقلب الرياضيات: الإيجار لمدة ساعة، القيام بالجري، ثم تسليمها مرة أخرى. استخدم الأداة المناسبة لهذا المنصب.

9.2 عندما تكون السحابة هي الإجابة الصحيحة

  • أنت بحاجة إلى تدريب أو تحسين نموذج أكبر مما يناسب 128 GB.
  • أنت بحاجة إلى الخدمة على نطاق واسع لقاعدة مستخدمين عالمية من خلال محددات مستوى الخدمة (SLO) الصارمة والقدرة المرنة.
  • أنت تجري تجربة تستفيد من التوازي 8x A100 أو H100.
  • يشير وضع الامتثال لمؤسستك إلى أنه يجب تشغيل الاستدلال في منطقة سحابية محددة مع مسارات تدقيق محددة.

9.3 عندما تكون Mac Studio هي الإجابة الصحيحة

  • تريد مربع استدلال خاص دائمًا لفريقك.
  • أنت تقوم ببناء RAG أو الوكلاء أو الطيارين المساعدين لـ IDE حيث يكون موقع البيانات والخصوصية مهمًا.
  • أنت تريد صندوق تطوير هادئ ومنخفض الطاقة ولا يتطلب غرفة خادم.
  • أنت تقوم بإعداد النماذج الأولية بسرعة، كما أن الفوترة لكل رمز مميز لسحابة API في طريقك.
  • تريد أن تتعلم المكدس - تمتلك نموذجًا، وتمتلك وقت تشغيل، وتمتلك متجرًا متجهًا، وتمتلك الحلقة.

10. التحديات والقيود

لن أقدم أي خدمة لهذا المقال إذا لم أذكر الحواف الخشنة. يعد Apple Silicon ممتازًا للذكاء الاصطناعي المحلي، ولكن هناك محاذير حقيقية.

10.1 التدريب لا يزال قصة أضعف من الاستدلال

قصة Apple Silicon AI أقوى بكثير الاستدلال من أجل تمرين. لقد نضجت الواجهة الخلفية MPS الخاصة بـ PyTorch بشكل كبير، ويعد إطار عمل MLX الخاص بشركة Apple جيدًا حقًا، ولكن نطاق أدوات التدريب الخاصة بـ CUDA فقط لا يزال أوسع. إذا كانت وظيفتك اليومية عبارة عن تصميمات نماذج جديدة أو ضبط دقيق على نطاق واسع، فسوف تصطدم بثغرات لم تصادفها ببساطة في Linux + NVIDIA.

10.2 يفترض النظام البيئي CUDA في العديد من الأماكن

لا تزال العديد من عمليات إعادة شراء الذكاء الاصطناعي تتخلف عن افتراضات CUDA. تحتوي معظم المشاريع التي تمت صيانتها الآن على مسارات Metal / MPS، ولكنها تتوقع احتكاكًا عرضيًا: مكتبة تتطلب البناء من المصدر، ونواة ليس لها مكافئ Metal، ومجموعة قياسية تعمل فقط على NVIDIA. التخطيط للوقت لهذا.

10.3 يتم إجراء التصغير بنفسك

واحد Mac Studio عبارة عن صندوق واحد. أدوات مثل EXO وتسمح لك الأجهزة الأخرى بتجميع أجهزة Mac لتشغيل نماذج كبيرة جدًا عبر أجهزة متعددة، ولكن هذه ليست القصة المصقولة التي تحصل عليها مع مجموعة Kubernetes من g5s. إذا كان عبء العمل الخاص بك يحتاج إلى مرونة أفقية، فإن السحابة لا تزال أفضل.

10.4 قابلية الإصلاح والتحديث

لا يمكنك إضافة ذاكرة الوصول العشوائي لاحقًا. لا يمكنك تبديل SSD لاحقًا (من الناحية العملية). شراء ما تحتاجه، ثم زائد واحد - وخاصة على الذاكرة. الطبقة 128 GB هي الطبقة التي أوصي بها للعمل الجاد في مجال الذكاء الاصطناعي؛ 64 GB هي الأرضية.

10.5 درجات الحرارة تحت الحمل المستمر

يعمل جهاز Mac Studio بشكل بارد وهادئ في وضع الخمول (تظهر لقطة الشاشة أعلاه 37 درجة مئوية و30 درجة مئوية مع عدم سماع صوت المراوح). تحت حمل LLM الثقيل المستمر، تدور المراوح - ليس بصوت عالٍ، ولكن بصوت مسموع - وتسخن الشريحة. وهذا جيد ضمن الأظرف الحرارية الاسمية. فقط انتبه إلى أن كلمة "صامت" هي توصيف خامل وخفيف الوزن، وليس مطلقًا.

11. مستقبل الذكاء الاصطناعي المحلي على Apple Silicon

تتقارب ثلاثة اتجاهات مما يجعل فترة الـ 12 إلى 24 شهرًا القادمة مثيرة للذكاء الاصطناعي المحلي على Apple Silicon.

أولاً، تستمر نماذج الأوزان المفتوحة في التصغير دون فقدان القدرة. Phi-3.5، وQwen 2.5 صغير، وعائلة Llama 3.x بوزن 8B أعلى من فئة وزنهم. يمكن مقارنة طراز 2026 8B تقريبًا من حيث الجودة بطراز 2023 70B في العديد من المهام. وهذا يعني أن المزيد من أعباء العمل تتلاءم بشكل مريح مع 32-64 GB من الذاكرة الموحدة، ويصبح 128 GB Mac Studio صندوق تقديم متعدد النماذج.

ثانية، يستمر إطار عمل MLX الخاص بشركة Apple في التحسن. يوفر MLX API يشبه NumPy، وتقييمًا بطيئًا، ووعيًا موحدًا بالذاكرة افتراضيًا، ورسومًا بيانية حسابية ديناميكية. يقوم مجتمع MLX بنقل النماذج والرموز المميزة وحلقات التدريب في مقطع سريع. إذا كنت تبدأ مشروعًا جديدًا لتعلم الآلة على جهاز Mac اليوم، فإن MLX هو الخيار الطبيعي؛ إذا كنت تستخدم PyTorch، فإن الواجهة الخلفية لـ MPS تكون أكثر قابلية للاستخدام في كل إصدار.

ثالث، يستمر التكميم وضغط ذاكرة التخزين المؤقت KV في التحسن. تقنيات مثل Q4_K_M، والتحليل الكمي لعائلة IQ، وتحسينات GGUF تعني أن نفس النموذج يناسب ذاكرة أقل مما كان عليه قبل ستة أشهر، مع فقدان أقل للجودة. يقع الذكاء الاصطناعي المحلي على منحنى حيث يعمل كل جيل من النماذج + الاقتران الكمي على توسيع النطاق العملي للأجهزة ذات الأسعار الاستهلاكية.

أضف إلى كل هذا الشائعات حول شرائح M-series المستقبلية (M5، Ultras المستقبلية، تحديثات الاستوديو)، والمسار واضح: صندوق الذكاء الاصطناعي الموجود بجانب المكتب موجود هنا، وهو يتحسن باستمرار.

12. تقوية Mac Studio كصندوق AI للفريق

إذا كنت ترغب في مشاركة Mac Studio الخاص بك مع فريق صغير - على سبيل المثال، الكشف عن Ollama ومثيل Open WebUI ونقطة نهاية RAG لعدد قليل من الزملاء - فإليك عملية التعزيز القاسية التي أقوم بها:

  1. تشغيل FileVault وكلمة مرور تسجيل دخول قوية. يبقيه على UPS.
  2. مقياس الذيل على الصندوق بحيث يمكن الوصول إليه من أجهزة فريقك دون تعريضه للإنترنت العام.
  3. ربط Ollama بالمضيف المحلي وأمامه باستخدام وكيل مصادقة رفيع (Caddy أو Traefik أو خادم Node/Python صغير) الذي يتعامل مع المصادقة وتحديد المعدل قبل إعادة التوجيه إلى 11434.
  4. قم بتشغيل Open WebUI في Docker Desktop مع حجم مستمر. قم بتوجيهه إلى نقطة نهاية Ollama المحلية.
  5. النسخ الاحتياطية لقاعدة بيانات RAG إلى SSD خارجي مشفر أو هدف Time Machine.
  6. التحديث التلقائي حزم macOS وHomebrew وفقًا لجدول زمني؛ قم بتثبيت Ollama وإصدارات الطراز عمدًا بدلاً من سحب الأحدث تلقائيًا.

حسنًا، لديك نقطة نهاية خاصة بالذكاء الاصطناعي وصديقة للتدقيق يستخدمها فريقك كل يوم ولا ترسل رمزًا مميزًا أبدًا خارج شبكة المبنى.

13. الخلاصة: ثورة هادئة على المكتب

إن فتح علبة Mac Studio M4 Max في عام 2026 يبدو أقل شبهاً بشراء جهاز كمبيوتر مكتبي وأكثر شبهاً بشراء جهاز صغير يعمل بتقنية الذكاء الاصطناعي والذي يصادف أنه جهاز Mac أيضاً. 128 GB من الذاكرة الموحدة، و40 نواة GPU، و16 نواة CPU، ومحرك عصبي، وأجهزة تشفير وسائط الأجهزة، ومحرك أقراص SSD سعة 2 تيرابايت، وسحب طاقة خامل يُقاس بالواط الفردي - كل ذلك في صندوق يمكنك التقاطه بيد واحدة.

الإعداد سريع، ويتم تشغيل أول LLM في غضون ساعة، وفي فترة ما بعد الظهر يكون لديك مسار RAG خاص للإجابة على الأسئلة المتعلقة بمستنداتك الخاصة. يحدث الأمر برمته على مكتبك، دون ظهور فاتورة سحابية في الخلفية. وهذا يغير طريقة البناء باستخدام الذكاء الاصطناعي بطريقة يصعب نقلها إلى أن تجربها.

إذا كنت تقوم بتقييم ما إذا كان Mac Studio ينتمي إلى مزيج الأجهزة الخاص بفريقك، آمل أن يكون هذا المقال قد أعطاك رؤية واضحة: ما هو المذهل، وما هو الصعب، وأين لا تزال السحابة تفوز، وأين يكون الصندوق الموجود على مكتبك هو الإجابة الأفضل. الرفيق مدونة قصيرة يقطر نفس سير العمل في قراءة مدتها 5 دقائق للمشاركة.

إذا كان هذا مفيدا - شاهد فتح العلبة على اليوتيوب (https://youtube.com/shorts/HUlUoHNsyNM)، اشترك في القناة لمتابعة البرامج التعليمية (ضبط MLX الدقيق، واستدلال أجهزة Mac المتعددة، ومكدسات الوكيل)، وراجع هنا مرة أخرى للاطلاع على المقالة التالية في السلسلة. لقد بدأ الذكاء الاصطناعي المحلي على Apple Silicon للتو، وسأستمر في الكتابة مع نضوج المكدس.


لقطة SEO لهذه المقالة

  • عنوان تحسين محركات البحث: فتح علبة Mac Studio M4: قم بتشغيل LLM الأول محليًا
  • الوصف التعريفي: قم بفك علبة Mac Studio M4 Max مع 128 ذاكرة GB موحدة، وقم بتثبيت Ollama، وتشغيل Llama 3 محليًا، وإنشاء خط أنابيب RAG خاص. قراءات حقيقية، ومقارنات صادقة.
  • الكلمات الرئيسية الأساسية: Mac Studio AI، Mac Studio LLM، تشغيل LLMs على Mac Studio، Ollama Mac Studio، Apple Silicon AI، إعداد AI المحلي، Mac Studio RAG، البرنامج التعليمي المحلي LLM، تشغيل Llama محليًا، مراجعة Mac Studio M4.
  • تويتر / X (أقل من 280 حرفًا): فتح علبة Mac Studio M4 Max. 128GB ذاكرة موحدة. التباطؤ عند 6.48 واط. تم سحب Llama 3.1 8B عبر Ollama، وتم بناء خط أنابيب RAG محلي في فترة ما بعد الظهر، بدون فاتورة سحابية. شرح تفصيلي كامل مكون من 4000 كلمة + 6 رسوم بيانية + مقطع YouTube القصير. #AppleSilicon #LocalLLM
  • مشاركة لينكد إن: وصل جهاز Mac Studio M4 Max الجديد إلى مكتبي وعاملته كجهاز يعمل بالذكاء الاصطناعي: قراءات حقيقية من mactop (6.48 واط خامل، 128 GB UMA، 40 نواة GPU)، تثبيت Ollama، تشغيل Llama 3.1 8B محليًا، خط أنابيب RAG كامل مقابل مستنداتي الخاصة - كل ذلك في فترة ما بعد الظهر. لقد قمت بكتابة سير العمل بالكامل، مع ستة رسوم بيانية أصلية، ومصفوفة قرارات صادقة للسحابة مقابل المحلية، وقسم حول المكان الذي لا تزال السحابة تفوز فيه. إذا كنت تقوم بتقييم الذكاء الاصطناعي المحلي لفريقك، فهذا مكان أساسي للبدء.

Watch

فتح علبة Mac Studio M4 وتشغيل أول LLM
Click to open in new window
Share this article

More in Technology

Jobshout SEO Analyst AI Agent — Analyse Any Website & Fix SEO Issues Automatically

Jobshout SEO Analyst AI Agent — Analyse Any Website & Fix SEO Issues Automatically

Technical brief: SEO Analyst modes, real workstation.co.uk run (score 44), findings with fix prompts, Improve/Publish paths, and Jobshout supervised agents

Read more
WSLVault: Steal the Server. Not the Secrets.

WSLVault: Steal the Server. Not the Secrets.

Technical brief: AES-256-GCM envelope hierarchy, cryptographic tenant isolation, engines, identity/MFA, active/active regions, Kubernetes deploy, and video chapters

Read more
Workstation WSL Proxy — Docker Image Optimisation, Build Cache, Full Deploy Workflow, and Shipping It with AI Assistance

Workstation WSL Proxy — Docker Image Optimisation, Build Cache, Full Deploy Workflow, and Shipping It with AI Assistance

Technical brief: prebuilt OpenResty Dockerfile, Buildx/GHA cache, Ansible extract, delivery pipeline DEPLOY_MODE, and an operator+agent loop for finishing pipeline work

Read more