Workstation Logo
مصنوعات
AI لیبزOpenAI ایجنٹسClaude ایجنٹسGrok BotWorkstation CRM (WSL CRM)مارکیٹنگتمام مصنوعات
AI حل
AI ورک سٹیشنزAI SME Packagesپرائیویٹ AIGPU کلسٹرزایج AIانٹرپرائز AI لیبصنعت کے مطابق AI
خدمات
Platform ModernisationDigital EngineeringData Foundations & AIAutonomous OperationsAI مشاورتDevOps آٹومیشنسائبر سیکیورٹیسافٹ ویئر ڈیولپمنٹایجنٹ بلڈنگMLOps سیٹ اپ
ہمارے بارے میں
شراکت دارگاہکوں کی کہانیاں
مضامین
دستاویزات
WSL ProxyRing PromoterWSL VaultJobshoutSysOps 24/7
بلاگ
ہم سے رابطہ کریںLogin
Workstation

جدید کاروبار کے لیے AI ورک اسٹیشنز، AI ملٹی ایجنٹک سافٹ ویئر، GPU انفراسٹرکچر اور ذہین ایجنٹ حل۔

ہم سے رابطہ کریں

AI حل

AI ورک سٹیشنزAI SME Packagesپرائیویٹ AIGPU کلسٹرزایج AIانٹرپرائز AI لیبصنعت کے مطابق AI

مصنوعات

تمام مصنوعاتWSL CRM اور ERPمارکیٹنگOpenAI ایجنٹسWSL ProxyRing PromoterWSL VaultJobshoutSysOps 24/7

کمپنی

ہمارے بارے میںWorkstation کیوںشراکت دارگاہکوں کی کہانیاںقیمتیںرابطہ

وسائل

مضامیندستاویزاتبلاگتلاشسائٹ میپ
برطانیہ آفس
77-79 Marlowes, Hemel Hempstead HP1 1LFراستہ - M25 آؤٹر لندن سے جنکشن 20 لیںکمپنی نمبر: 11641870پیر - جمعہ: صبح 9:00 - شام 6:00 GMT
+44 7515 356 146
بیلجیم آفس
Workstation SRL, Rue Vanderkindere 34, 1180 Uccle, BrusselsBE 0751.518.683پیر - جمعہ: صبح 9:00 - شام 6:00 CET
+32 492 45 67 46
بھارت آفس
#159 Sector 9, Pocket 1, DDA Flats, 110077 Dwarka, New Delhi
+91 98881 98841

© 2026 Workstation AI۔ جملہ حقوق محفوظ ہیں۔

رازداریکوکیزسروس کی شرائطویب سائٹ سائٹ میپ

Loading blog...

Home / Blog
AILLMApple SiliconMac StudioOllamaRagLocal AIHardware

Mac Studio M4 کو ان باکس کرنا اور اپنا پہلا LLM چلانا

ایک دوپہر میں تازہ M4 Max، Ollama انسٹال، مقامی طور پر Llama 3، اور ایک نجی RAG پائپ لائن پر میک ٹاپ سے حقیقی ریڈنگز

Balinder Walia15 مئی، 20265 min read

لمبی شکل کے گہرے غوطہ لگانے کا ایک مختصر، سکم پڑھنے کے قابل ساتھی۔ مکمل واک تھرو کے لیے، پر جائیں۔ طویل مضمون.

میز پر موجود باکس اب ایک AI آلات ہے۔

میں نے M4 Max چپ، 128 GB یونیفائیڈ میموری، 40 GPU cores، 16 CPU cores، اور 2 TB SSD کے ساتھ ایک نیا Mac Studio ان باکس کیا۔ ایک دوپہر کے اندر یہ مقامی طور پر Ollama کے ذریعے Llama 3.1 8B چلا رہا تھا، میری اپنی دستاویزات کو سرایت کر رہا تھا، اور ایک چھوٹی RAG پائپ لائن کے ذریعے ان پر سوالات کے جوابات دے رہا تھا۔ کوئی کلاؤڈ بل نہیں، کوئی API کلید نہیں، کمرے سے نکلنے والا کوئی ڈیٹا نہیں۔

یہ بلاگ مختصر ورژن ہے۔ مکمل مضمون گہرائی میں اسی ورک فلو سے گزرتا ہے۔

Mac Studio M4 + مقامی AI کور

60 سیکنڈ میں ان باکسنگ

یوٹیوب پر ان باکسنگ مختصر دیکھیں: https://youtube.com/shorts/HUlUoHNsyNM

کلاسک ایپل ان باکسنگ: کم سے کم گتے، ایک مولڈ ریسیس میں مشین، ایک پاور کیبل۔ Mac Studio انکلوژر تقریباً 7.7 انچ مربع اور گھنا ہے۔ جب آپ اسے اٹھاتے ہیں تو آپ کو تعمیراتی معیار کا احساس ہوتا ہے۔ سیٹ اپ حقیقی طور پر تیز ہے - Apple ID، زبان، FileVault، ہو گیا۔

پہلا بوٹ - میک ٹاپ سے حقیقی ریڈنگ

تازہ Mac Studio M4 Max پر میک ٹاپ ڈیش بورڈ: 128 GB یونیفائیڈ میموری، 40 GPU کور، 6.48 ڈبلیو پر بیکار
تازہ Mac Studio M4 Max پر میک ٹاپ - 128 GB یونیفائیڈ میموری، 40 GPU کور، 6.48 W پر بیکار۔ یہ SVG فال بیک ہے۔ پر ایک حقیقی PNG چھوڑیں۔ /img/mac-studio-mactop-firstboot.png اسے بعد میں تبدیل کرنے کے لیے۔

مندرجہ بالا نمبر صرف مشکل اعداد و شمار ہیں جن کا میں حوالہ دوں گا۔ وہ زمینی سچائی سے ہیں۔ mactop اپ ٹائم کے 37 منٹ پر میری مشین پر:

  • M4 Max - 16 کور (4 E + 12 P)، 784 میگاہرٹز پر 40 GPU کور، 16 کور ANE۔
  • 128 GB متحد میموری - 16.62 GB بیکار میں استعمال میں ہے (تقریباً 13%)۔
  • 6.48 ڈبلیو کل بیکار طاقت، 46.33 W زیادہ سے زیادہ مشاہدہ کیا گیا۔ تھرملز: برائے نام۔
  • 2 ٹی بی ایس ایس ڈی، ابتدائی سیٹ اپ کے بعد 1.9 TB مفت۔

قابل استعمال میموری کے 128 GB والے ڈیسک ٹاپ کے لیے 6.48 W بیکار میں میرے لیے ہیڈ لائن نمبر ہے۔ یہ باکس حقیقی طور پر ایک کم طاقت والا، ہمیشہ چلنے والا AI آلات ہے جسے آپ بجلی کے بل کے بارے میں سوچے بغیر 24x7 چلانا چھوڑ سکتے ہیں۔

یہ ہارڈ ویئر کیوں خاص ہے - ایک پیراگراف میں متحد میموری

روایتی PC پر، آپ کے CPU میں سسٹم RAM ہے اور آپ کے GPU میں الگ VRAM ہے۔ ایک ماڈل کو GPU چلانے سے پہلے اسے پورے PCIe میں کاپی کرنا ہوگا۔ اگر ماڈل VRAM سے بڑا ہے، تو یہ فٹ نہیں ہوتا ہے۔ Apple Silicon پر، CPU، GPU، نیورل انجن، اور میڈیا انجن اشتراک کرتے ہیں ایک 128 GB پول۔ کچھ بھی کاپی نہیں ہے۔ Q4_K_M پر ایک 70B پیرامیٹر LLM (ڈسک پر تقریباً 40 GB، عوامی تخمینہ) تقریباً 80 GB کے ساتھ لوڈ ہوتا ہے اب بھی سیاق و سباق، ایپلیکیشنز اور ٹولز کے لیے مفت ہے۔ یہی وجہ ہے کہ مقامی LLMs میک پر مختلف محسوس کرتے ہیں۔

باکس سے لے کر پہلے LLM تک تین کمانڈز میں

brew install ollama
ollama serve &
ollama run llama3.1:8b "Explain unified memory in 3 sentences."

یہ حقیقی طور پر پوری طرح کی تخلیق ہے۔ پہلا رن ماڈل کو ڈاؤن لوڈ کرتا ہے (Llama 3.1 8B Q4_K_M ڈسک پر تقریباً 4.7 GB ہے، عوامی تخمینہ) اور اسے متحد میموری میں لوڈ کرتا ہے۔ اس کے بعد، بات چیت کا سلسلہ ہموار ہے، جس میں قابل توجہ پہلی ٹوکن تاخیر اور ردعمل کے ذریعے مستحکم آؤٹ پٹ ہے۔ میں مناسب معیار کے طریقہ کار کے بغیر جان بوجھ کر ٹوکن فی سیکنڈ نمبر شائع نہیں کر رہا ہوں۔ طویل مضمون استدلال میں جاتا ہے.

Python کی 60 سے کم لائنوں میں مقامی RAG

مقامی LLM کے ساتھ آپ جو سب سے زیادہ کارآمد چیز کر سکتے ہیں وہ یہ ہے کہ اسے آپ کی اپنی دستاویزات کی طرف اشارہ کریں۔ کم از کم قابل عمل اسٹیک ہے:

  • PyMuPDF یا unstructured تجزیہ کرنے کے لیے
  • nomic-embed-text ایمبیڈنگز کے لیے Ollama کے ذریعے
  • ChromaDB ویکٹر اسٹور کے لیے
  • Llama 3.1 8B نسل کے لیے Ollama کے ذریعے

مکمل کوڈ میں ہے۔ طویل مضمون. سرخی یہ ہے: ہر چیز Mac Studio پر چلتی ہے، کوئی بیرونی API کیز نہیں، کوئی فی ٹوکن بلنگ نہیں، مشین کو چھوڑنے والا کوئی ڈیٹا نہیں۔

Mac Studio بمقابلہ کلاؤڈ - ایماندارانہ فیصلہ میٹرکس

Mac Studio اس کے لیے جیتتا ہے: ہمیشہ پرائیویٹ اندازہ، RAG آپ کے اپنے ڈیٹا پر، IDE copilots، ایجنٹ پروٹو ٹائپنگ، اسٹیک سیکھنا، اور گھریلو لیبز۔ کلاؤڈ اس کے لیے جیتتا ہے: برسٹ ٹریننگ جابز،> 70B پروڈکشن پیمانے پر پیش کرنا، غیر متوقع عالمی ٹریفک، اور کام کا بوجھ جن کو 8x A100/H100 متوازی کی ضرورت ہے۔ زیادہ تر ٹیمیں دونوں کا استعمال ختم کریں گی۔ طویل مضمون میں SVG کے بطور مکمل فیصلہ میٹرکس ہے۔

ایک ہفتے کے بعد پانچ اسباق

  1. پرائیویسی استعمال کے نئے کیسز کو کھول دیتی ہے۔ جب ماڈل مقامی ہوتا ہے تو میں بغیر کسی ہچکچاہٹ کے پروڈکشن لاگز، اندرونی دستاویزات اور کسٹمر ای میلز میں پیسٹ کرتا ہوں۔ اس سے میرے کام کرنے کا طریقہ بدل جاتا ہے۔
  2. فی استفسار لاگت نفسیاتی بھی ہے اور مالی بھی۔ کسی بل کا مطلب زیادہ سوالات، زیادہ تجربات، زیادہ تجسس نہیں ہے۔
  3. 128 GB پیاری جگہ ہے۔ 64 GB سنجیدہ کام کے لیے منزل ہے۔ 128 GB آپ کو Q4_K_M پر 70B چلانے کے لیے ہیڈ روم فراہم کرتا ہے اور پھر بھی ہر چیز کے لیے گنجائش ہے۔
  4. Ollama آسان آن ریمپ ہے۔ LM سٹوڈیو ایک ماڈل براؤزر کے طور پر بہت اچھا ہے، MLX بہت اچھا ہے اگر آپ Python میں نئے سرے سے شروعات کر رہے ہیں، llama.cpp ان سب کو زیر کرتا ہے۔
  5. بادل مرا نہیں ہے۔ یہ تربیت، اسکیل آؤٹ سرونگ، اور نامعلوم بوجھ والے کام کے بوجھ کے لیے اب بھی صحیح ٹول ہے۔

آگے کیا ہے

مستقبل کے مضامین میں Apple Silicon پر MLX فائن ٹیوننگ، EXO کے ساتھ ملٹی میک انفرنس کلسٹرز، ایجنٹ اسٹیک (LangGraph + Ollama)، اور ایک گہرے بینچ مارک طریقہ کار کا احاطہ کیا جائے گا۔ اگر آپ تمام خاکوں، کوڈ، اور فیصلہ میٹرکس کے ساتھ لمبا ورژن چاہتے ہیں تو پڑھیں طویل مضمون. اگر آپ بصری ورژن چاہتے ہیں تو دیکھیں یوٹیوب شارٹ. کسی بھی طرح - باقی سیریز کے لیے سبسکرائب کریں۔