Mac Studio M4 کو ان باکس کرنا اور اپنا پہلا LLM چلانا
ایک دوپہر میں تازہ M4 Max، Ollama انسٹال، مقامی طور پر Llama 3، اور ایک نجی RAG پائپ لائن پر میک ٹاپ سے حقیقی ریڈنگز
لمبی شکل کے گہرے غوطہ لگانے کا ایک مختصر، سکم پڑھنے کے قابل ساتھی۔ مکمل واک تھرو کے لیے، پر جائیں۔ طویل مضمون.
میز پر موجود باکس اب ایک AI آلات ہے۔
میں نے M4 Max چپ، 128 GB یونیفائیڈ میموری، 40 GPU cores، 16 CPU cores، اور 2 TB SSD کے ساتھ ایک نیا Mac Studio ان باکس کیا۔ ایک دوپہر کے اندر یہ مقامی طور پر Ollama کے ذریعے Llama 3.1 8B چلا رہا تھا، میری اپنی دستاویزات کو سرایت کر رہا تھا، اور ایک چھوٹی RAG پائپ لائن کے ذریعے ان پر سوالات کے جوابات دے رہا تھا۔ کوئی کلاؤڈ بل نہیں، کوئی API کلید نہیں، کمرے سے نکلنے والا کوئی ڈیٹا نہیں۔
یہ بلاگ مختصر ورژن ہے۔ مکمل مضمون گہرائی میں اسی ورک فلو سے گزرتا ہے۔
60 سیکنڈ میں ان باکسنگ
یوٹیوب پر ان باکسنگ مختصر دیکھیں: https://youtube.com/shorts/HUlUoHNsyNM
کلاسک ایپل ان باکسنگ: کم سے کم گتے، ایک مولڈ ریسیس میں مشین، ایک پاور کیبل۔ Mac Studio انکلوژر تقریباً 7.7 انچ مربع اور گھنا ہے۔ جب آپ اسے اٹھاتے ہیں تو آپ کو تعمیراتی معیار کا احساس ہوتا ہے۔ سیٹ اپ حقیقی طور پر تیز ہے - Apple ID، زبان، FileVault، ہو گیا۔
پہلا بوٹ - میک ٹاپ سے حقیقی ریڈنگ
/img/mac-studio-mactop-firstboot.png اسے بعد میں تبدیل کرنے کے لیے۔مندرجہ بالا نمبر صرف مشکل اعداد و شمار ہیں جن کا میں حوالہ دوں گا۔ وہ زمینی سچائی سے ہیں۔ mactop اپ ٹائم کے 37 منٹ پر میری مشین پر:
- M4 Max - 16 کور (4 E + 12 P)، 784 میگاہرٹز پر 40 GPU کور، 16 کور ANE۔
- 128 GB متحد میموری - 16.62 GB بیکار میں استعمال میں ہے (تقریباً 13%)۔
- 6.48 ڈبلیو کل بیکار طاقت، 46.33 W زیادہ سے زیادہ مشاہدہ کیا گیا۔ تھرملز: برائے نام۔
- 2 ٹی بی ایس ایس ڈی، ابتدائی سیٹ اپ کے بعد 1.9 TB مفت۔
قابل استعمال میموری کے 128 GB والے ڈیسک ٹاپ کے لیے 6.48 W بیکار میں میرے لیے ہیڈ لائن نمبر ہے۔ یہ باکس حقیقی طور پر ایک کم طاقت والا، ہمیشہ چلنے والا AI آلات ہے جسے آپ بجلی کے بل کے بارے میں سوچے بغیر 24x7 چلانا چھوڑ سکتے ہیں۔
یہ ہارڈ ویئر کیوں خاص ہے - ایک پیراگراف میں متحد میموری
روایتی PC پر، آپ کے CPU میں سسٹم RAM ہے اور آپ کے GPU میں الگ VRAM ہے۔ ایک ماڈل کو GPU چلانے سے پہلے اسے پورے PCIe میں کاپی کرنا ہوگا۔ اگر ماڈل VRAM سے بڑا ہے، تو یہ فٹ نہیں ہوتا ہے۔ Apple Silicon پر، CPU، GPU، نیورل انجن، اور میڈیا انجن اشتراک کرتے ہیں ایک 128 GB پول۔ کچھ بھی کاپی نہیں ہے۔ Q4_K_M پر ایک 70B پیرامیٹر LLM (ڈسک پر تقریباً 40 GB، عوامی تخمینہ) تقریباً 80 GB کے ساتھ لوڈ ہوتا ہے اب بھی سیاق و سباق، ایپلیکیشنز اور ٹولز کے لیے مفت ہے۔ یہی وجہ ہے کہ مقامی LLMs میک پر مختلف محسوس کرتے ہیں۔
باکس سے لے کر پہلے LLM تک تین کمانڈز میں
brew install ollama
ollama serve &
ollama run llama3.1:8b "Explain unified memory in 3 sentences."
یہ حقیقی طور پر پوری طرح کی تخلیق ہے۔ پہلا رن ماڈل کو ڈاؤن لوڈ کرتا ہے (Llama 3.1 8B Q4_K_M ڈسک پر تقریباً 4.7 GB ہے، عوامی تخمینہ) اور اسے متحد میموری میں لوڈ کرتا ہے۔ اس کے بعد، بات چیت کا سلسلہ ہموار ہے، جس میں قابل توجہ پہلی ٹوکن تاخیر اور ردعمل کے ذریعے مستحکم آؤٹ پٹ ہے۔ میں مناسب معیار کے طریقہ کار کے بغیر جان بوجھ کر ٹوکن فی سیکنڈ نمبر شائع نہیں کر رہا ہوں۔ طویل مضمون استدلال میں جاتا ہے.
Python کی 60 سے کم لائنوں میں مقامی RAG
مقامی LLM کے ساتھ آپ جو سب سے زیادہ کارآمد چیز کر سکتے ہیں وہ یہ ہے کہ اسے آپ کی اپنی دستاویزات کی طرف اشارہ کریں۔ کم از کم قابل عمل اسٹیک ہے:
- PyMuPDF یا
unstructuredتجزیہ کرنے کے لیے - nomic-embed-text ایمبیڈنگز کے لیے Ollama کے ذریعے
- ChromaDB ویکٹر اسٹور کے لیے
- Llama 3.1 8B نسل کے لیے Ollama کے ذریعے
مکمل کوڈ میں ہے۔ طویل مضمون. سرخی یہ ہے: ہر چیز Mac Studio پر چلتی ہے، کوئی بیرونی API کیز نہیں، کوئی فی ٹوکن بلنگ نہیں، مشین کو چھوڑنے والا کوئی ڈیٹا نہیں۔
Mac Studio بمقابلہ کلاؤڈ - ایماندارانہ فیصلہ میٹرکس
Mac Studio اس کے لیے جیتتا ہے: ہمیشہ پرائیویٹ اندازہ، RAG آپ کے اپنے ڈیٹا پر، IDE copilots، ایجنٹ پروٹو ٹائپنگ، اسٹیک سیکھنا، اور گھریلو لیبز۔ کلاؤڈ اس کے لیے جیتتا ہے: برسٹ ٹریننگ جابز،> 70B پروڈکشن پیمانے پر پیش کرنا، غیر متوقع عالمی ٹریفک، اور کام کا بوجھ جن کو 8x A100/H100 متوازی کی ضرورت ہے۔ زیادہ تر ٹیمیں دونوں کا استعمال ختم کریں گی۔ طویل مضمون میں SVG کے بطور مکمل فیصلہ میٹرکس ہے۔
ایک ہفتے کے بعد پانچ اسباق
- پرائیویسی استعمال کے نئے کیسز کو کھول دیتی ہے۔ جب ماڈل مقامی ہوتا ہے تو میں بغیر کسی ہچکچاہٹ کے پروڈکشن لاگز، اندرونی دستاویزات اور کسٹمر ای میلز میں پیسٹ کرتا ہوں۔ اس سے میرے کام کرنے کا طریقہ بدل جاتا ہے۔
- فی استفسار لاگت نفسیاتی بھی ہے اور مالی بھی۔ کسی بل کا مطلب زیادہ سوالات، زیادہ تجربات، زیادہ تجسس نہیں ہے۔
- 128 GB پیاری جگہ ہے۔ 64 GB سنجیدہ کام کے لیے منزل ہے۔ 128 GB آپ کو Q4_K_M پر 70B چلانے کے لیے ہیڈ روم فراہم کرتا ہے اور پھر بھی ہر چیز کے لیے گنجائش ہے۔
- Ollama آسان آن ریمپ ہے۔ LM سٹوڈیو ایک ماڈل براؤزر کے طور پر بہت اچھا ہے، MLX بہت اچھا ہے اگر آپ Python میں نئے سرے سے شروعات کر رہے ہیں، llama.cpp ان سب کو زیر کرتا ہے۔
- بادل مرا نہیں ہے۔ یہ تربیت، اسکیل آؤٹ سرونگ، اور نامعلوم بوجھ والے کام کے بوجھ کے لیے اب بھی صحیح ٹول ہے۔
آگے کیا ہے
مستقبل کے مضامین میں Apple Silicon پر MLX فائن ٹیوننگ، EXO کے ساتھ ملٹی میک انفرنس کلسٹرز، ایجنٹ اسٹیک (LangGraph + Ollama)، اور ایک گہرے بینچ مارک طریقہ کار کا احاطہ کیا جائے گا۔ اگر آپ تمام خاکوں، کوڈ، اور فیصلہ میٹرکس کے ساتھ لمبا ورژن چاہتے ہیں تو پڑھیں طویل مضمون. اگر آپ بصری ورژن چاہتے ہیں تو دیکھیں یوٹیوب شارٹ. کسی بھی طرح - باقی سیریز کے لیے سبسکرائب کریں۔