Workstation Logo
उत्पाद
एआई लैब्सOpenAI एजेंट्सClaude एजेंट्सGrok BotWorkstation CRM (WSL CRM)मार्केटिंगसभी उत्पाद
एआई समाधान
एआई वर्कस्टेशनAI SME Packagesप्राइवेट एआईजीपीयू क्लस्टरएज एआईएंटरप्राइज एआई लैबउद्योग अनुसार एआई
सेवाएँ
Platform ModernisationDigital EngineeringData Foundations & AIAutonomous Operationsएआई परामर्शDevOps स्वचालनसाइबर सुरक्षासॉफ़्टवेयर विकासएजेंट निर्माणMLOps सेटअप
हमारे बारे में
साझेदारग्राहक कहानियाँ
लेख
प्रलेखन
WSL ProxyRing PromoterWSL VaultJobshoutSysOps 24/7
ब्लॉग
संपर्क करेंLogin
Workstation

आधुनिक व्यवसायों के लिए AI वर्कस्टेशन, AI मल्टी-एजेंटिक सॉफ़्टवेयर, GPU अवसंरचना और बुद्धिमान एजेंट समाधान।

संपर्क करें

AI समाधान

एआई वर्कस्टेशनAI SME Packagesप्राइवेट एआईजीपीयू क्लस्टरएज एआईएंटरप्राइज एआई लैबउद्योग अनुसार एआई

उत्पाद

सभी उत्पादWSL CRM और ERPमार्केटिंगOpenAI एजेंट्सWSL ProxyRing PromoterWSL VaultJobshoutSysOps 24/7

कंपनी

हमारे बारे मेंWorkstation क्योंसाझेदारग्राहक कहानियाँमूल्य निर्धारणसंपर्क

संसाधन

लेखप्रलेखनब्लॉगखोजेंसाइटमैप
यूके कार्यालय
77-79 Marlowes, Hemel Hempstead HP1 1LFदिशा-निर्देश - M25 आउटर लंदन से जंक्शन 20 लेंकंपनी संख्या: 11641870सोम - शुक्र: सुबह 9:00 - शाम 6:00 GMT
+44 7515 356 146
बेल्जियम कार्यालय
Workstation SRL, Rue Vanderkindere 34, 1180 Uccle, BrusselsBE 0751.518.683सोम - शुक्र: सुबह 9:00 - शाम 6:00 CET
+32 492 45 67 46
भारत कार्यालय
#159 Sector 9, Pocket 1, DDA Flats, 110077 Dwarka, New Delhi
+91 98881 98841

© 2026 Workstation AI. सर्वाधिकार सुरक्षित।

गोपनीयताकुकीज़सेवा की शर्तेंवेबसाइट साइटमैप

Loading blog...

Home / Blog
AILLMApple SiliconMac StudioOllamaRagLocal AIHardware

Mac Studio M4 को अनबॉक्स करना और अपना पहला LLM चलाना

ताज़ा M4 Max, Ollama इंस्टॉल, स्थानीय स्तर पर Llama 3, और एक निजी RAG पाइपलाइन पर एक दोपहर में मैकटॉप से ​​वास्तविक रीडिंग

Balinder Walia15 मई 20265 min read

लंबे समय तक गहरे गोता लगाने के लिए एक छोटा, स्किम-पठनीय साथी। संपूर्ण पूर्वाभ्यास के लिए, यहां जाएं लंबा लेख.

डेस्क पर रखा बॉक्स अब एक एआई उपकरण है

मैंने M4 Max चिप, 128 GB एकीकृत मेमोरी, 40 GPU कोर, 16 CPU कोर और 2 टीबी SSD के साथ एक नया Mac Studio अनबॉक्स किया। एक दोपहर के भीतर यह Ollama के माध्यम से स्थानीय रूप से Llama 3.1 8B चला रहा था, मेरे स्वयं के दस्तावेज़ एम्बेड कर रहा था, और एक छोटी RAG पाइपलाइन के माध्यम से उन पर सवालों के जवाब दे रहा था। कोई क्लाउड बिल नहीं, कोई API कुंजी नहीं, कोई डेटा कमरे से बाहर नहीं जा रहा।

यह ब्लॉग लघु संस्करण है. पूरा लेख उसी वर्कफ़्लो पर गहराई से चलता है।

Mac Studio M4 + स्थानीय AI कवर

60 सेकंड में अनबॉक्सिंग

YouTube पर अनबॉक्सिंग शॉर्ट देखें: https://youtube.com/shorts/HUlUoHNsyNM

क्लासिक ऐप्पल अनबॉक्सिंग: न्यूनतम कार्डबोर्ड, एक ढाले हुए अवकाश में मशीन, एक पावर केबल। Mac Studio का घेरा लगभग 7.7 इंच वर्गाकार और घना है; जैसे ही आप इसे उठाते हैं आपको इसकी निर्माण गुणवत्ता का एहसास होता है। सेटअप वास्तव में तेज़ है - Apple ID, भाषा, FileVault, हो गया।

पहला बूट - मैकटॉप से ​​वास्तविक रीडिंग

ताजा Mac Studio M4 Max पर मैकटॉप डैशबोर्ड: 128 GB एकीकृत मेमोरी, 40 GPU कोर, 6.48 W पर निष्क्रिय
ताजा Mac Studio M4 Max पर मैकटॉप - 128 GB एकीकृत मेमोरी, 40 GPU कोर, 6.48 W पर निष्क्रिय। यह SVG फ़ॉलबैक है; एक वास्तविक पीएनजी यहां छोड़ें /img/mac-studio-mactop-firstboot.png बाद में इसे स्वैप करने के लिए।

उपरोक्त संख्याएं ही एकमात्र ठोस आंकड़े हैं जिनका मैं हवाला दूंगा। वे जमीनी सच्चाई से हैं mactop मेरी मशीन पर 37 मिनट के अपटाइम पर:

  • M4 Max - 16 कोर (4 ई + 12 पी), 784 मेगाहर्ट्ज पर 40 एक्सपीआर0एक्स कोर, 16-कोर एएनई।
  • 128 GB एकीकृत मेमोरी - 16.62 GB निष्क्रिय अवस्था में उपयोग में (लगभग 13%)।
  • 6.48 डब्ल्यू कुल निष्क्रिय शक्ति, 46.33 W अधिकतम देखी गई। थर्मल: नाममात्र.
  • 2 टीबी एसएसडी, प्रारंभिक सेटअप के बाद 1.9 टीबी मुफ़्त।

128 GB प्रयोग करने योग्य मेमोरी वाले डेस्कटॉप के लिए निष्क्रिय स्थिति में 6.48 W मेरे लिए हेडलाइन नंबर है। यह बॉक्स वास्तव में एक कम-शक्ति वाला, हमेशा चालू रहने वाला एआई उपकरण है जिसे आप बिजली बिल के बारे में सोचे बिना 24x7 चालू रख सकते हैं।

यह हार्डवेयर क्यों खास है - एक पैराग्राफ में एकीकृत मेमोरी

पारंपरिक पीसी पर, आपके CPU में सिस्टम रैम है और आपके GPU में अलग VRAM है। GPU चलाने से पहले एक मॉडल को PCIe पर कॉपी करना होगा; यदि मॉडल वीआरएएम से बड़ा है, तो यह फिट नहीं बैठता है। Apple Silicon पर, CPU, GPU, न्यूरल इंजन और मीडिया इंजन साझा करते हैं एक 128 GB पूल। कुछ भी कॉपी नहीं किया गया है. Q4_K_M पर एक 70B-पैरामीटर LLM (डिस्क पर लगभग 40 GB, सार्वजनिक अनुमान) लगभग 80 GB के साथ लोड होता है जो अभी भी संदर्भ, एप्लिकेशन और टूल के लिए निःशुल्क है। यही कारण है कि मैक पर स्थानीय LLM अलग महसूस होते हैं।

तीन कमांड में बॉक्स से पहले LLM तक

brew install ollama
ollama serve &
ollama run llama3.1:8b "Explain unified memory in 3 sentences."

वास्तव में यही संपूर्ण पालन-पोषण है। पहला रन मॉडल को डाउनलोड करता है (Llama 3.1 8B Q4_K_M डिस्क पर लगभग 4.7 GB है, सार्वजनिक अनुमान) और इसे एकीकृत मेमोरी में लोड करता है। उसके बाद, बातचीत की स्ट्रीमिंग सुचारू होती है, ध्यान देने योग्य प्रथम-टोकन विलंब और प्रतिक्रिया के माध्यम से स्थिर आउटपुट के साथ। मैं उचित बेंचमार्क पद्धति के बिना जानबूझकर यहां प्रति सेकंड टोकन संख्या प्रकाशित नहीं कर रहा हूं; लंबा लेख तर्क में जाता है।

पायथन की 60 से कम लाइनों में स्थानीय RAG

स्थानीय LLM के साथ आप जो सबसे उपयोगी चीज़ कर सकते हैं, वह है इसे अपने दस्तावेज़ों पर इंगित करना। न्यूनतम व्यवहार्य स्टैक है:

  • PyMuPDF या unstructured पार्सिंग के लिए
  • nomic-embed-text एम्बेडिंग के लिए Ollama के माध्यम से
  • ChromaDB वेक्टर स्टोर के लिए
  • Llama 3.1 8B पीढ़ी के लिए Ollama के माध्यम से

पूरा कोड इसमें है लंबा लेख. शीर्षक है: सब कुछ Mac Studio पर चलता है, कोई बाहरी API कुंजी नहीं, कोई प्रति-टोकन बिलिंग नहीं, मशीन से कोई डेटा नहीं निकलता।

Mac Studio बनाम क्लाउड - ईमानदार निर्णय मैट्रिक्स

Mac Studio इसके लिए जीतता है: हमेशा निजी अनुमान पर, आपके अपने डेटा पर RAG, IDE सह-पायलट, एजेंट प्रोटोटाइप, स्टैक सीखना, और होम लैब। क्लाउड इन के लिए जीतता है: बर्स्ट प्रशिक्षण नौकरियां, >70B उत्पादन बड़े पैमाने पर सेवा, अप्रत्याशित वैश्विक ट्रैफ़िक, और वर्कलोड जिन्हें 8x A100/H100 समानता की आवश्यकता होती है। अधिकांश टीमें दोनों का उपयोग करना बंद कर देंगी। लंबे लेख में एसवीजी के रूप में पूर्ण निर्णय मैट्रिक्स है।

एक सप्ताह के बाद पाँच पाठ

  1. गोपनीयता नए उपयोग के मामलों को खोलती है। जब मॉडल स्थानीय होता है, तो मैं बिना किसी हिचकिचाहट के उत्पादन लॉग, आंतरिक दस्तावेज़ और ग्राहक ईमेल पेस्ट करता हूं। इससे मेरे काम करने का तरीका बदल जाता है।
  2. प्रति-क्वेरी लागत मनोवैज्ञानिक होने के साथ-साथ वित्तीय भी है। किसी बिल का मतलब अधिक प्रश्न, अधिक प्रयोग, अधिक जिज्ञासा नहीं है।
  3. 128 GB सबसे अच्छी जगह है। 64 GB गंभीर कार्य के लिए मंजिल है। 128 GB आपको Q4_K_M पर 70B चलाने के लिए हेडरूम देता है और बाकी सभी चीजों के लिए अभी भी जगह है।
  4. Ollama आसान ऑन-रैंप है। एलएम स्टूडियो एक मॉडल ब्राउज़र के रूप में बहुत अच्छा है, यदि आप पाइथॉन में नए सिरे से शुरुआत कर रहे हैं तो एमएलएक्स बहुत अच्छा है, llama.cpp इस सब पर आधारित है।
  5. बादल मरा नहीं है. यह अभी भी प्रशिक्षण, स्केल-आउट सर्विंग और अज्ञात-लोड कार्यभार के लिए सही उपकरण है।

अगला क्या है

भविष्य के लेखों में Apple Silicon पर MLX फाइन-ट्यूनिंग, EXO के साथ मल्टी-मैक अनुमान क्लस्टर, एजेंट स्टैक (LangGraph + Ollama), और एक गहन बेंचमार्क पद्धति का हिस्सा शामिल होगा। यदि आप सभी आरेख, कोड और निर्णय मैट्रिक्स के साथ लंबा संस्करण चाहते हैं, तो पढ़ें लंबा लेख. यदि आप दृश्य संस्करण चाहते हैं, तो देखें यूट्यूब लघु. किसी भी तरह - श्रृंखला के शेष भाग के लिए सदस्यता लें।