আনবক্সিং Mac Studio M4 এবং আপনার প্রথম LLM চালানো
এক বিকেলে একটি নতুন M4 Max, Ollama ইনস্টল, Llama 3 স্থানীয়ভাবে, এবং একটি ব্যক্তিগত RAG পাইপলাইনে ম্যাকটপ থেকে আসল রিডিং
দীর্ঘ আকারের গভীর ডাইভের একটি সংক্ষিপ্ত, স্কিম-পঠনযোগ্য সঙ্গী। সম্পূর্ণ ওয়াকথ্রু জন্য, ঝাঁপ দাও দীর্ঘ নিবন্ধ.
ডেস্কের বাক্সটি এখন একটি এআই অ্যাপ্লায়েন্স
আমি M4 Max চিপ, 128 GB ইউনিফাইড মেমরি, 40 GPU কোর, 16 CPU কোর এবং একটি 2 TB SSD সহ একটি নতুন Mac Studio আনবক্স করেছি৷ একটি বিকেলের মধ্যে এটি স্থানীয়ভাবে Ollama এর মাধ্যমে Llama 3.1 8B চালাচ্ছিল, আমার নিজের নথিগুলি এম্বেড করছিল, এবং একটি ছোট RAG পাইপলাইনের মাধ্যমে তাদের প্রশ্নের উত্তর দিচ্ছিল। কোনো ক্লাউড বিল নেই, কোনো API কী নেই, কোনো ডেটা রুম ছেড়ে যাচ্ছে না।
এই ব্লগটি সংক্ষিপ্ত সংস্করণ। সম্পূর্ণ নিবন্ধটি একই কর্মপ্রবাহের গভীরতার মধ্য দিয়ে চলে।
60 সেকেন্ডের মধ্যে আনবক্সিং
ইউটিউবে আনবক্সিং শর্ট দেখুন: https://youtube.com/shorts/HUlUoHNsyNM
ক্লাসিক অ্যাপল আনবক্সিং: ন্যূনতম কার্ডবোর্ড, একটি ছাঁচে তৈরি রিসেসে মেশিন, একটি পাওয়ার তার। Mac Studio ঘেরটি প্রায় 7.7 ইঞ্চি বর্গক্ষেত্র এবং ঘন; আপনি এটি বাছাই মুহূর্তে বিল্ড গুণমান অনুভব করেন। সেটআপ প্রকৃতপক্ষে দ্রুত - Apple ID, ভাষা, FileVault, সম্পন্ন৷
প্রথম বুট - mactop থেকে বাস্তব রিডিং
/img/mac-studio-mactop-firstboot.png পরে এটি অদলবদল করতে।উপরের সংখ্যাগুলি হল একমাত্র কঠিন পরিসংখ্যান যা আমি উদ্ধৃত করব। তারা স্থল সত্য থেকে mactop আপটাইমের 37 মিনিটে আমার মেশিনে:
- M4 Max - 16 কোর (4 E + 12 P), 784 MHz এ 40 GPU কোর, 16-কোর ANE।
- 128 GB ইউনিফাইড মেমরি - নিষ্ক্রিয় অবস্থায় 16.62 GB ব্যবহার হচ্ছে (প্রায় 13%)।
- 6.48 W মোট নিষ্ক্রিয় শক্তি, 46.33 ওয়াট সর্বাধিক পর্যবেক্ষণ করা হয়েছে৷ থার্মাল: নামমাত্র।
- 2 টিবি এসএসডি, প্রাথমিক সেটআপের পরে 1.9 টিবি বিনামূল্যে।
128 GB ব্যবহারযোগ্য মেমরি সহ একটি ডেস্কটপের জন্য নিষ্ক্রিয় অবস্থায় 6.48 W আমার জন্য শিরোনাম নম্বর। এই বাক্সটি প্রকৃতপক্ষে একটি কম-পাওয়ার, সর্বদা-চালু AI অ্যাপ্লায়েন্স যা আপনি বিদ্যুতের বিলের কথা চিন্তা না করেই 24x7 চালিয়ে যেতে পারেন।
কেন এই হার্ডওয়্যারটি বিশেষ - এক অনুচ্ছেদে ইউনিফাইড মেমরি
একটি প্রথাগত পিসিতে, আপনার CPU এর সিস্টেম RAM আছে এবং আপনার GPU এর আলাদা VRAM আছে। GPU চালানোর আগে একটি মডেলকে PCIe জুড়ে কপি করতে হবে; যদি মডেলটি VRAM-এর চেয়ে বড় হয়, তাহলে এটি মাপসই হয় না। Apple Silicon-এ, CPU, GPU, নিউরাল ইঞ্জিন এবং মিডিয়া ইঞ্জিনগুলি ভাগ করে নেয় এক 128 GB পুল। কিছুই কপি করা হয় না. Q4_K_M-এ একটি 70B-প্যারামিটার LLM (ডিস্কে প্রায় 40 GB, সর্বজনীন অনুমান) মোটামুটি 80 GB এখনও প্রসঙ্গ, অ্যাপ্লিকেশন এবং সরঞ্জামগুলির জন্য বিনামূল্যে লোড হয়৷ এই কারণেই স্থানীয় LLMs একটি Mac-এ ভিন্ন বোধ করে।
তিনটি কমান্ডে বক্স থেকে প্রথম LLM পর্যন্ত
brew install ollama
ollama serve &
ollama run llama3.1:8b "Explain unified memory in 3 sentences."
যে প্রকৃতপক্ষে পুরো আনা আপ. প্রথম রান মডেলটি ডাউনলোড করে (Llama 3.1 8B Q4_K_M ডিস্কে প্রায় 4.7 GB, পাবলিক এস্টিমেট) এবং এটিকে ইউনিফাইড মেমরিতে লোড করে। এর পরে, কথোপকথনমূলক স্ট্রিমিং মসৃণ, একটি লক্ষণীয় প্রথম-টোকেন বিলম্ব এবং প্রতিক্রিয়ার মাধ্যমে স্থির আউটপুট সহ। আমি ইচ্ছাকৃতভাবে একটি সঠিক বেঞ্চমার্ক পদ্ধতি ছাড়া এখানে টোকেন-প্রতি-সেকেন্ড সংখ্যা প্রকাশ করছি না; দীর্ঘ নিবন্ধটি যুক্তিতে চলে যায়।
Python এর 60 লাইনের নিচে স্থানীয় RAG
একটি স্থানীয় LLM এর সাথে আপনি সবচেয়ে দরকারী জিনিসটি করতে পারেন তা হল এটি আপনার নিজের নথিতে নির্দেশ করুন৷ ন্যূনতম কার্যকর স্ট্যাক হল:
- PyMuPDF বা
unstructuredপার্স করার জন্য - nomic-embed-text এম্বেডিংয়ের জন্য Ollama এর মাধ্যমে
- ChromaDB ভেক্টর স্টোরের জন্য
- Llama 3.1 8B প্রজন্মের জন্য Ollama এর মাধ্যমে
সম্পূর্ণ কোড আছে দীর্ঘ নিবন্ধ. শিরোনামটি হল: সবকিছু Mac Studio-এ চলে, কোনও বাহ্যিক API কী নেই, কোনও প্রতি-টোকেন বিলিং নেই, কোনও ডেটা মেশিন থেকে বেরিয়ে যায় না।
Mac Studio বনাম ক্লাউড - সৎ সিদ্ধান্তের ম্যাট্রিক্স
Mac Studio এর জন্য জিতেছে: সর্বদা ব্যক্তিগত অনুমান, RAG আপনার নিজস্ব ডেটা, IDE কপিলট, এজেন্ট প্রোটোটাইপিং, স্ট্যাক শেখা এবং হোম ল্যাব। ক্লাউড এর জন্য জিতেছে: বার্স্ট ট্রেনিং জব, > 70B প্রোডাকশন স্কেলে পরিবেশন করা, অপ্রত্যাশিত গ্লোবাল ট্র্যাফিক, এবং কাজের চাপ যার জন্য 8x A100/H100 সমান্তরালতার প্রয়োজন। অধিকাংশ দল উভয় ব্যবহার করে শেষ হবে. দীর্ঘ নিবন্ধটি একটি SVG হিসাবে একটি সম্পূর্ণ সিদ্ধান্ত ম্যাট্রিক্স আছে.
এক সপ্তাহ পর পাঁচটি পাঠ
- গোপনীয়তা নতুন ব্যবহারের ক্ষেত্রে আনলক করে। মডেলটি স্থানীয় হলে, আমি বিনা দ্বিধায় প্রোডাকশন লগ, অভ্যন্তরীণ ডক্স এবং গ্রাহকের ইমেল পেস্ট করি। এটি আমার কাজ করার পদ্ধতি পরিবর্তন করে।
- প্রতি-কোয়েরি খরচ মানসিক পাশাপাশি আর্থিক। কোন বিল মানে আরো প্রশ্ন, আরো পরীক্ষা, আরো কৌতূহল।
- 128 GB হল মিষ্টি স্পট। 64 GB হল গুরুতর কাজের জন্য মেঝে। 128 GB আপনাকে Q4_K_M এ 70B চালানোর জন্য হেডরুম দেয় এবং এখনও অন্য সবকিছুর জন্য জায়গা আছে।
- Ollama হল সহজ অন-র্যাম্প৷ LM স্টুডিও একটি মডেল ব্রাউজার হিসাবে দুর্দান্ত, আপনি যদি Python-এ নতুন করে শুরু করেন তাহলে MLX দুর্দান্ত, llama.cpp এটিকে আন্ডারপিন করে।
- মেঘ মরেনি। এটি এখনও প্রশিক্ষণ, স্কেল-আউট পরিবেশন এবং অজানা-লোড ওয়ার্কলোডের জন্য সঠিক হাতিয়ার।
এর পরের কি আছে
ভবিষ্যতের নিবন্ধগুলি Apple Silicon-এ MLX ফাইন-টিউনিং, EXO সহ মাল্টি-ম্যাক ইনফারেন্স ক্লাস্টার, এজেন্ট স্ট্যাক (LangGraph + Ollama), এবং একটি গভীর বেঞ্চমার্ক পদ্ধতির অংশকে কভার করবে। আপনি যদি সমস্ত ডায়াগ্রাম, কোড এবং সিদ্ধান্ত ম্যাট্রিক্স সহ দীর্ঘ সংস্করণ চান তবে পড়ুন দীর্ঘ নিবন্ধ. আপনি যদি চাক্ষুষ সংস্করণ চান, দেখুন ইউটিউব শর্ট. যেভাবেই হোক - বাকি সিরিজের জন্য সাবস্ক্রাইব করুন।