Mac Studio M4 ਨੂੰ ਅਨਬਾਕਸ ਕਰਨਾ ਅਤੇ ਤੁਹਾਡਾ ਪਹਿਲਾ LLM ਚੱਲ ਰਿਹਾ ਹੈ
ਇੱਕ ਦੁਪਹਿਰ ਵਿੱਚ ਇੱਕ ਤਾਜ਼ਾ M4 Max, Ollama ਇੰਸਟਾਲ, Llama 3 ਸਥਾਨਕ ਤੌਰ 'ਤੇ, ਅਤੇ ਇੱਕ ਪ੍ਰਾਈਵੇਟ RAG ਪਾਈਪਲਾਈਨ 'ਤੇ ਮੈਕਟੌਪ ਤੋਂ ਅਸਲ ਰੀਡਿੰਗ
ਲੰਮੀ-ਫਾਰਮ ਡੂੰਘੀ ਗੋਤਾਖੋਰੀ ਲਈ ਇੱਕ ਛੋਟਾ, ਸਕੀਮ-ਪੜ੍ਹਨਯੋਗ ਸਾਥੀ। ਪੂਰੇ ਵਾਕਥਰੂ ਲਈ, 'ਤੇ ਜਾਓ ਲੰਬਾ ਲੇਖ.
ਡੈਸਕ 'ਤੇ ਬਕਸਾ ਹੁਣ ਇੱਕ AI ਉਪਕਰਣ ਹੈ
ਮੈਂ M4 Max ਚਿੱਪ, 128 GB ਯੂਨੀਫਾਈਡ ਮੈਮੋਰੀ, 40 GPU ਕੋਰ, 16 CPU ਕੋਰ, ਅਤੇ ਇੱਕ 2 TB SSD ਨਾਲ ਇੱਕ ਨਵਾਂ Mac Studio ਅਨਬਾਕਸ ਕੀਤਾ। ਇੱਕ ਦੁਪਹਿਰ ਦੇ ਅੰਦਰ ਇਹ Ollama ਦੁਆਰਾ ਸਥਾਨਕ ਤੌਰ 'ਤੇ Llama 3.1 8B ਨੂੰ ਚਲਾ ਰਿਹਾ ਸੀ, ਮੇਰੇ ਆਪਣੇ ਦਸਤਾਵੇਜ਼ਾਂ ਨੂੰ ਏਮਬੈਡ ਕਰ ਰਿਹਾ ਸੀ, ਅਤੇ ਇੱਕ ਛੋਟੀ RAG ਪਾਈਪਲਾਈਨ ਦੁਆਰਾ ਉਹਨਾਂ ਦੇ ਸਵਾਲਾਂ ਦੇ ਜਵਾਬ ਦੇ ਰਿਹਾ ਸੀ। ਕੋਈ ਕਲਾਊਡ ਬਿੱਲ ਨਹੀਂ, ਕੋਈ API ਕੁੰਜੀ ਨਹੀਂ, ਕਮਰੇ ਨੂੰ ਛੱਡਣ ਵਾਲਾ ਕੋਈ ਡਾਟਾ ਨਹੀਂ।
ਇਹ ਬਲੌਗ ਛੋਟਾ ਸੰਸਕਰਣ ਹੈ। ਪੂਰਾ ਲੇਖ ਡੂੰਘਾਈ ਵਿੱਚ ਉਸੇ ਵਰਕਫਲੋ ਵਿੱਚੋਂ ਲੰਘਦਾ ਹੈ.
60 ਸਕਿੰਟਾਂ ਵਿੱਚ ਅਨਬਾਕਸਿੰਗ
YouTube 'ਤੇ ਅਨਬਾਕਸਿੰਗ ਸ਼ਾਰਟ ਦੇਖੋ: https://youtube.com/shorts/HUlUoHNsyNM
ਕਲਾਸਿਕ ਐਪਲ ਅਨਬਾਕਸਿੰਗ: ਨਿਊਨਤਮ ਗੱਤੇ, ਇੱਕ ਮੋਲਡ ਰੀਸੈਸ ਵਿੱਚ ਮਸ਼ੀਨ, ਇੱਕ ਪਾਵਰ ਕੇਬਲ। Mac Studio ਦੀਵਾਰ ਲਗਭਗ 7.7 ਇੰਚ ਵਰਗ ਅਤੇ ਸੰਘਣੀ ਹੈ; ਜਦੋਂ ਤੁਸੀਂ ਇਸਨੂੰ ਚੁੱਕਦੇ ਹੋ ਤਾਂ ਤੁਸੀਂ ਬਿਲਡ ਗੁਣਵੱਤਾ ਮਹਿਸੂਸ ਕਰਦੇ ਹੋ। ਸੈੱਟਅੱਪ ਅਸਲ ਵਿੱਚ ਤੇਜ਼ ਹੈ - Apple ID, ਭਾਸ਼ਾ, FileVault, ਹੋ ਗਿਆ।
ਪਹਿਲਾ ਬੂਟ - ਮੈਕਟੌਪ ਤੋਂ ਅਸਲ ਰੀਡਿੰਗ
/img/mac-studio-mactop-firstboot.png ਇਸ ਨੂੰ ਬਾਅਦ ਵਿੱਚ ਸਵੈਪ ਕਰਨ ਲਈ।ਉਪਰੋਕਤ ਸੰਖਿਆ ਸਿਰਫ ਉਹੀ ਸਖਤ ਅੰਕੜੇ ਹਨ ਜਿਨ੍ਹਾਂ ਦਾ ਮੈਂ ਹਵਾਲਾ ਦੇਵਾਂਗਾ. ਤੋਂ ਜ਼ਮੀਨੀ ਸੱਚਾਈ ਹੈ mactop ਅਪਟਾਈਮ ਦੇ 37 ਮਿੰਟ 'ਤੇ ਮੇਰੀ ਮਸ਼ੀਨ 'ਤੇ:
- M4 Max - 16 ਕੋਰ (4 E + 12 P), 784 MHz 'ਤੇ 40 GPU ਕੋਰ, 16-ਕੋਰ ANE।
- 128 GB ਯੂਨੀਫਾਈਡ ਮੈਮੋਰੀ - 16.62 GB ਨਿਸ਼ਕਿਰਿਆ 'ਤੇ ਵਰਤੋਂ ਵਿੱਚ ਹੈ (ਲਗਭਗ 13%)।
- 6.48 ਡਬਲਯੂ ਕੁੱਲ ਨਿਸ਼ਕਿਰਿਆ ਸ਼ਕਤੀ, 46.33 W ਅਧਿਕਤਮ ਦੇਖਿਆ ਗਿਆ। ਥਰਮਲ: ਨਾਮਾਤਰ।
- 2 TB SSD, ਸ਼ੁਰੂਆਤੀ ਸੈੱਟਅੱਪ ਤੋਂ ਬਾਅਦ 1.9 TB ਮੁਫ਼ਤ।
128 GB ਵਰਤੋਂ ਯੋਗ ਮੈਮੋਰੀ ਵਾਲੇ ਡੈਸਕਟਾਪ ਲਈ ਨਿਸ਼ਕਿਰਿਆ 'ਤੇ 6.48 W ਮੇਰੇ ਲਈ ਹੈੱਡਲਾਈਨ ਨੰਬਰ ਹੈ। ਇਹ ਬਾਕਸ ਅਸਲ ਵਿੱਚ ਇੱਕ ਘੱਟ-ਪਾਵਰ, ਹਮੇਸ਼ਾ-ਚਾਲੂ AI ਉਪਕਰਣ ਹੈ ਜਿਸ ਨੂੰ ਤੁਸੀਂ ਬਿਜਲੀ ਦੇ ਬਿੱਲ ਬਾਰੇ ਸੋਚੇ ਬਿਨਾਂ 24x7 ਚੱਲਣਾ ਛੱਡ ਸਕਦੇ ਹੋ।
ਇਹ ਹਾਰਡਵੇਅਰ ਵਿਸ਼ੇਸ਼ ਕਿਉਂ ਹੈ - ਇੱਕ ਪੈਰੇ ਵਿੱਚ ਯੂਨੀਫਾਈਡ ਮੈਮੋਰੀ
ਇੱਕ ਰਵਾਇਤੀ PC 'ਤੇ, ਤੁਹਾਡੇ CPU ਵਿੱਚ ਸਿਸਟਮ RAM ਹੈ ਅਤੇ ਤੁਹਾਡੇ GPU ਵਿੱਚ ਵੱਖਰੀ VRAM ਹੈ। GPU ਦੁਆਰਾ ਚਲਾਉਣ ਤੋਂ ਪਹਿਲਾਂ ਇੱਕ ਮਾਡਲ ਨੂੰ PCIe ਵਿੱਚ ਕਾਪੀ ਕੀਤਾ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ; ਜੇਕਰ ਮਾਡਲ VRAM ਤੋਂ ਵੱਡਾ ਹੈ, ਤਾਂ ਇਹ ਫਿੱਟ ਨਹੀਂ ਬੈਠਦਾ। Apple Silicon 'ਤੇ, CPU, GPU, ਨਿਊਰਲ ਇੰਜਣ, ਅਤੇ ਮੀਡੀਆ ਇੰਜਣ ਸਾਂਝੇ ਕਰਦੇ ਹਨ ਇੱਕ 128 GB ਪੂਲ। ਕੁਝ ਵੀ ਨਕਲ ਨਹੀਂ ਕੀਤਾ ਗਿਆ ਹੈ. Q4_K_M 'ਤੇ ਇੱਕ 70B-ਪੈਰਾਮੀਟਰ LLM (ਡਿਸਕ 'ਤੇ ਲਗਭਗ 40 GB, ਜਨਤਕ ਅਨੁਮਾਨ) ਲਗਭਗ 80 GB ਨਾਲ ਲੋਡ ਹੁੰਦਾ ਹੈ ਪਰ ਸੰਦਰਭ, ਐਪਲੀਕੇਸ਼ਨਾਂ ਅਤੇ ਟੂਲਸ ਲਈ ਅਜੇ ਵੀ ਮੁਫ਼ਤ ਹੈ। ਇਹੀ ਕਾਰਨ ਹੈ ਕਿ ਸਥਾਨਕ LLMs ਮੈਕ 'ਤੇ ਵੱਖਰਾ ਮਹਿਸੂਸ ਕਰਦੇ ਹਨ।
ਤਿੰਨ ਕਮਾਂਡਾਂ ਵਿੱਚ ਬਾਕਸ ਤੋਂ ਪਹਿਲੇ LLM ਤੱਕ
brew install ollama
ollama serve &
ollama run llama3.1:8b "Explain unified memory in 3 sentences."
ਇਹ ਸੱਚਮੁੱਚ ਪੂਰਾ ਲਿਆਉਣ-ਅੱਪ ਹੈ. ਪਹਿਲੀ ਰਨ ਮਾਡਲ ਨੂੰ ਡਾਊਨਲੋਡ ਕਰਦੀ ਹੈ (Llama 3.1 8B Q4_K_M ਡਿਸਕ 'ਤੇ ਲਗਭਗ 4.7 GB ਹੈ, ਜਨਤਕ ਅਨੁਮਾਨ) ਅਤੇ ਇਸਨੂੰ ਯੂਨੀਫਾਈਡ ਮੈਮੋਰੀ ਵਿੱਚ ਲੋਡ ਕਰਦਾ ਹੈ। ਉਸ ਤੋਂ ਬਾਅਦ, ਪ੍ਰਤੀਕਿਰਿਆ ਦੁਆਰਾ ਧਿਆਨ ਦੇਣ ਯੋਗ ਪਹਿਲੀ-ਟੋਕਨ ਦੇਰੀ ਅਤੇ ਸਥਿਰ ਆਉਟਪੁੱਟ ਦੇ ਨਾਲ, ਗੱਲਬਾਤ ਵਾਲੀ ਸਟ੍ਰੀਮਿੰਗ ਨਿਰਵਿਘਨ ਹੈ। ਮੈਂ ਜਾਣਬੁੱਝ ਕੇ ਸਹੀ ਮਾਪਦੰਡ ਵਿਧੀ ਤੋਂ ਬਿਨਾਂ ਟੋਕਨ-ਪ੍ਰਤੀ-ਸੈਕਿੰਡ ਨੰਬਰ ਪ੍ਰਕਾਸ਼ਿਤ ਨਹੀਂ ਕਰ ਰਿਹਾ ਹਾਂ; ਲੰਮਾ ਲੇਖ ਤਰਕ ਵਿੱਚ ਜਾਂਦਾ ਹੈ।
Python ਦੀਆਂ 60 ਲਾਈਨਾਂ ਦੇ ਹੇਠਾਂ ਸਥਾਨਕ RAG
ਸਭ ਤੋਂ ਲਾਭਦਾਇਕ ਚੀਜ਼ ਜੋ ਤੁਸੀਂ ਸਥਾਨਕ LLM ਨਾਲ ਕਰ ਸਕਦੇ ਹੋ ਉਹ ਹੈ ਇਸਨੂੰ ਤੁਹਾਡੇ ਆਪਣੇ ਦਸਤਾਵੇਜ਼ਾਂ 'ਤੇ ਪੁਆਇੰਟ ਕਰੋ। ਘੱਟੋ-ਘੱਟ ਵਿਹਾਰਕ ਸਟੈਕ ਹੈ:
- PyMuPDF ਜਾਂ
unstructuredਪਾਰਸ ਕਰਨ ਲਈ - nomic-embed-text ਏਮਬੈਡਿੰਗ ਲਈ Ollama ਰਾਹੀਂ
- ChromaDB ਵੈਕਟਰ ਸਟੋਰ ਲਈ
- Llama 3.1 8B ਪੀੜ੍ਹੀ ਲਈ Ollama ਰਾਹੀਂ
ਪੂਰਾ ਕੋਡ ਵਿੱਚ ਹੈ ਲੰਮਾ ਲੇਖ. ਸਿਰਲੇਖ ਹੈ: ਹਰ ਚੀਜ਼ Mac Studio 'ਤੇ ਚੱਲਦੀ ਹੈ, ਕੋਈ ਬਾਹਰੀ API ਕੁੰਜੀਆਂ ਨਹੀਂ, ਕੋਈ ਪ੍ਰਤੀ-ਟੋਕਨ ਬਿਲਿੰਗ ਨਹੀਂ, ਮਸ਼ੀਨ ਨੂੰ ਛੱਡਣ ਵਾਲਾ ਕੋਈ ਡਾਟਾ ਨਹੀਂ।
Mac Studio ਬਨਾਮ ਕਲਾਉਡ - ਇਮਾਨਦਾਰ ਫੈਸਲਾ ਮੈਟ੍ਰਿਕਸ
Mac Studio ਇਹਨਾਂ ਲਈ ਜਿੱਤਦਾ ਹੈ: ਹਮੇਸ਼ਾਂ-ਨਿੱਜੀ ਅਨੁਮਾਨ, RAG ਤੁਹਾਡੇ ਆਪਣੇ ਡੇਟਾ 'ਤੇ, IDE ਕੋਪਾਇਲਟ, ਏਜੰਟ ਪ੍ਰੋਟੋਟਾਈਪਿੰਗ, ਸਟੈਕ ਸਿੱਖਣਾ, ਅਤੇ ਘਰੇਲੂ ਲੈਬਾਂ। ਕਲਾਉਡ ਇਸ ਲਈ ਜਿੱਤਦਾ ਹੈ: ਬਰਸਟ ਟ੍ਰੇਨਿੰਗ ਨੌਕਰੀਆਂ, > 70B ਉਤਪਾਦਨ ਪੈਮਾਨੇ 'ਤੇ ਸੇਵਾ, ਅਣ-ਅਨੁਮਾਨਿਤ ਗਲੋਬਲ ਟ੍ਰੈਫਿਕ, ਅਤੇ ਵਰਕਲੋਡ ਜਿਨ੍ਹਾਂ ਨੂੰ 8x A100/H100 ਸਮਾਨਤਾ ਦੀ ਲੋੜ ਹੈ। ਜ਼ਿਆਦਾਤਰ ਟੀਮਾਂ ਦੋਵਾਂ ਦੀ ਵਰਤੋਂ ਕਰਨਗੀਆਂ। ਲੰਬੇ ਲੇਖ ਵਿੱਚ ਇੱਕ SVG ਦੇ ਰੂਪ ਵਿੱਚ ਇੱਕ ਪੂਰਾ ਫੈਸਲਾ ਮੈਟ੍ਰਿਕਸ ਹੈ।
ਇੱਕ ਹਫ਼ਤੇ ਬਾਅਦ ਪੰਜ ਪਾਠ
- ਗੋਪਨੀਯਤਾ ਵਰਤੋਂ ਦੇ ਨਵੇਂ ਕੇਸਾਂ ਨੂੰ ਖੋਲ੍ਹਦੀ ਹੈ। ਜਦੋਂ ਮਾਡਲ ਸਥਾਨਕ ਹੁੰਦਾ ਹੈ, ਤਾਂ ਮੈਂ ਬਿਨਾਂ ਝਿਜਕਦੇ ਉਤਪਾਦਨ ਲੌਗਸ, ਅੰਦਰੂਨੀ ਦਸਤਾਵੇਜ਼ਾਂ ਅਤੇ ਗਾਹਕ ਈਮੇਲਾਂ ਵਿੱਚ ਪੇਸਟ ਕਰਦਾ ਹਾਂ। ਇਹ ਮੇਰੇ ਕੰਮ ਕਰਨ ਦੇ ਤਰੀਕੇ ਨੂੰ ਬਦਲਦਾ ਹੈ।
- ਪ੍ਰਤੀ-ਪੁੱਛਗਿੱਛ ਲਾਗਤ ਮਨੋਵਿਗਿਆਨਕ ਦੇ ਨਾਲ-ਨਾਲ ਵਿੱਤੀ ਵੀ ਹੈ। ਕੋਈ ਬਿੱਲ ਦਾ ਮਤਲਬ ਹੋਰ ਸਵਾਲ, ਹੋਰ ਪ੍ਰਯੋਗ, ਹੋਰ ਉਤਸੁਕਤਾ ਨਹੀਂ ਹੈ।
- 128 GB ਮਿੱਠਾ ਸਥਾਨ ਹੈ। 64 GB ਗੰਭੀਰ ਕੰਮ ਲਈ ਮੰਜ਼ਿਲ ਹੈ। 128 GB ਤੁਹਾਨੂੰ Q4_K_M 'ਤੇ 70B ਚਲਾਉਣ ਲਈ ਹੈੱਡਰੂਮ ਦਿੰਦਾ ਹੈ ਅਤੇ ਅਜੇ ਵੀ ਹਰ ਚੀਜ਼ ਲਈ ਜਗ੍ਹਾ ਹੈ।
- Ollama ਆਸਾਨ ਆਨ-ਰੈਂਪ ਹੈ। LM ਸਟੂਡੀਓ ਇੱਕ ਮਾਡਲ ਬ੍ਰਾਊਜ਼ਰ ਦੇ ਰੂਪ ਵਿੱਚ ਬਹੁਤ ਵਧੀਆ ਹੈ, MLX ਬਹੁਤ ਵਧੀਆ ਹੈ ਜੇਕਰ ਤੁਸੀਂ Python ਵਿੱਚ ਨਵੀਂ ਸ਼ੁਰੂਆਤ ਕਰ ਰਹੇ ਹੋ, llama.cpp ਇਸ ਸਭ ਨੂੰ ਅੰਡਰਪਿਨ ਕਰਦਾ ਹੈ।
- ਬੱਦਲ ਮਰਿਆ ਨਹੀਂ ਹੈ। ਇਹ ਅਜੇ ਵੀ ਸਿਖਲਾਈ, ਸਕੇਲ-ਆਊਟ ਸਰਵਿੰਗ, ਅਤੇ ਅਣਜਾਣ-ਲੋਡ ਵਰਕਲੋਡ ਲਈ ਸਹੀ ਸਾਧਨ ਹੈ।
ਅੱਗੇ ਕੀ ਹੈ
ਭਵਿੱਖ ਦੇ ਲੇਖਾਂ ਵਿੱਚ Apple Silicon 'ਤੇ MLX ਫਾਈਨ-ਟਿਊਨਿੰਗ, EXO ਦੇ ਨਾਲ ਮਲਟੀ-ਮੈਕ ਇਨਫਰੈਂਸ ਕਲੱਸਟਰ, ਏਜੰਟ ਸਟੈਕ (LangGraph + Ollama), ਅਤੇ ਇੱਕ ਡੂੰਘੇ ਬੈਂਚਮਾਰਕ ਵਿਧੀ ਭਾਗ ਨੂੰ ਕਵਰ ਕੀਤਾ ਜਾਵੇਗਾ। ਜੇ ਤੁਸੀਂ ਸਾਰੇ ਚਿੱਤਰਾਂ, ਕੋਡ ਅਤੇ ਫੈਸਲੇ ਮੈਟ੍ਰਿਕਸ ਦੇ ਨਾਲ ਲੰਬਾ ਸੰਸਕਰਣ ਚਾਹੁੰਦੇ ਹੋ, ਤਾਂ ਪੜ੍ਹੋ ਲੰਬਾ ਲੇਖ. ਜੇ ਤੁਸੀਂ ਵਿਜ਼ੂਅਲ ਸੰਸਕਰਣ ਚਾਹੁੰਦੇ ਹੋ, ਤਾਂ ਵੇਖੋ YouTube ਛੋਟਾ. ਕਿਸੇ ਵੀ ਤਰ੍ਹਾਂ - ਬਾਕੀ ਸੀਰੀਜ਼ ਲਈ ਗਾਹਕ ਬਣੋ।