Muse Glimmer ਇੱਕ ਸਮਰਪਿਤ ਧਾਰਨਾ ਏਨਕੋਡਰ ਦੇ ਨਾਲ ਮੈਟਾ ਦਾ 30-ਬਿਲੀਅਨ-ਪੈਰਾਮੀਟਰ ਕਾਰਕ ਭਾਸ਼ਾ ਮਾਡਲ ਹੈ, Muse Spark ਤੋਂ ਡਿਸਟਿਲ ਕੀਤਾ ਗਿਆ ਹੈ ਅਤੇ ਉਪਭੋਗਤਾ ਅਤੇ ਵਰਕਸਟੇਸ਼ਨ ਹਾਰਡਵੇਅਰ 'ਤੇ ਆਟੋਨੋਮਸ ਏਜੰਟ ਵਰਕਲੋਡ ਲਈ ਪ੍ਰਕਾਸ਼ਿਤ ਕੀਤਾ ਗਿਆ ਹੈ। ਰਾਹੀਂ ਵੰਡਿਆ ਗਿਆ Ollama ਅਧੀਨ Apache 2.0, ਇਹ ਭਰੋਸੇਮੰਦ ਟੂਲ ਦੀ ਵਰਤੋਂ, ਲੰਬੇ-ਦਿੱਤੀ ਕਾਰਜਾਂ, ਮਲਟੀਮੋਡਲ ਸਮਝ, ਅਤੇ ਅਸਫਲਤਾ ਰਿਕਵਰੀ ਨੂੰ ਨਿਸ਼ਾਨਾ ਬਣਾਉਂਦਾ ਹੈ — ਬਿਨਾਂ ਕਲਾਉਡ ਅਨੁਮਾਨ ਦੀ ਲੋੜ ਦੇ। ਇਹ Workstation ਤਕਨੀਕੀ ਸੰਖੇਪ ਸਥਾਨਕ ਏਜੰਟਾਂ ਨੂੰ ਸ਼ਿਪਿੰਗ ਕਰਨ ਵਾਲੇ ਇੰਜੀਨੀਅਰਾਂ ਲਈ ਜਨਤਕ ਮਾਡਲ ਕਾਰਡ ਨੂੰ ਮੁੜ ਲਿਖਦਾ ਅਤੇ ਵਿਸਤਾਰ ਕਰਦਾ ਹੈ।
- ਕਲਾਸ: 30B causal LM + ਧਾਰਨਾ ਏਨਕੋਡਰ; Muse Spark ਤੋਂ ਡਿਸਟਿਲ; ਦ੍ਰਿਸ਼ਟੀ + ਸਾਧਨ + ਸੋਚ।
- ਸੇਵਾ ਕਰੋ:
ollama run muse-glimmer(~18GB, 128K, ਟੈਕਸਟ+ਚਿੱਤਰ); Apple Silicon:muse-glimmer:30b-mlx(~21GB, DFlash)। - ਫਿੱਟ: ਇੱਕ GPU ਜਾਂ ਮੈਕ ਸਿਲੀਕਾਨ 'ਤੇ ਹਮੇਸ਼ਾ-ਚਾਲੂ ਸਥਾਨਕ / ਏਅਰ-ਗੈਪਡ ਏਜੰਟ - ਇੱਕ ਮਲਟੀ-ਟੀਬੀ MoE ਕਲੱਸਟਰ ਮਾਡਲ ਨਹੀਂ।
- ਤਾਕਤ ਸੰਕੇਤ: MCP-Atlas, DeepSearch QA, WildClawBench, SWE-Bench Pro, AA-LCR, Beam128K (ਉੱਚ ਤਰਕ) 'ਤੇ Meta ਦੇ ਰਿਪੋਰਟ ਕੀਤੇ ਆਕਾਰ-ਕਲਾਸ ਮੈਟ੍ਰਿਕਸ ਦੀ ਅਗਵਾਈ ਕਰਦਾ ਹੈ।
- ਓਪਸ: ਦੁਆਰਾ scaffold
ollama launch(Claude Code, OpenCode, ਹਰਮੇਸ, OpenClaw); Evals, HITL, MCP ਪ੍ਰਮਾਣਿਕਤਾ ਨਾਲ ਸ਼ਾਸਨ ਕਰੋ।
ਪ੍ਰਾਇਮਰੀ ਸਰੋਤ: Ollama ਲਾਇਬ੍ਰੇਰੀ — ਮਿਊਜ਼-ਗਲਿਮਰ; ਮੈਟਾ ਮੁਲਾਂਕਣ ਵਿਧੀ - Muse Glimmer ਵਿਧੀ. ਨੰਬਰ ਅਤੇ ਟੈਗ ਬਦਲਦੇ ਹਨ; ਖਰੀਦ ਤੋਂ ਪਹਿਲਾਂ ਲਾਈਵ ਮਾਡਲ ਕਾਰਡ ਦੀ ਪੁਸ਼ਟੀ ਕਰੋ।
1. ਆਰਕੀਟੈਕਚਰ ਅਤੇ ਡਿਜ਼ਾਈਨ ਇਰਾਦਾ
Muse Glimmer ਇੱਕ ਆਮ ਚੈਟ MoE ਦੇ ਤੌਰ 'ਤੇ ਨਹੀਂ ਹੈ। ਮੈਟਾ ਦੀ ਫਰੇਮਿੰਗ ਹੈ ਅੰਤ-ਤੋਂ-ਅੰਤ ਏਜੰਟੀ ਕੰਮ ਨੂੰ ਪੂਰਾ ਕਰਨਾ ਹਾਰਡਵੇਅਰ 'ਤੇ ਤੁਸੀਂ ਇੱਕ ਡੈਸਕ ਜਾਂ ਇੱਕ ਛੋਟੇ ਲੈਬ ਰੈਕ ਲਈ ਖਰੀਦ ਸਕਦੇ ਹੋ:
- ਕਾਰਕ LM ਰੀੜ੍ਹ ਦੀ ਹੱਡੀ (30B) - ਲੰਬੇ ਵਰਕਫਲੋ ਵਿੱਚ ਕਾਇਮ ਮਲਟੀ-ਸਟੈਪ ਤਰਕ ਚੇਨਾਂ ਦੇ ਨਾਲ ਅਗਲੀ-ਟੋਕਨ ਪੀੜ੍ਹੀ।
- ਸਮਰਪਿਤ ਧਾਰਨਾ ਏਨਕੋਡਰ - ਇੰਟਰਲੀਵਡ ਟੈਕਸਟ ਅਤੇ ਚਿੱਤਰਾਂ ਨੂੰ ਸਵੀਕਾਰ ਕਰਦਾ ਹੈ ਤਾਂ ਜੋ ਏਜੰਟ ਟੂਲ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟਾਂ ਦੇ ਰੂਪ ਵਿੱਚ ਉਸੇ ਸੰਦਰਭ ਵਿੰਡੋ ਵਿੱਚ ਸਕ੍ਰੀਨਸ਼ਾਟ, ਚਾਰਟ ਅਤੇ ਦਸਤਾਵੇਜ਼ਾਂ 'ਤੇ ਤਰਕ ਕਰ ਸਕਣ।
- Muse Spark ਤੋਂ ਡਿਸਟਿਲੇਸ਼ਨ — ਇੱਕ ਫੁੱਟਪ੍ਰਿੰਟ ਵਿੱਚ ਸਮਰੱਥਾ ਟ੍ਰਾਂਸਫਰ ਜੋ ਡੇਟਾਸੈਂਟਰ-ਸਿਰਫ ਸੇਵਾ ਦੀ ਬਜਾਏ ਸਿੰਗਲ-GPU / ਉਪਭੋਗਤਾ-ਸ਼੍ਰੇਣੀ ਦੀ ਤੈਨਾਤੀ ਨੂੰ ਨਿਸ਼ਾਨਾ ਬਣਾਉਂਦਾ ਹੈ।
- ਅਸਫਲਤਾ ਰਿਕਵਰੀ ਵਿਵਹਾਰ - ਜਦੋਂ ਇੱਕ ਟੂਲ ਕਾਲ ਫੇਲ ਹੋ ਜਾਂਦੀ ਹੈ ਜਾਂ ਇੱਕ ਅਚਾਨਕ ਪੇਲੋਡ ਵਾਪਸ ਕਰਦੀ ਹੈ, ਤਾਂ ਮਾਡਲ ਨੂੰ ਐਪੀਸੋਡ ਨੂੰ ਰੋਕਣ ਦੀ ਬਜਾਏ ਨਿਦਾਨ ਕਰਨ ਅਤੇ ਦੁਬਾਰਾ ਕੋਸ਼ਿਸ਼ ਕਰਨ ਲਈ ਸਿਖਲਾਈ ਦਿੱਤੀ ਜਾਂਦੀ ਹੈ।
- ਨਿਯੰਤਰਣਯੋਗ ਕੋਸ਼ਿਸ਼ — ਤਰਕ ਦੀ ਤਾਕਤ ਚੋਣਯੋਗ ਹੈ ਇਸਲਈ ਓਪਰੇਟਰ ਪ੍ਰਤੀ ਰੂਟ ਦੀ ਗੁਣਵੱਤਾ ਲਈ ਲੇਟੈਂਸੀ ਦਾ ਵਪਾਰ ਕਰ ਸਕਦੇ ਹਨ।
- ਬਹੁ-ਭਾਸ਼ਾਈ ਸਿਖਲਾਈ ਕਵਰੇਜ - ਮੈਟਾ 100 ਤੋਂ ਵੱਧ ਭਾਸ਼ਾਵਾਂ ਤੋਂ ਸਿਖਲਾਈ ਡੇਟਾ ਦੱਸਦਾ ਹੈ।
Workstation ਸਟੈਕ ਲਈ, ਉਤਪਾਦ ਦਾ ਅਰਥ ਇਹ ਹੈ: ਗਲਿਮਰ ਨੂੰ ਇੱਕ ਦੇ ਰੂਪ ਵਿੱਚ ਮੰਨੋ ਏਜੰਟ ਰਨਟਾਈਮ ਦਿਮਾਗ MCP ਟੂਲਸ, ਸ਼ੈੱਲਾਂ, ਬ੍ਰਾਊਜ਼ਰਾਂ, ਅਤੇ ਫਾਈਲ ਐਡੀਟਰਾਂ ਦੇ ਪਿੱਛੇ — ਹਰ ਬੰਦ ਫਰੰਟੀਅਰ API ਕਾਲ ਲਈ ਡ੍ਰੌਪ-ਇਨ ਰਿਪਲੇਸਮੈਂਟ ਵਜੋਂ ਨਹੀਂ।
2. Ollama ਵੰਡ (ਟੈਗ, ਫੁਟਪ੍ਰਿੰਟ, I/O)
ਜਿਵੇਂ ਕਿ Ollama ਲਾਇਬ੍ਰੇਰੀ ਕਾਰਡ 'ਤੇ ਪ੍ਰਕਾਸ਼ਿਤ ਕੀਤਾ ਗਿਆ ਹੈ (ਲਾਈਵ ਆਕਾਰਾਂ ਦੀ ਪੁਸ਼ਟੀ ਕਰੋ):
| ਟੈਗ ਕਰੋ | ਲਗਭਗ. ਆਕਾਰ | ਸੰਦਰਭ | ਇੰਪੁੱਟ | ਨੋਟਸ |
|---|---|---|---|---|
muse-glimmer:latest / :30b | ~18GB | 128K | ਟੈਕਸਟ, ਚਿੱਤਰ | ਪੂਰਵ-ਨਿਰਧਾਰਤ ਸਿੰਗਲ-GPU ਮਾਰਗ |
muse-glimmer:30b-mlx | ~21GB | 128K | ਟੈਕਸਟ, ਚਿੱਤਰ | Ollama MLX ਇੰਜਣ; Apple Silicon 'ਤੇ DFlash + ਚਿੱਤਰ |
# Pull + interactive
ollama run muse-glimmer
# Apple Silicon (MLX)
ollama run muse-glimmer:30b-mlx
# HTTP chat (localhost Ollama)
curl http://localhost:11434/api/chat \
-d '{"model":"muse-glimmer","messages":[{"role":"user","content":"Hello!"}]}'
# Scaffold launchers (from Ollama applications list)
ollama launch claude --model muse-glimmer
ollama launch opencode --model muse-glimmer
ollama launch hermes --model muse-glimmer
ollama launch openclaw --model muse-glimmer
Python / JS ਕਲਾਇੰਟਸ ਨੂੰ ਤੁਹਾਡੇ ਦੁਆਰਾ ਪ੍ਰਮਾਣਿਤ ਟੈਗ ਨੂੰ ਪਿੰਨ ਕਰਨਾ ਚਾਹੀਦਾ ਹੈ (muse-glimmer ਬਨਾਮ :30b-mlx) ਸੰਰਚਨਾ ਵਿੱਚ, ਹਾਰਡ-ਕੋਡ ਨਹੀਂ latest ਉਤਪਾਦਨ ਏਜੰਟ ਵਿੱਚ.
3. ਸਮਰੱਥਾ ਦੀ ਸਤਹ (ਇੰਜੀਨੀਅਰਿੰਗ ਰੀਡਿੰਗ)
- ਅੰਤ-ਤੋਂ-ਅੰਤ ਏਜੰਟਿਕ ਸੰਪੂਰਨਤਾ — ਮੈਟਾ ਨੇ DeepSearch QA, MCP-Atlas, τ3-ਬੈਂਚ (ਬੈਂਕਿੰਗ), ਅਤੇ SWE-Bench ਪਰਿਵਾਰਕ ਕਾਰਜਾਂ 'ਤੇ ਮਜ਼ਬੂਤ ਨਤੀਜਿਆਂ ਦਾ ਹਵਾਲਾ ਦਿੱਤਾ ਹੈ ਜੋ ਸਕੈਫੋਲਡ ਮਲਟੀ-ਟਰਨ ਸਫਲਤਾ ਨੂੰ ਮਾਪਦੇ ਹਨ, ਨਾ ਕਿ ਸਿੰਗਲ-ਸ਼ਾਟ ਟ੍ਰੀਵੀਆ।
- ਭਰੋਸੇਯੋਗ ਸੰਦ ਦੀ ਵਰਤੋਂ — ਵਿਸਤ੍ਰਿਤ ਵਰਕਫਲੋਜ਼ (MCP ਟੂਲ ਫਲੀਟਾਂ ਲਈ ਮਹੱਤਵਪੂਰਨ) ਵਿੱਚ ਸਕੀਮਾ ਸ਼ੁੱਧਤਾ ਦੇ ਨਾਲ ਵਿਆਪਕ ਫੰਕਸ਼ਨ-ਕਾਲ ਕਵਰੇਜ।
- ਬਹੁ-ਕਦਮ ਤਰਕ - ਲੰਬੇ ਦੂਰੀ 'ਤੇ ਇਕਸੁਰਤਾ ਦੀ ਯੋਜਨਾ ਬਣਾਓ; ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ + ਦਸਤਾਵੇਜ਼ ਧਾਰਨ ਲਈ 128K ਸੰਦਰਭ ਵਿੰਡੋ ਦੇ ਨਾਲ ਜੋੜੇ।
- ਅਸਫਲਤਾ ਰਿਕਵਰੀ - ਅਚਾਨਕ ਟੂਲ ਨਤੀਜਿਆਂ ਦਾ ਨਿਦਾਨ ਕਰੋ ਅਤੇ ਦੁਬਾਰਾ ਕੋਸ਼ਿਸ਼ ਕਰੋ; ਰਾਤੋ-ਰਾਤ ਨੌਕਰੀਆਂ ਵਿੱਚ "ਭੁਰਭੁਰਾ ਏਜੰਟ" ਅਧੂਰੇ ਨੂੰ ਘਟਾਉਂਦਾ ਹੈ।
- ਮਲਟੀਮੋਡਲ ਤਰਕ — ਧਾਰਨਾ ਏਨਕੋਡਰ ਟੈਕਸਟ ਦੇ ਨਾਲ ਇੰਟਰਲੀਵਡ ਸਕ੍ਰੀਨਸ਼ੌਟ/ਚਾਰਟ/ਦਸਤਾਵੇਜ਼ ਨੂੰ ਸਮਰੱਥ ਬਣਾਉਂਦਾ ਹੈ (GUI ਗਰਾਉਂਡਿੰਗ ਅਤੇ ਮੈਟਾ ਦੇ ਮੈਟਰਿਕਸ ਵਿੱਚ ਸ਼ਾਮਲ ਦਸਤਾਵੇਜ਼ ਪਾਰਸ ਬੈਂਚ)।
- ਸਕੈਫੋਲਡ ਅਨੁਕੂਲਤਾ - OpenClaw, Hermes Agent, ਅਤੇ ਸਮਾਨ ਆਰਕੈਸਟਰੇਸ਼ਨ ਪੈਟਰਨ; Ollama Claude Code ਅਤੇ OpenCode ਲਾਂਚਰਾਂ ਨੂੰ ਪਹਿਲੀ ਸ਼੍ਰੇਣੀ ਦੀਆਂ ਐਪਾਂ ਵਜੋਂ ਸੂਚੀਬੱਧ ਕਰਦਾ ਹੈ।
4. ਬੈਂਚਮਾਰਕ ਮੈਟ੍ਰਿਕਸ (ਮੈਟਾ-ਰਿਪੋਰਟ ਕੀਤੀ, ਉੱਚ ਤਰਕ)
ਮੈਟਾ ਸੋਚਣ ਮੋਡ ਵਿੱਚ Gemma4-31B ਅਤੇ Qwen3.6-27B ਦੇ ਵਿਰੁੱਧ Muse Glimmer-30B (ਉੱਚ ਤਰਕ) ਦੀ ਤੁਲਨਾ ਕਰਦਾ ਹੈ। ਹੈੱਡਲਾਈਨ Workstation ਰੀਡਿੰਗ: ਗਲਿਮਰ ਕਈਆਂ ਦੀ ਅਗਵਾਈ ਕਰਦਾ ਹੈ ਏਜੰਟ ਜਨਤਕ ਸੂਟ (MCP-Atlas, DeepSearch QA, WildClawBench, Gaia2, SWE-Bench Pro) ਜਦੋਂ ਕਿ ਕੁਝ ਡੈਸਕਟੌਪ-ਏਜੰਟ ਅਤੇ GDP-val ਮੈਟ੍ਰਿਕਸ 'ਤੇ ਸਾਥੀਆਂ ਨੂੰ ਟ੍ਰੇਲ ਕਰਦੇ ਜਾਂ ਬੰਨ੍ਹਦੇ ਹਨ। ਹਮੇਸ਼ਾ ਮੁੜ-ਚਾਲੂ ਤੁਹਾਡਾ ਹਾਰਨੈੱਸ
| ਸ਼੍ਰੇਣੀ | ਬੈਂਚਮਾਰਕ | ਗਲਿਮਰ-30 ਬੀ | Gemma4-31B | Qwen3.6-27B |
|---|---|---|---|---|
| ਜਨਰਲ ਏਜੰਟ | MCP-Atlas (ਜਨਤਕ) | 75.5 | 54.2 | 62.5 |
| ਡੂੰਘੀ ਖੋਜ QA | 74.6 | 61.7 | 71.1 | |
| τ3-ਬੈਂਕਿੰਗ | 23.5 | 15.1 | 16.7 | |
| WildClawBench | 47.6 | 37.6 | 43.2 | |
| GDPVal-AA v2 | 953 | 811 | 1141 | |
| ਗਇਆ ੨ | 43.3 | 36.4 | 40.0 | |
| ਸਕਿੱਲ ਬੈਂਚ (ਕੁਸ਼ਲਤਾਵਾਂ ਨਾਲ) | 44.3 | 32.4 | 46.6 | |
| OSWorld-ਪ੍ਰਮਾਣਿਤ | 65.9 | 58.5 | 75.6 | |
| ਏਜੰਟਿਕ ਕੋਡਿੰਗ | SWE-Bench ਪ੍ਰੋ | 51.2 | 36.9 | 50.2 |
| SWE-Bench ਪ੍ਰਮਾਣਿਤ | 76.0 | 66.6 | 77.2 | |
| ਟਰਮੀਨਲ ਬੈਂਚ 2.1 | 51.7 | 43.4 | 60.7 | |
| SciCode | 43.6 | 43.4 | 39.8 | |
| ਮਲਟੀਮੋਡਲ | CharXiv ਤਰਕ | 78.8 | 77.7 | 78.4 |
| ਸਕ੍ਰੀਨਸਪੌਟ ਪ੍ਰੋ | 75.4 | 75.9 | 76.1 | |
| OmniDocBench v1.5 | 75.8 | 72.5 | 77.8 | |
| MMMU ਪ੍ਰੋ | 74 | 73 | 75 | |
| ਤਰਕ / LCR | IFBench | 77.0 | 76.0 | 70.8 |
| ਏਆਈਐਮਈ 2026 | 94.7 | 89.2 | 94.1 | |
| GPQA ਡਾਇਮੰਡ (AA) | 83.5 | 85.7 | 84.2 | |
| HLE ਟੈਕਸਟ (AA) | 22.0 | 23.6 | 23.1 | |
| AA-LCR | 80.0 | 68.3 | 73.3 | |
| ਬੀਮ128K | 65.1 | 58.2 | 63.0 |
ਸੇਫਟੀ ਬੈਂਚ (ਸੀਆਈ ਮੈਮੋਰੀਜ਼, ਸਾਇਰਨ ਏਜੰਟਡੋਜੋ) ਟ੍ਰੇਡ-ਆਫ ਦਿਖਾਉਂਦੇ ਹਨ: ਗਲਿਮਰ ਮਿਡ-ਪੈਕ ਏਐਸਆਰ ਦੇ ਨਾਲ ਏਜੰਟਡੋਜੋ ਇੰਜੈਕਸ਼ਨਾਂ ਦੇ ਤਹਿਤ ਉੱਚ ਉਪਯੋਗਤਾ ਦੀ ਰਿਪੋਰਟ ਕਰਦਾ ਹੈ; ਸੁਰੱਖਿਆ ਨੂੰ ਇੱਕ ਤੈਨਾਤੀ ਨਿਯੰਤਰਣ ਸਮੱਸਿਆ ਦੇ ਰੂਪ ਵਿੱਚ ਸਮਝੋ (ਪ੍ਰੋਂਪਟ ਫਾਇਰਵਾਲ, ਟੂਲ ਆਗਿਆ ਸੂਚੀ, HITL) — ਇੱਕ ਹੱਲ ਕੀਤੀ ਮਾਡਲ ਸੰਪਤੀ ਨਹੀਂ। ਜੱਜ ਮਾਡਲਾਂ, ਕੋਸ਼ਿਸ਼ਾਂ ਦੀ ਗਿਣਤੀ, ਅਤੇ ਹਾਰਨੇਸ ਚੇਤਾਵਨੀਆਂ ਲਈ ਮੈਟਾ ਦੀ ਕਾਰਜਪ੍ਰਣਾਲੀ PDF ਦੇਖੋ।
5. ਮੁਲਾਂਕਣ ਵਿਧੀ (ਅੰਕਾਂ ਦਾ ਕੀ ਅਰਥ ਹੈ)
ਬੋਰਡ ਡੈੱਕ ਵਿੱਚ ਕਿਸੇ ਵੀ ਸੈੱਲ ਦਾ ਹਵਾਲਾ ਦੇਣ ਤੋਂ ਪਹਿਲਾਂ ਮੈਟਾ ਦਾ ਕਾਰਜਪ੍ਰਣਾਲੀ ਨੋਟ ਜ਼ਰੂਰੀ ਹੈ:
- ਪੀਅਰ ਦੀ ਚੋਣ: ਆਕਾਰ-ਸ਼੍ਰੇਣੀ ਦੇ ਖੁੱਲੇ ਮਾਡਲ (Gemma4-31B, Qwen3.6-27B); ਸਾਥੀ ਸਵੈ-ਰਿਪੋਰਟ ਕੀਤੇ ਜਾਂ ਅੰਦਰੂਨੀ ਤੌਰ 'ਤੇ ਦੁਬਾਰਾ ਤਿਆਰ ਕੀਤੇ ਸਕੋਰ ਦੀ ਵਰਤੋਂ ਕਰ ਸਕਦੇ ਹਨ; ਤਿੰਨਾਂ ਲਈ ਉਪਲਬਧ ਹੋਣ 'ਤੇ ਨਕਲੀ ਵਿਸ਼ਲੇਸ਼ਣ ਵਰਤਿਆ ਜਾਂਦਾ ਹੈ।
- ਨਮੂਨਾ: ਤਾਪਮਾਨ=1.0 / top_p=0.95 / top_k=64; ਸਾਥੀ ਵਿਕਰੇਤਾ-ਸਿਫ਼ਾਰਸ਼ੀ ਸੋਚ ਸੰਰਚਨਾ ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹਨ (ਕੁਵੇਨ ਕੁਝ ਏਜੰਟ ਬੈਂਚਾਂ 'ਤੇ ਕੂਲਰ ਟੈਂਪ ਦੀ ਵਰਤੋਂ ਕਰਦਾ ਹੈ)।
- ਹਾਰਨੈਸ ਪੱਖਪਾਤ ਚੇਤਾਵਨੀ: ਮੈਟਾ ਨੋਟਸ ਥਰਡ-ਪਾਰਟੀ ਮਾਡਲਾਂ ਨੂੰ ਮੇਟਾ ਦੇ ਟੂਲ/ਸਿਸਟਮ ਪ੍ਰੋਂਪਟ ਨਾਲ ਟਿਊਨ ਨਹੀਂ ਕੀਤਾ ਜਾ ਸਕਦਾ ਹੈ - ਸੰਪੂਰਨ ਰੈਂਕ ਪੀਅਰ-ਨੇਟਿਵ ਸਕੈਫੋਲਡਜ਼ ਦੇ ਅਧੀਨ ਬਦਲ ਸਕਦੇ ਹਨ।
- MCP-Atlas: 20+ MCP ਸਰਵਰਾਂ ਵਿੱਚ ਮਲਟੀ-ਟਰਨ ਟੂਲ ਦੀ ਵਰਤੋਂ; LLM-ਜੱਜ ਪਾਸ ਦਰ (ਥ੍ਰੈਸ਼ਹੋਲਡ 0.75) 500 ਜਨਤਕ ਕਾਰਜਾਂ 'ਤੇ, ਔਸਤ 4 ਦੌੜਾਂ ਤੋਂ ਵੱਧ।
- DeepSearch QA: 900 ਸਖ਼ਤ ਖੋਜ ਪ੍ਰਸ਼ਨਾਂ 'ਤੇ ਖੁਦਮੁਖਤਿਆਰੀ ਬ੍ਰਾਊਜ਼ਿੰਗ ਲੂਪ (ਖੋਜ/ਖੋਲ੍ਹਾ/ਲੱਭੋ); ਜੱਜ ਕੱਢਣ ਦੁਆਰਾ F1.
- WildClawBench / Gaia2: ਇਵੈਂਟ ਇੰਜੈਕਸ਼ਨ ਅਤੇ ਮਿਕਸਡ ਡਿਟਰਮਿਨਿਸਟਿਕ/LLM ਗਰੇਡਿੰਗ ਦੇ ਨਾਲ OpenClaw-ਸ਼ੈਲੀ ਦੇ ਹਾਰਨੇਸ ਦੇ ਅਧੀਨ ਲੰਬੇ-ਹਰੀਜੋਨ ਡੌਕਰਾਈਜ਼ਡ ਏਜੰਟ ਟਾਸਕ।
- SWE-Bench: bash + ਫਾਈਲ ਟੂਲ ਸਕੈਫੋਲਡ; ਪ੍ਰੋ ਅਤੇ ਵੈਰੀਫਾਈਡ ਦਾ ਔਸਤ ਮਲਟੀਪਲ ਦੌੜਾਂ ਵਿੱਚ — ਪ੍ਰੋ ਤੁਲਨਾ Qwen ਦੇ ਰਿਫਾਈਨਡ-ਟਾਸਕ ਵੇਰੀਐਂਟ ਤੋਂ ਬਚਦੀ ਹੈ।
- OSWorld-ਪ੍ਰਮਾਣਿਤ: ਸਕ੍ਰੀਨਸ਼ੌਟਸ ਤੋਂ GUI-ਸਿਰਫ ਉਬੰਟੂ VM ਨਿਯੰਤਰਣ (ਕੋਈ ਸਿੱਧਾ ਸ਼ੈੱਲ ਨਹੀਂ); ਮਾਡਲਾਂ ਵਿਚਕਾਰ ਐਕਸ਼ਨ-ਸਪੇਸ ਅੰਤਰ ਮਹੱਤਵਪੂਰਨ ਹਨ।
- ਬੀਮ128K: 128K 'ਤੇ ਗੈਰ-ਏਜੰਟਿਕ ਲੰਬੀ-ਸੰਦਰਭ ਮੈਮੋਰੀ ਪੜਤਾਲ — ਢੁਕਵੀਂ ਹੈ ਜੇਕਰ ਤੁਸੀਂ RAG ਤੋਂ ਬਿਨਾਂ ਵੱਡੇ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟਾਂ ਨੂੰ ਸੰਦਰਭ ਵਿੱਚ ਰੱਖਦੇ ਹੋ।
Workstation ਨੀਤੀ: ਸਥਿਤੀ ਲਈ ਮੈਟਾ ਦੇ ਮੈਟਰਿਕਸ ਨੂੰ ਪ੍ਰਕਾਸ਼ਿਤ ਕਰੋ, ਫਿਰ ਅੰਦਰੂਨੀ ਸੁਨਹਿਰੀ ਸੈੱਟ (ਤੁਹਾਡੇ MCP ਟੂਲ, ਤੁਹਾਡੇ ਰਿਪੋਜ਼, ਤੁਹਾਡੀ ਲੇਟੈਂਸੀ SLO) 'ਤੇ ਗੇਟ ਉਤਪਾਦਨ।
6. ਹਾਰਡਵੇਅਰ ਅਤੇ ਸੇਵਾ ਕਰਨ ਵਾਲੀ ਅਸਲੀਅਤ
- ਸਿੰਗਲ GPU ਕਲਾਸ: ~18GB ਵਜ਼ਨ ਫੁਟਪ੍ਰਿੰਟ ਦਾ ਮਤਲਬ ਹੈ ਇੱਕ ਆਧੁਨਿਕ 24GB+ ਉਪਭੋਗਤਾ/ਪ੍ਰੋ GPU ਇੱਕ ਪ੍ਰੈਕਟੀਕਲ NVIDIA ਫਲੋਰ ਹੈ ਜਦੋਂ ਇੱਕ ਵਾਰ KV ਕੈਸ਼ ਅਤੇ ਵਿਜ਼ਨ ਐਕਟੀਵੇਸ਼ਨ ਨੂੰ ਵਿਚਾਰਿਆ ਜਾਂਦਾ ਹੈ; ਤੁਹਾਡੇ ਅਧਿਕਤਮ ਸੰਦਰਭ ਅਤੇ ਸਮਕਾਲੀ ਸੈਸ਼ਨਾਂ ਦੇ ਨਾਲ ਪ੍ਰੋਫਾਈਲ।
- Apple Silicon: ਤਰਜੀਹ
:30b-mlx(~21GB) Ollama ਦੇ MLX ਮਾਰਗ ਲਈ DFlash ਸੱਟੇਬਾਜ਼ੀ ਡੀਕੋਡਿੰਗ ਅਤੇ ਮੂਲ ਚਿੱਤਰ ਇਨਪੁਟ ਨਾਲ — Mac Studio / ਮੈਕ ਮਿਨੀ ਮੈਕਸ ਕੌਂਫਿਗਸ ਪਹਿਲੇ ਦਰਜੇ ਦੇ SME ਨੋਡ ਹਨ। - ਕਿਮੀ-ਕੇ3-ਕਲਾਸ ਨਹੀਂ: ਇਹ ਮਲਟੀ-ਨੋਡ MoE ਨਹੀਂ ਹੈ। ਜੇਕਰ ਤੁਹਾਨੂੰ ਟ੍ਰਿਲੀਅਨ-ਪੈਰਾਮੀਟਰ ਓਪਨ ਏਜੰਟਾਂ ਦੀ ਲੋੜ ਹੈ, ਤਾਂ ਸਾਡੇ ਦੇਖੋ ਓਪਨ-ਵੇਟ ਗਾਈਡ; ਗਲਿਮਰ ਦਾ ਮਾਲਕ ਹੈ ਡੈਸਕ-ਸਾਈਡ ਹਮੇਸ਼ਾ-ਚਾਲੂ ਸਥਾਨ
- ਕੁਬਰਨੇਟਸ: ਪੈਕੇਜ Ollama ਜਾਂ ਇੱਕ OpenAI- ਅਨੁਕੂਲ ਸਾਈਡਕਾਰ ਪ੍ਰਤੀ ਨੋਡ; ਆਪਣੀ ਪ੍ਰਾਈਵੇਟ ਰਜਿਸਟਰੀ/ਕੈਸ਼ ਵਿੱਚ ਮਾਡਲ ਖਿੱਚੋ; Ollama ਨੂੰ ਇੰਟਰਨੈੱਟ 'ਤੇ ਅਨਬਾਊਂਡ ਨਾ ਕਰੋ।
7. ਹਮੇਸ਼ਾ-ਚਾਲੂ ਏਜੰਟਾਂ ਲਈ ਸੁਰੱਖਿਆ ਅਤੇ ਪ੍ਰਸ਼ਾਸਨ
ਲੋਕਲ ਵਜ਼ਨ ਡਾਟਾ ਏਗਰੈਸ ਨੂੰ ਘਟਾਉਂਦੇ ਹਨ ਪਰ ਸਮਝੌਤਾ ਕੀਤੇ ਏਜੰਟ ਹੋਸਟ ਦੇ ਧਮਾਕੇ ਦੇ ਘੇਰੇ ਨੂੰ ਵਧਾਉਂਦੇ ਹਨ। ਘੱਟੋ-ਘੱਟ Workstation ਬੇਸਲਾਈਨ:
- MCP OAuth 2.1 + ਥੋੜ੍ਹੇ ਸਮੇਂ ਲਈ ਰਹੱਸ (ਵਾਲਟ ਲੀਜ਼) - ਦੇਖੋ ਏਜੰਟ ਸੁਰੱਖਿਆ ਲੇਖ.
- ਪ੍ਰਤੀ ਏਜੰਟ ਪਛਾਣ ਲਈ ਟੂਲ ਮਨਜ਼ੂਰ ਸੂਚੀਆਂ ਅਤੇ ਨੈੱਟਵਰਕ ਨਿਕਾਸੀ ਨੀਤੀਆਂ।
- ਨਾ ਬਦਲ ਸਕਣ ਵਾਲੀਆਂ ਕਾਰਵਾਈਆਂ (ਭੁਗਤਾਨ, ਉਤਪਾਦ ਤੈਨਾਤ, ਪੁੰਜ ਈਮੇਲ) 'ਤੇ HITL ਗੇਟਸ।
- ਟੂਲ-ਰਿਟਰਨ ਕੀਤੀ ਸਮੱਗਰੀ (ਸਾਈਰਨ ਏਜੰਟਡੋਜੋ-ਸ਼ੈਲੀ ਦੇ ਧਮਕੀ ਮਾਡਲ) 'ਤੇ ਪ੍ਰੋਂਪਟ-ਇੰਜੈਕਸ਼ਨ ਨਿਗਰਾਨੀ.
- ਔਫਲਾਈਨ / ਏਅਰ-ਗੈਪ ਮੋਡ ਨੂੰ ਪਹਿਲੀ-ਸ਼੍ਰੇਣੀ ਦੀ ਰਨਬੁੱਕ ਦੇ ਤੌਰ 'ਤੇ ਟੈਸਟ ਕੀਤਾ ਗਿਆ, ਨਾ ਕਿ ਉਮੀਦ।
8. ਉਤਪਾਦਨ ਚੈੱਕਲਿਸਟ
- Ollama ਟੈਗ ਨੂੰ ਪਿੰਨ ਕਰੋ (
30bਬਨਾਮ30b-mlx) ਅਤੇ GitOps ਵਿੱਚ ਡਾਇਜੈਸਟ/ਹੈਸ਼ ਰਿਕਾਰਡ ਕਰੋ। - ਇੱਕ 20-50 ਟਾਸਕ ਗੋਲਡਨ ਸੂਟ ਬਣਾਓ ਜੋ ਤੁਹਾਡੇ MCP ਟੂਲਸ ਅਤੇ ਕੋਡਿੰਗ ਵਰਕਫਲੋ ਨੂੰ ਮਿਰਰ ਕਰਦਾ ਹੈ; ਹਰੇਕ ਕੋਸ਼ਿਸ਼ ਪੱਧਰ 'ਤੇ ਪਾਸ@1 ਅਤੇ p95 ਲੇਟੈਂਸੀ ਨੂੰ ਟਰੈਕ ਕਰੋ।
- ਵਾਇਰ ਸਕੈਫੋਲਡ (
ollama launch …ਜਾਂ ਕਸਟਮ) ਟੂਲ ਕਾਲਾਂ ਅਤੇ ਮੁੜ ਕੋਸ਼ਿਸ਼ਾਂ ਦੇ ਢਾਂਚਾਗਤ ਲੌਗਿੰਗ ਦੇ ਨਾਲ। - ਹਾਈਬ੍ਰਿਡ ਰਾਊਟਰ ਨੂੰ ਪਰਿਭਾਸ਼ਿਤ ਕਰੋ: ਪ੍ਰਾਈਵੇਟ RAG/ਏਜੰਟਾਂ ਲਈ ਗਲਿਮਰ ਲੋਕਲ; ਓਵਰਫਲੋ / ਪੀਕ IQ ਲਈ ਕਲਾਉਡ ਫੇਲਓਵਰ।
- ਵਿਜ਼ਨ ਚਾਲੂ ਦੇ ਨਾਲ 32K / 64K / 128K 'ਤੇ ਦਸਤਾਵੇਜ਼ VRAM/ਯੂਨੀਫਾਈਡ-ਮੈਮੋਰੀ ਹੈੱਡਰੂਮ।
- ਕਨੂੰਨੀ: ਤੁਹਾਡੇ ਡਿਸਟਰੀਬਿਊਸ਼ਨ ਮਾਡਲ ਲਈ Apache 2.0 ਸਮੀਖਿਆ (ਆਮ ਤੌਰ 'ਤੇ ਸਿੱਧੇ ਬਨਾਮ ਪ੍ਰਤੀਬੰਧਿਤ ਓਪਨ-ਵੇਟ ਲਾਇਸੈਂਸ)।
- ਰਾਤੋ-ਰਾਤ ਗੈਰ-ਹਾਜ਼ਰ ਏਜੰਟਾਂ ਨੂੰ ਸਮਰੱਥ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ ਸ਼ਿਪ ਰਿਵਿਊ ਬੋਟ + ਈਵਲ ਗੇਟਸ।
ਦੁਆਰਾ ਪ੍ਰਕਾਸ਼ਿਤ Workstation. ਮਾਡਲ ਕਾਰਡ: ollama.com/library/muse-glimmer.