Moonshot’s Kimi K3 zette open-weight modellen in hetzelfde gesprek als frontier closed API’s — voor agentic coding, niet alleen chatdemo’s. Hier de Workstation-blik voor business en builders. Deep dive, radarlijst en productiechecklist in het lang artikel.
Kern. Open weights zijn niet langer «bijna zo goed». Kimi K3 (2.8T MoE, 1M context, native multimodal) landde met day-0 vLLM / SGLang-support en scores die open modellen op agent-relevante benches naast Claude/GPT-klasse systemen zetten. De echte beslissing is niet «open of closed» — het is welk model voor welke job, op hardware en ops die je echt kunt draaien.
Wat Kimi K3 veranderde
- Schaal: eerste breed besproken open model in de ~3T-parameterklasse (Moonshot; weights op Hugging Face als
moonshotai/Kimi-K3). - Agent-fitness: onafhankelijke benches (bijv. MindStudio-achtige SWE-bench / LiveCodeBench-rapporten in juli 2026) zetten K3 in dezelfde band als top proprietary modellen op coding/agent-taken.
- Serving-snelheid: vLLM leverde day-0-recepten (KDA-kernels, P/D-disaggregatie, DSpark speculative decoding) — self-host is een engineeringproject, geen researchpaper.
- Licentiecaveat: «open weights» ≠ MIT voor elk commercieel SaaS-gebruik — lees de Kimi K3 License voordat je productiseert.
Industriesignaal (zelfde twee weken)
- MCP 2026-07-28 — protocol wordt grotendeels stateless (geen session handshake / session IDs); makkelijker horizontaal schalen voor agenttools. Extensies: MCP Apps, MCP Tasks.
- Open Secure AI Alliance (NVIDIA + 100+ firms) + brief «Open Weights and American AI Leadership» — beleids- en securityframing van open modellen als defensieve infrastructuur.
- Adoptie ≠ productie: Mozilla-achtige open-source AI-surveys blijven hoge open-model experimentatie tonen maar een hardnekkig gat naar productie — ops en evals, niet ruwe IQ, zijn de bottleneck.
Bekijk: open modellen serveren met vLLM
Workstation-advies
- MKB: verkies kleinere open MoE’s (Laguna S 2.1, Solar Open 2, Qwen/DeepSeek-klasse) op AI-workstations / kleine GPU-nodes; gebruik managed K3-API’s als je die IQ wilt zonder rack.
- Enterprises: self-host K3-klasse alleen met GPU-cluster + MLOps-budget; anders hybride — open voor private RAG/agents, closed voor peak-critical paden.
- Altijd: eval harness, Review Bot, GitOps, MCP-tools met HITL — zie onze multi-agent workflow.
Volledige radar (Kimi, Laguna, Solar, DeepSeek, Qwen, Llama, Nemotron, GLM, KAT-Coder, Mage-Flow, Inflect en meer), MCP-notes en productiechecklist: lang artikel. Gepubliceerd door Workstation.