O Kimi K3 da Moonshot colocou modelos open-weight na mesma conversa que APIs fechadas de fronteira — para coding agêntico, não só demos de chat. Aqui a visão Workstation para negócio e builders. Análise, lista radar e checklist de produção no artigo longo.
Resumo. Pesos abertos já não são «quase tão bons». Kimi K3 (2,8T MoE, contexto 1M, multimodal nativo) chegou com suporte vLLM / SGLang day-0 e scores que colocam modelos abertos em benches agenticos ao lado de sistemas classe Claude/GPT. A decisão real não é «aberto ou fechado» — é qual modelo para qual trabalho, em hardware e ops que você realmente consegue operar.
O que o Kimi K3 mudou
- Escala: primeiro modelo aberto amplamente discutido na classe ~3T parâmetros (Moonshot; pesos no Hugging Face como
moonshotai/Kimi-K3). - Aptidão agêntica: benches independentes (ex. relatórios SWE-bench / LiveCodeBench estilo MindStudio em julho 2026) colocam K3 na mesma faixa dos top proprietários em coding/agentes.
- Velocidade de serving: vLLM entregou receitas day-0 (kernels KDA, desagregação P/D, decoding especulativo DSpark) — self-host é projeto de engenharia, não paper de pesquisa.
- Caveat de licença: «open weights» ≠ MIT para todo uso SaaS comercial — leia a Kimi K3 License antes de productizar.
Sinal da indústria (mesma quinzena)
- MCP 2026-07-28 — o protocolo fica em grande parte sem estado (sem handshake de sessão / session IDs); escala horizontal mais fácil para ferramentas agenticas. Extensões: MCP Apps, MCP Tasks.
- Open Secure AI Alliance (NVIDIA + 100+ firmas) + carta «Open Weights and American AI Leadership» — enquadramento político e de segurança de modelos abertos como infraestrutura defensiva.
- Adoção ≠ produção: pesquisas open-source AI estilo Mozilla continuam mostrando alta experimentação open-model mas um gap teimoso até produção — ops e evals, não IQ bruto, são o gargalo.
Assista: servir modelos abertos com vLLM
Conselho Workstation
- PMEs: preferir MoEs abertos menores (Laguna S 2.1, Solar Open 2, classe Qwen/DeepSeek) em workstations AI / nós GPU pequenos; use APIs K3 gerenciadas se precisar desse IQ sem rack.
- Empresas: self-host classe K3 só com cluster GPU + orçamento MLOps; senão híbrido — aberto para RAG/agentes privados, fechado para caminhos peak-critical.
- Sempre: harness de eval, Review Bot, GitOps, ferramentas MCP com HITL — veja nosso workflow multiagente.
Radar completo (Kimi, Laguna, Solar, DeepSeek, Qwen, Llama, Nemotron, GLM, KAT-Coder, Mage-Flow, Inflect e mais), notas MCP e checklist de produção: artigo longo. Publicado por Workstation.