Um guia rápido e prático dos tiers de modelos Claude. Para o deep-dive completo com blueprints de routing, padrões de prompting e um playbook de orçamento de tokens, leia o artigo grande.
claude-haiku-4-5 para trabalho de intenção rápido e barato, claude-sonnet-5 para o melhor equilíbrio velocidade/qualidade, claude-opus-4-8 para coding agêntico complexo e trabalho enterprise, e reserve claude-fable-5 (e gated claude-mythos-5) para os trabalhos verdadeiramente difíceis de longo horizonte que demoram horas ou dias.
Linha de modelos de relance
| Modelo | Ideal para | Janela de contexto | Saída máx. | Preços (input / output) | Comportamento de thinking |
|---|---|---|---|---|---|
Claude Fable 5 (claude-fable-5) |
Agentes de longa duração e os problemas por resolver mais difíceis | 1M tokens | 128K tokens | $10 / $50 per MTok | Adaptive thinking always on |
Claude Opus 4.8 (claude-opus-4-8) |
Coding agêntico complexo e trabalho enterprise | 1M tokens | 128K tokens | $5 / $25 per MTok | Adaptive thinking always on |
Claude Sonnet 5 (claude-sonnet-5) |
Melhor equilíbrio velocidade/qualidade | 1M tokens | 128K tokens | $3 / $15 per MTok | Adaptive thinking always on |
Claude Haiku 4.5 (claude-haiku-4-5-20251001) |
Modelo mais rápido para tarefas baratas de elevado volume | 200K tokens | 64K tokens | $1 / $5 per MTok | Extended thinking available (adaptive off) |
Claude Mythos 5 (claude-mythos-5) é um modelo gated que partilha as mesmas specs e preços do Fable 5, mas não inclui os classificadores de segurança do Fable 5. A disponibilidade está limitada a parceiros aprovados via Project Glasswing.
Escolha o modelo certo (regras rápidas)
- Haiku 4.5: routing, classificação, extração e qualquer workflow onde queira respostas rápidas e não possa pagar orçamentos elevados de tokens de saída.
- Sonnet 5: coding diário e trabalho documental onde quer qualidade forte sem o preço Opus/Fable.
- Opus 4.8: coding agêntico complexo, análise empresarial e debugging mais difícil onde é necessário trabalho mais longo e autónomo.
- Fable 5: os problemas difíceis de longo horizonte que demoram horas ou dias, especialmente quando o modelo tem de manter o objetivo, delegar subtarefas e permanecer coerente.
Effort e thinking: impacto no custo
Na API, effort é o controlo principal do trade-off entre inteligência, latência e custo em Fable 5 e Mythos 5. Para Opus 4.8 e Sonnet 5, também pode definir effort de forma explícita quando precisar de um perfil diferente de custo/latência.
Implicação prática: colocar cada request no effort máximo é normalmente a forma mais rápida de gastar o orçamento em tokens de saída.
Estratégia de tokens que funciona em todos os tiers
Os tokens de saída Claude são a parte cara. Uma regra simples é: limitar o comprimento de saída, prompt para TLDR primeiro, e use prompt caching para que prefixos estáveis (instruções de sistema e schemas de tools) sejam reutilizados.
- Use o modelo mais barato que consiga terminar. Um router (Haiku -> Sonnet/Opus -> Fable) muitas vezes corta o custo de forma dramática mantendo a qualidade elevada.
- Defina limites de saída. Em produção, defina sempre um max output / teto de tokens. Respostas sem limite são um acidente de orçamento.
- Use resumos de forma estratégica. Em vez de enviar transcripts completos em cada turno, mantenha uma memória compacta de “lessons” e atualize apenas essa.
Um blueprint de router simples
- Classifique a intenção e a complexidade estimada com
claude-haiku-4-5. - Envie o trabalho “normalmente difícil” para
claude-sonnet-5(ouclaude-opus-4-8quando espera coding agêntico mais pesado). - Escale para
claude-fable-5apenas quando a tarefa é claramente de longo horizonte ou falhou em tiers inferiores. - Se o Fable 5 recusar via classificadores de segurança, faça fallback para Opus 4.8 (a API permite reenviar com fallbacks quando configurado).