Esta é a referência de formato longo. Para a versão superficial de cinco minutos (tabela rápida + regras do roteador), consulte o blog complementar.
1. Por que comparar os modelos de Claude?
A maioria das equipes não perde dinheiro porque suas instruções são ruins. Perdem dinheiro porque usam o modelo mais caro para tudo, ou porque tratam a escolha do modelo como uma preferência vaga em vez de uma escolha. decisão de produto orçado. A escalação de Claude é explicitamente escalonada: é construída para que você possa combinar forma de tarefa até o menor modelo que tenha um bom acabamento.
O resultado prático: a seleção do modelo é uma das alavancas mais simples que você pode usar para melhorar latência, qualidadee custo por resultado ao mesmo tempo.
2. A formação moderna de Claude (2026)
Todos os modelos Claude atuais suportam entrada de texto e imagem, capacidades multilínguese visão, e estão disponíveis por meio de Claude API, Claude Platform em AWS, Amazon Bedrock, Google Cloud e Microsoft Foundry.
2.1 Especificações com as quais você realmente deve se preocupar
| Modelo | APIID | Janela de contexto | Saída máxima | Preços (entrada/saída) | Comportamento de pensamento |
|---|---|---|---|---|---|
| Claude Haiku 4.5 | claude-haiku-4-5-20251001 (alias: claude-haiku-4-5) |
200 mil tokens | Tokens de 64 mil | US$ 1 / US$ 5 por MTok | Pensamento estendido disponível (adaptável desativado) |
| Claude Sonnet 5 | claude-sonnet-5 |
1 milhão de tokens | 128 mil tokens | US$ 3 / US$ 15 por MTok | Pensamento adaptativo sempre ativado |
| Claude Opus 4.8 | claude-opus-4-8 |
1 milhão de tokens | 128 mil tokens | US$ 5 / US$ 25 por MTok | Pensamento adaptativo sempre ativado |
| Claude Fable 5 | claude-fable-5 |
1 milhão de tokens | 128 mil tokens | $ 10 / $ 50 por MTok | Pensamento adaptativo sempre ativado |
Claude Mythos 5 (claude-mythos-5) é fechado e compartilha as mesmas especificações e preços de Fable 5, mas é combinado com uma arquitetura de segurança diferente (sem classificadores de segurança da mesma forma que Fable 5). Se você não tiver acesso, ainda poderá executar essencialmente a mesma lógica de integração usando Fable 5 quando disponível.
2.2 Limite de conhecimento (por que é importante para “informações atuais”)
Listas de visão geral do modelo da Antrópico:
- Limite de conhecimento confiável: Janeiro de 2026 para Fable 5 / Opus 4.8 / Sonnet 5; Fevereiro de 2025 para Haiku 4.5.
- Corte de dados de treinamento: amplamente em janeiro de 2026 para Fable 5 / Opus 4.8 / Sonnet 5; Julho de 2025 para Haiku 4.5.
Tomada prática: se você precisar de fatos após o corte, use recuperação (RAG) ou uma ferramenta, independentemente do nível do modelo.
3. O que os níveis significam na prática
3.1 Latência e a realidade do token de saída
Em toda a programação, a economia simbólica difere mais por saída do que por entrada. Uma maneira simples de pensar sobre isso:
- Haiku é mais barato (e mais rápido) quando você deseja respostas curtas e estruturadas.
- Opus e Sonnet gastam mais, mas ainda escalam bem quando seus prompts são limitados.
- Fable 5 é caro porque se destina a execuções longas e difíceis, onde o modelo precisa permanecer no escopo ao longo do tempo.
Se você permitir que qualquer modelo produza texto ilimitado, os tokens de saída dominarão os gastos. É por isso saída máxima (ou instruções fortes para TLDR primeiro) são importantes para todos os níveis, não apenas para Fable 5.
3.2 Pensamento adaptativo versus pensamento estendido
A tabela de visão geral da Anthropic destaca duas diferenças:
- Fable 5 / Opus 4.8 / Sonnet 5 tenha o pensamento adaptativo sempre ativado.
- Haiku 4.5 tem pensamento estendido disponível, mas o pensamento adaptativo está desativado.
Tomada prática: use o Haiku para tarefas de alto volume, mas esteja ciente de que ele não está otimizado para o mesmo comportamento de “sempre se adaptar” de longo horizonte. Quando você encontrar ambiguidade ou necessidades profundas de planejamento, avance para Sonnet/Opus/Fable.
3.3 Esforço como indicador de custo-qualidade
O esforço é o principal controle para o equilíbrio entre inteligência, latência e custo em Fable 5 e Mythos 5. Opus 4.8 e Sonnet 5 também expõem o controle de esforço nas superfícies API.
Implicação prática: o erro de migração mais comum não é o “prompt errado”. É “maximizar o esforço em todos os lugares”. Para a maioria das cargas de trabalho de produção, você obtém o melhor valor roteando o esforço deliberadamente (tarefas baratas com esforço baixo/médio, tarefas difíceis com esforço maior).
4. Uma matriz de decisão que você pode implementar
Em vez de perguntar “Qual modelo é melhor?”, pergunte “Qual modelo pode terminar isso fluxo de trabalho com o menor número de tokens caros?”
| Formato da tarefa | Escolha | Por que |
|---|---|---|
| Classificação de intenção, roteamento, extração de entidade | Haiku | Rápido, barato e ideal para alto rendimento |
| Ajuda diária de codificação, documentação, raciocínio estruturado | Soneto | Melhor equilíbrio velocidade/qualidade |
| Codificação agente complexa, análise empresarial, depuração profunda | obra | Forte desempenho em tarefas empresariais longas e de várias etapas |
| Execuções de agentes que duram dias, síntese de vários documentos com delegação | Fable 5 (ou fechado Mythos 5) | Projetado para autonomia de longo horizonte e permanência no escopo |
5. Plano de roteamento para produção (barato -> inteligente -> fronteira)
Este é um padrão prático que funciona bem quando você tem uma mistura de tarefas: algumas fáceis, outras difíceis e muitas “principalmente fáceis, mas ocasionalmente complicadas”.
5.1 Roteador passo a passo
- Classifique com Haiku. Determine a intenção e a complexidade aproximada; também estime se você precisa de um longo contexto ou uso de ferramentas.
- Execute o caminho principal no Sonnet ou Opus. Soneto para a maioria das tarefas “sérias, mas limitadas”. Opus quando você espera uma codificação de agente complexa ou uma depuração mais profunda.
- Aumente para Fable 5 para um verdadeiro trabalho de longo prazo. Exemplos: refatoradores de repositórios cruzados, síntese de vários documentos onde o modelo deve manter múltiplas restrições vivas e execuções autônomas que delegam subtarefas.
- Lidar com substitutos/recusas. Se Fable 5 recusar devido a classificadores de segurança, volte para Opus 4.8 (ou outro modelo apropriado) dependendo dos requisitos do seu produto.
5.2 Faça um orçamento do roteador (não deixe que o escalonamento apague as economias)
Um roteador só pode ser econômico se o escalonamento for raro. Adicione restrições para que o nível caro não aumente:
- Defina tokens de saída máximos em cada camada.
- Use as primeiras instruções do TLDR para que o modelo possa parar mais cedo quando for conhecido o suficiente.
- Prefixos estáveis em cache (prompt do sistema e esquemas de ferramentas) para reduzir custos de entrada repetidos.
6. Economia simbólica que você pode usar como uma verificação de sanidade
Como o preço é por token, você pode aproximar o custo por solicitação. Usando os valores de preço da visão geral do modelo:
- Fable 5: $ 10 de entrada / $ 50 de saída por MTok
- Opus 4.8: $ 5 de entrada / $ 25 de saída por MTok
- Sonnet 5: $ 3 de entrada / $ 15 de saída por MTok
- Haiku 4.5: $ 1 de entrada / $ 5 de saída por MTok
Fórmula aproximada (insira suas estimativas):
cost ~= (input_tokens / 1_000_000) * input_price
+ (output_tokens / 1_000_000) * output_price
Regra de sanidade: se os tokens de saída forem grandes, Fable 5 torna-se rapidamente o direcionador de custos dominante. É por isso que a estrutura imediata e os limites de produção são mais importantes do que muitas equipes esperam.
7. Padrões de solicitação entre níveis
A maioria das melhores práticas de solicitação se aplica a todos os modelos de Claude: forneça metas claras, restrinja o formato de saída e peça apenas o que você precisa. As diferenças específicas do nível aparecem em como você comprimento de controle e esforço de controle.
7.1 Regras gerais que evitam fugas orçamentais
- Lidere com o resultado. Sua primeira linha deve dizer o que aconteceu ou o que você encontrou.
- Solicite o TLDR primeiro. Deixe o modelo parar mais cedo, quando puder.
- Aumento do escopo do limite. Não peça recursos extras, refatorações ou melhorias “bom ter”, a menos que solicitado.
- Comprimento de saída vinculado. Use tokens de saída máximos ou formatos estritos.
7.2 Quando Fable 5 muda o trabalho
Fable 5 foi desenvolvido para autonomia de longo horizonte: ele pode sustentar a produção produtiva por longos períodos, delegar subtarefas e permanecer coerente quando a tarefa é realmente multietapa. A diferença que motiva não é apenas “mais raciocínio”. É que você pode (e deve) estruturar fluxos de trabalho como metas + pontos de verificação + evidências baseadas em ferramentas, em vez de forçar tudo em uma resposta única.
8. Exemplos de fluxos de trabalho (o que usar e onde)
8.1 Haiku 4.5
- Classifique as solicitações recebidas (intenção + complexidade) e encaminhe para o nível correto.
- Extraia campos estruturados em JSON para sistemas downstream.
- Resuma passagens curtas com um esquema estrito e limite máximo de produção.
8.2 Sonnet 5
- Refatore e explique o código com um formato “o quê/por que/como”.
- Elabore conteúdo voltado para o cliente com tom consistente e resultados curtos.
- Crie ferramentas de agente que ainda precisam de velocidade (chamada de ferramenta + loops curtos).
8.3 Opus 4.8
- Codificação agente complexa: alterações em vários arquivos, depuração mais profunda e raciocínio mais cuidadoso em todo o sistema.
- Análise de documentos empresariais: planilhas, slides e relatórios longos.
- Tarefas difíceis, mas limitadas, nas quais você ainda deseja uma resposta de nível empresarial, não apenas um esboço.
8.4 Fable 5 (e Mythos 5)
- Migrações de código de dias entre repositórios com uso de ferramentas e etapas de verificação.
- Síntese de vários documentos onde a retenção e a coerência das instruções em longos períodos são essenciais.
- Fluxos de trabalho autônomos que delegam subtarefas e continuam após resultados intermediários.
9. Notas de migração
9.1 Migrando para Opus 4.8
Se você está atualmente no Opus 4.7 ou anterior, comece por:
- Garantindo que você defina
effortexplicitamente quando você tem requisitos de latência ou orçamento. - Revisar quaisquer habilidades imediatas que possam ser excessivamente prescritivas. Maior capacidade pode amplificar instruções excessivamente específicas.
- Testar novamente as suposições de comprimento de saída e aplicar limites máximos de saída quando necessário.
9.2 Migrando do Opus para Fable 5
Fable 5 não é um “Opus mais rápido”. Trate-o como uma ferramenta de fluxo de trabalho para tarefas de longo prazo:
- Mude para a estruturação de meta + checkpoint (especialmente para execuções de agente).
- Delegue subtarefas em vez de empilhar tudo em um longo thread.
- Use cache e saída limitada para que execuções longas não aumentem os gastos.
10. Pegadinhas comuns
- Usando Fable para tudo. Destina-se a casos difíceis e de longo prazo.
- Sem limites de saída. Até mesmo o Haiku pode ficar caro se você permitir que ele gere texto ilimitado.
- Supondo que as janelas de contexto sejam intercambiáveis. Haiku tem 200 mil tokens; os outros assumem como padrão 1M.
- Ignorando diferenças de corte. Se você precisar de informações pós-corte, use recuperação/ferramentas.
- Não roteando esforço. Definir o esforço máximo em todos os lugares geralmente aumenta os custos sem melhorar os resultados.
11. Resultado final
A linha de Claude foi projetada para que você possa construir um modelo de roteador que corresponda ao menor nível de capacidade para cada formato de tarefa. Comece com o Haiku para roteamento e extração baratos. Use o Sonnet para a maior parte do trabalho diário. Escale para o Opus para codificação corporativa e de agente complexa. Reserva Fable 5 (e portão Mythos 5) para as verdadeiras corridas de longo horizonte que exigem autonomia e coerência sustentadas.
Em caso de dúvida, mantenha seus prompts limitados, limite o comprimento da saída e meça os tokens de saída por resultado. Essa métrica tende a tornar óbvia a escolha do modelo.
Instantâneo de SEO para este artigo
- Título SEO: Modelos de Claude comparados: Haiku vs Sonnet vs Opus vs Fable 5 (Mythos 5)
- Meta descrição: Compare Antrópico Claude Haiku, Sonnet, Opus, Fable 5 e gated Mythos 5. Inclui especificações, estratégia de custo/tokens, plano de roteamento e quando usar cada camada.
- Palavras-chave primárias: Comparação de modelos Claude, Claude Opus 4.8, Claude Fable 5, Claude Sonnet 5, Claude Haiku 4.5, Claude Mythos 5, orçamento de token, codificação de agente
- Twitter/X: As camadas do modelo Claude explicaram: Haiku para roteamento barato, Sonnet para trabalho diário, Opus para codificação complexa, Fable 5 para execuções de agentes de vários dias. Plano de roteamento de orçamento de token interno.
- LinkedIn: Uma comparação prática e implementável entre Anthropic Claude Haiku, Sonnet, Opus, Fable 5 e gated Mythos 5. Especificações, modelo de custo e um roteador que mantém os tokens de saída sob controle. De Workstation.