Una guía rápida y práctica de los tiers de modelos Claude. Para el deep-dive completo con blueprints de routing, patrones de prompting y un playbook de presupuesto de tokens, lee el artículo grande.
claude-haiku-4-5 para trabajo de intención rápido y barato, claude-sonnet-5 para el mejor equilibrio velocidad/calidad, claude-opus-4-8 para coding agéntico complejo y trabajo enterprise, y reserva claude-fable-5 (y gated claude-mythos-5) para los trabajos realmente duros de largo horizonte que llevan horas o días.
Línea de modelos de un vistazo
| Modelo | Ideal para | Ventana de contexto | Salida máx. | Precios (input / output) | Comportamiento de thinking |
|---|---|---|---|---|---|
Claude Fable 5 (claude-fable-5) |
Agentes de larga duración y los problemas no resueltos más duros | 1M tokens | 128K tokens | $10 / $50 per MTok | Adaptive thinking always on |
Claude Opus 4.8 (claude-opus-4-8) |
Coding agéntico complejo y trabajo enterprise | 1M tokens | 128K tokens | $5 / $25 per MTok | Adaptive thinking always on |
Claude Sonnet 5 (claude-sonnet-5) |
Mejor equilibrio velocidad/calidad | 1M tokens | 128K tokens | $3 / $15 per MTok | Adaptive thinking always on |
Claude Haiku 4.5 (claude-haiku-4-5-20251001) |
Modelo más rápido para tareas baratas de alto volumen | 200K tokens | 64K tokens | $1 / $5 per MTok | Extended thinking available (adaptive off) |
Claude Mythos 5 (claude-mythos-5) es un modelo gated que comparte las mismas specs y precios que Fable 5, pero no incluye los clasificadores de seguridad de Fable 5. La disponibilidad está limitada a partners aprobados vía Project Glasswing.
Elige el modelo adecuado (reglas rápidas)
- Haiku 4.5: routing, clasificación, extracción y cualquier workflow donde quieras respuestas rápidas y no puedas permitirte presupuestos altos de tokens de salida.
- Sonnet 5: coding diario y trabajo documental donde quieres alta calidad sin el precio de Opus/Fable.
- Opus 4.8: coding agéntico complejo, análisis empresarial y debugging más duro donde se requiere trabajo más largo y autónomo.
- Fable 5: los problemas duros de largo horizonte que llevan horas o días, especialmente cuando el modelo debe mantener el objetivo, delegar subtareas y seguir coherente.
Effort y thinking: cómo impacta el coste
En la API, effort es el control principal del equilibrio entre inteligencia, latencia y coste en Fable 5 y Mythos 5. Para Opus 4.8 y Sonnet 5, también puedes fijar effort de forma explícita cuando necesites un perfil distinto de coste/latencia.
Implicación práctica: poner cada request al effort máximo suele ser la forma más rápida de gastar tu presupuesto en tokens de salida.
Estrategia de tokens que funciona en todos los tiers
Los tokens de salida de Claude son la parte cara. Una regla simple es: limitar la longitud de salida, prompt para TLDR primero, y usa prompt caching para que los prefijos estables (instrucciones de sistema y schemas de tools) se reutilicen.
- Usa el modelo más barato que pueda terminar. Un router (Haiku -> Sonnet/Opus -> Fable) a menudo reduce el coste de forma dramática manteniendo alta calidad.
- Fija límites de salida. En producción, fija siempre un max output / tope de tokens. Las respuestas sin límite son un accidente de presupuesto.
- Usa resúmenes de forma estratégica. En lugar de enviar transcripciones completas en cada turno, mantén una memoria compacta de “lessons” y solo actualízala.
Un blueprint de router simple
- Clasifica la intención y la complejidad estimada con
claude-haiku-4-5. - Envía el trabajo “normalmente duro” a
claude-sonnet-5(oclaude-opus-4-8cuando esperas coding agéntico más pesado). - Escala a
claude-fable-5solo cuando la tarea es claramente de largo horizonte o ha fallado en tiers inferiores. - Si Fable 5 se niega vía clasificadores de seguridad, haz fallback a Opus 4.8 (la API admite reintento con fallbacks si está configurado).