Быстрый практический гайд по тирам моделей Claude. Полный deep-dive с чертежами маршрутизации, prompting-паттернами и playbook token-бюджета — читайте большая статья.
claude-haiku-4-5 для быстрой и дешёвой работы с intent, claude-sonnet-5 для лучшего баланса скорость/качество, claude-opus-4-8 для сложного agentic coding и enterprise-работы, и оставляйте claude-fable-5 (и gated claude-mythos-5) для по-настоящему трудных long-horizon задач на часы или дни.
Линейка моделей кратко
| Model | Лучше всего для | Context window | Max output | Цены (input / output) | Поведение thinking |
|---|---|---|---|---|---|
Claude Fable 5 (claude-fable-5) |
Долгоживущие агенты и самые трудные нерешённые задачи | 1M tokens | 128K tokens | $10 / $50 per MTok | Adaptive thinking always on |
Claude Opus 4.8 (claude-opus-4-8) |
Сложный agentic coding и enterprise-работа | 1M tokens | 128K tokens | $5 / $25 per MTok | Adaptive thinking always on |
Claude Sonnet 5 (claude-sonnet-5) |
Лучший баланс скорость/качество | 1M tokens | 128K tokens | $3 / $15 per MTok | Adaptive thinking always on |
Claude Haiku 4.5 (claude-haiku-4-5-20251001) |
Самая быстрая модель для дешёвых high-volume задач | 200K tokens | 64K tokens | $1 / $5 per MTok | Extended thinking available (adaptive off) |
Claude Mythos 5 (claude-mythos-5) — gated-модель с теми же спецификациями и ценами, что у Fable 5, но без safety classifiers Fable 5. Доступна только одобренным партнёрам через Project Glasswing.
Выберите правильную модель (быстрые правила)
- Haiku 4.5: маршрутизация, классификация, extraction и любой workflow, где нужны быстрые ответы и нельзя тратить высокий budget на output tokens.
- Sonnet 5: ежедневный coding и работа с документами, где нужно сильное качество без цен Opus/Fable.
- Opus 4.8: сложный agentic coding, enterprise-анализ и более трудный debugging, где нужна более длинная и автономная работа.
- Fable 5: жёсткие long-horizon задачи на часы или дни, особенно когда модель должна держать цель, делегировать подзадачи и оставаться coherent.
Effort и thinking: как это бьёт по стоимости
В API, effort является основным рычагом компромисса между интеллектом, задержкой и стоимостью на Fable 5 и Mythos 5. Для Opus 4.8 и Sonnet 5 можно также явно задать effort, когда нужен другой профиль cost/latency.
Практический вывод: ставить maximum effort на каждый запрос — обычно самый быстрый способ сжечь бюджет на output tokens.
Token-стратегия, работающая на всех тирах
Output tokens Claude — дорогая часть. Простое правило: ограничить длину output, prompt для TLDR-first, и используйте prompt caching чтобы стабильные префиксы (system instructions и tool schemas) переиспользовались.
- Используйте самый дешёвый модель, которая справится. Роутер (Haiku -> Sonnet/Opus -> Fable) часто резко режет стоимость, сохраняя высокое качество.
- Задайте лимиты output. В production всегда задавайте max output / token cap. Безграничные ответы — авария бюджета.
- Используйте summaries стратегически. Вместо полной транскрипции каждый ход держите компактную память «lessons» и обновляйте только её.
Простой чертёж роутера
- Классифицируйте intent и оценку сложности через
claude-haiku-4-5. - Отправляйте «обычно сложную» работу на
claude-sonnet-5(илиclaude-opus-4-8когда ждёте более тяжёлый agentic coding). - Эскалируйте к
claude-fable-5только когда задача явно long-horizon или провалилась на более низких тирах. - Если Fable 5 отказывает через safety classifiers, откатывайтесь на Opus 4.8 (API поддерживает повтор с fallbacks при настройке).