Claude 模型档位的快速实用指南。含路由蓝图、提示模式与 token 预算手册的完整深潜,请阅读 长文大作.
一段话版。 Claude 模型选择主要是在以下之间权衡 延迟, 成本,以及 任务需要模型在流程中停留多久。使用
claude-haiku-4-5 用于快速且廉价的意图工作, claude-sonnet-5 以求最佳速度/质量平衡, claude-opus-4-8 用于复杂智能体编码与企业工作,并保留 claude-fable-5 (以及受限的 claude-mythos-5) 用于真正困难、耗时数小时或数天的长周期任务。
模型阵容一览
| 模型 | 最适合 | 上下文窗口 | 最大输出 | 定价(输入 / 输出) | Thinking 行为 |
|---|---|---|---|---|---|
Claude Fable 5 (claude-fable-5) |
长时运行智能体与最难未解问题 | 1M tokens | 128K tokens | $10 / $50 per MTok | Adaptive thinking always on |
Claude Opus 4.8 (claude-opus-4-8) |
复杂智能体编码与企业工作 | 1M tokens | 128K tokens | $5 / $25 per MTok | Adaptive thinking always on |
Claude Sonnet 5 (claude-sonnet-5) |
最佳速度/质量平衡 | 1M tokens | 128K tokens | $3 / $15 per MTok | Adaptive thinking always on |
Claude Haiku 4.5 (claude-haiku-4-5-20251001) |
面向廉价、高流量任务的最快模型 | 200K tokens | 64K tokens | $1 / $5 per MTok | Extended thinking available (adaptive off) |
Claude Mythos 5 (claude-mythos-5) 是一个受限发布模型,规格与定价与 Fable 5 相同,但不包含 Fable 5 所用的安全分类器。仅向经 Project Glasswing 批准的合作伙伴开放。
选择正确模型(快速规则)
- Haiku 4.5:路由、分类、抽取,以及任何需要快速回复、且无法承受高输出 token 预算的工作流。
- Sonnet 5:日常编码与文档工作,既要强质量又不要 Opus/Fable 定价。
- Opus 4.8:复杂智能体编码、企业分析,以及需要更长、更自主工作的高难度调试。
- Fable 5:那些耗时数小时或数天的硬题、长周期问题,尤其当模型必须守住目标、委派子任务并保持连贯时。
Effort 与 thinking:如何影响成本
在 API 上, effort 是 Fable 5 与 Mythos 5 上在智能、延迟与成本之间权衡的主要控制项。对 Opus 4.8 与 Sonnet 5,当你需要不同的成本/延迟画像时,也可以显式设置 effort。
实践含义:把每个请求默认设为最大 effort,通常是最快把预算烧在输出 token 上的方式。
跨所有档位通用的 token 策略
Claude 输出 token 是昂贵的部分。简单规则是: 限制输出长度, 优先 TLDR 的提示,并使用 prompt caching 以便稳定前缀(系统指令与工具 schema)被复用。
- 使用能完成任务的最便宜模型。 路由器(Haiku -> Sonnet/Opus -> Fable)常能大幅降本,同时保持高质量。
- 设置输出上限。 生产中务必设置最大输出 / token 上限。无界回答是预算事故。
- 有策略地使用摘要。 不要每轮发送完整对话记录,保留紧凑的「lessons」记忆并只更新它。
简单路由器蓝图
- 用以下方式对意图与估计复杂度分类
claude-haiku-4-5. - 把「正常偏难」的工作发给
claude-sonnet-5(或claude-opus-4-8当你预期更重的智能体编码时)。 - 升级到
claude-fable-5仅当任务明显是长周期,或在更低档位已失败时。 - 若 Fable 5 因安全分类器拒绝,回退到 Opus 4.8(配置后 API 支持带 fallback 的重试)。