Claude model tiers-এর দ্রুত, ব্যবহারিক গাইড। Routing blueprints, prompting patterns এবং token-budget playbookসহ পূর্ণ deep-dive-এর জন্য পড়ুন বড় article.
claude-haiku-4-5 দ্রুত ও সস্তা intent কাজের জন্য, claude-sonnet-5 সেরা speed/quality balance-এর জন্য, claude-opus-4-8 জটিল agentic coding ও enterprise কাজের জন্য, এবং সংরক্ষণ করুন claude-fable-5 (এবং gated claude-mythos-5) সত্যিই কঠিন, long-horizon jobs-এর জন্য যা ঘণ্টা বা দিন নেয়।
এক নজরে model lineup
| মডেল | সেরা | Context window | Max output | Pricing (input / output) | Thinking behavior |
|---|---|---|---|---|---|
Claude Fable 5 (claude-fable-5) |
Long-running agents এবং কঠিনতম unresolved সমস্যা | 1M tokens | 128K tokens | $10 / $50 per MTok | Adaptive thinking always on |
Claude Opus 4.8 (claude-opus-4-8) |
জটিল agentic coding ও enterprise কাজ | 1M tokens | 128K tokens | $5 / $25 per MTok | Adaptive thinking always on |
Claude Sonnet 5 (claude-sonnet-5) |
সেরা speed/quality balance | 1M tokens | 128K tokens | $3 / $15 per MTok | Adaptive thinking always on |
Claude Haiku 4.5 (claude-haiku-4-5-20251001) |
সস্তা, high-volume tasks-এর জন্য দ্রুততম model | 200K tokens | 64K tokens | $1 / $5 per MTok | Extended thinking available (adaptive off) |
Claude Mythos 5 (claude-mythos-5) একটি gated model যা Fable 5-এর মতোই specs ও pricing শেয়ার করে, কিন্তু Fable 5-এর safety classifiers অন্তর্ভুক্ত করে না। উপলব্ধতা Project Glasswing-এর মাধ্যমে অনুমোদিত partners-এ সীমিত।
সঠিক model বেছে নিন (দ্রুত নিয়ম)
- Haiku 4.5: routing, classification, extraction, এবং যেকোনো workflow যেখানে দ্রুত উত্তর চান এবং উচ্চ output-token budgets বহন করতে পারেন না।
- Sonnet 5: দৈনন্দিন coding ও document কাজ যেখানে Opus/Fable মূল্য ছাড়া শক্তিশালী মান চান।
- Opus 4.8: জটিল agentic coding, enterprise analysis, এবং কঠিন debugging যেখানে দীর্ঘ, আরও autonomous কাজ দরকার।
- Fable 5: কঠিন, long-horizon সমস্যা যা ঘণ্টা বা দিন নেয়, বিশেষ করে যখন model-কে লক্ষ্য রাখতে, sub-tasks অর্পণ করতে এবং সুসংগত্ত থাকতে হয়।
Effort ও thinking: খরচে প্রভাব
API-তে, effort Fable 5 ও Mythos 5-এ intelligence, latency এবং cost-এর trade-off-এর প্রাথমিক নিয়ন্ত্রণ। Opus 4.8 ও Sonnet 5-এর জন্য আপনি effort স্পষ্টভাবেও সেট করতে পারেন যখন ভিন্ন cost/latency profile দরকার।
ব্যবহারিক অর্থ: প্রতি request-কে maximum effort-এ ডিফল্ট করা প্রায়শই output tokens-এ বাজেট খরচের দ্রুততম উপায়।
Token strategy যা সব tiers-এ কাজ করে
Claude output tokens ব্যয়বহুল অংশ। একটি সহজ নিয়ম: output length সীমিত করুন, TLDR-first-এর জন্য prompt, এবং ব্যবহার করুন prompt caching যাতে stable prefixes (system instructions ও tool schemas) পুনরায় ব্যবহৃত হয়।
- সবচেয়ে সস্তা model ব্যবহার করুন যা শেষ করতে পারে। একটি router (Haiku -> Sonnet/Opus -> Fable) প্রায়শই মান উঁচু রেখে খরচ নাটকীয়ভাবে কমায়।
- Output limits সেট করুন। Production-এ সবসময় max output / token cap সেট করুন। সীমাহীন উত্তর budgeting accident।
- Summaries কৌশলগতভাবে ব্যবহার করুন। প্রতি turn-এ পূর্ণ transcripts পাঠানোর বদলে, একটি compact “lessons” memory রাখুন এবং শুধু সেটি আপডেট করুন।
একটি সহজ router blueprint
- Intent ও আনুমানিক complexity classify করুন
claude-haiku-4-5. - “Normal hard” কাজ পাঠান
claude-sonnet-5(বাclaude-opus-4-8যখন heavier agentic coding আশা করেন)। - Escalate করুন
claude-fable-5শুধু যখন task স্পষ্টত long-horizon বা নিচের tiers-এ ব্যর্থ হয়েছে। - যদি Fable 5 safety classifiers দিয়ে প্রত্যাখ্যান করে, Opus 4.8-এ ফিরে যান (API কনফিগার থাকলে fallbacksসহ refiring সাপোর্ট করে)।