Claude ماڈل ٹائرز کی فوری، عملی گائیڈ۔ روٹنگ بلیو پرنٹس، prompting پیٹرنز اور token-budget پلے بک کے ساتھ مکمل ڈیپ ڈائیو کے لیے پڑھیں بڑا مضمون.
claude-haiku-4-5 تیز اور سستے intent کام کے لیے، claude-sonnet-5 بہترین رفتار/معیار توازن کے لیے، claude-opus-4-8 پیچیدہ agentic coding اور انٹرپرائز کام کے لیے، اور محفوظ رکھیں claude-fable-5 (اور gated claude-mythos-5) واقعی مشکل، طویل افق جابز کے لیے جو گھنٹوں یا دنوں لیتے ہیں۔
ماڈل لائن اپ ایک نظر میں
| ماڈل | بہترین برائے | Context ونڈو | زیادہ سے زیادہ آؤٹ پٹ | قیمت (input / output) | Thinking رویہ |
|---|---|---|---|---|---|
Claude Fable 5 (claude-fable-5) |
طویل چلنے والے ایجنٹس اور مشکل ترین حل نہ ہوئے مسائل | 1M tokens | 128K tokens | $10 / $50 per MTok | Adaptive thinking always on |
Claude Opus 4.8 (claude-opus-4-8) |
پیچیدہ agentic coding اور انٹرپرائز کام | 1M tokens | 128K tokens | $5 / $25 per MTok | Adaptive thinking always on |
Claude Sonnet 5 (claude-sonnet-5) |
بہترین رفتار/معیار توازن | 1M tokens | 128K tokens | $3 / $15 per MTok | Adaptive thinking always on |
Claude Haiku 4.5 (claude-haiku-4-5-20251001) |
سستے، زیادہ حجم کاموں کے لیے تیز ترین ماڈل | 200K tokens | 64K tokens | $1 / $5 per MTok | Extended thinking available (adaptive off) |
Claude Mythos 5 (claude-mythos-5) ایک gated ماڈل ہے جو Fable 5 جیسے ہی specs اور قیمت رکھتا ہے، مگر Fable 5 کے safety classifiers شامل نہیں۔ دستیابی Project Glasswing کے ذریعے منظور شدہ پارٹنرز تک محدود ہے۔
صحیح ماڈل چنیں (فوری قواعد)
- Haiku 4.5: روٹنگ، classification، extraction، اور کوئی بھی ورک فلو جہاں تیز جوابات چاہییں اور زیادہ output-token بجٹ برداشت نہ ہو۔
- Sonnet 5: روزمرہ کوڈنگ اور دستاویزی کام جہاں آپ Opus/Fable قیمت کے بغیر مضبوط معیار چاہتے ہیں۔
- Opus 4.8: پیچیدہ agentic coding، انٹرپرائز تجزیہ، اور مشکل ڈیبگنگ جہاں طویل، زیادہ خودمختار کام درکار ہو۔
- Fable 5: وہ مشکل، طویل افق مسائل جو گھنٹوں یا دنوں لیتے ہیں، خاص طور پر جب ماڈل کو ہدف رکھنا، ذیلی کام سونپنا، اور ہم آہنگ رہنا ہو۔
Effort اور thinking: لاگت پر اثر
API پر، effort Fable 5 اور Mythos 5 پر ذہانت، لیٹنسی اور لاگت کے trade-off کا بنیادی کنٹرول ہے۔ Opus 4.8 اور Sonnet 5 کے لیے آپ effort کو واضح طور پر بھی سیٹ کر سکتے ہیں جب مختلف cost/latency پروفائل چاہیے۔
عملی مفہوم: ہر درخواست کو زیادہ سے زیادہ effort پر ڈیفالٹ کرنا عموماً output tokens پر بجٹ جلانے کا تیز ترین طریقہ ہے۔
ٹوکن حکمت عملی جو سب ٹائرز پر کام کرے
Claude output tokens مہنگا حصہ ہیں۔ ایک سادہ قاعدہ یہ ہے: آؤٹ پٹ لمبائی محدود کریں, TLDR-first کے لیے پرامپٹ، اور استعمال کریں prompt caching تاکہ مستحکم prefixes (سسٹم ہدایات اور ٹول schemas) دوبارہ استعمال ہوں۔
- سب سے سستا ماڈل استعمال کریں جو ختم کر سکے۔ ایک روٹر (Haiku -> Sonnet/Opus -> Fable) اکثر لاگت کو ڈرامائی طور پر کاٹتا ہے جبکہ معیار بلند رکھتا ہے۔
- آؤٹ پٹ حدود سیٹ کریں۔ پروڈکشن میں ہمیشہ max output / token cap سیٹ کریں۔ بے حد جوابات بجٹ کا حادثہ ہیں۔
- خلاصے حکمت عملی سے استعمال کریں۔ ہر موڑ پر مکمل ٹرانسکرپٹس بھیجنے کے بجائے، ایک compact "lessons" میموری رکھیں اور صرف اسے اپ ڈیٹ کریں۔
ایک سادہ روٹر بلیو پرنٹ
- نیت اور تخمینی پیچیدگی درجہ بندی کریں ساتھ
claude-haiku-4-5. - "عام مشکل" کام بھیجیں
claude-sonnet-5(یاclaude-opus-4-8جب آپ بھاری agentic coding کی توقع کریں)۔ - اضافہ کریں
claude-fable-5صرف جب کام واضح طور پر طویل افق ہو یا نچلے ٹائرز پر ناکام ہو۔ - اگر Fable 5 safety classifiers کے ذریعے انکار کرے تو Opus 4.8 پر واپس جائیں (API کنفیگر ہونے پر fallbacks کے ساتھ دوبارہ فائرنگ سپورٹ کرتا ہے)۔