LLM বাধাগুলি উন্মোচন করা: পর্যবেক্ষণযোগ্যতা, OTEL এবং খরচ নিয়ন্ত্রণ
ব্যবসায়িক সংক্ষিপ্ত: OpenTelemetry, Prometheus/Grafana, Langfuse — সুবিধা, অসুবিধা, খরচ, এবং ব্যবহারের মেট্রিক যা এজেন্টের খরচ কমায়
Workstationব্যবসায়িক সংক্ষিপ্ত: LLM এবং পর্যবেক্ষণযোগ্যতার সাথে এজেন্টের বাধাগুলি উন্মোচন করুন — OpenTelemetry, Prometheus/Grafana/Thanos, এবং LLM প্ল্যাটফর্ম যেমন Langfuse — যাতে আপনি প্রমাণ সহ খরচ কমাতে, SLOs শক্ত করতে এবং জাহাজ এজেন্টদের করতে পারেন৷ গভীর ডুব:দীর্ঘ প্রযুক্তিগত নিবন্ধ (OTEL, FinOps, এজেন্ট বাজেট)। সম্পর্কিত:টার্বোচার্জিং LLMs·এন্টারপ্রাইজ এআই ল্যাব।
কেন টেলিমেট্রি ছাড়া বাধা লুকিয়ে থাকে
LLM এজেন্ট চেইন প্রম্পট, টুল, RAG পুনরুদ্ধার, এবং পুনঃপ্রচার। হপস জুড়ে বিলম্ব এবং ব্যয় যৌগ। স্প্যান এবং মেট্রিক্স ছাড়া আপনি বলতে পারবেন না যে বটলনেকটি মডেল, ভেক্টর স্টোর, একটি ফ্ল্যাকি টুল, বা একটি সীমাহীন স্ব-ডিবাগ লুপ। ব্যবসায়িক স্টেকহোল্ডাররা তখন GPUs বা API কোটা অতিরিক্ত ক্রয় করে যখন পণ্যের গুণমান সমতল থাকে।
AI এস্টেটের জন্যWorkstation-এর অবস্থান: অন্য যে কোনও প্রোডাকশন পরিষেবার মতো এজেন্ট পাইপলাইনগুলি ব্যবহার করুন —পর্যবেক্ষণযোগ্যতা প্রথমে, তারপর পরিবেশন অপ্টিমাইজ করুন (PagedAttention / vLLMদেখুন), তারপর শৃঙ্খলার সাথে প্রচার করুন (Ring PromoterXTAG3)৷
পর্যবেক্ষণযোগ্যতা স্ট্যাক যা নিজের জন্য অর্থ প্রদান করে
- OpenTelemetry (OTEL)— ট্রেস, মেট্রিক্স এবং (যেখানে দরকারী) লগগুলির জন্য একটি উপকরণ স্তর৷ একটি সংগ্রাহক রপ্তানি; ব্যাকএন্ডে ফ্যান আউট.
- Prometheus + Grafana (+ Thanos)— সুবর্ণ সংকেত: অনুরোধের হার, ত্রুটির হার, লেটেন্সি, টোকেন থ্রুপুট, আনুমানিক $/অনুরোধ, GPU ব্যবহার। থানোস (বা সমতুল্য) FinOps পর্যালোচনাগুলির জন্য দীর্ঘমেয়াদী মেট্রিক্স রাখে।
- LLM পর্যবেক্ষণযোগ্যতা প্ল্যাটফর্মগুলি(যেমনল্যাংফিউজ,LMNR) — সেশন/ট্রেস UI, প্রম্পট সংস্করণ, মানব & স্বয়ংক্রিয় স্কোর, রিগ্রেশনের জন্য ডেটাসেট।
এই পদ্ধতির সুবিধা এবং অসুবিধা
| মাত্রা | পেশাদার | কনস / ট্রেড-অফ |
|---|---|---|
| খরচ নিয়ন্ত্রণ | ভাড়াটে, বৈশিষ্ট্য, মডেল এবং এজেন্ট পদক্ষেপের জন্যবৈশিষ্ট্য ব্যয়; অপব্যয় পুনঃ চেষ্টা হত্যা. | প্রকৌশল যন্ত্রের সময়; ধারণ নিষ্পাপ হলে ট্রেস জন্য স্টোরেজ খরচ. |
| গুণমান | স্কোর + ডেটাসেট গ্রাহকদের আগে প্রম্পট রিগ্রেশন ক্যাচ করে। | স্বয়ংক্রিয় স্কোরিং গোলমাল হতে পারে; মানুষের এখনও সমালোচনামূলক পথের জন্য প্রয়োজন। |
| Ops | আপনার অন্যান্য মাইক্রোসার্ভিসের মতো একই OTEL/Prometheus দক্ষতা সেট। | LLM-নির্দিষ্ট UIs (Langfuse ইত্যাদি) চালানো বা কেনার জন্য অন্য পণ্য যোগ করুন। |
| কমপ্লায়েন্স | অডিট কে কোন মডেলকে কোন প্রম্পট সংস্করণ দিয়ে কল করেছে। | প্রম্পট/PII ধরে রাখার নীতিগুলি অবশ্যই সামনের দিকে ডিজাইন করা উচিত৷ |
| গতির মান | আপনি যদি ইতিমধ্যেই Grafana চালান তাহলেদিনের মধ্যে প্রথম ড্যাশবোর্ড। | মাল্টি-এজেন্ট গ্রাফ জুড়েসম্পূর্ণ খরচের অ্যাট্রিবিউশন বেশি সময় নেয়। |
খরচ: আপনি যা খরচ করেন বনাম আপনি
কি সংরক্ষণ করেনইন্সট্রুমেন্টেশন খরচ (সাধারণ মাঝারি আকারের এজেন্ট প্ল্যাটফর্ম):
- OTEL স্প্যান কনভেনশন + রপ্তানিকারক ওয়্যারিং গ্রহণ করতে
- 1-2 ইঞ্জিনিয়ার-সপ্তাহ।
- সংগ্রাহক + মেট্রিক্স ধরে রাখা: প্রায়ই <5-10% মাসিক LLM API/GPU একবার স্যাম্পলিং টিউন হয়ে গেলে খরচ করে৷
- ঐচ্ছিক SaaS LLM পর্যবেক্ষণযোগ্যতা: ইভেন্ট/ট্রেস প্রতি মূল্য - এটিকে মডেল খরচের % হিসাবে বাজেট করুন, চিন্তাভাবনা হিসাবে নয়।
সেভিংস লিভার (ব্যবহারের মেট্রিক যা সুই সরায়):
- সফল টাস্কপ্রতি টোকেন - কাঁচা কল প্রতি টোকেন নয়। ক্যাপ টুল লুপ এবং স্ব-ডিবাগ রাউন্ড।
- সফল টাস্ক প্রতি খরচ— শ্রেণীবদ্ধ/রুটের জন্য রুট সস্তা মডেল; কঠিন পদক্ষেপের জন্য সীমান্ত মডেল রিজার্ভ করুন।
- ক্যাশে হিট রেট— প্রম্পট/প্রিফিক্স ক্যাশিং যেখানে নিরাপদ; শুদ্ধতা পরিমাপ, শুধুমাত্র বিলম্ব না.
- পুনরায় চেষ্টা করার হার & ডেড-লেটার রেট— ফ্ল্যাকি টুলসকে "মডেল কোয়ালিটি" সমস্যা হিসেবে মাস্করাড করে।
- p95 TTFT এবং এন্ড-টু-এন্ড লেটেন্সি— যখন আপনি খরচ কম করেন তখন UX রক্ষা করুন।
স্কোরিং: ম্যানুয়াল বনাম স্বয়ংক্রিয়
| পদ্ধতি | কখন | ব্যবহার করবেনব্যবসায়িক নোট |
|---|---|---|
| ম্যানুয়াল স্কোরিং | গোল্ড সেট, নিয়ন্ত্রিত উত্তর, ব্র্যান্ড-সংবেদনশীল কপি। | ব্যয়বহুল কিন্তু স্বয়ংক্রিয় বিচারকদের ভিত্তি। |
| স্বয়ংক্রিয় স্কোরিং | হাই-ভলিউম রিগ্রেশন, LLM-এজ-জজ, রুব্রিক চেক। | স্কেলে সস্তা; মাসিক মানুষের বিরুদ্ধে ক্রমাঙ্কন. |
মাইগ্রেশন প্লেবুক (ছোট শুরু করুন)
- ইন্সট্রুমেন্টএকপ্রোডাকশন এজেন্ট পাথ এন্ড-টু-এন্ড OTEL + টোকেন/কস্ট অ্যাট্রিবিউট সহ।
- হার / ত্রুটি / বিলম্ব / $/সফলতার জন্য একটি Grafana বোর্ড পাঠান৷ সেই পথে প্রম্পট সংস্করণ এবং স্কোরের জন্য
- Langfuse (বা সমতুল্য) যোগ করুন।
- হার্ড ক্যাপ প্রয়োগ করুন: সর্বোচ্চ টোকেন, সর্বোচ্চ টুল কল, প্রতি সেশনে সর্বোচ্চ পুনঃপ্রয়াস।
- প্রথম পাথ একটি পরিমাপিত খরচ বা লেটেন্সি জয় দেখানোর পরেই পরবর্তী এজেন্টে প্রসারিত করুন।
ঘড়ি: কেন AI সিস্টেম
এর জন্য পর্যবেক্ষণযোগ্যতা গুরুত্বপূর্ণঅবজারভেবিলিটি কালচারের প্রসঙ্গ আলোচনা — Workstation প্রোডাক্ট ডেমো নয়।OpenTelemetry ডক্সএবংWorkstation প্রযুক্তিগত নিবন্ধএর সাথে পেয়ার করুন।
পরবর্তী
পড়ুন- দীর্ঘ নিবন্ধ— OTEL স্প্যান স্কিমা, সংগ্রাহক, খরচ সূত্র, এজেন্ট ক্যাপস, Langfuse/LMNR নোট।
- টার্বোচার্জিং LLMs— সার্ভিং-সাইড বাধাগুলি আপনি দেখতে পাওয়ার পরে৷
- স্থানীয় এজেন্ট·এন্টারপ্রাইজ AI ল্যাব·যোগাযোগ Workstation
Workstationদ্বারা প্রকাশিত। তথ্যসূত্র:langfuse/langfuse·lmnr-ai/lmnr·OpenTelemetry।