یہ طویل حوالہ ہے۔ پانچ منٹ کے خلاصے کے لیے ساتھی بلاگ دیکھیں۔
1. تعارف: MLOps کو دو کنٹرول پلین درکار ہیں
Kubernetes پر مشین لرننگ دو متوقع طریقوں سے ناکام ہوتی ہے۔ ٹیمیں یا تو ٹریننگ کو بغیر lineage والے ad-hoc Jobs کا مجموعہ سمجھتی ہیں، یا serving کو بغیر آڈٹ ٹریل والے ایک بار کے kubectl apply کے طور پر۔ Kubeflow اور Argo CD اس مسئلے کے مخالف آدھے حصے حل کرتے ہیں۔
Kubeflow ML کنٹرول پلین ہے: pipelines، تقسیم شدہ ٹریننگ، تجربہ ٹریکنگ، model registry اور KServe۔ Argo CD ڈیلیوری کنٹرول پلین ہے: pull-based GitOps تاکہ کلسٹر کی حالت Git سے میل کھائے — خود Kubeflow پلیٹ فارم اور ہر پروڈکشن InferenceService سمیت۔
یہ مضمون پلیٹ فارم اور MLOps انجینئرز کے لیے عملی آرکیٹیکچر گائیڈ ہے۔ یہ Kubernetes کی واقفیت اور بنیادی GitOps کی سمجھ مانتا ہے (ہمارا پہلے والا Argo CD & Flux continuous delivery پوسٹ دیکھیں)۔ یہاں ہم 2026 میں ML ورک لوڈز کے لیے دونوں سسٹمز کے جوڑ پر توجہ دیتے ہیں۔
2. 2026 Kubernetes MLOps نقشہ
| لائف سائیکل مرحلہ | ٹول | کردار |
|---|---|---|
| Pipeline آرکیسٹریشن | Kubeflow Pipelines 2.x | کنٹینرائزڈ مراحل کا DAG؛ ٹریک شدہ runs |
| تقسیم شدہ ٹریننگ | Kubeflow Trainer (TrainJob) | PyTorch / JAX / XGBoost / DeepSpeed jobs |
| GPU قطار | Kueue (+ optional Volcano) | منصفانہ حصہ، gang scheduling، کوٹہ |
| ماڈل serving | KServe | آٹو اسکیل InferenceService؛ canary splits |
| آٹو اسکیلنگ | KEDA + HPA | ایونٹ ڈرائیون اسکیل، scale-to-zero سمیت |
| ڈیلیوری اور رول بیک | Argo CD | manifests کے لیے Git حقیقت کا ماخذ |
| آبزرویبلٹی | Prometheus / Grafana / drift tools | انفرا + ماڈل کوالٹی سگنلز |
کچھ pipeline backends کے نیچے اب بھی Argo Workflows نظر آتا ہے، مگر authoring کے لیے Kubeflow Pipelines IR / v2 اور Kubernetes وسائل کی continuous delivery کے لیے Argo CD سوچیں — «Argo Workflows» کو «Argo CD» سے نہ ملائیں۔
3. واضح ملکیت: Kubeflow کیا کرتا ہے بمقابلہ Argo CD کیا کرتا ہے
3.1 Kubeflow کی ملکیت
- ٹریننگ / ETL / تشخیص DAGs لکھنا اور چلانا
- GPU جاب لائف سائیکل اور تجربہ میٹا ڈیٹا
- Model Registry میں ماڈل ورژن اور lineage رجسٹر کرنا
- یہ متعین کرنا کہ ماڈل کیسے سرور ہو سکتا ہے (runtime، وسائل) — اکثر جنریٹڈ manifests کے ذریعے
3.2 Argo CD کی ملکیت
- Kubeflow اجزاء کی تنصیب اور اپ گریڈ (GitOps پلیٹ فارم)
- ٹریننگ شروع کرنے والی pipeline تعریفیں اور CronWorkflows سنک کرنا
- ماحولوں میں
InferenceServiceتبدیلیاں پروموٹ کرنا - Git تاریخ کے ذریعے فوری، آڈٹ کے قابل رول بیک
storageUri، digest، tags) اور وہ Kubernetes YAML رہتا ہے جو Argo CD لاگو کرتا ہے۔
4. تجویز کردہ Git لے آؤٹ
ml-platform/ # Argo CD App: install Kubeflow once
overlays/
staging/
production/
ml-apps/ # Argo CD App-of-Apps or projects
pipelines/
fraud-detector/
serving/
fraud-detector/
base/inferenceservice.yaml
overlays/
staging/
production/
components/ # reusable KFP components (OCI or YAML)
platform اور application سنکس الگ رکھیں۔ ڈیٹا سائنسدان ml-apps کے خلاف PR کھولتے ہیں؛ پلیٹ فارم انجینئرز ml-platform کے مالک ہیں۔ Argo CD Projects + RBAC استعمال کریں تاکہ خراب pipeline PR Kubeflow کنٹرول پلین کو دوبارہ نہ لکھ سکے۔
5. Argo CD سے Kubeflow کا انتظام
دستی Kubeflow تنصیبات نازک ہوتی ہیں: بہت سے CRDs، ترتیب کی پابندیاں اور اپ گریڈ راستے۔ پلیٹ فارم کو Argo CD Application (یا ApplicationSet) سمجھیں جس میں:
- Sync waves — سرٹیفکیٹس، اسٹوریج، MySQL/Postgres (یا managed DB)، MinIO/S3 کریڈنشلز، پھر KFP / Trainer / KServe
- Health checks — منحصر ایپس سنک کرنے سے پہلے CRDs اور webhooks کا انتظار
- پروڈکشن میں managed سروسز — جب all-in-one ڈیمو سے آگے بڑھیں تو in-cluster MySQL/MinIO کو Cloud SQL/RDS اور S3 سے بدل دیں
مثال Application خاکہ (وضاحتی):
apiVersion: argoproj.io/v1alpha1
kind: Application
metadata:
name: kubeflow-platform
namespace: argocd
annotations:
argocd.argoproj.io/sync-wave: "0"
spec:
project: ml-platform
source:
repoURL: https://git.example.com/org/ml-platform.git
targetRevision: main
path: overlays/production
destination:
server: https://kubernetes.default.svc
namespace: kubeflow
syncPolicy:
automated:
prune: false
selfHeal: true
syncOptions:
- CreateNamespace=true
- ServerSideApply=true
6. Pipelines بطور GitOps وسائل
Kubeflow Pipelines v2 / Kubernetes-native APIs کے ساتھ، مرتب شدہ pipelines کلسٹر وسائل کے طور پر منظم ہو سکتے ہیں۔ ورک فلو بنتا ہے:
- Python میں pipeline لکھیں (KFP SDK)
- YAML میں مرتب کریں
ml-apps/pipelines/...میں کمیٹ کریں- Argo CD سنک کرتا ہے؛ runs UI، API، یا Git میں محفوظ CronWorkflow سے ٹرگر ہوتے ہیں
مراحل پر ہمیشہ CPU، میموری اور GPU حدود سیٹ کریں۔ غیر محدود ٹریننگ مراحل کسی بھی برے ماڈل سے تیزی سے multi-tenant کلسٹرز کو متاثر کریں گے۔
7. ماڈل پروموشن: registry → Git → Argo CD
یہ اہم ہینڈ آف ہے:
- ٹریننگ رن ختم؛ تشخیص میٹرکس حدیں پوری کرتے ہیں۔
- Model Registry URI + میٹا ڈیٹا (accuracy، fairness، signer) کے ساتھ نیا ورژن ریکارڈ کرتا ہے۔
- آٹومیشن (یا انسان) serving overlay میں
storageUri(اور امیج ٹیگ / runtime) اپ ڈیٹ کرنے والا PR کھولتا ہے۔ - مرج کے بعد Argo CD KServe رول آؤٹ کرتا ہے۔ Canary ترجیح دیں:
canaryTrafficPercent10% سیٹ کریں، error rate اور latency دیکھیں، پھر پروموٹ کریں۔
apiVersion: serving.kserve.io/v1beta1
kind: InferenceService
metadata:
name: fraud-detector
spec:
predictor:
model:
modelFormat:
name: sklearn
storageUri: s3://models/fraud/v1.4.2/
resources:
requests:
cpu: "1"
memory: 2Gi
limits:
cpu: "2"
memory: 4Gi
رول بیک ڈیش بورڈ کلک نہیں — اس URI تبدیلی کا git revert ہے۔ Argo CD کلسٹر کو پچھلی desired state پر درست کرتا ہے۔
8. GPUs، کوٹہ اور FinOps
- Kueue استعمال کریں تاکہ TrainJobs ناکام یا oversubscribe ہونے کے بجائے منصفانہ GPU صلاحیت کا انتظار کریں۔
- جب ممکن ہو، ٹریننگ بمقابلہ latency حساس inference کے لیے node pools الگ کریں۔
- فی pipeline رن لاگت ٹریک کریں (GPU-seconds × شرح)۔ GitOps FinOps نہیں ہٹاتا — خرچ کو commit اور ماڈل ورژن سے منسوب کرتا ہے۔
- NVIDIA پر MIG / time-slicing کے لیے پلیٹ فارم ریپو میں پارٹیشن حکمت عملی دستاویز کریں تاکہ Argo CD-managed DevicePlugin کنفگز مطابقت رکھیں۔
9. سیکیورٹی اور multi-tenancy
- Kubeflow Profiles ٹیموں کو الگ کرتے ہیں؛ انہیں Argo CD Projects سے میپ کریں۔
- کلاؤڈ کریڈنشلز Sealed Secrets / External Secrets میں رکھیں — Git میں کبھی plain ConfigMaps نہیں۔
- پروموشن بوٹ کے prod PR کھولنے سے پہلے registry میٹا ڈیٹا گیٹس (جیسے fairness_score، sign_off_user) ضروری کریں۔
- Network policies: ٹریننگ جابز کو unrestricted egress نہیں چاہیے؛ serving pods کو صرف ماڈل اسٹوریج اور کلائنٹس چاہیے۔
10. پوڈ میٹرکس سے آگے آبزرویبلٹی
GPU استعمال پر Prometheus ضروری ہے مگر کافی نہیں۔ جوڑیں:
- Pipeline ناکامی الرٹس (رن اسٹیٹس، صرف Deployment CrashLoop نہیں)
- Serving SLO: latency، error rate، saturation
- ڈیٹا/ماڈل drift مانیٹرز جو ٹکٹ کھول سکیں یا ٹریننگ CronWorkflow دوبارہ ٹرگر کریں
جب drift فائر ہو، remediation راستہ پھر بھی GitOps ہونا چاہیے: نیا رن → نیا URI → PR → Argo CD sync — نوڈ پر دستی اوور رائٹ نہیں۔
11. رول آؤٹ چیک لسٹ
- Argo CD انسٹال کریں؛
ml-platformاورml-appsپروجیکٹس بنائیں۔ - Sync waves کے ساتھ GitOps سے Kubeflow انسٹال کریں؛ KFP UI اور KServe CRDs تصدیق کریں۔
- Object storage + Model Registry کھڑا کریں؛ URI کنونشنز دستاویز کریں۔
- ایک golden path pipeline آن بورڈ کریں (train → evaluate → register)۔
- پہلے staging overlay کے ساتھ Argo CD کے تحت ایک InferenceService شامل کریں۔
- Canary پروموشن فعال کریں؛
git revertڈرل مشق کریں۔ - ملٹی ٹیم رول آؤٹ سے پہلے Kueue کوٹہ اور GPU FinOps ڈیش بورڈز شامل کریں۔
12. اینٹی پیٹرنز
- «آسانی» کے لیے 4 GB وزن فائلیں Git LFS میں کمیٹ کرنا
- نوٹ بکس کو پروڈکشن InferenceServices پر
kubectl applyکرنے دینا - ایک Argo CD Application جو پلیٹ فارم اور تمام ٹیم pipelines ملائے (blast radius)
- ٹریننگ مراحل پر کوئی resource limits نہیں
- Argo Workflows (عمل درآمد) کو Argo CD (desired-state sync) سے ملانا
- Staging چھوڑنا — لیپ ٹاپ تجربے سے سیدھا prod ٹریفک پر پروموٹ
13. اس اسٹیک کا استعمال کب نہ کریں
ورک سٹیشن پر ایک نجی LLM چلانے والے SMEs (ہمارے AI SME Packages دیکھیں) کو پہلے دن Kubeflow + Argo CD کی ضرورت نہیں۔ جب متعدد ماڈلز، ہم وقتی GPU صارفین، ضابطہ شدہ change control، یا متعدد ایک جیسے ماحول ہوں تو یہ آرکیٹیکچر لائیں۔
14. نتیجہ
Kubeflow اور Argo CD تکمیلی ہیں۔ Kubeflow Kubernetes پر ML کام کو چلانے اور دوبارہ پیدا کرنے کے قابل بناتا ہے۔ Argo CD ML انفراسٹرکچر اور ماڈل serving کو اعلانیہ، آڈٹ کے قابل اور الٹنے کے قابل بناتا ہے۔ جیتنے والا پیٹرن سادہ ہے: object storage میں آرٹیفیکٹس، Git میں پوائنٹرز اور YAML، Kubeflow میں ٹریننگ، Argo CD میں ڈیلیوری اور رول بیک۔
ساتھی بلاگ شیئر کرنے کے قابل خلاصہ ہے؛ یہ مضمون پلیٹ فارم ڈیزائن ریویوز کا حوالہ ہے۔
Workstation کی طرف سے شائع (workstation.co.uk)۔
اس مضمون کے لیے SEO اسنیپ شاٹ
- SEO عنوان: Kubeflow + Argo CD: Kubernetes پر GitOps MLOps
- Meta description: Kubernetes پر ٹرین کے قابل، آڈٹ کے قابل، رول بیک محفوظ ML کے لیے Kubeflow Pipelines، Model Registry اور KServe کو Argo CD GitOps کے ساتھ کیسے جوڑیں۔
- بنیادی کلیدی الفاظ: Kubeflow Argo CD, GitOps MLOps, KServe InferenceService, Kubeflow Pipelines GitOps, ML on Kubernetes
- Twitter / X: Kubeflow ٹرین کرتا ہے۔ Argo CD ڈیلیور کرتا ہے۔ ماڈلز object storage میں رہتے ہیں؛ Git URIs رکھتا ہے۔ Workstation سے مکمل GitOps MLOps گائیڈ۔
- LinkedIn: ہم نے Kubeflow اور Argo CD جوڑنے پر گہرا تجزیہ شائع کیا: platform vs apps Git لے آؤٹ، پروموشن گیٹس، canary serving، GPU کوٹہ اور git revert کے ذریعے رول بیک۔ Workstation انجینئرنگ سے۔