Una guía práctica para combinar Kubeflow (entrenar / evaluar / registrar) con Argo CD (entregar / rollback GitOps). Para la arquitectura completa, manifests y anti-patrones, lee el artículo largo.
InferenceService, definición de pipeline y componente de plataforma se reconcilia desde Git. Entrena y evalúa en Kubeflow; promueve actualizando un manifest de Git; haz rollback con git revert. Mantén los modelos en object storage — Git guarda URIs y config, no los pesos.
¿Por qué ambas herramientas?
Kubeflow responde: ¿cómo ejecutamos entrenamiento y evaluación reproducibles en GPUs? Argo CD responde: ¿cómo llevamos el modelo resultante a producción sin clusters snowflake? Usar solo Kubeflow suele acabar en kubectl apply para el serving. Usar solo Argo CD te deja sin un pipeline ML y sistema de experimentos de primera clase. Juntos forman un bucle MLOps cerrado.
La división del trabajo
| Preocupación | Herramienta | Qué vive en Git |
|---|---|---|
| DAGs de pipeline, TrainJobs, experimentos | Kubeflow Pipelines / Trainer | YAML de pipeline / specs de componentes |
| Artefactos de modelo y linaje | Model Registry + object storage | URI + metadatos — no el archivo de pesos |
| Serving, canaries, rollbacks | KServe + Argo CD | InferenceService overlays |
| Instalación y upgrades de plataforma | Applications de Argo CD | Helm/Kustomize para el propio Kubeflow |
Bucle de extremo a extremo (cómo se ve lo bueno)
- El data scientist mergea un cambio de pipeline → Argo CD sincroniza los CRDs del pipeline.
- Kubeflow ejecuta el entrenamiento en nodos GPU (opcionalmente en cola vía Kueue).
- Las gates de evaluación pasan → URI del modelo registrada; un PR actualiza el prod
InferenceServicestorageUri. - Argo CD detecta OutOfSync y despliega (tráfico canary primero).
- Drift o métricas malas →
git revertrestaura la URI anterior; Argo CD reconcilia.
Cinco prácticas que te ahorran dolor
- Repositorios o carpetas separados: plataforma (instalación de Kubeflow) vs apps (pipelines + InferenceServices).
- Nunca hagas commit de binarios de modelos — referencia
s3:///gs:/// URIs de PVC. - Sync waves: MySQL/MinIO (o equivalentes gestionados) antes de los componentes KFP.
- Límites de recursos en cada paso — los jobs de entrenamiento sin límites dejarán el cluster sin recursos.
- Promotion = PR, no un botón en un notebook. La pista de auditoría sale gratis.
Cuándo este stack es excesivo
Un solo Mac Studio ejecutando Ollama para un chatbot de pyme no necesita Kubeflow + Argo CD. Adopta este patrón cuando tengas varios modelos, contención de GPU, necesidades de cumplimiento, o más de un entorno (dev/staging/prod) que deban permanecer idénticos.
Lee la versión larga
El artículo largo cubre el mapa MLOps de Kubernetes 2026 (KFP v2, Trainer, KServe, Kueue), patrones Application de Argo CD, gates de promoción, serving canary, FinOps de GPU y una checklist de rollout. Publicado por Workstation.