KubePilot es una cabina de solución de problemas de Kubernetes de código abierto creada por Workstation equipo de ingeniería. Combina el diagnóstico asistido por IA (Copiloto), navegación en clúster estilo SRE (Piloto) y remediación basada en políticas (Piloto automático) para que los equipos de plataforma, SRE y DevOps pasen de señales ruidosas a una solución segura, sin tener que hacer malabarismos con las pestañas de kubectl en medio del incidente. Sitio del producto: kubepilot.org. Fuente: github.com/bwalia/kubepilot.
- Qué: Cabina K8 de código abierto: CoPilot (AI RCA) + Pilot (navegador SRE) + AutoPilot (reparador cerrado).
- OMS: Equipos de SRE, DevOps, plataforma/AIOps que necesitan un MTTR más rápido con automatización auditable.
- Correr: binario
serveen :8383, gráfico de timón, Docker (ghcr.io/kubepilot/kubepilot), compañero de iOS. - AI: LLM locales a través de Ollama; Mensaje de copia; Servidor MCP en: 9090.
- Seguridad: valores predeterminados de Pilot de solo lectura; Piloto automático apagado/funcionamiento en seco/activo; pisos de confianza; listas de bloqueo; interruptor de apagado; libro de decisiones.
1. Mira el tutorial
youtu.be/CsiJWpfncqA — Balinder Walia, Workstation.
2. El problema que resuelve KubePilot
Los clústeres modernos emiten más señales de las que los humanos pueden clasificar en una sola página: CrashLoops, ImagePullBackOff, OOMKills, presión de nodo, sondas inestables y deriva YAML. La respuesta típica se extiende a lo largo de:
kubectlscripts de historia y shell,- una interfaz de usuario del navegador (Lens/Rancher/tablero),
- inicia sesión en una tercera herramienta,
- un chat LLM con YAML pegado (y sin autenticación de clúster).
Esa fragmentación quema minutos cuando los minutos son el SLA. KubePilot colapsa el bucle en una sola cabina: detectar → preguntar → verificar → arreglar.
3. Modo A: CoPilot (solución de problemas asistida por IA)
CoPilot es la superficie RCA automatizada y en lenguaje natural:
- Haga preguntas operativas en inglés sencillo ("¿por qué aparece CrashLooping en el producto?").
- Un clic Análisis de IA en grupos de problemas y eventos.
- Análisis de causa raíz con cadenas de evidencia, confianza, riesgo, comandos sugeridos, correcciones de YAML y próximos pasos.
- Detección de anomalías para CrashLoop, OOM, ImagePull y patrones de presión de nodos.
- Copiar mensaje para reutilizar el mensaje de diagnóstico exacto con su modelo preferido.
- Diseñado para Ollama / modelos locales para que el contexto del clúster pueda permanecer en su red.
4. Modo B: Piloto (navegador de solución de problemas SRE)
Pilot es el banco de trabajo de solo lectura estilo Lens/Rancher para verificación antes de la mutación:
- Explore implementaciones, StatefulSets, DaemonSets, trabajos, servicios, ingresos, ConfigMaps, secretos y PVC.
- Banco de trabajo de pod: descripción general, contenedores, eventos, registros, YAML desinfectado, recuentos de reinicios, tiempo de actividad.
- Medidores de recursos del clúster en vivo (CPU, memoria, disco): compatible con Longhorn cuando corresponda.
- Lienzo de topología del servicio: Ingreso → Servicio → Carga de trabajo → Pod con colores de estado y puertos.
- Clasificación IP de LAN, WAN y túnel de nodo (por ejemplo, WireGuard/franela), no solo la dirección superpuesta.
- Túneles de reenvío de puertos desde la interfaz de usuario; Carga de kubeconfig de múltiples clústeres y cambio de contexto sin reinicio.
5. Modo C: Piloto automático (fijador de IA con rieles de seguridad)
AutoPilot cierra el círculo con autocuración auditable; nunca "aplica YOLO" como valor predeterminado:
| Control | Objetivo |
|---|---|
| Modos: apagado/funcionamiento en seco/activo | Vista previa antes de aplicar; mantenga la automatización estacionada cuando sea necesario |
| Pisos de confianza | Evite los RCA de baja confianza en lugar de adivinar |
| Listas de bloqueo de espacios de nombres y listas de acciones permitidas | Proteger los espacios de nombres kube-system/prod; limitar los tipos de mutación |
| Enfriamientos y límites por hora | Prevenir tormentas de remediación |
| interruptor de apagado | Pausa con un clic para operadores |
| Libro mayor de decisiones | Ejecutado, omitido, escalado, fallido: pista de auditoría |
| Escalada de código CR | Aprobación humana para acciones arriesgadas |
6. Mapa de funciones completo (de kubepilot.org)
- Runbooks prediseñados: siete flujos de trabajo de diagnóstico obstinados; runbooks YAML personalizados con fsnotify hot-reload (los ID de usuario anulan las funciones integradas).
- Historia duradera de RCA: SQLite integrado opcional (WAL, sin CGO) con retención de informes y anomalías durante los reinicios.
- Alertas y cronograma: advertencias, eventos, anomalías, RCA como línea de tiempo de operaciones con capacidad de búsqueda; Tarjetas de incidentes de Slack opcionales.
- Chip de salud de IA: Sepa que Ollama está listo antes de que un incidente dependa de ello.
- Valores predeterminados de seguridad primero: autenticación opcional, navegación de solo lectura, puertas de mutación, políticas CORS.
- Protocolo del agente MCP: Servidor MCP integrado para orquestación de agentes de múltiples clústeres y acceso programático.
- Compañero nativo de iOS: Aplicación SwiftUI: tarjetas de salud, pods, registros, RCA, Face ID, widgets, Siri/App Intents.
7. Opciones de instalación
Requisitos previos para las compilaciones de código fuente: Go 1.22+, Node.js 18+, un clúster accesible + kubeconfig; Ollama recomendado para IA local.
7.1 Construir desde la fuente
git clone https://github.com/bwalia/kubepilot.git cd kubepilot make dashboard-install make dashboard make build KUBEPILOT_KUBECONFIG="$HOME/.kube/config" ./dist/kubepilot serve --dashboard-port=8383 # Dashboard/API: http://localhost:8383 # MCP server: :9090
7.2 Helm (instalación en clúster)
helm repo add kubepilot https://bwalia.github.io/kubepilot helm repo update helm upgrade --install kubepilot kubepilot/kubepilot \ -n kubepilot --create-namespace kubectl port-forward svc/kubepilot -n kubepilot 8080:8080 # Open http://localhost:8080
También se admiten: NodePort, Ingress (+ cert-manager TLS), LoadBalancer y anulaciones de valores; consulte el gráfico README en GitHub.
7.3 Ventana acoplable
docker run --rm -p 8383:8383 -p 9090:9090 \ -v "$HOME/.kube:/root/.kube:ro" \ ghcr.io/kubepilot/kubepilot:latest \ serve --dashboard-port=8383
Compañero de iOS 7.4
cd ios brew install xcodegen ./generate.sh open KubePilot.xcodeproj # Point the app at http://<server-ip>:8383
8. Modelo operativo recomendado
- Día 0: ejecute Pilot de solo lectura en un clúster que no sea de producción; cable Ollama; confirmar el chip de salud AI.
- Día 1: utilice CoPilot AI Analyse en pods defectuosos conocidos; compare RCA con sus runbooks; Sintonice Copy Prompt en su equipo LLM.
- Día 2: habilitar el piloto automático en ejecución en seco solo; revisar el libro de decisiones durante una semana.
- Día 3+: promover espacios de nombres seleccionados para que estén activos con listas de permitidos estrictas, niveles mínimos de confianza y alertas de Slack; mantenga el sistema kube bloqueado.
- Siempre: interruptor de apagado ensayado; Ruta del código CR para mutaciones riesgosas; Herramientas MCP detrás de la autenticación (consulte nuestra informe de seguridad agente).
9. Lista de verificación de producción
- ☐ Autenticación habilitada para cualquier panel accesible en red.
- ☐ AutoPilot se inicia en funcionamiento en seco; activo sólo después de la revisión del libro mayor.
- ☐ La lista de bloqueo de espacios de nombres incluye espacios de nombres compartidos/del sistema.
- ☐ Los límites por hora y los tiempos de reutilización se establecen por debajo de los umbrales de tormenta.
- ☐ Ollama (o ruta LLM aprobada) monitoreado a través del estado de AI.
- ☐ Integración de holgura o buscapersonas para anomalías de alta gravedad.
- ☐ GitOps todavía posee el estado deseado: AutoPilot es un reparador táctico, no un sustituto de Argo CD/Flux.
- ☐ Lanzamientos de estrellas y pistas: github.com/bwalia/kubepilot.
10. ¿Por qué Workstation incluye este código abierto?
Workstation crea plataformas de automatización para equipos de operaciones reales. KubePilot es nuestra apuesta por que AIOps solo funciona cuando el diagnóstico y la remediación comparten un rastro de evidencia – y cuando la automatización está activada como lo haría un SRE humano, se produciría un cambio. Lo publicamos en código abierto para que los equipos de la plataforma puedan ejecutarlo en sus propias redes, ampliar los runbooks y conectar agentes MCP sin depender de un proveedor.
Empezar en kubepilot.org, clonar el repositorioy mira el tutorial en YouTube. Resumen complementario: publicación de blog.