Workstation Logo
Productos
Labs de IAAgentes OpenAIAgentes ClaudeGrok BotWorkstation CRM (WSL CRM)MarketingTodos los Productos
Soluciones IA
Estaciones de Trabajo IAAI SME PackagesIA PrivadaClústeres GPUIA en el BordeLaboratorio IA EmpresarialIA por Industria
Servicios
Modernización de plataformaIngeniería digitalFundamentos de datos e IAOperaciones autónomasConsultoría de IAAutomatización DevOpsCiberseguridadDesarrollo de softwareCreación de agentesConfiguración MLOps
Sobre Nosotros
SociosHistorias de Clientes
Artículos
Documentación
WSL ProxyRing PromoterWSL VaultJobshoutSysOps 24/7
Blog
ContáctenosLogin
Workstation

Estaciones de trabajo de IA, software multiagente de IA, infraestructura de GPU y soluciones de agentes inteligentes para empresas modernas.

Contáctenos

Soluciones de IA

Estaciones de Trabajo IAAI SME PackagesIA PrivadaClústeres GPUIA en el BordeLaboratorio IA EmpresarialIA por Industria

Productos

Todos los ProductosWSL CRM y ERPMarketingAgentes OpenAIWSL ProxyRing PromoterWSL VaultJobshoutSysOps 24/7

Empresa

Sobre NosotrosPor qué WorkstationSociosHistorias de ClientesPreciosContacto

Recursos

ArtículosDocumentaciónBlogBuscarMapa del Sitio
Oficina Reino Unido
77-79 Marlowes, Hemel Hempstead HP1 1LFCómo llegar: tome la salida 20 de la M25, Outer LondonN.º de empresa: 11641870Lun - Vie: 9:00 - 18:00 GMT
+44 7515 356 146
Oficina Bélgica
Workstation SRL, Rue Vanderkindere 34, 1180 Uccle, BrusselsBE 0751.518.683Lun - Vie: 9:00 - 18:00 CET
+32 492 45 67 46
Oficina India
#159 Sector 9, Pocket 1, DDA Flats, 110077 Dwarka, New Delhi
+91 98881 98841

© 2026 Workstation AI. Todos los derechos reservados.

PrivacidadCookiesTérminos de ServicioMapa del sitio web

Loading blog...

Home / Blog
AILLMMachine LearningGPUMLOpsPerformanceKubernetes

Turbocompresor LLMs

PagedAttention, vLLM, Self-Debugging, PowerInfer y EG-MLA: cómo escalar los agentes LLM sin desperdiciar la caché KV de GPU

Balinder Walia30 de agosto de 20264 min read

Workstationsobre cómo potenciar modelos con lenguajes grandes en producción: PagedAttention, vLLM, Self-Debugging, PowerInfer y EG-MLA, con las ventajas y desventajas que realmente aparecen en los GPU. Análisis profundo: artículo extenso sobre. Cartilla:LLMs explicado + Kubernetes.

Turbocharging LLMs cover

Conclusión. El rendimiento demuere cuando la caché KV se fragmenta. Busque el caché como un sistema operativo (PagedAttention dentro de vLLM), elija un motor de token que coincida con la caja (PowerInfer en un consumidor gordo GPU, vLLM en un clúster de servicio), reduzca la atención cuando la arquitectura lo permita (EG-MLA) y limite los bucles de depuración del agente para que la calidad no compre una latencia ilimitada.
Reloj

: qué es realmente un LLM

Contexto de

, no una demostración del producto:Introducción a los modelos de lenguajes grandes(Andrej Karpathy). Combínelo con nuestra guíaen inglés sencillo LLM + Kubernetes.

El problema de escala

LLMs desbloqueó la generación y la IA conversacional, e inmediatamente se convirtió en un problema de servicio. Cada paso de decodificación agrega claves y valores a una caché KV que crece con la longitud de la secuencia y el tamaño del lote. Los motores ingenuos reservan previamente enormes losas contiguas. La mayor parte de esa memoria permanece inactiva mientras otras solicitudes esperan. El rendimiento colapsa a pesar de que el GPU parece "lleno".

PagedAttention: memoria virtual para atención

PagedAttention maps logical token pages to physical GPU KV blocks

PagedAttention (Kwon et al., SOSP 2023) trata la caché KV como paginación del sistema operativo: bloques de tamaño fijo, una tabla de bloques por solicitud, páginas físicas no contiguas[arXiv:2309.06180]. El núcleo reúne bloques en el momento de la atención. Aún debe ajustar el tamaño del bloque, la longitud máxima del modeloy la jerarquía de caché(descarga GPU HBM vs CPU vs caché de prefijo). Los bloques demasiado pequeños añaden una sobrecarga de mapeo; Los bloques demasiado grandes reintroducen residuos.

vLLM: desperdicio casi nulo al servicio de

vLLM es el sistema de servicio construido alrededor de PagedAttention. Su objetivo es un desperdicio de KV cercano a cero, procesamiento por lotes continuo y una superficie HTTP compatible con OpenAI. En producción, observe tres cosas: (1)gpu_memory_utilizationfrente a OOM, (2) tiempo hasta el primer token frente a tokens de decodificación, (3) si el almacenamiento en caché de prefijo/indicador cambia las respuestas para su conjunto de evaluación. El almacenamiento en caché mejora el rendimiento; no está libre de efectos de corrección y latencia de cola.

from vllm import LLM, SamplingParams

llm = LLM(model="meta-llama/Llama-3.1-8B-Instruct", gpu_memory_utilization=0.90)
params = SamplingParams(temperature=0.2, max_tokens=256)
outs = llm.generate(["Explain PagedAttention in one paragraph."], params)
print(outs[0].outputs[0].text)

Ese es el uso real de vLLM. Una llamada Hugging Face BERTforward()es, noPagedAttention; no confunda los logits clasificadores con el servicio KV paginado.

Self-Debugging: bucles de calidad con un presupuesto de latencia

Self-Debugging (Chen et al.) enseña a un modelo a corregir sus propios programas predichos a partir de rastros de pocos disparos, igualando o superando líneas de base que emiten 10 veces más candidatos[arXiv:2304.05128]. Para los agentes, eso es oro, hasta que se acumulan las rondas de retroalimentación. Limite la cantidad de mensajes de depuración, registre cada ronda y cierre el error a un humano o a un modelo especializado más pequeño cuando se acabe el presupuesto.

Watch: contexto de servicio e inferencia

Charla contextual sobre el servicio rápido de LLM; no es una demostración oficial de Workstation. Combínelo con el papel vLLM ydocs.vllm.ai.

PowerInfer: tokens en un único y grueso GPU

PowerInfer divide las neuronas frías y calientes para que un consumidor GPU más CPU pueda generar tokens rápidamente. Cifras informadas:13,20 tokens/s promedio, pico29,08 tokens/sen un NVIDIA RTX 4090, hasta11,69xfrente a llama.cpp manteniendo la precisión[PowerInfer]. A escala de flota, aún necesita ubicación: qué capas permanecen en GPU, cómo se fragmenta entre nodos y si el perfil de localidad deque le indica sucoincide con los modelos del papel.

EG-MLA: reduce el KV sin destrozar el banco

EG-MLA (atención latente de cabezales múltiples con activación integrada) informa quetiene una reducción de caché de KV superior al 91,6 %.frente a atención de cabezales múltiples con degradación insignificante, ahorros adicionales frente a MLA (hasta 59,9 %) y mejores puntuaciones en conjuntos de razonamiento, escalados más allá de los parámetros de 1B[documento de EG-MLA]. Trátelo como una elección de arquitectura, no como una señal directa en un punto de control vLLM congelado: valide su arnés de evaluación antes de celebrar el gráfico de memoria.

vLLM, PowerInfer, Self-Debugging and EG-MLA stack

Armado

Combine PagedAttention + vLLM para servicio de clúster, PowerInfer cuando la caja es una estación de trabajo GPU, Self-Debugging agentes de codificación internos con un límite de redondeo estricto y EG-MLA cuando controla la familia de modelos. El servicio distribuido añade complejidad: paralelismo KV, división de precarga/decodificación y escalado automático que no altera las tablas de páginas. Medida. Luego escriba el ADR.

Leer siguiente

  1. Artículo extenso: perillas, modos de falla, notas de Kubernetes.
  2. LLMs explicado + ejecute el suyo propio en Kubernetes
  3. Muse Glimmer / agentes locales·Laboratorio de IA empresarial

Publicado porWorkstation.