Turbocompresor LLMs
PagedAttention, vLLM, Self-Debugging, PowerInfer y EG-MLA: cómo escalar los agentes LLM sin desperdiciar la caché KV de GPU
Workstationsobre cómo potenciar modelos con lenguajes grandes en producción: PagedAttention, vLLM, Self-Debugging, PowerInfer y EG-MLA, con las ventajas y desventajas que realmente aparecen en los GPU. Análisis profundo: artículo extenso sobre. Cartilla:LLMs explicado + Kubernetes.
: qué es realmente un LLM
Contexto de, no una demostración del producto:Introducción a los modelos de lenguajes grandes(Andrej Karpathy). Combínelo con nuestra guíaen inglés sencillo LLM + Kubernetes.
El problema de escala
LLMs desbloqueó la generación y la IA conversacional, e inmediatamente se convirtió en un problema de servicio. Cada paso de decodificación agrega claves y valores a una caché KV que crece con la longitud de la secuencia y el tamaño del lote. Los motores ingenuos reservan previamente enormes losas contiguas. La mayor parte de esa memoria permanece inactiva mientras otras solicitudes esperan. El rendimiento colapsa a pesar de que el GPU parece "lleno".
PagedAttention: memoria virtual para atención
PagedAttention (Kwon et al., SOSP 2023) trata la caché KV como paginación del sistema operativo: bloques de tamaño fijo, una tabla de bloques por solicitud, páginas físicas no contiguas[arXiv:2309.06180]. El núcleo reúne bloques en el momento de la atención. Aún debe ajustar el tamaño del bloque, la longitud máxima del modeloy la jerarquía de caché(descarga GPU HBM vs CPU vs caché de prefijo). Los bloques demasiado pequeños añaden una sobrecarga de mapeo; Los bloques demasiado grandes reintroducen residuos.
vLLM: desperdicio casi nulo al servicio de
vLLM es el sistema de servicio construido alrededor de PagedAttention. Su objetivo es un desperdicio de KV cercano a cero, procesamiento por lotes continuo y una superficie HTTP compatible con OpenAI. En producción, observe tres cosas: (1)gpu_memory_utilizationfrente a OOM, (2) tiempo hasta el primer token frente a tokens de decodificación, (3) si el almacenamiento en caché de prefijo/indicador cambia las respuestas para su conjunto de evaluación. El almacenamiento en caché mejora el rendimiento; no está libre de efectos de corrección y latencia de cola.
from vllm import LLM, SamplingParams llm = LLM(model="meta-llama/Llama-3.1-8B-Instruct", gpu_memory_utilization=0.90) params = SamplingParams(temperature=0.2, max_tokens=256) outs = llm.generate(["Explain PagedAttention in one paragraph."], params) print(outs[0].outputs[0].text)
Ese es el uso real de vLLM. Una llamada Hugging Face BERTforward()es, noPagedAttention; no confunda los logits clasificadores con el servicio KV paginado.
Self-Debugging: bucles de calidad con un presupuesto de latencia
Self-Debugging (Chen et al.) enseña a un modelo a corregir sus propios programas predichos a partir de rastros de pocos disparos, igualando o superando líneas de base que emiten 10 veces más candidatos[arXiv:2304.05128]. Para los agentes, eso es oro, hasta que se acumulan las rondas de retroalimentación. Limite la cantidad de mensajes de depuración, registre cada ronda y cierre el error a un humano o a un modelo especializado más pequeño cuando se acabe el presupuesto.
Watch: contexto de servicio e inferencia
Charla contextual sobre el servicio rápido de LLM; no es una demostración oficial de Workstation. Combínelo con el papel vLLM ydocs.vllm.ai.
PowerInfer: tokens en un único y grueso GPU
PowerInfer divide las neuronas frías y calientes para que un consumidor GPU más CPU pueda generar tokens rápidamente. Cifras informadas:13,20 tokens/s promedio, pico29,08 tokens/sen un NVIDIA RTX 4090, hasta11,69xfrente a llama.cpp manteniendo la precisión[PowerInfer]. A escala de flota, aún necesita ubicación: qué capas permanecen en GPU, cómo se fragmenta entre nodos y si el perfil de localidad deque le indica sucoincide con los modelos del papel.
EG-MLA: reduce el KV sin destrozar el banco
EG-MLA (atención latente de cabezales múltiples con activación integrada) informa quetiene una reducción de caché de KV superior al 91,6 %.frente a atención de cabezales múltiples con degradación insignificante, ahorros adicionales frente a MLA (hasta 59,9 %) y mejores puntuaciones en conjuntos de razonamiento, escalados más allá de los parámetros de 1B[documento de EG-MLA]. Trátelo como una elección de arquitectura, no como una señal directa en un punto de control vLLM congelado: valide su arnés de evaluación antes de celebrar el gráfico de memoria.
Armado
Combine PagedAttention + vLLM para servicio de clúster, PowerInfer cuando la caja es una estación de trabajo GPU, Self-Debugging agentes de codificación internos con un límite de redondeo estricto y EG-MLA cuando controla la familia de modelos. El servicio distribuido añade complejidad: paralelismo KV, división de precarga/decodificación y escalado automático que no altera las tablas de páginas. Medida. Luego escriba el ADR.
Leer siguiente
- Artículo extenso: perillas, modos de falla, notas de Kubernetes.
- LLMs explicado + ejecute el suyo propio en Kubernetes
- Muse Glimmer / agentes locales·Laboratorio de IA empresarial
Publicado porWorkstation.