Workstation Logo
ผลิตภัณฑ์
AI LabsOpenAI AgentsClaude AgentsGrok BotWorkstation CRM (WSL CRM)การตลาดผลิตภัณฑ์ทั้งหมด
โซลูชัน AI
เวิร์กสเตชัน AIAI SME PackagesAI ส่วนตัวคลัสเตอร์ GPUEdge AIแล็บ AI องค์กรAI ตามอุตสาหกรรม
บริการ
Platform ModernisationDigital EngineeringData Foundations & AIAutonomous Operationsที่ปรึกษา AIระบบอัตโนมัติ DevOpsความมั่นคงปลอดภัยไซเบอร์การพัฒนาซอฟต์แวร์การสร้างเอเจนต์การตั้งค่า MLOps
เกี่ยวกับเรา
พาร์ทเนอร์เรื่องราวลูกค้า
บทความ
เอกสาร
WSL ProxyRing PromoterWSL VaultJobshoutSysOps 24/7
บล็อก
ติดต่อเราLogin
Workstation

เวิร์กสเตชัน AI ซอฟต์แวร์มัลติเอเจนต์ AI โครงสร้างพื้นฐาน GPU และโซลูชันเอเจนต์อัจฉริยะสำหรับธุรกิจยุคใหม่

ติดต่อเรา

โซลูชัน AI

เวิร์กสเตชัน AIAI SME PackagesAI ส่วนตัวคลัสเตอร์ GPUEdge AIแล็บ AI องค์กรAI ตามอุตสาหกรรม

ผลิตภัณฑ์

ผลิตภัณฑ์ทั้งหมดWSL CRM และ ERPการตลาดOpenAI AgentsWSL ProxyRing PromoterWSL VaultJobshoutSysOps 24/7

บริษัท

เกี่ยวกับเราทำไมต้อง Workstationพาร์ทเนอร์เรื่องราวลูกค้าราคาติดต่อ

แหล่งข้อมูล

บทความเอกสารประกอบบล็อกค้นหาแผนผังเว็บไซต์
สำนักงานสหราชอาณาจักร
77-79 Marlowes, Hemel Hempstead HP1 1LFเส้นทาง - ออกทางแยกที่ 20 จาก M25 Outer Londonเลขทะเบียนบริษัท: 11641870จ. - ศ.: 9:00 - 18:00 น. GMT
+44 7515 356 146
สำนักงานเบลเยียม
Workstation SRL, Rue Vanderkindere 34, 1180 Uccle, BrusselsBE 0751.518.683จ. - ศ.: 9:00 - 18:00 น. CET
+32 492 45 67 46
สำนักงานอินเดีย
#159 Sector 9, Pocket 1, DDA Flats, 110077 Dwarka, New Delhi
+91 98881 98841

© 2026 Workstation AI สงวนลิขสิทธิ์

ความเป็นส่วนตัวคุกกี้ข้อกำหนดการให้บริการแผนผังเว็บไซต์

Loading blog...

Home / Blog
AILLMMachine LearningGPUMLOpsPerformanceKubernetes

เทอร์โบชาร์จเจอร์ LLMs

PagedAttention, vLLM, Self-Debugging, PowerInfer และ EG-MLA — วิธีปรับขนาดเอเจนต์ LLM โดยไม่เปลืองแคช GPU KV

Balinder Walia30 สิงหาคม 25692 min read

Workstationเกี่ยวกับวิธีการเทอร์โบชาร์จโมเดลภาษาขนาดใหญ่ในการผลิต: PagedAttention, vLLM, Self-Debugging, PowerInfer และ EG-MLA — พร้อมข้อดีข้อเสียที่จะแสดงบน GPU จริงๆ เจาะลึก: บทความยาวไพรเมอร์:LLMs อธิบาย + Kubernetes

Turbocharging LLMs cover

สิ่งสำคัญที่สุด ปริมาณงานตายเมื่อแฟรกเมนต์แคช KV เพจแคชเหมือนกับ OS (PagedAttention ภายใน vLLM) เลือกกลไกโทเค็นที่ตรงกับกล่อง (PowerInfer บน GPU สำหรับผู้ใช้ไขมันสูง, vLLM บนคลัสเตอร์ที่ให้บริการ) ลดความสนใจเมื่อสถาปัตยกรรมอนุญาต (EG-MLA) และ cap agent debug loops เพื่อให้คุณภาพไม่ซื้อเวลาแฝงที่ไม่จำกัด

Watch: LLM แท้จริงแล้วคือ

บริบท

ไม่ใช่การสาธิตผลิตภัณฑ์:ข้อมูลเบื้องต้นเกี่ยวกับรุ่นภาษาขนาดใหญ่(Andrej Karpathy) จับคู่กับคู่มือภาษาอังกฤษธรรมดา LLM + Kubernetesของเรา

ปัญหาการปรับขนาด

LLMs ปลดล็อก AI การสนทนาและการสร้าง จากนั้นจึงกลายเป็นปัญหาการให้บริการทันที แต่ละขั้นตอนการถอดรหัสจะผนวกคีย์และค่าเข้ากับแคช KV ที่ขยายตามความยาวของลำดับและขนาดแบตช์ เครื่องยนต์ไร้เดียงสาจะจองแผ่นคอนกรีตที่ต่อเนื่องกันขนาดใหญ่ไว้ล่วงหน้า หน่วยความจำส่วนใหญ่นั้นไม่ได้ใช้งานในขณะที่คำขออื่นรออยู่ ปริมาณงานลดลงแม้ว่า GPU จะดู "เต็ม"

PagedAttention: หน่วยความจำเสมือนเพื่อความสนใจ

PagedAttention maps logical token pages to physical GPU KV blocks

PagedAttention (Kwon และคณะ, SOSP 2023) ปฏิบัติต่อแคช KV เช่น การเพจ OS: บล็อกขนาดคงที่, ตารางบล็อกต่อคำขอ, หน้าทางกายภาพที่ไม่ต่อเนื่องกัน[arXiv:2309.06180]เคอร์เนลรวบรวมบล็อกในเวลาที่สนใจ คุณยังคงต้องปรับแต่งขนาดบล็อก,ความยาวโมเดลสูงสุดและลำดับชั้นแคช(GPU HBM กับ CPU ออฟโหลดเทียบกับแคชคำนำหน้า) บล็อกที่เล็กเกินไปจะเพิ่มค่าใช้จ่ายในการทำแผนที่ บล็อกขนาดใหญ่เกินไปจะทำให้เกิดขยะอีกครั้ง

vLLM: ของเสียเกือบเป็นศูนย์ที่ให้บริการ

vLLM คือระบบการให้บริการที่สร้างขึ้นโดยใช้ PagedAttention โดยกำหนดเป้าหมายของเสีย KV ที่เกือบเป็นศูนย์ การแบ่งกลุ่มอย่างต่อเนื่อง และพื้นผิว HTTP ที่เข้ากันได้กับ OpenAI ในการผลิต ให้ดูสามสิ่ง: (1)gpu_memory_utilizationกับ OOM, (2) โทเค็นเวลาถึงโทเค็นแรกเทียบกับโทเค็นการถอดรหัส/วินาที (3) ว่าการแคชคำนำหน้า / พรอมต์จะเปลี่ยนคำตอบสำหรับชุดการประเมินของคุณหรือไม่ การแคชคือการชนะปริมาณงาน มันไม่ได้ปราศจากความถูกต้องและผลกระทบจากความล่าช้าหาง

from vllm import LLM, SamplingParams

llm = LLM(model="meta-llama/Llama-3.1-8B-Instruct", gpu_memory_utilization=0.90)
params = SamplingParams(temperature=0.2, max_tokens=256)
outs = llm.generate(["Explain PagedAttention in one paragraph."], params)
print(outs[0].outputs[0].text)

นั่นคือการใช้งาน vLLM จริง ๆ การเรียก Hugging Face BERTforward()คือไม่ใช่PagedAttention — อย่าสับสนกับบันทึกของตัวแยกประเภทกับการแสดงเพจ KV

Self-Debugging: ลูปคุณภาพพร้อมงบประมาณแฝง

Self-Debugging (Chen และคณะ) สอนแบบจำลองเพื่อแก้ไขโปรแกรมที่คาดการณ์ไว้ของตัวเองจากการติดตามแบบไม่กี่ช็อต การจับคู่หรือการเอาชนะเส้นพื้นฐานที่ปล่อยผู้สมัครมากกว่า 10 เท่า[arXiv:2304.05128]สำหรับตัวแทน นั่นคือทองคำ — จนกว่าผลตอบรับจะรวมกัน จำกัดจำนวนข้อความแก้ไขข้อบกพร่อง บันทึกในแต่ละรอบ และปิดความล้มเหลวให้กับบุคคลหรือโมเดลผู้เชี่ยวชาญที่มีขนาดเล็กลงเมื่องบประมาณหมด

Watch: การแสดงและการอนุมานบริบท

พูดคุยตามบริบทเกี่ยวกับการให้บริการ LLM ที่รวดเร็ว — ไม่ใช่การสาธิต Workstation อย่างเป็นทางการ จับคู่กับกระดาษ vLLM และdocs.vllm.ai

PowerInfer: โทเค็นบน GPU

ไขมันตัวเดียว

PowerInfer แยกเซลล์ประสาทร้อน/เย็น ดังนั้นผู้บริโภค GPU บวก CPU จึงสามารถสร้างโทเค็นได้อย่างรวดเร็ว ตัวเลขที่รายงาน:13.20 โทเค็น/วินาทีโดยเฉลี่ย, จุดสูงสุด29.08 โทเค็น/วินาทีบน NVIDIA RTX 4090 หนึ่งตัว สูงสุด11.69xเทียบกับ llama.cpp ในขณะที่ยังคงความแม่นยำ[PowerInfer]ในระดับกลุ่มยานพาหนะ คุณยังคงต้องการตำแหน่ง: เลเยอร์ใดที่อยู่บน GPU วิธีที่คุณแบ่งส่วนข้ามโหนด และโปรไฟล์ตำแหน่งท้องถิ่นของข้อความแจ้งของคุณตรงกับรุ่นของกระดาษหรือไม่

EG-MLA: ลดขนาด KV โดยไม่ทำลายม้านั่ง

EG-MLA (ความสนใจแฝงแบบหลายหัวที่มีการฝังรั้วรอบขอบชิด) รายงานมากกว่า 91.6% การลดแคช KVเทียบกับความสนใจแบบหลายหัวที่มีการลดลงเล็กน้อย การประหยัดเพิ่มเติมเทียบกับ MLA (สูงถึง 59.9%) และคะแนนที่ดีกว่าในชุดการให้เหตุผล โดยปรับขนาดพารามิเตอร์ 1B ที่ผ่านมา[กระดาษ EG-MLA]ถือว่าเป็นทางเลือกทางสถาปัตยกรรม ไม่ใช่ธงแบบดรอปอินบนจุดตรวจสอบ vLLM ที่ค้าง — ตรวจสอบสายรัดประเมินผลของคุณก่อนที่คุณจะเฉลิมฉลองกราฟหน่วยความจำ

vLLM, PowerInfer, Self-Debugging and EG-MLA stack

เอามาต่อกัน

รวม PagedAttention + vLLM สำหรับการให้บริการคลัสเตอร์, PowerInfer เมื่อกล่องนั้นเป็นเวิร์กสเตชัน GPU, Self-Debugging ภายในเอเจนต์การเข้ารหัสที่มีขีดจำกัดแบบฮาร์ดรอบ และ EG-MLA เมื่อคุณควบคุมตระกูลโมเดล การให้บริการแบบกระจายจะเพิ่มความซับซ้อน: ความขนานของ KV, การแยกการเติมล่วงหน้า/การถอดรหัส และการปรับขนาดอัตโนมัติที่ไม่กระทบกับตารางหน้า วัด. จากนั้นเขียน ADR

อ่าน

ถัดไป
  1. บทความแบบยาว— ปุ่มหมุน, โหมดความล้มเหลว, บันทึกย่อ Kubernetes
  2. LLMs อธิบาย + รันของคุณเองบน Kubernetes
  3. Muse Glimmer / ตัวแทนท้องถิ่น·Enterprise AI Lab

เผยแพร่โดยWorkstation.