Workstation Logo
ผลิตภัณฑ์
AI LabsOpenAI AgentsClaude AgentsGrok BotWorkstation CRM (WSL CRM)การตลาดผลิตภัณฑ์ทั้งหมด
โซลูชัน AI
เวิร์กสเตชัน AIAI SME PackagesAI ส่วนตัวคลัสเตอร์ GPUEdge AIแล็บ AI องค์กรAI ตามอุตสาหกรรม
บริการ
Platform ModernisationDigital EngineeringData Foundations & AIAutonomous Operationsที่ปรึกษา AIระบบอัตโนมัติ DevOpsความมั่นคงปลอดภัยไซเบอร์การพัฒนาซอฟต์แวร์การสร้างเอเจนต์การตั้งค่า MLOps
เกี่ยวกับเรา
พาร์ทเนอร์เรื่องราวลูกค้า
บทความ
เอกสาร
WSL ProxyRing PromoterWSL VaultJobshoutSysOps 24/7
บล็อก
ติดต่อเราLogin
Workstation

เวิร์กสเตชัน AI ซอฟต์แวร์มัลติเอเจนต์ AI โครงสร้างพื้นฐาน GPU และโซลูชันเอเจนต์อัจฉริยะสำหรับธุรกิจยุคใหม่

ติดต่อเรา

โซลูชัน AI

เวิร์กสเตชัน AIAI SME PackagesAI ส่วนตัวคลัสเตอร์ GPUEdge AIแล็บ AI องค์กรAI ตามอุตสาหกรรม

ผลิตภัณฑ์

ผลิตภัณฑ์ทั้งหมดWSL CRM และ ERPการตลาดOpenAI AgentsWSL ProxyRing PromoterWSL VaultJobshoutSysOps 24/7

บริษัท

เกี่ยวกับเราทำไมต้อง Workstationพาร์ทเนอร์เรื่องราวลูกค้าราคาติดต่อ

แหล่งข้อมูล

บทความเอกสารประกอบบล็อกค้นหาแผนผังเว็บไซต์
สำนักงานสหราชอาณาจักร
77-79 Marlowes, Hemel Hempstead HP1 1LFเส้นทาง - ออกทางแยกที่ 20 จาก M25 Outer Londonเลขทะเบียนบริษัท: 11641870จ. - ศ.: 9:00 - 18:00 น. GMT
+44 7515 356 146
สำนักงานเบลเยียม
Workstation SRL, Rue Vanderkindere 34, 1180 Uccle, BrusselsBE 0751.518.683จ. - ศ.: 9:00 - 18:00 น. CET
+32 492 45 67 46
สำนักงานอินเดีย
#159 Sector 9, Pocket 1, DDA Flats, 110077 Dwarka, New Delhi
+91 98881 98841

© 2026 Workstation AI สงวนลิขสิทธิ์

ความเป็นส่วนตัวคุกกี้ข้อกำหนดการให้บริการแผนผังเว็บไซต์

Loading blog...

Home / Blog
AIDevOps

อธิบายระบบปฏิบัติการ DGX: ระบบปฏิบัติการของ NVIDIA สำหรับ AI

อะไรทำให้ DGX OS แตกต่างจาก Standard Linux

Balinder Walia21 มีนาคม 25693 min read

DGX OS คืออะไร?

DGX OS คือระบบปฏิบัติการที่สร้างขึ้นโดยเฉพาะของ NVIDIA สำหรับโครงสร้างพื้นฐาน AI บน Ubuntu Linux มันก้าวไปไกลกว่าการแจกจ่ายแบบมาตรฐานโดยการผสานรวมซอฟต์แวร์ AI ที่ได้รับการปรับให้เหมาะสมที่สุด คุณลักษณะด้านความปลอดภัยระดับองค์กร และเครื่องมือการจัดการคลัสเตอร์ไว้ในแพลตฟอร์มเดียวที่เหนียวแน่น เดิมทีมีให้บริการเฉพาะบนฮาร์ดแวร์ DGX ของ NVIDIA เท่านั้น DGX OS ได้ขยายการเข้าถึงและตอนนี้สนับสนุนระบบพันธมิตรที่เลือก ซึ่งสะท้อนถึงความทะเยอทะยานของ NVIDIA ที่จะกลายเป็นแพลตฟอร์มเริ่มต้นสำหรับการประมวลผล AI ในทุกขนาด

สำหรับวิศวกร AI DGX OS แก้ปัญหาที่เกิดขึ้นอย่างต่อเนื่อง นั่นคือช่องว่างระหว่างการติดตั้งระบบปฏิบัติการและการมีสภาพแวดล้อมที่พร้อมสำหรับการผลิตสำหรับการฝึกอบรมและการอนุมาน บน Ubuntu มาตรฐาน การกำหนดค่าไดรเวอร์ CUDA, cuDNN, รันไทม์ของคอนเทนเนอร์, โครงสร้างเครือข่าย และพื้นที่เก็บข้อมูลอาจใช้เวลาหลายวันในด้านวิศวกรรมและทำให้เกิดปัญหาความเข้ากันได้เล็กน้อย DGX OS ขจัดความขัดแย้งนี้โดยสิ้นเชิง

ชุดซอฟต์แวร์ AI ที่กำหนดค่าไว้ล่วงหน้า

กองซอฟต์แวร์ DGX แอพพลิเคชั่นเอไอ การฝึกอบรม LLM · คอมพิวเตอร์วิทัศน์ · NLP · ระบบผู้แนะนำ กรอบงาน AI PyTorch · TensorFlow · JAX · RAPIDS · เครื่องยนต์หม้อแปลงไฟฟ้า รันไทม์ของคอนเทนเนอร์ นักเทียบท่า · Enroot · ชุดเครื่องมือคอนเทนเนอร์ NVIDIA · แค็ตตาล็อก NGC ระบบปฏิบัติการ DGX (บน Ubuntu) CUDA · cuDNN · TensorRT · NCCL · บูตอย่างปลอดภัย · ไดรเวอร์ ดีจีเอ็กซ์ ฮาร์ดแวร์ 8× H100/B200 GPUs · NVSwitch · InfiniBand · อุปกรณ์จัดเก็บข้อมูล NVMe ▲ ระดับนามธรรม ▼

หัวใจสำคัญของ DGX OS คือสแต็กซอฟต์แวร์ AI ที่ได้รับการกำหนดค่าล่วงหน้าและตรวจสอบความถูกต้องแล้ว ทุกส่วนประกอบได้รับการทดสอบร่วมกันและรับประกันว่าจะทำงานได้อย่างมีประสิทธิภาพสูงสุดบนฮาร์ดแวร์ที่รองรับ

ชุดเครื่องมือ CUDA: DGX OS มาพร้อมกับ CUDA ที่เสถียรล่าสุด ซึ่งได้รับการกำหนดค่าอย่างสมบูรณ์ด้วยตัวแปรสภาพแวดล้อม เส้นทางไลบรารี และชุดเครื่องมือคอมไพเลอร์ เวอร์ชันของไดรเวอร์จะถูกจับคู่กับเคอร์เนลและทดสอบกับรุ่น GPU เฉพาะในระบบ ไม่มีการติดตั้งไดรเวอร์ด้วยตนเอง ไม่มีการแก้ไขข้อบกพร่องเวอร์ชันไม่ตรงกัน และไม่มีลิงก์สัญลักษณ์ที่เสียหาย

cuDNN: ไลบรารี CUDA Deep Neural Network ได้รับการติดตั้งไว้ล่วงหน้าและปรับแต่งสำหรับสถาปัตยกรรม GPU ที่มีอยู่ในระบบ DGX OS มีโปรไฟล์การปรับแต่งอัตโนมัติของ cuDNN สำหรับสถาปัตยกรรมเครือข่ายทั่วไป ซึ่งหมายความว่าการดำเนินการ Convolution หรือ Attention ครั้งแรกของคุณจะทำงานด้วยความเร็วที่เกือบจะเหมาะสมที่สุดโดยไม่ต้องมีการทดลองอุ่นเครื่อง

TensorRT: กลไกการเพิ่มประสิทธิภาพการอนุมานของ NVIDIA มาพร้อมกับปลั๊กอินที่สร้างไว้ล่วงหน้าสำหรับสถาปัตยกรรมโมเดลยอดนิยม DGX OS กำหนดค่า TensorRT ให้ใช้หน่วยความจำ GPU ที่มีอยู่อย่างมีประสิทธิภาพ ช่วยให้สามารถอนุมาน INT8 และ FP16 ได้ทันทีด้วยเครื่องมือสอบเทียบที่พร้อมใช้งาน

ปปช.: NVIDIA Collective Communications Library มีความสำคัญอย่างยิ่งต่อการฝึกฝนแบบหลาย GPU และแบบหลายโหนด DGX OS กำหนดค่า NCCL ด้วยการตั้งค่าที่รับรู้ถึงโทโพโลยีที่ตรงกับแฟบริค NVLink, NVSwitch และ InfiniBand ของระบบ บนระบบ DGX H100 ที่มี GPU แปดตัวเชื่อมต่อผ่าน NVSwitch นั้น NCCL จะได้รับแบนด์วิดท์ที่ใกล้เคียงตามทฤษฎีสูงสุดสำหรับการดำเนินการแบบลดขนาดทั้งหมดโดยไม่ต้องปรับแต่งด้วยตนเอง

คอนเทนเนอร์รันไทม์และ NGC

DGX OS ใช้คอนเทนเนอร์เป็นกลไกการใช้งานหลักสำหรับปริมาณงาน AI NVIDIA Container Toolkit ได้รับการติดตั้งไว้ล่วงหน้า ช่วยให้ Docker และรันไทม์ที่เข้ากันได้กับ OCI อื่นๆ สามารถเข้าถึง GPU ได้อย่างโปร่งใส เมื่อคุณเรียกใช้คอนเทนเนอร์ อุปกรณ์ GPU ไดรเวอร์ และไลบรารีจะถูกต่อเชื่อมภายในเนมสเปซของคอนเทนเนอร์โดยอัตโนมัติ

ระบบนี้ได้รับการบูรณาการอย่างแนบแน่นกับ NVIDIA NGC ซึ่งเป็นแค็ตตาล็อกของคอนเทนเนอร์ที่ปรับให้เหมาะสม GPU สำหรับเฟรมเวิร์ก AI หลักทุกรายการ คอนเทนเนอร์ NGC สำหรับ PyTorch, TensorFlow, JAX, RAPIDS และเครื่องมืออื่นๆ อีกหลายสิบรายการได้รับการทดสอบทุกเดือนกับ DGX OS และเผยแพร่พร้อมเกณฑ์มาตรฐานประสิทธิภาพ การดึงและเรียกใช้คอนเทนเนอร์ NGC บน DGX OS เป็นคำสั่งเดียว:

docker run --gpus all nvcr.io/nvidia/pytorch:24.03-py3

คอนเทนเนอร์นี้ประกอบด้วย PyTorch ที่คอมไพล์ด้วยเวอร์ชัน CUDA และ cuDNN ที่เหมาะสมที่สุดสำหรับระบบโฮสต์ พร้อมด้วย Apex สำหรับการฝึกแบบผสมความแม่นยำ Transformer Engine สำหรับการคำนวณความสนใจอย่างมีประสิทธิภาพ และยูทิลิตีการฝึกอบรมแบบกระจายที่กำหนดค่าไว้ล่วงหน้า

ตัวจัดการคำสั่งฐานสำหรับการจัดกลุ่มคลัสเตอร์

สถาปัตยกรรมคลัสเตอร์ DGX DGX โหนด 1 8× H100 GPU 640GB HBM3 ระบบปฏิบัติการ DGX DGX โหนด 2 8× H100 GPU 640GB HBM3 ระบบปฏิบัติการ DGX DGX โหนด 3 8× H100 GPU 640GB HBM3 ระบบปฏิบัติการ DGX DGX โหนด 4 8× H100 GPU 640GB HBM3 ระบบปฏิบัติการ DGX ผ้า InfiniBand NDR 400Gb/s RDMA · GPUDirect · การสื่อสารหลายโหนดที่มีความหน่วงต่ำ ตัวจัดการคำสั่งฐาน สเลม / Kubernetes · การจัดตารางงาน พื้นที่เก็บข้อมูลที่ใช้ร่วมกัน ความมันวาว / GPFS · I/O ความเร็วสูง 32× H100 GPUs · รวม 2.56TB HBM3 · 31,680 FP16 TFLOPS

สำหรับองค์กรที่ใช้ระบบ DGX หลายระบบ DGX OS จะทำงานร่วมกับ Base Command Manager (เดิมคือ Bright Cluster Manager) เลเยอร์การประสานนี้จัดให้มีการกำหนดเวลางานผ่าน Slurm หรือ Kubernetes การจัดสรรทรัพยากรแบบหลายโหนด การจัดการผู้ใช้และกลุ่ม และการตรวจสอบสภาพทั่วทั้งคลัสเตอร์

Base Command Manager จัดการงานที่ซับซ้อนในการประสานงานงานการฝึกอบรมแบบหลายโหนด เมื่อคุณส่งงานการฝึกอบรมที่ต้องใช้ 32 GPU บนโหนด DGX สี่โหนด ผู้จัดการจะจัดสรรทรัพยากร กำหนดค่าแฟบริคเครือข่าย เรียกใช้กระบวนการในแต่ละโหนด และตรวจสอบความล้มเหลว หาก GPU พบข้อผิดพลาด ผู้จัดการสามารถตรวจสอบสถานะการฝึกและรีสตาร์ทงานด้วยฮาร์ดแวร์ที่แข็งแรง

สำหรับทีมที่ชอบ Kubernetes นั้น DGX OS รองรับ NVIDIA GPU Operator และ Network Operator ซึ่งเปิดเผย GPU และการเชื่อมต่อระหว่างกันความเร็วสูงเป็นทรัพยากร Kubernetes ช่วยให้ทีมแพลตฟอร์มสามารถจัดเตรียมโครงสร้างพื้นฐาน AI แบบบริการตนเองผ่าน Kubernetes API มาตรฐาน ในขณะที่ DGX OS จัดการกับความซับซ้อนเฉพาะของฮาร์ดแวร์ที่อยู่ด้านล่าง

คุณสมบัติด้านความปลอดภัย

ระบบ AI ระดับองค์กรจัดการข้อมูลที่ละเอียดอ่อนและทรัพยากรการประมวลผลราคาแพง ทำให้การรักษาความปลอดภัยเป็นข้อกังวลอันดับหนึ่งใน DGX OS

บูตอย่างปลอดภัย: DGX OS ตรวจสอบความสมบูรณ์ของห่วงโซ่การบูตตั้งแต่เฟิร์มแวร์ผ่านเคอร์เนลไปจนถึงพื้นที่ผู้ใช้ ทุกส่วนประกอบได้รับการเซ็นชื่อแบบเข้ารหัส เพื่อป้องกันไม่ให้โหลดเคอร์เนลหรือรูทคิทที่ถูกดัดแปลง สิ่งนี้มีความสำคัญอย่างยิ่งในสภาพแวดล้อมที่ใช้ร่วมกันซึ่งหลายทีมเข้าถึงฮาร์ดแวร์เดียวกัน

พื้นที่เก็บข้อมูลที่เข้ารหัส: การเข้ารหัสทั้งดิสก์พร้อมใช้งานทันทีตั้งแต่แกะกล่อง ปกป้องข้อมูลที่เหลือบนทั้งไดรฟ์ OS และพื้นที่จัดเก็บ NVMe ความเร็วสูง การจัดการคีย์ทำงานร่วมกับระบบองค์กร เช่น HashiCorp Vault และโมดูลความปลอดภัยของฮาร์ดแวร์

การแยกเครือข่าย: DGX OS รองรับนโยบายเครือข่ายแบบละเอียดที่แยกงานการฝึกอบรมออกจากกันและจากการรับส่งข้อมูลการจัดการ การรับส่งข้อมูล RDMA โดยตรง GPU จะไหลผ่านพาร์ติชัน InfiniBand เฉพาะ ช่วยป้องกันข้อมูลรั่วไหลระหว่างผู้เช่าบนคลัสเตอร์ที่ใช้ร่วมกัน

การบันทึกการตรวจสอบ: การดำเนินการด้านการดูแลระบบทั้งหมด การจัดสรร GPU และการเปิดตัวคอนเทนเนอร์จะถูกบันทึกไว้ในเส้นทางการตรวจสอบที่ป้องกันการงัดแงะ บันทึกเหล่านี้ผสานรวมกับแพลตฟอร์ม SIEM มาตรฐานสำหรับการตรวจสอบการปฏิบัติตามข้อกำหนด

การปรับแต่งประสิทธิภาพนอกกรอบ

DGX OS มีการเพิ่มประสิทธิภาพหลายร้อยรายการ ซึ่งผู้ดูแลระบบที่เชี่ยวชาญจะใช้เวลาหลายสัปดาห์ในการดำเนินการด้วยตนเอง เคอร์เนลได้รับการกำหนดค่าด้วยการตั้งค่าตัวควบคุม CPU ที่เหมาะสมที่สุด การจัดสรรหน่วยความจำ NUMA-aware และพารามิเตอร์สแต็กเครือข่ายที่ได้รับการปรับแต่ง โหมดคงอยู่ GPU ถูกเปิดใช้งานตามค่าเริ่มต้น ซึ่งช่วยลดเวลาแฝงในการเริ่มต้นที่รบกวนเวิร์กโฟลว์การพัฒนาบน Linux มาตรฐาน หน้าขนาดใหญ่ได้รับการจัดสรรไว้ล่วงหน้าสำหรับการแมปหน่วยความจำ GPU IRQ affinity ถูกตั้งค่าให้ลดโอเวอร์เฮด CPU ในระหว่างการถ่ายโอนข้อมูล

ผลลัพธ์สามารถวัดได้ การเปรียบเทียบเกณฑ์มาตรฐานแสดงให้เห็นอย่างสม่ำเสมอว่า DGX OS ให้ปริมาณงานการฝึกอบรมที่สูงกว่าห้าถึงสิบห้าเปอร์เซ็นต์เมื่อเทียบกับฮาร์ดแวร์ตัวเดียวกันที่ใช้งาน Ubuntu พร้อมไดรเวอร์ที่ติดตั้งด้วยตนเอง ความแตกต่างที่ประกอบขึ้นจากการฝึกอบรมหลายวันทำให้ประหยัดเวลาและต้นทุนได้อย่างมาก

ใครต้องการ DGX OS กับ Ubuntu มาตรฐาน?

DGX OS ไม่ใช่สำหรับทุกคน และการทำความเข้าใจว่าเมื่อใดจะเพิ่มมูลค่าเป็นสิ่งสำคัญ หากคุณเป็นนักวิจัยเดี่ยวที่มีการทดลอง GPU เพียงครั้งเดียวจากโน้ตบุ๊ก Jupyter Ubuntu มาตรฐานพร้อมชุดเครื่องมือ CUDA ที่ติดตั้งด้วยตนเองก็เพียงพอแล้ว โอเวอร์เฮดของฟีเจอร์ระดับองค์กรของ DGX OS จะเพิ่มความซับซ้อนโดยไม่เกิดประโยชน์

DGX OS จะน่าสนใจเมื่อคุณมี GPU หรือโหนดหลายรายการ เมื่อผู้ใช้หลายคนแชร์ฮาร์ดแวร์ เมื่อคุณต้องการสภาพแวดล้อมที่ทำซ้ำได้ทั่วทั้งการพัฒนาและการใช้งานจริง หรือเมื่อข้อกำหนดการปฏิบัติตามข้อกำหนดกำหนดคุณลักษณะด้านความปลอดภัย เช่น Secure Boot และการบันทึกการตรวจสอบ ในสถานการณ์เหล่านี้ เวลาที่ประหยัดได้ในการตั้งค่า การลดความเบี่ยงเบนของการกำหนดค่า และความอุ่นใจจากชุดซอฟต์แวร์ที่ผ่านการตรวจสอบแล้ว ถือเป็นการลงทุนที่สมเหตุสมผล

DGX OS บน Lenovo ThinkStation PGX

ในการขยายระบบนิเวศ DGX อย่างมีนัยสำคัญ NVIDIA ร่วมมือกับ Lenovo เพื่อนำ DGX OS มาสู่ ThinkStation PGX ซึ่งเป็นระบบระดับเวิร์กสเตชันที่ออกแบบมาเพื่อการพัฒนา AI ThinkStation PGX จับคู่ NVIDIA GPU กับการออกแบบเวิร์กสเตชัน การจัดการระบายความร้อน และโครงสร้างพื้นฐานการสนับสนุนของ Lenovo ในขณะที่ DGX OS มอบประสบการณ์ซอฟต์แวร์ที่ก่อนหน้านี้มีเฉพาะในฮาร์ดแวร์แบรนด์ NVIDIA เท่านั้น

ความร่วมมือครั้งนี้มีความสำคัญเนื่องจากนำความสามารถ AI ขององค์กรมาสู่ฟอร์มแฟคเตอร์ที่วางไว้ใต้โต๊ะได้ ทีมที่ต้องการซอฟต์แวร์ระดับ DGX แต่ไม่สามารถจัดวางแร็คศูนย์ข้อมูลได้ ขณะนี้สามารถติดตั้งระบบ ThinkStation PGX ในสภาพแวดล้อมสำนักงานที่มีสแต็กที่ได้รับการตรวจสอบเหมือนกันซึ่งทำงานบนระบบ DGX ในศูนย์ข้อมูล

การตั้งค่าและขั้นตอนแรก

การเริ่มต้นใช้งาน DGX OS ขึ้นอยู่กับฮาร์ดแวร์ของคุณ บนระบบ NVIDIA DGX ระบบปฏิบัติการจะถูกติดตั้งไว้ล่วงหน้า บนฮาร์ดแวร์ของคู่ค้าที่รองรับ เช่น ThinkStation PGX คุณจะติดตั้ง DGX OS จากอิมเมจ USB ที่สามารถบู๊ตได้ซึ่งให้บริการผ่านพอร์ทัลองค์กรของ NVIDIA

หลังการติดตั้ง ขั้นตอนแรกคือการลงทะเบียนระบบกับเซิร์ฟเวอร์ลิขสิทธิ์ของ NVIDIA เพื่อเปิดใช้งานการสนับสนุนระดับองค์กรและการเข้าถึง NGC ถัดไป ตรวจสอบสแต็ก GPU โดยการเรียกใช้ชุดการตรวจสอบความถูกต้องในตัว:

nvidia-smi
dgxos-validate --full

This runs a comprehensive check of drivers, libraries, interconnects, and storage. Once validation passes, pull your first NGC container and run a benchmark to confirm everything is performing as expected. From there, you can configure user accounts, set up Slurm or Kubernetes for job scheduling, and begin onboarding your AI workloads onto a platform that was built specifically to run them.