Workstation Logo
产品
AI 实验室OpenAI代理Claude 代理Grok BotWorkstation CRM (WSL CRM)营销全部产品
AI 解决方案
AI 工作站AI SME Packages私有 AIGPU 集群边缘 AI企业 AI 实验室按行业分类的 AI
服务
Platform ModernisationDigital EngineeringData Foundations & AIAutonomous OperationsAI 咨询DevOps 自动化网络安全软件开发智能体构建MLOps 搭建
关于我们
合作伙伴客户案例
文章
文档
WSL ProxyRing PromoterWSL VaultJobshoutSysOps 24/7
博客
联系我们Login
Workstation

面向现代企业的 AI 工作站、AI 多智能体软件、GPU 基础设施和智能代理解决方案。

联系我们

AI 解决方案

AI 工作站AI SME Packages私有 AIGPU 集群边缘 AI企业 AI 实验室按行业分类的 AI

产品

全部产品WSL CRM 与 ERP营销OpenAI代理WSL ProxyRing PromoterWSL VaultJobshoutSysOps 24/7

公司

关于我们为什么选择Workstation合作伙伴客户案例价格联系

资源

文章文档博客搜索网站地图
英国办公室
77-79 Marlowes, Hemel Hempstead HP1 1LF路线指引 — 从 M25 外环伦敦 20 号出口驶出公司编号: 11641870周一至周五:上午 9:00 - 下午 6:00 GMT
+44 7515 356 146
比利时办公室
Workstation SRL, Rue Vanderkindere 34, 1180 Uccle, BrusselsBE 0751.518.683周一至周五:上午 9:00 - 下午 6:00 CET
+32 492 45 67 46
印度办公室
#159 Sector 9, Pocket 1, DDA Flats, 110077 Dwarka, New Delhi
+91 98881 98841

© 2026 Workstation AI。保留所有权利。

隐私Cookie服务条款网站地图

Loading blog...

Home / Blog
AIDevOps

DGX操作系统解释:NVIDIA的AI操作系统

DGX 操作系统与标准 Linux 有何不同

Balinder Walia2026年3月21日2 min read

什么是 DGX 操作系统?

DGX OS是NVIDIA专门为人工智能基础设施构建的操作系统。它基于 Ubuntu Linux,将完全优化的 AI 软件堆栈、企业安全功能和集群管理工具集成到一个单一的、有凝聚力的平台中,远远超出了标准发行版。 DGX OS 最初仅在 NVIDIA 自己的 DGX 硬件上提供,现在扩大了其覆盖范围,现在支持选定的合作伙伴系统,反映了 NVIDIA 成为各种规模的 AI 计算默认平台的雄心。

对于人工智能工程师来说,DGX OS 解决了一个长期存在的问题:安装操作系统与拥有用于训练和推理的生产就绪环境之间的差距。在标准 Ubuntu 上,配置 CUDA 驱动程序、cuDNN、容器运行时、网络结构和存储可能会消耗数天的工程时间并引入微妙的兼容性问题。 DGX 操作系统完全消除了这种摩擦。

预配置的人工智能软件堆栈

DGX 软件堆栈 人工智能应用 LLM 培训 · 计算机视觉 · NLP · 推荐系统 人工智能框架 PyTorch · TensorFlow · JAX · RAPIDS · 变压器引擎 容器运行时 Docker · Enroot · NVIDIA 容器工具包 · NGC 目录 DGX 操作系统(基于 Ubuntu) CUDA · cuDNN · TensorRT · NCCL · 安全启动 · 驱动程序 DGX 硬件 8× H100/B200 GPUs · NVSwitch · InfiniBand · NVMe 存储 ▲ 抽象级别 ▼

DGX 操作系统的核心是其预先配置且经过验证的 AI 软件堆栈。每个组件都经过一起测试,并保证在支持的硬件上以最佳性能工作。

CUDA 工具包: DGX OS 附带最新的稳定 CUDA 版本,完全配置了环境变量、库路径和编译器工具链。驱动程序版本与内核匹配,并针对系统中的特定 GPU 型号进行测试。没有手动驱动程序安装,没有版本不匹配调试,也没有损坏的符号链接。

cuDNN: CUDA 深度神经网络库已预先安装并针对系统中存在的 GPU 架构进行了调整。 DGX OS 包括 cuDNN 针对常见网络架构的自动调整配置文件,这意味着您的第一个卷积或注意力操作以接近最佳的速度运行,无需预热实验。

张量RT: NVIDIA 的推理优化引擎包含在针对流行模型架构的预构建插件中。 DGX 操作系统将 TensorRT 配置为高效使用可用的 GPU 内存,从而支持开箱即用的 INT8 和 FP16 推理,并可随时运行校准工具。

国家癌症中心: NVIDIA 集体通信库对于多 GPU 和多节点训练至关重要。 DGX 操作系统使用与系统的 NVLink、NVSwitch 和 InfiniBand 结构相匹配的拓扑感知设置来配置 NCCL。在通过 NVSwitch 连接八个 GPU 的 DGX H100 系统上,NCCL 无需任何手动调整即可实现 all-reduce 操作的接近理论最大带宽。

容器运行时和 NGC

DGX操作系统使用容器作为AI工作负载的主要部署机制。预安装了 NVIDIA 容器工具包,使 Docker 和其他 OCI 兼容运行时能够透明地访问 GPU。当您运行容器时,GPU 设备、驱动程序和库会自动安装在容器命名空间内。

该系统与 NVIDIA NGC 紧密集成,NVIDIA NGC 是针对每个主要人工智能框架的 GPU 优化容器目录。适用于 PyTorch、TensorFlow、JAX、RAPIDS 和数十种其他工具的 NGC 容器每月都会针对 DGX 操作系统进行测试,并发布性能基准。在 DGX 操作系统上拉取并运行 NGC 容器只需一个命令:

docker run --gpus all nvcr.io/nvidia/pytorch:24.03-py3

该容器包括使用主机系统的最佳 CUDA 和 cuDNN 版本编译的 PyTorch,以及用于混合精度训练的 Apex、用于高效注意力计算的 Transformer Engine 以及预配置的分布式训练实用程序。

用于集群编排的基本命令管理器

DGX集群架构 DGX 节点 1 8× H100 GPUs 640GB HBM3 DGX操作系统 DGX 节点 2 8× H100 GPUs 640GB HBM3 DGX操作系统 DGX 节点 3 8× H100 GPUs 640GB HBM3 DGX操作系统 DGX 节点 4 8× H100 GPUs 640GB HBM3 DGX操作系统 InfiniBand NDR 400Gb/s 结构 RDMA·GPUDirect·低延迟多节点通信 基地指挥经理 Slurm / Kubernetes · 作业调度 共享存储 Lustre / GPFS · 高吞吐量 I/O 32× H100 GPUs · 2.56TB 总 HBM3 · 31,680 FP16 TFLOPS

对于运行多个 DGX 系统的组织,DGX 操作系统与 Base Command Manager(以前称为 Bright Cluster Manager)集成。该编排层通过 Slurm 或 Kubernetes 提供作业调度、多节点资源分配、用户和组管理以及整个集群的运行状况监控。

基地命令管理器处理协调多节点训练作业的复杂任务。当您提交需要跨四个 DGX 节点的 32 个 GPU 的训练作业时,管理器会分配资源、配置网络结构、在每个节点上启动进程并监视故障。如果 GPU 遇到错误,经理可以检查训练状态并在健康的硬件上重新启动作业。

对于喜欢 Kubernetes 的团队,DGX 操作系统支持 NVIDIA GPU Operator 和 Network Operator,它们将 GPU 和高速互连公开为 Kubernetes 资源。这使得平台团队可以通过标准 Kubernetes API 提供自助式 AI 基础设施,而 DGX 操作系统则可以处理底层特定于硬件的复杂性。

安全特性

企业人工智能系统处理敏感数据和昂贵的计算资源,使安全性成为 DGX 操作系统的首要关注点。

安全启动: DGX 操作系统验证从固件到内核到用户空间的引导链的完整性。每个组件都经过加密签名,防止加载被篡改的内核或 rootkit。这在多个团队访问相同硬件的共享环境中尤其重要。

加密存储: 全磁盘加密开箱即用,可保护操作系统驱动器和高速 NVMe 存储上的静态数据。密钥管理与 HashiCorp Vault 和硬件安全模块等企业系统集成。

网络隔离: DGX OS 支持细粒度的网络策略,将训练作业彼此隔离并与管理流量隔离。 GPU-direct RDMA 流量流经专用 InfiniBand 分区,防止共享集群上租户之间的数据泄漏。

审计日志记录: 所有管理操作、GPU 分配和容器启动都会记录到防篡改审计跟踪中。这些日志与标准 SIEM 平台集成以进行合规性监控。

开箱即用的性能调整

DGX 操作系统包括数百项性能优化,专家系统管理员需要几周的时间才能手动实施。内核配置有最佳的 CPU 调控器设置、NUMA 感知内存分配和调整的网络堆栈参数。 GPU 持久模式默认启用,消除了困扰标准 Linux 上开发工作流程的启动延迟。大页面是为 GPU 内存映射预先分配的。 IRQ 关联性设置为最大限度地减少数据传输期间的 CPU 开销。

结果是可衡量的。基准比较始终显示,与运行 Ubuntu 并手动安装驱动程序的相同硬件相比,DGX 操作系统的训练吞吐量高出 5% 到 15%,这种差异经过多天的训练后可以节省大量时间和成本。

谁需要 DGX 操作系统与标准 Ubuntu?

DGX 操作系统并不适合所有人,了解它何时能增加价值非常重要。如果您是一名单独的研究人员,使用单个 GPU 在 Jupyter 笔记本上运行实验,那么带有手动安装的 CUDA 工具包的标准 Ubuntu 就完全足够了。 DGX 操作系统的企业功能的开销会增加复杂性,而没有任何好处。

当您拥有多个 GPU 或节点时,当多个用户共享硬件时,当您需要跨开发和生产的可重复环境时,或者当合规性要求强制要求安全功能(如安全启动和审核日志记录)时,DGX 操作系统就会变得引人注目。在这些场景中,节省的设置时间、减少配置偏差以及经过验证的软件堆栈带来的安心感证明了投资的合理性。

联想 ThinkStation PGX 上的 DGX 操作系统

在 DGX 生态系统的重大扩展中,NVIDIA 与联想合作,将 DGX 操作系统引入 ThinkStation PGX,这是一款专为人工智能开发而设计的工作站级系统。 ThinkStation PGX 将 NVIDIA GPU 与联想的工作站设计、热管理和支持基础设施配对,而 DGX 操作系统则提供以前仅在 NVIDIA 品牌硬件上提供的软件体验。

这种合作关系很重要,因为它将企业人工智能功能带到了适合放在桌子下面的外形尺寸。需要 DGX 级软件但无法证明数据中心机架合理的团队现在可以在办公环境中部署 ThinkStation PGX 系统,并在数据中心的 DGX 系统上运行相同的经过验证的堆栈。

设置和第一步

DGX 操作系统的入门取决于您的硬件。在 NVIDIA DGX 系统上,操作系统是预安装的。在 ThinkStation PGX 等受支持的合作伙伴硬件上,您可以通过 NVIDIA 企业门户提供的可启动 USB 映像安装 DGX 操作系统。

安装后,第一步是向 NVIDIA 的许可服务器注册系统,以激活企业支持和 NGC 访问。接下来,通过运行内置验证套件来验证 GPU 堆栈:

nvidia-smi
dgxos-validate --full

这会对驱动程序、库、互连和存储进行全面检查。验证通过后,拉取您的第一个 NGC 容器并运行基准测试以确认一切都按预期运行。从那里,您可以配置用户帐户,设置 Slurm 或 Kubernetes 进行作业调度,并开始将您的 AI 工作负载加载到专门为运行它们而构建的平台上。