¿Qué es el sistema operativo DGX?
DGX OS es el sistema operativo de NVIDIA diseñado específicamente para la infraestructura de IA. Basado en Ubuntu Linux, va mucho más allá de una distribución estándar al integrar una pila de software de inteligencia artificial totalmente optimizada, funciones de seguridad empresarial y herramientas de administración de clústeres en una plataforma única y cohesiva. Originalmente disponible solo en el hardware DGX de NVIDIA, DGX OS ha ampliado su alcance y ahora admite sistemas de socios selectos, lo que refleja la ambición de NVIDIA de convertirse en la plataforma predeterminada para la computación de IA en todas las escalas.
Para los ingenieros de IA, DGX OS resuelve un problema persistente: la brecha entre instalar un sistema operativo y tener un entorno listo para producción para capacitación e inferencia. En Ubuntu estándar, la configuración de controladores CUDA, cuDNN, tiempos de ejecución de contenedores, estructura de red y almacenamiento puede consumir días de tiempo de ingeniería e introducir problemas sutiles de compatibilidad. DGX OS elimina esta fricción por completo.
Pila de software de IA preconfigurada
La pieza central de DGX OS es su pila de software de IA preconfigurada y validada. Cada componente se prueba en conjunto y se garantiza que funcionará al máximo rendimiento en el hardware compatible.
Kit de herramientas CUDA: DGX OS se entrega con la última versión estable de CUDA, completamente configurado con variables de entorno, rutas de biblioteca y cadenas de herramientas del compilador. Las versiones de los controladores se comparan con el kernel y se prueban con los modelos GPU específicos del sistema. No hay instalación manual del controlador, ni depuración de versiones no coincidentes ni enlaces simbólicos rotos.
cuDNN: La biblioteca CUDA Deep Neural Network está preinstalada y ajustada para la arquitectura GPU presente en el sistema. DGX OS incluye perfiles de ajuste automático de cuDNN para arquitecturas de red comunes, lo que significa que su primera operación de convolución o atención se ejecuta a una velocidad casi óptima sin experimentos de calentamiento.
TensorRT: El motor de optimización de inferencia de NVIDIA se incluye con complementos prediseñados para arquitecturas de modelos populares. DGX OS configura TensorRT para usar la memoria GPU disponible de manera eficiente, lo que permite la inferencia INT8 y FP16 lista para usar con herramientas de calibración listas para ejecutar.
NCCL: La biblioteca de comunicaciones colectivas de NVIDIA es fundamental para el entrenamiento de múltiples GPU y múltiples nodos. DGX OS configura NCCL con configuraciones que tienen en cuenta la topología y que coinciden con la estructura NVLink, NVSwitch e InfiniBand del sistema. En un sistema DGX H100 con ocho GPU conectados a través de NVSwitch, NCCL logra un ancho de banda máximo casi teórico para operaciones de reducción total sin ningún ajuste manual.
Tiempo de ejecución de contenedores y NGC
DGX OS utiliza contenedores como mecanismo de implementación principal para cargas de trabajo de IA. El NVIDIA Container Toolkit está preinstalado, lo que permite que Docker y otros tiempos de ejecución compatibles con OCI accedan a los GPU de forma transparente. Cuando ejecuta un contenedor, los dispositivos, controladores y bibliotecas GPU se montan automáticamente dentro del espacio de nombres del contenedor.
El sistema está estrechamente integrado con NVIDIA NGC, un catálogo de contenedores optimizados para GPU para todos los principales marcos de IA. Los contenedores NGC para PyTorch, TensorFlow, JAX, RAPIDS y docenas de otras herramientas se prueban mensualmente con el sistema operativo DGX y se publican con puntos de referencia de rendimiento. Extraer y ejecutar un contenedor NGC en DGX OS es un solo comando:
docker run --gpus all nvcr.io/nvidia/pytorch:24.03-py3
Este contenedor incluye PyTorch compilado con las versiones óptimas de CUDA y cuDNN para el sistema host, junto con Apex para entrenamiento de precisión mixta, Transformer Engine para cálculo de atención eficiente y utilidades de entrenamiento distribuido preconfiguradas.
Administrador de comandos base para la orquestación de clústeres
Para organizaciones que ejecutan varios sistemas DGX, DGX OS se integra con Base Command Manager (anteriormente Bright Cluster Manager). Esta capa de orquestación proporciona programación de trabajos a través de Slurm o Kubernetes, asignación de recursos de múltiples nodos, administración de usuarios y grupos, y monitoreo del estado en todo el clúster.
Base Command Manager maneja la compleja tarea de coordinar trabajos de capacitación de múltiples nodos. Cuando envía un trabajo de capacitación que requiere 32 GPU en cuatro nodos DGX, el administrador asigna recursos, configura la estructura de la red, inicia procesos en cada nodo y monitorea las fallas. Si un GPU encuentra un error, el administrador puede verificar el estado de entrenamiento y reiniciar el trabajo en un hardware en buen estado.
Para los equipos que prefieren Kubernetes, DGX OS admite el operador y el operador de red NVIDIA GPU, que exponen los GPU y las interconexiones de alta velocidad como recursos Kubernetes. Esto permite a los equipos de plataforma proporcionar una infraestructura de IA de autoservicio a través de Kubernetes API estándar, mientras que DGX OS maneja la complejidad específica del hardware subyacente.
Funciones de seguridad
Los sistemas de IA empresarial manejan datos confidenciales y recursos informáticos costosos, lo que hace que la seguridad sea una preocupación de primera clase en DGX OS.
Arranque seguro: DGX OS valida la integridad de la cadena de arranque desde el firmware hasta el kernel y el espacio de usuario. Cada componente está firmado criptográficamente, lo que evita que se carguen kernels o rootkits manipulados. Esto es particularmente importante en entornos compartidos donde varios equipos acceden al mismo hardware.
Almacenamiento cifrado: El cifrado de disco completo está disponible de fábrica, lo que protege los datos en reposo tanto en las unidades del sistema operativo como en el almacenamiento NVMe de alta velocidad. La gestión de claves se integra con sistemas empresariales como HashiCorp Vault y módulos de seguridad de hardware.
Aislamiento de red: DGX OS admite políticas de red detalladas que aíslan los trabajos de capacitación entre sí y del tráfico de administración. El tráfico RDMA directo a GPU fluye a través de particiones InfiniBand dedicadas, lo que evita la fuga de datos entre inquilinos en clústeres compartidos.
Registro de auditoría: Todas las acciones administrativas, asignaciones de GPU y lanzamientos de contenedores se registran en un registro de auditoría a prueba de manipulaciones. Estos registros se integran con plataformas SIEM estándar para el monitoreo del cumplimiento.
Ajuste de rendimiento listo para usar
DGX OS incluye cientos de optimizaciones de rendimiento que a un administrador de sistemas experto le llevaría semanas implementar manualmente. El kernel está configurado con configuraciones óptimas del gobernador CPU, asignación de memoria compatible con NUMA y parámetros de pila de red ajustados. El modo de persistencia GPU está habilitado de forma predeterminada, lo que elimina la latencia de inicio que afecta a los flujos de trabajo de desarrollo en Linux estándar. Se preasignan páginas enormes para las asignaciones de memoria GPU. La afinidad IRQ está configurada para minimizar la sobrecarga de CPU durante las transferencias de datos.
El resultado es mensurable. Las comparaciones de referencia muestran consistentemente que DGX OS ofrece un rendimiento de capacitación de cinco a quince por ciento más alto que el mismo hardware que ejecuta Ubuntu con controladores instalados manualmente, una diferencia que se suma a la capacitación de varios días y genera importantes ahorros de tiempo y costos.
¿Quién necesita DGX OS frente a Ubuntu estándar?
DGX OS no es para todos y es importante comprender cuándo agrega valor. Si es un investigador solitario con un único GPU que ejecuta experimentos desde portátiles Jupyter, Ubuntu estándar con un kit de herramientas CUDA instalado manualmente es perfectamente adecuado. La sobrecarga de las funciones empresariales de DGX OS agregaría complejidad sin beneficio.
DGX OS se vuelve atractivo cuando tiene varios GPU o nodos, cuando varios usuarios comparten hardware, cuando necesita entornos reproducibles en desarrollo y producción, o cuando los requisitos de cumplimiento exigen funciones de seguridad como arranque seguro y registro de auditoría. En estos escenarios, el tiempo ahorrado en la configuración, la reducción de la desviación de la configuración y la tranquilidad de las pilas de software validadas justifican la inversión.
Sistema operativo DGX en Lenovo ThinkStation PGX
En una expansión significativa del ecosistema DGX, NVIDIA se asoció con Lenovo para llevar DGX OS a ThinkStation PGX, un sistema de estación de trabajo diseñado para el desarrollo de IA. ThinkStation PGX combina NVIDIA GPU con el diseño de estación de trabajo, administración térmica e infraestructura de soporte de Lenovo, mientras que DGX OS brinda la experiencia de software que antes solo estaba disponible en hardware de la marca NVIDIA.
Esta asociación es importante porque lleva las capacidades de IA empresarial a un factor de forma que cabe debajo de un escritorio. Los equipos que necesitan software de clase DGX pero no pueden justificar un bastidor de centro de datos ahora pueden implementar sistemas ThinkStation PGX en entornos de oficina con la misma pila validada ejecutándose en sistemas DGX en el centro de datos.
Configuración y primeros pasos
Comenzar con DGX OS depende de su hardware. En los sistemas NVIDIA DGX, el sistema operativo viene preinstalado. En hardware de socios compatible, como ThinkStation PGX, instala el sistema operativo DGX desde una imagen USB de arranque proporcionada a través del portal empresarial de NVIDIA.
Después de la instalación, el primer paso es registrar el sistema en el servidor de licencias de NVIDIA para activar el soporte empresarial y el acceso a NGC. A continuación, verifique la pila GPU ejecutando el conjunto de validación integrado:
nvidia-smidgxos-validate --full
Esto ejecuta una verificación exhaustiva de controladores, bibliotecas, interconexiones y almacenamiento. Una vez que pase la validación, extraiga su primer contenedor NGC y ejecute una prueba comparativa para confirmar que todo funciona como se esperaba. Desde allí, puede configurar cuentas de usuario, configurar Slurm o Kubernetes para la programación de trabajos y comenzar a incorporar sus cargas de trabajo de IA en una plataforma creada específicamente para ejecutarlas.