O que é o sistema operacional DGX?
DGX OS é o sistema operacional desenvolvido especificamente pela NVIDIA para infraestrutura de IA. Baseado no Ubuntu Linux, ele vai muito além de uma distribuição padrão, integrando uma pilha de software de IA totalmente otimizada, recursos de segurança empresarial e ferramentas de gerenciamento de cluster em uma plataforma única e coesa. Originalmente disponível apenas no hardware DGX da própria NVIDIA, o DGX OS expandiu seu alcance e agora oferece suporte a sistemas de parceiros selecionados, refletindo a ambição da NVIDIA de se tornar a plataforma padrão para computação de IA em todas as escalas.
Para os engenheiros de IA, o DGX OS resolve um problema persistente: a lacuna entre instalar um sistema operacional e ter um ambiente pronto para produção para treinamento e inferência. No Ubuntu padrão, configurar drivers CUDA, cuDNN, tempos de execução de contêiner, malha de rede e armazenamento pode consumir dias de engenharia e introduzir problemas sutis de compatibilidade. O DGX OS elimina totalmente esse atrito.
Pilha de software de IA pré-configurada
A peça central do DGX OS é sua pilha de software de IA pré-configurada e validada. Cada componente é testado em conjunto e tem garantia de funcionamento com desempenho máximo em hardware compatível.
Kit de ferramentas CUDA: O DGX OS vem com a versão CUDA estável mais recente, totalmente configurada com variáveis de ambiente, caminhos de biblioteca e cadeias de ferramentas do compilador. As versões do driver são compatíveis com o kernel e testadas em relação aos modelos GPU específicos no sistema. Não há instalação manual de driver, depuração de incompatibilidade de versão e links simbólicos quebrados.
cuDNN: A biblioteca CUDA Deep Neural Network vem pré-instalada e ajustada para a arquitetura GPU presente no sistema. O DGX OS inclui perfis de ajuste automático do cuDNN para arquiteturas de rede comuns, o que significa que sua primeira operação de convolução ou atenção é executada em velocidade quase ideal, sem experimentos de aquecimento.
TensorRT: O mecanismo de otimização de inferência da NVIDIA está incluído em plug-ins pré-construídos para arquiteturas de modelos populares. O DGX OS configura o TensorRT para usar a memória GPU disponível de forma eficiente, permitindo a inferência INT8 e FP16 pronta para uso com ferramentas de calibração prontas para execução.
NCCL: A NVIDIA Collective Communications Library é fundamental para treinamento multi-GPU e multi-nós. O DGX OS configura NCCL com configurações de reconhecimento de topologia que correspondem à malha NVLink, NVSwitch e InfiniBand do sistema. Em um sistema DGX H100 com oito GPUs conectados via NVSwitch, o NCCL atinge largura de banda máxima quase teórica para operações de redução total sem qualquer ajuste manual.
Tempo de execução do contêiner e NGC
O DGX OS usa contêineres como mecanismo de implantação principal para cargas de trabalho de IA. O NVIDIA Container Toolkit vem pré-instalado, permitindo que o Docker e outros tempos de execução compatíveis com OCI acessem GPUs de forma transparente. Quando você executa um contêiner, dispositivos, drivers e bibliotecas GPU são montados automaticamente dentro do namespace do contêiner.
O sistema é totalmente integrado ao NVIDIA NGC, um catálogo de contêineres otimizados para GPU para todas as principais estruturas de IA. Os contêineres NGC para PyTorch, TensorFlow, JAX, RAPIDS e dezenas de outras ferramentas são testados mensalmente no sistema operacional DGX e publicados com benchmarks de desempenho. Extrair e executar um contêiner NGC no sistema operacional DGX é um único comando:
docker run --gpus all nvcr.io/nvidia/pytorch:24.03-py3
Este contêiner inclui PyTorch compilado com as versões CUDA e cuDNN ideais para o sistema host, junto com Apex para treinamento de precisão mista, Transformer Engine para cálculo de atenção eficiente e utilitários de treinamento distribuído pré-configurados.
Gerenciador de comando básico para orquestração de cluster
Para organizações que executam vários sistemas DGX, o DGX OS integra-se ao Base Command Manager (anteriormente Bright Cluster Manager). Essa camada de orquestração fornece agendamento de tarefas por meio de Slurm ou Kubernetes, alocação de recursos de vários nós, gerenciamento de usuários e grupos e monitoramento de integridade em todo o cluster.
O Base Command Manager lida com a complexa tarefa de coordenar trabalhos de treinamento de vários nós. Quando você envia um trabalho de treinamento que requer 32 GPUs em quatro nós DGX, o gerenciador aloca recursos, configura a malha da rede, inicia processos em cada nó e monitora falhas. Se um GPU encontrar um erro, o gerente poderá verificar o estado de treinamento e reiniciar o trabalho em hardware íntegro.
Para equipes que preferem Kubernetes, o DGX OS oferece suporte ao operador NVIDIA GPU e ao operador de rede, que expõem GPUs e interconexões de alta velocidade como recursos Kubernetes. Isso permite que as equipes de plataforma forneçam infraestrutura de IA de autoatendimento por meio de Kubernetes APIs padrão, enquanto o DGX OS lida com a complexidade específica do hardware subjacente.
Recursos de segurança
Os sistemas empresariais de IA lidam com dados confidenciais e recursos computacionais caros, tornando a segurança uma preocupação de primeira classe no sistema operacional DGX.
Inicialização segura: O DGX OS valida a integridade da cadeia de inicialização desde o firmware, passando pelo kernel, até o espaço do usuário. Cada componente é assinado criptograficamente, evitando o carregamento de kernels ou rootkits adulterados. Isto é particularmente importante em ambientes compartilhados onde várias equipes acessam o mesmo hardware.
Armazenamento criptografado: A criptografia completa de disco está disponível imediatamente, protegendo os dados em repouso nas unidades do sistema operacional e no armazenamento NVMe de alta velocidade. O gerenciamento de chaves se integra a sistemas corporativos como HashiCorp Vault e módulos de segurança de hardware.
Isolamento de rede: O DGX OS oferece suporte a políticas de rede refinadas que isolam os trabalhos de treinamento uns dos outros e do tráfego de gerenciamento. O tráfego RDMA direto GPU flui por partições InfiniBand dedicadas, evitando vazamento de dados entre locatários em clusters compartilhados.
Registro de auditoria: Todas as ações administrativas, alocações de GPU e lançamentos de contêineres são registrados em uma trilha de auditoria resistente a violações. Esses logs são integrados a plataformas SIEM padrão para monitoramento de conformidade.
Ajuste de desempenho pronto para uso
O DGX OS inclui centenas de otimizações de desempenho que levariam semanas para um administrador de sistema especialista implementar manualmente. O kernel é configurado com configurações ideais do governador CPU, alocação de memória compatível com NUMA e parâmetros de pilha de rede ajustados. O modo de persistência GPU é ativado por padrão, eliminando a latência de inicialização que afeta os fluxos de trabalho de desenvolvimento no Linux padrão. Páginas enormes são pré-alocadas para mapeamentos de memória GPU. A afinidade IRQ é definida para minimizar a sobrecarga do CPU durante transferências de dados.
O resultado é mensurável. As comparações de benchmark mostram consistentemente que o DGX OS oferece um rendimento de treinamento de cinco a quinze por cento maior do que o mesmo hardware executando o Ubuntu padrão com drivers instalados manualmente, uma diferença que se soma ao treinamento de vários dias e resulta em economias significativas de tempo e custos.
Quem precisa do sistema operacional DGX versus Ubuntu padrão?
O DGX OS não é para todos e é importante entender quando ele agrega valor. Se você é um pesquisador solo com um único GPU executando experimentos em notebooks Jupyter, o Ubuntu padrão com um kit de ferramentas CUDA instalado manualmente é perfeitamente adequado. A sobrecarga dos recursos empresariais do DGX OS aumentaria a complexidade sem trazer benefícios.
O DGX OS torna-se atraente quando você tem vários GPUs ou nós, quando vários usuários compartilham hardware, quando você precisa de ambientes reproduzíveis em desenvolvimento e produção ou quando requisitos de conformidade exigem recursos de segurança como inicialização segura e registro de auditoria. Nesses cenários, o tempo economizado na configuração, a redução no desvio de configuração e a tranquilidade proporcionada pelas pilhas de software validadas justificam o investimento.
SO DGX no Lenovo ThinkStation PGX
Numa expansão significativa do ecossistema DGX, a NVIDIA fez parceria com a Lenovo para trazer o DGX OS para o ThinkStation PGX, um sistema de classe de estação de trabalho projetado para desenvolvimento de IA. O ThinkStation PGX combina NVIDIA GPUs com o design de estação de trabalho, gerenciamento térmico e infraestrutura de suporte da Lenovo, enquanto o DGX OS fornece a experiência de software anteriormente disponível apenas em hardware da marca NVIDIA.
Essa parceria é importante porque traz recursos empresariais de IA para um formato que cabe embaixo de uma mesa. As equipes que precisam de software de classe DGX, mas não conseguem justificar um rack de data center, agora podem implantar sistemas ThinkStation PGX em ambientes de escritório com a mesma pilha validada em execução em sistemas DGX no data center.
Configuração e primeiros passos
A introdução ao DGX OS depende do seu hardware. Nos sistemas NVIDIA DGX, o sistema operacional vem pré-instalado. Em hardware de parceiro compatível, como o ThinkStation PGX, você instala o sistema operacional DGX a partir de uma imagem USB inicializável fornecida pelo portal corporativo da NVIDIA.
Após a instalação, o primeiro passo é registrar o sistema no servidor de licenciamento da NVIDIA para ativar o suporte empresarial e o acesso NGC. Em seguida, verifique a pilha GPU executando o conjunto de validação integrado:
nvidia-smidgxos-validate --full
Isso executa uma verificação abrangente de drivers, bibliotecas, interconexões e armazenamento. Depois que a validação for aprovada, extraia seu primeiro contêiner NGC e execute um benchmark para confirmar que tudo está funcionando conforme o esperado. A partir daí, você pode configurar contas de usuário, configurar Slurm ou Kubernetes para agendamento de tarefas e começar a integrar suas cargas de trabalho de IA em uma plataforma que foi construída especificamente para executá-las.