Что такое ОС DGX?
DGX OS — это специально созданная операционная система NVIDIA для инфраструктуры искусственного интеллекта. Основанный на Ubuntu Linux, он выходит далеко за рамки стандартного дистрибутива, интегрируя полностью оптимизированный стек программного обеспечения для искусственного интеллекта, функции корпоративной безопасности и инструменты управления кластером в единую целостную платформу. Первоначально доступная только на собственном оборудовании NVIDIA DGX, ОС DGX расширила сферу своего применения и теперь поддерживает избранные партнерские системы, что отражает стремление NVIDIA стать платформой по умолчанию для вычислений ИИ в любом масштабе.
Для инженеров ИИ DGX OS решает постоянную проблему: разрыв между установкой операционной системы и наличием готовой к работе среды для обучения и вывода. В стандартной Ubuntu настройка драйверов CUDA, cuDNN, среды выполнения контейнеров, сетевой структуры и хранилища может занять несколько дней инженерного времени и вызвать небольшие проблемы совместимости. ОС DGX полностью устраняет это противоречие.
Предварительно настроенный стек программного обеспечения для искусственного интеллекта
Центральным элементом ОС DGX является предварительно настроенный и проверенный стек программного обеспечения для искусственного интеллекта. Каждый компонент тестируется вместе и гарантированно работает с максимальной производительностью на поддерживаемом оборудовании.
Инструментарий CUDA: ОС DGX поставляется с последней стабильной версией CUDA, полностью настроенной с использованием переменных среды, путей к библиотекам и наборов инструментов компилятора. Версии драйверов соответствуют ядру и тестируются на конкретных моделях GPU в системе. Не требуется установка драйверов вручную, отладка несоответствия версий и неработающие символические ссылки.
cuDNN: Библиотека CUDA Deep Neural Network предварительно установлена и настроена для архитектуры GPU, присутствующей в системе. ОС DGX включает в себя профили автоматической настройки cuDNN для распространенных сетевых архитектур, что означает, что ваша первая операция свертки или внимания выполняется на почти оптимальной скорости без экспериментов с прогревом.
ТензорРТ: Механизм оптимизации вывода NVIDIA включен в состав готовых плагинов для популярных архитектур моделей. ОС DGX настраивает TensorRT для эффективного использования доступной памяти GPU, обеспечивая возможность вывода INT8 и FP16 «из коробки» с готовыми к запуску инструментами калибровки.
НККЛ: Библиотека коллективных коммуникаций NVIDIA имеет решающее значение для обучения на нескольких GPU и нескольких узлах. ОС DGX настраивает NCCL с учетом топологии, которая соответствует фабрике NVLink, NVSwitch и InfiniBand системы. В системе DGX H100 с восемью GPU, подключенными через NVSwitch, NCCL достигает почти теоретической максимальной пропускной способности для операций полного сокращения без какой-либо ручной настройки.
Среда выполнения контейнера и NGC
ОС DGX использует контейнеры в качестве основного механизма развертывания рабочих нагрузок ИИ. Предустановлен набор инструментов NVIDIA Container Toolkit, который позволяет Docker и другим OCI-совместимым средам выполнения прозрачно получать доступ к GPU. При запуске контейнера устройства, драйверы и библиотеки GPU автоматически монтируются внутри пространства имен контейнера.
Система тесно интегрирована с NVIDIA NGC — каталогом оптимизированных для GPU контейнеров для всех основных инфраструктур искусственного интеллекта. Контейнеры NGC для PyTorch, TensorFlow, JAX, RAPIDS и десятков других инструментов ежемесячно тестируются на ОС DGX и публикуются с тестами производительности. Извлечение и запуск контейнера NGC в ОС DGX выполняется одной командой:
docker run --gpus all nvcr.io/nvidia/pytorch:24.03-py3
Этот контейнер включает PyTorch, скомпилированный с оптимальными версиями CUDA и cuDNN для хост-системы, а также Apex для обучения смешанной точности, Transformer Engine для эффективного вычисления внимания и предварительно настроенные утилиты распределенного обучения.
Базовый командный менеджер по оркестровке кластера
Для организаций, использующих несколько систем DGX, ОС DGX интегрируется с Base Command Manager (ранее Bright Cluster Manager). Этот уровень оркестрации обеспечивает планирование заданий с помощью Slurm или Kubernetes, распределение ресурсов на нескольких узлах, управление пользователями и группами, а также мониторинг работоспособности во всем кластере.
Менеджер базового командования решает сложную задачу по координации многоузловых учебных работ. Когда вы отправляете задание на обучение, требующее 32 GPU на четырех узлах DGX, менеджер распределяет ресурсы, настраивает сетевую структуру, запускает процессы на каждом узле и отслеживает сбои. If a GPU encounters an error, the manager can checkpoint the training state and restart the job on healthy hardware.
Для команд, предпочитающих Kubernetes, ОС DGX поддерживает оператора NVIDIA GPU и оператора сети, которые предоставляют GPU и высокоскоростные межсоединения в качестве ресурсов Kubernetes. Это позволяет командам платформы предоставлять инфраструктуру искусственного интеллекта самообслуживания с помощью стандартных Kubernetes API, в то время как ОС DGX справляется со сложностями, связанными с аппаратным обеспечением.
Функции безопасности
Корпоративные системы искусственного интеллекта обрабатывают конфиденциальные данные и дорогостоящие вычислительные ресурсы, что делает безопасность первостепенной задачей в ОС DGX.
Безопасная загрузка: ОС DGX проверяет целостность цепочки загрузки от прошивки через ядро до пользовательского пространства. Каждый компонент имеет криптографическую подпись, что предотвращает загрузку измененных ядер или руткитов. Это особенно важно в общих средах, где несколько команд имеют доступ к одному и тому же оборудованию.
Зашифрованное хранилище: Полнодисковое шифрование доступно «из коробки», защищая данные, хранящиеся как на дисках ОС, так и в высокоскоростном хранилище NVMe. Управление ключами интегрируется с корпоративными системами, такими как HashiCorp Vault, и аппаратными модулями безопасности.
Сетевая изоляция: ОС DGX поддерживает детальные сетевые политики, которые изолируют задания обучения друг от друга и от трафика управления. Трафик RDMA напрямую с GPU проходит через выделенные разделы InfiniBand, предотвращая утечку данных между арендаторами в общих кластерах.
Журнал аудита: Все административные действия, распределение GPU и запуск контейнеров регистрируются в защищенном от несанкционированного доступа журнале аудита. Эти журналы интегрируются со стандартными платформами SIEM для мониторинга соответствия.
Настройка производительности «из коробки»
ОС DGX включает в себя сотни оптимизаций производительности, на реализацию которых опытному системному администратору потребуются недели. Ядро настроено с оптимальными настройками регулятора CPU, распределением памяти с учетом NUMA и настроенными параметрами сетевого стека. Режим сохранения GPU включен по умолчанию, что устраняет задержку при запуске, которая мешает рабочим процессам разработки в стандартном Linux. Для сопоставления памяти GPU заранее выделены огромные страницы. Привязка IRQ настроена для минимизации накладных расходов CPU во время передачи данных.
Результат измерим. Сравнение эталонных показателей неизменно показывает, что ОС DGX обеспечивает на пять-пятнадцать процентов более высокую производительность обучения, чем такое же аппаратное обеспечение Ubuntu с установленными вручную драйверами. Эта разница, которая суммируется с многодневным обучением, приводит к значительной экономии времени и средств.
Кому нужна ОС DGX или стандартная Ubuntu?
ОС DGX не для всех, и важно понимать, когда она приносит пользу. Если вы исследователь-одиночка и проводите эксперименты на одном компьютере GPU с ноутбуков Jupyter, вам вполне подойдет стандартная Ubuntu с установленным вручную набором инструментов CUDA. Накладные расходы на корпоративные функции ОС DGX усложнят систему, но не принесут никакой пользы.
ОС DGX становится привлекательной, когда у вас есть несколько GPU или узлов, когда несколько пользователей совместно используют оборудование, когда вам нужны воспроизводимые среды для разработки и производства или когда требования соответствия требуют использования функций безопасности, таких как безопасная загрузка и ведение журнала аудита. В этих сценариях экономия времени на настройке, уменьшение дрейфа конфигурации и душевное спокойствие благодаря проверенным стекам программного обеспечения оправдывают инвестиции.
ОС DGX на Lenovo ThinkStation PGX
В рамках значительного расширения экосистемы DGX NVIDIA в партнерстве с Lenovo внедрила ОС DGX в ThinkStation PGX, систему класса рабочей станции, предназначенную для разработки искусственного интеллекта. ThinkStation PGX сочетает в себе NVIDIA GPU с дизайном рабочей станции Lenovo, управлением температурным режимом и инфраструктурой поддержки, а ОС DGX обеспечивает возможности программного обеспечения, ранее доступные только на оборудовании марки NVIDIA.
Это партнерство имеет большое значение, поскольку оно объединяет возможности корпоративного искусственного интеллекта в форм-факторе, который помещается под столом. Команды, которым необходимо программное обеспечение класса DGX, но которые не могут оправдать установку стойки в центре обработки данных, теперь могут развертывать системы ThinkStation PGX в офисных средах с тем же проверенным стеком, работающим на системах DGX в центре обработки данных.
Настройка и первые шаги
Начало работы с ОС DGX зависит от вашего оборудования. В системах NVIDIA DGX операционная система поставляется предустановленной. На поддерживаемом партнерском оборудовании, таком как ThinkStation PGX, вы устанавливаете ОС DGX с загрузочного образа USB, предоставленного через корпоративный портал NVIDIA.
После установки первым шагом является регистрация системы на сервере лицензирования NVIDIA, чтобы активировать корпоративную поддержку и доступ к NGC. Затем проверьте стек GPU, запустив встроенный пакет проверки:
nvidia-smidgxos-validate --full
При этом выполняется комплексная проверка драйверов, библиотек, межсоединений и хранилища. После прохождения проверки извлеките свой первый контейнер NGC и запустите тест, чтобы убедиться, что все работает так, как ожидалось. Отсюда вы можете настроить учетные записи пользователей, настроить Slurm или Kubernetes для планирования заданий и начать внедрение своих рабочих нагрузок ИИ на платформу, созданную специально для их выполнения.