Workstation Logo
ਉਤਪਾਦ
AI ਲੈਬਜ਼OpenAI ਏਜੰਟClaude ਏਜੰਟGrok BotWorkstation CRM (WSL CRM)ਮਾਰਕੀਟਿੰਗਸਾਰੇ ਉਤਪਾਦ
AI ਹੱਲ
AI ਵਰਕਸਟੇਸ਼ਨAI SME Packagesਪ੍ਰਾਈਵੇਟ AIGPU ਕਲੱਸਟਰਐਜ AIਐਂਟਰਪ੍ਰਾਈਜ਼ AI ਲੈਬਉਦਯੋਗ ਅਨੁਸਾਰ AI
ਸੇਵਾਵਾਂ
Platform ModernisationDigital EngineeringData Foundations & AIAutonomous OperationsAI ਸਲਾਹDevOps ਆਟੋਮੇਸ਼ਨਸਾਈਬਰ ਸੁਰੱਖਿਆਸਾਫਟਵੇਅਰ ਵਿਕਾਸਏਜੰਟ ਨਿਰਮਾਣMLOps ਸੈੱਟਅੱਪ
ਸਾਡੇ ਬਾਰੇ
ਸਾਂਝੇਦਾਰਗਾਹਕ ਕਹਾਣੀਆਂ
ਲੇਖ
ਦਸਤਾਵੇਜ਼
WSL ProxyRing Promoter
ਬਲੌਗ
ਸਾਡੇ ਨਾਲ ਸੰਪਰਕ ਕਰੋLogin
Workstation

AI workstations, AI Multi Agentic Software, GPU infrastructure, and intelligent agent solutions for modern businesses.

ਯੂਕੇ ਦਫ਼ਤਰ: 77-79 Marlowes, Hemel Hempstead HP1 1LF - Directions - Take Junction 20 off M25 Outer London
Company No: 11641870
Mon - Fri: 9:00 AM - 6:00 PM GMT
+44 7515 356 146

ਬੈਲਜੀਅਮ ਦਫ਼ਤਰ: Workstation SRL, Rue Vanderkindere 34, 1180 Uccle, Brussels
BE 0751.518.683
Mon - Fri: 9:00 AM - 6:00 PM CET
+32 492 45 67 46

ਭਾਰਤ ਦਫ਼ਤਰ: #159 Sector 9, Pocket 1, DDA Flats, 110077 Dwarka, New Delhi
+91 98881 98841

ਉਤਪਾਦ

ਸਾਰੇ ਉਤਪਾਦWSL ProxyRing PromoterAI ਲੈਬਜ਼OpenAI ਏਜੰਟClaude ਏਜੰਟGrok BotWorkstation CRM (WSL CRM)

AI ਹੱਲ

AI ਹੱਲAI ਵਰਕਸਟੇਸ਼ਨਪ੍ਰਾਈਵੇਟ AIGPU ਕਲੱਸਟਰਐਂਟਰਪ੍ਰਾਈਜ਼ AI ਲੈਬਸੇਵਾਵਾਂ

ਸਰੋਤ

ਲੇਖਦਸਤਾਵੇਜ਼ਬਲੌਗSearchਸਾਈਟ ਮੈਪ

ਕੰਪਨੀ

ਸਾਡੇ ਬਾਰੇਸਾਂਝੇਦਾਰਸਾਡੇ ਨਾਲ ਸੰਪਰਕ ਕਰੋ

© 2026 Workstation AI. ਸਾਰੇ ਹੱਕ ਰਾਖਵੇਂ ਹਨ

ਗੋਪਨੀਯਤਾ ਨੀਤੀਕੂਕੀ ਨੀਤੀਸਾਈਟ ਮੈਪ

Loading blog...

Home / Blog
AIDevOps

DGX OS ਦੀ ਵਿਆਖਿਆ ਕੀਤੀ ਗਈ: AI ਲਈ NVIDIA ਦਾ ਓਪਰੇਟਿੰਗ ਸਿਸਟਮ

ਕੀ DGX OS ਨੂੰ ਸਟੈਂਡਰਡ ਲੀਨਕਸ ਤੋਂ ਵੱਖਰਾ ਬਣਾਉਂਦਾ ਹੈ

Balinder Walia21 ਮਾਰਚ 20269 min read

DGX OS ਕੀ ਹੈ?

DGX OS AI ਬੁਨਿਆਦੀ ਢਾਂਚੇ ਲਈ NVIDIA ਦਾ ਉਦੇਸ਼-ਨਿਰਮਿਤ ਓਪਰੇਟਿੰਗ ਸਿਸਟਮ ਹੈ। ਉਬੰਟੂ ਲੀਨਕਸ ਦੇ ਆਧਾਰ 'ਤੇ, ਇਹ ਪੂਰੀ ਤਰ੍ਹਾਂ ਅਨੁਕੂਲਿਤ AI ਸੌਫਟਵੇਅਰ ਸਟੈਕ, ਐਂਟਰਪ੍ਰਾਈਜ਼ ਸੁਰੱਖਿਆ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ, ਅਤੇ ਕਲੱਸਟਰ ਪ੍ਰਬੰਧਨ ਸਾਧਨਾਂ ਨੂੰ ਇੱਕ ਸਿੰਗਲ, ਇਕਸੁਰਤਾ ਵਾਲੇ ਪਲੇਟਫਾਰਮ ਵਿੱਚ ਜੋੜ ਕੇ ਇੱਕ ਮਿਆਰੀ ਵੰਡ ਤੋਂ ਬਹੁਤ ਪਰੇ ਹੈ। ਮੂਲ ਰੂਪ ਵਿੱਚ ਸਿਰਫ਼ NVIDIA ਦੇ ਆਪਣੇ DGX ਹਾਰਡਵੇਅਰ 'ਤੇ ਉਪਲਬਧ ਹੈ, DGX OS ਨੇ ਆਪਣੀ ਪਹੁੰਚ ਦਾ ਵਿਸਤਾਰ ਕੀਤਾ ਹੈ ਅਤੇ ਹੁਣ ਚੁਣੇ ਹੋਏ ਪਾਰਟਨਰ ਸਿਸਟਮਾਂ ਦਾ ਸਮਰਥਨ ਕਰਦਾ ਹੈ, ਜੋ ਕਿ ਹਰ ਪੈਮਾਨੇ 'ਤੇ AI ਕੰਪਿਊਟ ਲਈ ਡਿਫੌਲਟ ਪਲੇਟਫਾਰਮ ਬਣਨ ਦੀ NVIDIA ਦੀ ਇੱਛਾ ਨੂੰ ਦਰਸਾਉਂਦਾ ਹੈ।

AI ਇੰਜੀਨੀਅਰਾਂ ਲਈ, DGX OS ਇੱਕ ਸਥਾਈ ਸਮੱਸਿਆ ਨੂੰ ਹੱਲ ਕਰਦਾ ਹੈ: ਇੱਕ ਓਪਰੇਟਿੰਗ ਸਿਸਟਮ ਨੂੰ ਸਥਾਪਿਤ ਕਰਨ ਅਤੇ ਸਿਖਲਾਈ ਅਤੇ ਅਨੁਮਾਨ ਲਈ ਉਤਪਾਦਨ ਲਈ ਤਿਆਰ ਵਾਤਾਵਰਣ ਹੋਣ ਦੇ ਵਿਚਕਾਰ ਅੰਤਰ। ਸਟੈਂਡਰਡ ਉਬੰਟੂ 'ਤੇ, CUDA ਡਰਾਈਵਰਾਂ, cuDNN, ਕੰਟੇਨਰ ਰਨਟਾਈਮ, ਨੈੱਟਵਰਕ ਫੈਬਰਿਕ, ਅਤੇ ਸਟੋਰੇਜ ਨੂੰ ਕੌਂਫਿਗਰ ਕਰਨਾ ਇੰਜੀਨੀਅਰਿੰਗ ਸਮੇਂ ਦੇ ਦਿਨਾਂ ਦੀ ਖਪਤ ਕਰ ਸਕਦਾ ਹੈ ਅਤੇ ਸੂਖਮ ਅਨੁਕੂਲਤਾ ਮੁੱਦਿਆਂ ਨੂੰ ਪੇਸ਼ ਕਰ ਸਕਦਾ ਹੈ। DGX OS ਇਸ ਰਗੜ ਨੂੰ ਪੂਰੀ ਤਰ੍ਹਾਂ ਖਤਮ ਕਰਦਾ ਹੈ।

ਪੂਰਵ-ਸੰਰਚਿਤ AI ਸੌਫਟਵੇਅਰ ਸਟੈਕ

DGX ਸੌਫਟਵੇਅਰ ਸਟੈਕ AI ਐਪਲੀਕੇਸ਼ਨਾਂ LLM ਸਿਖਲਾਈ · ਕੰਪਿਊਟਰ ਵਿਜ਼ਨ · NLP · ਸਿਫਾਰਸ਼ੀ ਸਿਸਟਮ ਏਆਈ ਫਰੇਮਵਰਕ PyTorch · TensorFlow · JAX · RAPIDS · ਟ੍ਰਾਂਸਫਾਰਮਰ ਇੰਜਣ ਕੰਟੇਨਰ ਰਨਟਾਈਮ ਡੌਕਰ · ਐਨਰੂਟ · NVIDIA ਕੰਟੇਨਰ ਟੂਲਕਿਟ · NGC ਕੈਟਾਲਾਗ DGX OS (ਉਬੰਟੂ-ਆਧਾਰਿਤ) CUDA · cuDNN · TensorRT · NCCL · ਸੁਰੱਖਿਅਤ ਬੂਟ · ਡਰਾਈਵਰ DGX ਹਾਰਡਵੇਅਰ 8× H100/B200 GPUs · NVSwitch · InfiniBand · NVMe ਸਟੋਰੇਜ ▲ ਐਬਸਟਰੈਕਸ਼ਨ ਪੱਧਰ ▼

DGX OS ਦਾ ਕੇਂਦਰ ਭਾਗ ਇਸਦਾ ਪਹਿਲਾਂ ਤੋਂ ਸੰਰਚਿਤ ਅਤੇ ਪ੍ਰਮਾਣਿਤ AI ਸਾਫਟਵੇਅਰ ਸਟੈਕ ਹੈ। ਹਰੇਕ ਹਿੱਸੇ ਦੀ ਇਕੱਠੇ ਜਾਂਚ ਕੀਤੀ ਜਾਂਦੀ ਹੈ ਅਤੇ ਸਮਰਥਿਤ ਹਾਰਡਵੇਅਰ 'ਤੇ ਉੱਚ ਪ੍ਰਦਰਸ਼ਨ 'ਤੇ ਕੰਮ ਕਰਨ ਦੀ ਗਾਰੰਟੀ ਦਿੱਤੀ ਜਾਂਦੀ ਹੈ।

CUDA ਟੂਲਕਿੱਟ: DGX OS ਨਵੀਨਤਮ ਸਥਿਰ CUDA ਰੀਲੀਜ਼ ਦੇ ਨਾਲ, ਪੂਰੀ ਤਰ੍ਹਾਂ ਵਾਤਾਵਰਣ ਵੇਰੀਏਬਲ, ਲਾਇਬ੍ਰੇਰੀ ਮਾਰਗ, ਅਤੇ ਕੰਪਾਈਲਰ ਟੂਲਚੇਨ ਨਾਲ ਸੰਰਚਿਤ ਕੀਤਾ ਗਿਆ ਹੈ। ਡਰਾਈਵਰ ਸੰਸਕਰਣ ਕਰਨਲ ਨਾਲ ਮੇਲ ਖਾਂਦੇ ਹਨ ਅਤੇ ਸਿਸਟਮ ਵਿੱਚ ਖਾਸ GPU ਮਾਡਲਾਂ ਦੇ ਵਿਰੁੱਧ ਟੈਸਟ ਕੀਤੇ ਜਾਂਦੇ ਹਨ। ਇੱਥੇ ਕੋਈ ਮੈਨੂਅਲ ਡਰਾਈਵਰ ਇੰਸਟਾਲੇਸ਼ਨ ਨਹੀਂ ਹੈ, ਕੋਈ ਸੰਸਕਰਣ ਬੇਮੇਲ ਡੀਬਗਿੰਗ ਨਹੀਂ ਹੈ, ਅਤੇ ਕੋਈ ਟੁੱਟੇ ਹੋਏ ਸਿਮਲਿੰਕਸ ਨਹੀਂ ਹਨ।

cuDNN: CUDA ਡੀਪ ਨਿਊਰਲ ਨੈੱਟਵਰਕ ਲਾਇਬ੍ਰੇਰੀ ਸਿਸਟਮ ਵਿੱਚ ਮੌਜੂਦ GPU ਆਰਕੀਟੈਕਚਰ ਲਈ ਪਹਿਲਾਂ ਤੋਂ ਸਥਾਪਿਤ ਅਤੇ ਟਿਊਨ ਕੀਤੀ ਗਈ ਹੈ। DGX OS ਵਿੱਚ ਆਮ ਨੈੱਟਵਰਕ ਆਰਕੀਟੈਕਚਰ ਲਈ cuDNN ਦੇ ਆਟੋ-ਟਿਊਨਿੰਗ ਪ੍ਰੋਫਾਈਲਾਂ ਸ਼ਾਮਲ ਹਨ, ਮਤਲਬ ਕਿ ਤੁਹਾਡਾ ਪਹਿਲਾ ਕਨਵੋਲਿਊਸ਼ਨ ਜਾਂ ਧਿਆਨ ਸੰਚਾਲਨ ਵਾਰਮਅੱਪ ਪ੍ਰਯੋਗਾਂ ਦੇ ਬਿਨਾਂ ਨਜ਼ਦੀਕੀ-ਅਨੁਕੂਲ ਗਤੀ 'ਤੇ ਚੱਲਦਾ ਹੈ।

TensorRT: NVIDIA ਦੇ ਇਨਫਰੈਂਸ ਓਪਟੀਮਾਈਜੇਸ਼ਨ ਇੰਜਣ ਨੂੰ ਪ੍ਰਸਿੱਧ ਮਾਡਲ ਆਰਕੀਟੈਕਚਰ ਲਈ ਪ੍ਰੀ-ਬਿਲਟ ਪਲੱਗਇਨਾਂ ਨਾਲ ਸ਼ਾਮਲ ਕੀਤਾ ਗਿਆ ਹੈ। DGX OS ਉਪਲਬਧ GPU ਮੈਮੋਰੀ ਦੀ ਕੁਸ਼ਲਤਾ ਨਾਲ ਵਰਤੋਂ ਕਰਨ ਲਈ TensorRT ਨੂੰ ਕੌਂਫਿਗਰ ਕਰਦਾ ਹੈ, INT8 ਅਤੇ FP16 ਅਨੁਮਾਨ ਨੂੰ ਚਲਾਉਣ ਲਈ ਤਿਆਰ ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਟੂਲਸ ਦੇ ਨਾਲ ਬਕਸੇ ਦੇ ਬਾਹਰ ਸਮਰੱਥ ਬਣਾਉਂਦਾ ਹੈ।

NCCL: NVIDIA ਕਲੈਕਟਿਵ ਕਮਿਊਨੀਕੇਸ਼ਨਜ਼ ਲਾਇਬ੍ਰੇਰੀ ਮਲਟੀ-GPU ਅਤੇ ਮਲਟੀ-ਨੋਡ ਸਿਖਲਾਈ ਲਈ ਮਹੱਤਵਪੂਰਨ ਹੈ। DGX OS NCCL ਨੂੰ ਟੌਪੋਲੋਜੀ-ਜਾਗਰੂਕ ਸੈਟਿੰਗਾਂ ਨਾਲ ਕੌਂਫਿਗਰ ਕਰਦਾ ਹੈ ਜੋ ਸਿਸਟਮ ਦੇ NVLink, NVSwitch, ਅਤੇ InfiniBand ਫੈਬਰਿਕ ਨਾਲ ਮੇਲ ਖਾਂਦਾ ਹੈ। NVSwitch ਦੁਆਰਾ ਜੁੜੇ ਅੱਠ GPUs ਦੇ ਨਾਲ ਇੱਕ DGX H100 ਸਿਸਟਮ 'ਤੇ, NCCL ਬਿਨਾਂ ਕਿਸੇ ਦਸਤੀ ਟਿਊਨਿੰਗ ਦੇ ਸਾਰੇ-ਘਟਾਉਣ ਵਾਲੇ ਓਪਰੇਸ਼ਨਾਂ ਲਈ ਨੇੜੇ-ਸਿਧਾਂਤਕ-ਵੱਧ ਤੋਂ ਵੱਧ ਬੈਂਡਵਿਡਥ ਪ੍ਰਾਪਤ ਕਰਦਾ ਹੈ।

ਕੰਟੇਨਰ ਰਨਟਾਈਮ ਅਤੇ NGC

DGX OS ਕੰਟੇਨਰਾਂ ਨੂੰ AI ਵਰਕਲੋਡ ਲਈ ਪ੍ਰਾਇਮਰੀ ਡਿਪਲਾਇਮੈਂਟ ਵਿਧੀ ਵਜੋਂ ਵਰਤਦਾ ਹੈ। NVIDIA ਕੰਟੇਨਰ ਟੂਲਕਿੱਟ ਪ੍ਰੀ-ਇੰਸਟਾਲ ਕੀਤੀ ਗਈ ਹੈ, ਜੋ ਡੌਕਰ ਅਤੇ ਹੋਰ OCI-ਅਨੁਕੂਲ ਰਨਟਾਈਮ ਨੂੰ GPUs ਨੂੰ ਪਾਰਦਰਸ਼ੀ ਢੰਗ ਨਾਲ ਐਕਸੈਸ ਕਰਨ ਲਈ ਸਮਰੱਥ ਬਣਾਉਂਦਾ ਹੈ। ਜਦੋਂ ਤੁਸੀਂ ਇੱਕ ਕੰਟੇਨਰ ਚਲਾਉਂਦੇ ਹੋ, ਤਾਂ GPU ਡਿਵਾਈਸਾਂ, ਡਰਾਈਵਰ, ਅਤੇ ਲਾਇਬ੍ਰੇਰੀਆਂ ਆਪਣੇ ਆਪ ਹੀ ਕੰਟੇਨਰ ਨੇਮਸਪੇਸ ਦੇ ਅੰਦਰ ਮਾਊਂਟ ਹੋ ਜਾਂਦੀਆਂ ਹਨ।

ਸਿਸਟਮ NVIDIA NGC, ਹਰੇਕ ਵੱਡੇ AI ਫਰੇਮਵਰਕ ਲਈ GPU- ਅਨੁਕੂਲਿਤ ਕੰਟੇਨਰਾਂ ਦਾ ਇੱਕ ਕੈਟਾਲਾਗ, ਨਾਲ ਮਜ਼ਬੂਤੀ ਨਾਲ ਏਕੀਕ੍ਰਿਤ ਹੈ। PyTorch, TensorFlow, JAX, RAPIDS, ਅਤੇ ਦਰਜਨਾਂ ਹੋਰ ਟੂਲਾਂ ਲਈ NGC ਕੰਟੇਨਰਾਂ ਦੀ DGX OS ਦੇ ਵਿਰੁੱਧ ਮਹੀਨਾਵਾਰ ਜਾਂਚ ਕੀਤੀ ਜਾਂਦੀ ਹੈ ਅਤੇ ਪ੍ਰਦਰਸ਼ਨ ਮਾਪਦੰਡਾਂ ਨਾਲ ਪ੍ਰਕਾਸ਼ਿਤ ਕੀਤੀ ਜਾਂਦੀ ਹੈ। DGX OS 'ਤੇ NGC ਕੰਟੇਨਰ ਨੂੰ ਖਿੱਚਣਾ ਅਤੇ ਚਲਾਉਣਾ ਇੱਕ ਸਿੰਗਲ ਕਮਾਂਡ ਹੈ:

docker run --gpus all nvcr.io/nvidia/pytorch:24.03-py3

ਇਸ ਕੰਟੇਨਰ ਵਿੱਚ ਮੇਜ਼ਬਾਨ ਸਿਸਟਮ ਲਈ ਅਨੁਕੂਲ CUDA ਅਤੇ cuDNN ਸੰਸਕਰਣਾਂ ਦੇ ਨਾਲ ਕੰਪਾਇਲ ਕੀਤਾ PyTorch, ਮਿਸ਼ਰਤ-ਸ਼ੁੱਧਤਾ ਸਿਖਲਾਈ ਲਈ Apex ਦੇ ਨਾਲ, ਕੁਸ਼ਲ ਧਿਆਨ ਗਣਨਾ ਲਈ ਟ੍ਰਾਂਸਫਾਰਮਰ ਇੰਜਣ, ਅਤੇ ਪਹਿਲਾਂ ਤੋਂ ਸੰਰਚਿਤ ਵਿਤਰਿਤ ਸਿਖਲਾਈ ਉਪਯੋਗਤਾਵਾਂ ਸ਼ਾਮਲ ਹਨ।

ਕਲੱਸਟਰ ਆਰਕੈਸਟਰੇਸ਼ਨ ਲਈ ਬੇਸ ਕਮਾਂਡ ਮੈਨੇਜਰ

ਡੀਜੀਐਕਸ ਕਲੱਸਟਰ ਆਰਕੀਟੈਕਚਰ DGX ਨੋਡ 1 8× H100 GPUs 640GB HBM3 DGX OS DGX ਨੋਡ 2 8× H100 GPUs 640GB HBM3 DGX OS DGX ਨੋਡ 3 8× H100 GPUs 640GB HBM3 DGX OS DGX ਨੋਡ 4 8× H100 GPUs 640GB HBM3 DGX OS InfiniBand NDR 400Gb/s ਫੈਬਰਿਕ RDMA · GPUDirect · ਘੱਟ-ਲੇਟੈਂਸੀ ਮਲਟੀ-ਨੋਡ ਸੰਚਾਰ ਬੇਸ ਕਮਾਂਡ ਮੈਨੇਜਰ Slurm / Kubernetes · ਨੌਕਰੀ ਦੀ ਸਮਾਂ-ਸਾਰਣੀ ਸ਼ੇਅਰਡ ਸਟੋਰੇਜ ਚਮਕ / GPFS · ਉੱਚ-ਥਰੂਪੁਟ I/O 32× H100 GPUs · 2.56TB ਕੁੱਲ HBM3 · 31,680 FP16 TFLOPS

ਮਲਟੀਪਲ DGX ਸਿਸਟਮ ਚਲਾਉਣ ਵਾਲੀਆਂ ਸੰਸਥਾਵਾਂ ਲਈ, DGX OS ਬੇਸ ਕਮਾਂਡ ਮੈਨੇਜਰ (ਪਹਿਲਾਂ ਬ੍ਰਾਈਟ ਕਲੱਸਟਰ ਮੈਨੇਜਰ) ਨਾਲ ਏਕੀਕ੍ਰਿਤ ਹੁੰਦਾ ਹੈ। ਇਹ ਆਰਕੈਸਟਰੇਸ਼ਨ ਲੇਅਰ ਸਲਰਮ ਜਾਂ Kubernetes, ਮਲਟੀ-ਨੋਡ ਸਰੋਤ ਵੰਡ, ਉਪਭੋਗਤਾ ਅਤੇ ਸਮੂਹ ਪ੍ਰਬੰਧਨ, ਅਤੇ ਕਲੱਸਟਰ ਵਿੱਚ ਸਿਹਤ ਨਿਗਰਾਨੀ ਦੁਆਰਾ ਨੌਕਰੀ ਦੀ ਸਮਾਂ-ਸਾਰਣੀ ਪ੍ਰਦਾਨ ਕਰਦੀ ਹੈ।

ਬੇਸ ਕਮਾਂਡ ਮੈਨੇਜਰ ਮਲਟੀ-ਨੋਡ ਸਿਖਲਾਈ ਨੌਕਰੀਆਂ ਦੇ ਤਾਲਮੇਲ ਦੇ ਗੁੰਝਲਦਾਰ ਕੰਮ ਨੂੰ ਸੰਭਾਲਦਾ ਹੈ। ਜਦੋਂ ਤੁਸੀਂ ਇੱਕ ਸਿਖਲਾਈ ਨੌਕਰੀ ਜਮ੍ਹਾਂ ਕਰਦੇ ਹੋ ਜਿਸ ਲਈ ਚਾਰ DGX ਨੋਡਾਂ ਵਿੱਚ 32 GPUs ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ, ਤਾਂ ਮੈਨੇਜਰ ਸਰੋਤ ਨਿਰਧਾਰਤ ਕਰਦਾ ਹੈ, ਨੈਟਵਰਕ ਫੈਬਰਿਕ ਨੂੰ ਕੌਂਫਿਗਰ ਕਰਦਾ ਹੈ, ਹਰੇਕ ਨੋਡ 'ਤੇ ਪ੍ਰਕਿਰਿਆਵਾਂ ਲਾਂਚ ਕਰਦਾ ਹੈ, ਅਤੇ ਅਸਫਲਤਾਵਾਂ ਲਈ ਮਾਨੀਟਰ ਕਰਦਾ ਹੈ। ਜੇਕਰ ਇੱਕ GPU ਇੱਕ ਗਲਤੀ ਦਾ ਸਾਹਮਣਾ ਕਰਦਾ ਹੈ, ਤਾਂ ਮੈਨੇਜਰ ਸਿਖਲਾਈ ਸਥਿਤੀ ਦੀ ਜਾਂਚ ਕਰ ਸਕਦਾ ਹੈ ਅਤੇ ਸਿਹਤਮੰਦ ਹਾਰਡਵੇਅਰ 'ਤੇ ਕੰਮ ਨੂੰ ਮੁੜ ਚਾਲੂ ਕਰ ਸਕਦਾ ਹੈ।

Kubernetes ਨੂੰ ਤਰਜੀਹ ਦੇਣ ਵਾਲੀਆਂ ਟੀਮਾਂ ਲਈ, DGX OS NVIDIA GPU ਆਪਰੇਟਰ ਅਤੇ ਨੈੱਟਵਰਕ ਆਪਰੇਟਰ ਦਾ ਸਮਰਥਨ ਕਰਦਾ ਹੈ, ਜੋ GPUs ਅਤੇ ਹਾਈ-ਸਪੀਡ ਇੰਟਰਕਨੈਕਟਾਂ ਨੂੰ Kubernetes ਸਰੋਤਾਂ ਵਜੋਂ ਉਜਾਗਰ ਕਰਦੇ ਹਨ। ਇਹ ਪਲੇਟਫਾਰਮ ਟੀਮਾਂ ਨੂੰ ਸਟੈਂਡਰਡ Kubernetes APIs ਦੁਆਰਾ ਸਵੈ-ਸੇਵਾ AI ਬੁਨਿਆਦੀ ਢਾਂਚਾ ਪ੍ਰਦਾਨ ਕਰਨ ਦਿੰਦਾ ਹੈ ਜਦੋਂ ਕਿ DGX OS ਹੇਠਾਂ ਹਾਰਡਵੇਅਰ-ਵਿਸ਼ੇਸ਼ ਜਟਿਲਤਾ ਨੂੰ ਸੰਭਾਲਦਾ ਹੈ।

ਸੁਰੱਖਿਆ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ

ਐਂਟਰਪ੍ਰਾਈਜ਼ ਏਆਈ ਸਿਸਟਮ ਸੰਵੇਦਨਸ਼ੀਲ ਡੇਟਾ ਅਤੇ ਮਹਿੰਗੇ ਗਣਨਾ ਸਰੋਤਾਂ ਨੂੰ ਸੰਭਾਲਦੇ ਹਨ, ਜਿਸ ਨਾਲ DGX OS ਵਿੱਚ ਸੁਰੱਖਿਆ ਨੂੰ ਪਹਿਲੀ ਸ਼੍ਰੇਣੀ ਦੀ ਚਿੰਤਾ ਬਣ ਜਾਂਦੀ ਹੈ।

ਸੁਰੱਖਿਅਤ ਬੂਟ: DGX OS ਫਰਮਵੇਅਰ ਤੋਂ ਕਰਨਲ ਦੁਆਰਾ ਯੂਜ਼ਰਸਪੇਸ ਤੱਕ ਬੂਟ ਚੇਨ ਦੀ ਇਕਸਾਰਤਾ ਨੂੰ ਪ੍ਰਮਾਣਿਤ ਕਰਦਾ ਹੈ। ਹਰ ਕੰਪੋਨੈਂਟ ਨੂੰ ਕ੍ਰਿਪਟੋਗ੍ਰਾਫਿਕ ਤੌਰ 'ਤੇ ਹਸਤਾਖਰਿਤ ਕੀਤਾ ਗਿਆ ਹੈ, ਟੈਂਪਰਡ ਕਰਨਲ ਜਾਂ ਰੂਟਕਿਟਸ ਨੂੰ ਲੋਡ ਹੋਣ ਤੋਂ ਰੋਕਦਾ ਹੈ। ਇਹ ਖਾਸ ਤੌਰ 'ਤੇ ਸਾਂਝੇ ਵਾਤਾਵਰਨ ਵਿੱਚ ਮਹੱਤਵਪੂਰਨ ਹੈ ਜਿੱਥੇ ਕਈ ਟੀਮਾਂ ਇੱਕੋ ਹਾਰਡਵੇਅਰ ਤੱਕ ਪਹੁੰਚ ਕਰਦੀਆਂ ਹਨ।

ਐਨਕ੍ਰਿਪਟਡ ਸਟੋਰੇਜ: ਪੂਰੀ-ਡਿਸਕ ਇਨਕ੍ਰਿਪਸ਼ਨ ਬਾਕਸ ਦੇ ਬਾਹਰ ਉਪਲਬਧ ਹੈ, OS ਡਰਾਈਵਾਂ ਅਤੇ ਹਾਈ-ਸਪੀਡ NVMe ਸਟੋਰੇਜ ਦੋਵਾਂ 'ਤੇ ਬਾਕੀ ਦੇ ਡੇਟਾ ਦੀ ਸੁਰੱਖਿਆ ਕਰਦੀ ਹੈ। ਕੁੰਜੀ ਪ੍ਰਬੰਧਨ ਐਂਟਰਪ੍ਰਾਈਜ਼ ਪ੍ਰਣਾਲੀਆਂ ਜਿਵੇਂ ਕਿ HashiCorp ਵਾਲਟ ਅਤੇ ਹਾਰਡਵੇਅਰ ਸੁਰੱਖਿਆ ਮੋਡੀਊਲ ਨਾਲ ਏਕੀਕ੍ਰਿਤ ਹੁੰਦਾ ਹੈ।

ਨੈੱਟਵਰਕ ਆਈਸੋਲੇਸ਼ਨ: DGX OS ਵਧੀਆ ਨੈੱਟਵਰਕ ਨੀਤੀਆਂ ਦਾ ਸਮਰਥਨ ਕਰਦਾ ਹੈ ਜੋ ਸਿਖਲਾਈ ਦੀਆਂ ਨੌਕਰੀਆਂ ਨੂੰ ਇੱਕ ਦੂਜੇ ਤੋਂ ਅਤੇ ਪ੍ਰਬੰਧਨ ਟ੍ਰੈਫਿਕ ਤੋਂ ਅਲੱਗ ਕਰਦੀਆਂ ਹਨ। GPU-ਸਿੱਧਾ RDMA ਟ੍ਰੈਫਿਕ ਸਮਰਪਿਤ InfiniBand ਭਾਗਾਂ 'ਤੇ ਵਹਿੰਦਾ ਹੈ, ਸਾਂਝੇ ਕਲੱਸਟਰਾਂ 'ਤੇ ਕਿਰਾਏਦਾਰਾਂ ਵਿਚਕਾਰ ਡਾਟਾ ਲੀਕੇਜ ਨੂੰ ਰੋਕਦਾ ਹੈ।

ਆਡਿਟ ਲੌਗਿੰਗ: ਸਾਰੀਆਂ ਪ੍ਰਸ਼ਾਸਕੀ ਕਾਰਵਾਈਆਂ, GPU ਵੰਡ, ਅਤੇ ਕੰਟੇਨਰ ਲਾਂਚਾਂ ਨੂੰ ਛੇੜਛਾੜ-ਰੋਧਕ ਆਡਿਟ ਟ੍ਰੇਲ ਵਿੱਚ ਲੌਗ ਕੀਤਾ ਗਿਆ ਹੈ। ਇਹ ਲੌਗ ਪਾਲਣਾ ਨਿਗਰਾਨੀ ਲਈ ਮਿਆਰੀ SIEM ਪਲੇਟਫਾਰਮਾਂ ਨਾਲ ਏਕੀਕ੍ਰਿਤ ਹੁੰਦੇ ਹਨ।

ਬਾਕਸ ਦੇ ਬਾਹਰ ਪ੍ਰਦਰਸ਼ਨ ਟਿਊਨਿੰਗ

DGX OS ਵਿੱਚ ਸੈਂਕੜੇ ਪ੍ਰਦਰਸ਼ਨ ਅਨੁਕੂਲਨ ਸ਼ਾਮਲ ਹੁੰਦੇ ਹਨ ਜੋ ਇੱਕ ਮਾਹਰ ਸਿਸਟਮ ਪ੍ਰਸ਼ਾਸਕ ਨੂੰ ਹੱਥੀਂ ਲਾਗੂ ਕਰਨ ਲਈ ਹਫ਼ਤਿਆਂ ਦਾ ਸਮਾਂ ਲੈਂਦੇ ਹਨ। ਕਰਨਲ ਨੂੰ ਅਨੁਕੂਲ CPU ਗਵਰਨਰ ਸੈਟਿੰਗਾਂ, NUMA-ਜਾਣੂ ਮੈਮੋਰੀ ਵੰਡ, ਅਤੇ ਟਿਊਨਡ ਨੈੱਟਵਰਕ ਸਟੈਕ ਪੈਰਾਮੀਟਰਾਂ ਨਾਲ ਸੰਰਚਿਤ ਕੀਤਾ ਗਿਆ ਹੈ। GPU ਪਰਸਿਸਟੈਂਸ ਮੋਡ ਡਿਫੌਲਟ ਤੌਰ 'ਤੇ ਸਮਰੱਥ ਹੈ, ਸਟਾਰਟਅਪ ਲੇਟੈਂਸੀ ਨੂੰ ਖਤਮ ਕਰਦਾ ਹੈ ਜੋ ਸਟੈਂਡਰਡ ਲੀਨਕਸ 'ਤੇ ਵਿਕਾਸ ਕਾਰਜਪ੍ਰਵਾਹ ਨੂੰ ਪ੍ਰਭਾਵਿਤ ਕਰਦਾ ਹੈ। GPU ਮੈਮੋਰੀ ਮੈਪਿੰਗ ਲਈ ਵੱਡੇ ਪੰਨੇ ਪਹਿਲਾਂ ਤੋਂ ਨਿਰਧਾਰਤ ਕੀਤੇ ਗਏ ਹਨ। IRQ ਸਬੰਧ ਡਾਟਾ ਟ੍ਰਾਂਸਫਰ ਦੌਰਾਨ CPU ਓਵਰਹੈੱਡ ਨੂੰ ਘੱਟ ਕਰਨ ਲਈ ਸੈੱਟ ਕੀਤਾ ਗਿਆ ਹੈ।

ਨਤੀਜਾ ਮਾਪਣਯੋਗ ਹੈ. ਬੈਂਚਮਾਰਕ ਤੁਲਨਾਵਾਂ ਲਗਾਤਾਰ ਦਿਖਾਉਂਦੀਆਂ ਹਨ ਕਿ DGX OS ਹੱਥੀਂ ਸਥਾਪਿਤ ਡ੍ਰਾਈਵਰਾਂ ਦੇ ਨਾਲ ਚੱਲ ਰਹੇ ਸਟਾਕ ਉਬੰਟੂ ਦੇ ਸਮਾਨ ਹਾਰਡਵੇਅਰ ਨਾਲੋਂ ਪੰਜ ਤੋਂ ਪੰਦਰਾਂ ਪ੍ਰਤੀਸ਼ਤ ਉੱਚ ਸਿਖਲਾਈ ਥ੍ਰਰੂਪੁਟ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ, ਇੱਕ ਅੰਤਰ ਜੋ ਬਹੁ-ਦਿਨ ਦੀ ਸਿਖਲਾਈ ਦੇ ਨਾਲ ਮਹੱਤਵਪੂਰਨ ਸਮਾਂ ਅਤੇ ਲਾਗਤ ਬਚਤ ਵਿੱਚ ਚਲਦਾ ਹੈ।

ਕਿਸਨੂੰ DGX OS ਬਨਾਮ ਸਟੈਂਡਰਡ ਉਬੰਟੂ ਦੀ ਲੋੜ ਹੈ?

DGX OS ਹਰ ਕਿਸੇ ਲਈ ਨਹੀਂ ਹੈ, ਅਤੇ ਇਹ ਸਮਝਣਾ ਮਹੱਤਵਪੂਰਨ ਹੈ ਕਿ ਇਹ ਕਦੋਂ ਮੁੱਲ ਜੋੜਦਾ ਹੈ। ਜੇ ਤੁਸੀਂ ਜੁਪੀਟਰ ਨੋਟਬੁੱਕਾਂ ਤੋਂ ਇੱਕ ਸਿੰਗਲ GPU ਚੱਲ ਰਹੇ ਪ੍ਰਯੋਗਾਂ ਦੇ ਨਾਲ ਇੱਕਲੇ ਖੋਜਕਰਤਾ ਹੋ, ਤਾਂ ਇੱਕ ਦਸਤੀ ਸਥਾਪਿਤ CUDA ਟੂਲਕਿੱਟ ਵਾਲਾ ਮਿਆਰੀ ਉਬੰਟੂ ਬਿਲਕੁਲ ਉਚਿਤ ਹੈ। DGX OS ਦੀਆਂ ਐਂਟਰਪ੍ਰਾਈਜ਼ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ ਦਾ ਓਵਰਹੈੱਡ ਬਿਨਾਂ ਲਾਭ ਦੇ ਜਟਿਲਤਾ ਨੂੰ ਜੋੜ ਦੇਵੇਗਾ।

DGX OS ਮਜਬੂਰ ਹੋ ਜਾਂਦਾ ਹੈ ਜਦੋਂ ਤੁਹਾਡੇ ਕੋਲ ਇੱਕ ਤੋਂ ਵੱਧ GPUs ਜਾਂ ਨੋਡ ਹੁੰਦੇ ਹਨ, ਜਦੋਂ ਇੱਕ ਤੋਂ ਵੱਧ ਉਪਭੋਗਤਾ ਹਾਰਡਵੇਅਰ ਸਾਂਝੇ ਕਰਦੇ ਹਨ, ਜਦੋਂ ਤੁਹਾਨੂੰ ਵਿਕਾਸ ਅਤੇ ਉਤਪਾਦਨ ਵਿੱਚ ਦੁਬਾਰਾ ਪੈਦਾ ਕਰਨ ਯੋਗ ਵਾਤਾਵਰਣ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ, ਜਾਂ ਜਦੋਂ ਪਾਲਣਾ ਦੀਆਂ ਲੋੜਾਂ ਸੁਰੱਖਿਅਤ ਬੂਟ ਅਤੇ ਆਡਿਟ ਲੌਗਿੰਗ ਵਰਗੀਆਂ ਸੁਰੱਖਿਆ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ ਨੂੰ ਲਾਜ਼ਮੀ ਕਰਦੀਆਂ ਹਨ। ਇਹਨਾਂ ਸਥਿਤੀਆਂ ਵਿੱਚ, ਸੈੱਟਅੱਪ 'ਤੇ ਬਚਿਆ ਸਮਾਂ, ਕੌਂਫਿਗਰੇਸ਼ਨ ਡ੍ਰਾਈਫਟ ਵਿੱਚ ਕਮੀ, ਅਤੇ ਪ੍ਰਮਾਣਿਤ ਸੌਫਟਵੇਅਰ ਸਟੈਕ ਤੋਂ ਮਨ ਦੀ ਸ਼ਾਂਤੀ ਨਿਵੇਸ਼ ਨੂੰ ਜਾਇਜ਼ ਠਹਿਰਾਉਂਦੀ ਹੈ।

Lenovo ThinkStation PGX 'ਤੇ DGX OS

DGX ਈਕੋਸਿਸਟਮ ਦੇ ਮਹੱਤਵਪੂਰਨ ਵਿਸਤਾਰ ਵਿੱਚ, NVIDIA ਨੇ DGX OS ਨੂੰ ThinkStation PGX ਵਿੱਚ ਲਿਆਉਣ ਲਈ Lenovo ਨਾਲ ਸਾਂਝੇਦਾਰੀ ਕੀਤੀ, ਇੱਕ ਵਰਕਸਟੇਸ਼ਨ-ਕਲਾਸ ਸਿਸਟਮ ਜੋ AI ਵਿਕਾਸ ਲਈ ਤਿਆਰ ਕੀਤਾ ਗਿਆ ਹੈ। ThinkStation PGX NVIDIA GPUs ਨੂੰ Lenovo ਦੇ ਵਰਕਸਟੇਸ਼ਨ ਡਿਜ਼ਾਈਨ, ਥਰਮਲ ਪ੍ਰਬੰਧਨ, ਅਤੇ ਸਹਾਇਤਾ ਬੁਨਿਆਦੀ ਢਾਂਚੇ ਨਾਲ ਜੋੜਦਾ ਹੈ, ਜਦੋਂ ਕਿ DGX OS ਪਹਿਲਾਂ ਸਿਰਫ਼ NVIDIA-ਬ੍ਰਾਂਡ ਵਾਲੇ ਹਾਰਡਵੇਅਰ 'ਤੇ ਉਪਲਬਧ ਸਾਫਟਵੇਅਰ ਅਨੁਭਵ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ।

ਇਹ ਭਾਈਵਾਲੀ ਮਾਇਨੇ ਰੱਖਦੀ ਹੈ ਕਿਉਂਕਿ ਇਹ ਐਂਟਰਪ੍ਰਾਈਜ਼ AI ਸਮਰੱਥਾਵਾਂ ਨੂੰ ਇੱਕ ਫਾਰਮ ਫੈਕਟਰ ਵਿੱਚ ਲਿਆਉਂਦਾ ਹੈ ਜੋ ਇੱਕ ਡੈਸਕ ਦੇ ਹੇਠਾਂ ਫਿੱਟ ਹੁੰਦਾ ਹੈ। ਉਹ ਟੀਮਾਂ ਜਿਨ੍ਹਾਂ ਨੂੰ DGX-ਕਲਾਸ ਸਾਫਟਵੇਅਰ ਦੀ ਲੋੜ ਹੈ ਪਰ ਡਾਟਾ ਸੈਂਟਰ ਰੈਕ ਨੂੰ ਜਾਇਜ਼ ਨਹੀਂ ਠਹਿਰਾਇਆ ਜਾ ਸਕਦਾ ਹੈ, ਉਹ ਹੁਣ ThinkStation PGX ਸਿਸਟਮਾਂ ਨੂੰ ਦਫ਼ਤਰ ਦੇ ਵਾਤਾਵਰਨ ਵਿੱਚ ਤੈਨਾਤ ਕਰ ਸਕਦੀਆਂ ਹਨ ਜਿਸ ਨਾਲ ਡਾਟਾ ਸੈਂਟਰ ਵਿੱਚ DGX ਸਿਸਟਮਾਂ 'ਤੇ ਚੱਲ ਰਹੇ ਪ੍ਰਮਾਣਿਤ ਸਟੈਕ ਹਨ।

ਸੈੱਟਅੱਪ ਅਤੇ ਪਹਿਲੇ ਕਦਮ

DGX OS ਨਾਲ ਸ਼ੁਰੂਆਤ ਕਰਨਾ ਤੁਹਾਡੇ ਹਾਰਡਵੇਅਰ 'ਤੇ ਨਿਰਭਰ ਕਰਦਾ ਹੈ। NVIDIA DGX ਸਿਸਟਮਾਂ 'ਤੇ, OS ਪਹਿਲਾਂ ਤੋਂ ਸਥਾਪਿਤ ਹੁੰਦਾ ਹੈ। ਥਿੰਕਸਟੇਸ਼ਨ PGX ਵਰਗੇ ਸਮਰਥਿਤ ਪਾਰਟਨਰ ਹਾਰਡਵੇਅਰ 'ਤੇ, ਤੁਸੀਂ NVIDIA ਦੇ ਐਂਟਰਪ੍ਰਾਈਜ਼ ਪੋਰਟਲ ਦੁਆਰਾ ਪ੍ਰਦਾਨ ਕੀਤੇ ਬੂਟ ਹੋਣ ਯੋਗ USB ਚਿੱਤਰ ਤੋਂ DGX OS ਨੂੰ ਸਥਾਪਿਤ ਕਰਦੇ ਹੋ।

ਇੰਸਟਾਲੇਸ਼ਨ ਤੋਂ ਬਾਅਦ, ਐਂਟਰਪ੍ਰਾਈਜ਼ ਸਹਾਇਤਾ ਅਤੇ NGC ਪਹੁੰਚ ਨੂੰ ਸਰਗਰਮ ਕਰਨ ਲਈ ਸਿਸਟਮ ਨੂੰ NVIDIA ਦੇ ਲਾਇਸੈਂਸ ਸਰਵਰ ਨਾਲ ਰਜਿਸਟਰ ਕਰਨਾ ਪਹਿਲਾ ਕਦਮ ਹੈ। ਅੱਗੇ, ਬਿਲਟ-ਇਨ ਪ੍ਰਮਾਣਿਕਤਾ ਸੂਟ ਚਲਾ ਕੇ GPU ਸਟੈਕ ਦੀ ਪੁਸ਼ਟੀ ਕਰੋ:

nvidia-smi
dgxos-validate --full

ਇਹ ਡਰਾਈਵਰਾਂ, ਲਾਇਬ੍ਰੇਰੀਆਂ, ਇੰਟਰਕਨੈਕਟਸ, ਅਤੇ ਸਟੋਰੇਜ ਦੀ ਇੱਕ ਵਿਆਪਕ ਜਾਂਚ ਚਲਾਉਂਦਾ ਹੈ। ਇੱਕ ਵਾਰ ਪ੍ਰਮਾਣਿਕਤਾ ਪਾਸ ਹੋਣ ਤੋਂ ਬਾਅਦ, ਆਪਣਾ ਪਹਿਲਾ NGC ਕੰਟੇਨਰ ਖਿੱਚੋ ਅਤੇ ਇਹ ਪੁਸ਼ਟੀ ਕਰਨ ਲਈ ਇੱਕ ਬੈਂਚਮਾਰਕ ਚਲਾਓ ਕਿ ਹਰ ਚੀਜ਼ ਉਮੀਦ ਅਨੁਸਾਰ ਕੰਮ ਕਰ ਰਹੀ ਹੈ। ਉੱਥੋਂ, ਤੁਸੀਂ ਉਪਭੋਗਤਾ ਖਾਤਿਆਂ ਨੂੰ ਕੌਂਫਿਗਰ ਕਰ ਸਕਦੇ ਹੋ, ਨੌਕਰੀ ਦੀ ਸਮਾਂ-ਸਾਰਣੀ ਲਈ Slurm ਜਾਂ Kubernetes ਸੈਟ ਕਰ ਸਕਦੇ ਹੋ, ਅਤੇ ਆਪਣੇ AI ਵਰਕਲੋਡਾਂ ਨੂੰ ਇੱਕ ਪਲੇਟਫਾਰਮ 'ਤੇ ਆਨਬੋਰਡ ਕਰਨਾ ਸ਼ੁਰੂ ਕਰ ਸਕਦੇ ਹੋ ਜੋ ਉਹਨਾਂ ਨੂੰ ਚਲਾਉਣ ਲਈ ਵਿਸ਼ੇਸ਼ ਤੌਰ 'ਤੇ ਬਣਾਇਆ ਗਿਆ ਸੀ।