ما هو نظام DGX؟
DGX OS هو نظام تشغيل NVIDIA المصمم خصيصًا للبنية التحتية للذكاء الاصطناعي. استنادًا إلى Ubuntu Linux، فإنه يذهب إلى ما هو أبعد من التوزيع القياسي من خلال دمج مجموعة برامج الذكاء الاصطناعي المحسنة بالكامل، وميزات أمان المؤسسة، وأدوات إدارة المجموعة في منصة واحدة متماسكة. كان نظام DGX OS متاحًا في الأصل فقط على أجهزة DGX الخاصة بشركة NVIDIA، وقد قام بتوسيع نطاق وصوله ويدعم الآن أنظمة شريكة مختارة، مما يعكس طموح NVIDIA لتصبح النظام الأساسي الافتراضي لحوسبة الذكاء الاصطناعي على كل نطاق.
بالنسبة لمهندسي الذكاء الاصطناعي، يحل نظام DGX OS مشكلة مستمرة: الفجوة بين تثبيت نظام التشغيل وامتلاك بيئة جاهزة للإنتاج للتدريب والاستدلال. في نظام Ubuntu القياسي، يمكن أن يستهلك تكوين برامج تشغيل CUDA وcuDNN وأوقات تشغيل الحاوية ونسيج الشبكة والتخزين أيامًا من الوقت الهندسي ويسبب مشكلات توافق دقيقة. يعمل نظام DGX OS على التخلص من هذا الاحتكاك تمامًا.
مجموعة برامج الذكاء الاصطناعي التي تم تكوينها مسبقًا
محور نظام DGX OS هو مجموعة برامج الذكاء الاصطناعي التي تم تكوينها مسبقًا والتحقق من صحتها. يتم اختبار كل مكون معًا وضمان العمل بأعلى أداء على الأجهزة المدعومة.
مجموعة أدوات كودا: يأتي نظام DGX OS مزودًا بأحدث إصدار مستقر من CUDA، وتم تكوينه بالكامل باستخدام متغيرات البيئة ومسارات المكتبة وسلاسل أدوات المترجم. تتم مطابقة إصدارات برامج التشغيل مع kernel واختبارها مقابل نماذج GPU المحددة في النظام. لا يوجد تثبيت يدوي لبرنامج التشغيل، ولا يوجد تصحيح أخطاء لعدم تطابق الإصدار، ولا توجد روابط رمزية معطلة.
كودنن: تم تثبيت مكتبة CUDA Deep Neural Network مسبقًا وضبطها لتتناسب مع بنية GPU الموجودة في النظام. يتضمن نظام التشغيل DGX ملفات تعريف الضبط التلقائي الخاصة بـ cuDNN لبنيات الشبكات الشائعة، مما يعني أن عملية الالتفاف أو الانتباه الأولى تعمل بسرعة قريبة من المثالية دون تجارب تمهيدية.
TensorRT: تم تضمين محرك تحسين الاستدلال من NVIDIA مع المكونات الإضافية المعدة مسبقًا لبنيات النماذج الشائعة. يقوم نظام DGX OS بتكوين TensorRT لاستخدام ذاكرة GPU المتاحة بكفاءة، مما يتيح استنتاج INT8 وFP16 خارج الصندوق باستخدام أدوات المعايرة الجاهزة للتشغيل.
نكل: تعد مكتبة NVIDIA Collective Communications ضرورية للتدريب على أجهزة GPU المتعددة والعقد المتعددة. يقوم نظام DGX OS بتكوين NCCL بإعدادات متوافقة مع هيكل النظام والتي تتوافق مع نسيج NVLink وNVSwitch وInfiniBand الخاص بالنظام. في نظام DGX H100 المزود بثماني وحدات GPU متصلة عبر NVSwitch، تحقق NCCL أقصى عرض نطاق ترددي نظري تقريبًا لعمليات التخفيض الشامل دون أي ضبط يدوي.
وقت تشغيل الحاوية وNGC
يستخدم نظام DGX OS الحاويات كآلية نشر أساسية لأحمال عمل الذكاء الاصطناعي. تم تثبيت مجموعة أدوات حاوية NVIDIA مسبقًا، مما يتيح لـ Docker وأوقات التشغيل الأخرى المتوافقة مع OCI الوصول إلى GPUs بشفافية. عند تشغيل حاوية، يتم تثبيت أجهزة GPU وبرامج التشغيل والمكتبات تلقائيًا داخل مساحة اسم الحاوية.
تم دمج النظام بإحكام مع NVIDIA NGC، وهو كتالوج للحاويات المحسنة لـ GPU لكل إطار عمل رئيسي للذكاء الاصطناعي. يتم اختبار حاويات NGC لـ PyTorch وTensorFlow وJAX وRAPIDS وعشرات الأدوات الأخرى شهريًا وفقًا لنظام التشغيل DGX ويتم نشرها مع معايير الأداء. يعد سحب حاوية NGC وتشغيلها على نظام DGX OS أمرًا واحدًا:
docker run --gpus all nvcr.io/nvidia/pytorch:24.03-py3
تشتمل هذه الحاوية على PyTorch المجمعة مع إصدارات CUDA وcuDNN المثالية للنظام المضيف، إلى جانب Apex للتدريب المختلط الدقة، وTransformer Engine لحساب الانتباه بكفاءة، وأدوات تدريب موزعة تم تكوينها مسبقًا.
مدير الأوامر الأساسي لتنسيق المجموعة
بالنسبة للمؤسسات التي تستخدم أنظمة DGX متعددة، يتكامل نظام DGX OS مع Base Command Manager (المعروف سابقًا باسم Bright Cluster Manager). توفر طبقة التنسيق هذه جدولة المهام من خلال Slurm أو Kubernetes، وتخصيص الموارد متعددة العقد، وإدارة المستخدم والمجموعة، ومراقبة الصحة عبر المجموعة.
يتولى Base Command Manager المهمة المعقدة المتمثلة في تنسيق وظائف التدريب متعددة العقد. عند إرسال مهمة تدريب تتطلب 32 GPU عبر أربع عقد DGX، يقوم المدير بتخصيص الموارد وتكوين نسيج الشبكة وإطلاق العمليات على كل عقدة ومراقبة حالات الفشل. إذا واجه GPU خطأً، فيمكن للمدير التحقق من حالة التدريب وإعادة تشغيل المهمة على الأجهزة السليمة.
بالنسبة للفرق التي تفضل Kubernetes، يدعم نظام DGX OS مشغل NVIDIA GPU ومشغل الشبكة، الذي يعرض GPUs والوصلات البينية عالية السرعة كموارد Kubernetes. يتيح ذلك لفرق النظام الأساسي توفير بنية تحتية للذكاء الاصطناعي ذاتية الخدمة من خلال Kubernetes APIs القياسية بينما يتعامل نظام DGX OS مع التعقيد الخاص بالأجهزة الموجود أسفله.
ميزات الأمان
تتعامل أنظمة الذكاء الاصطناعي للمؤسسات مع البيانات الحساسة وموارد الحوسبة باهظة الثمن، مما يجعل الأمان اهتمامًا من الدرجة الأولى في نظام التشغيل DGX.
التمهيد الآمن: يتحقق نظام DGX OS من سلامة سلسلة التمهيد من البرامج الثابتة عبر kernel إلى مساحة المستخدم. يتم توقيع كل مكون بشكل مشفر، مما يمنع تحميل النواة أو الجذور الخفية التي تم العبث بها. وهذا مهم بشكل خاص في البيئات المشتركة حيث تصل فرق متعددة إلى نفس الأجهزة.
التخزين المشفر: يتوفر تشفير القرص بالكامل بشكل جاهز، مما يحمي البيانات غير النشطة على كل من محركات أقراص نظام التشغيل ووحدات تخزين NVMe عالية السرعة. تتكامل إدارة المفاتيح مع أنظمة المؤسسات مثل HashiCorp Vault ووحدات أمان الأجهزة.
عزل الشبكة: يدعم نظام DGX OS سياسات الشبكة الدقيقة التي تعزل وظائف التدريب عن بعضها البعض وعن حركة مرور الإدارة. تتدفق حركة مرور RDMA المباشرة عبر GPU عبر أقسام InfiniBand المخصصة، مما يمنع تسرب البيانات بين المستأجرين في المجموعات المشتركة.
تسجيل التدقيق: يتم تسجيل جميع الإجراءات الإدارية وتخصيصات GPU وعمليات إطلاق الحاويات في مسار تدقيق مقاوم للتلاعب. تتكامل هذه السجلات مع منصات SIEM القياسية لمراقبة الامتثال.
ضبط الأداء خارج الصندوق
يتضمن نظام DGX OS المئات من تحسينات الأداء التي قد يستغرق تنفيذها يدويًا من مسؤول النظام الخبير أسابيع. تم تكوين kernel باستخدام إعدادات حاكم CPU المثالية، وتخصيص الذاكرة المتوافق مع NUMA، ومعلمات مكدس الشبكة المضبوطة. يتم تمكين وضع الثبات GPU افتراضيًا، مما يؤدي إلى التخلص من زمن وصول بدء التشغيل الذي يصيب سير عمل التطوير على نظام التشغيل Linux القياسي. يتم تخصيص صفحات ضخمة مسبقًا لتعيينات ذاكرة GPU. تم تعيين تقارب IRQ لتقليل حمل CPU أثناء عمليات نقل البيانات.
والنتيجة قابلة للقياس. تُظهر المقارنات المعيارية باستمرار أن نظام DGX OS يوفر إنتاجية تدريب أعلى بنسبة تتراوح بين 5 إلى 15 بالمائة من نفس الأجهزة التي تعمل بنظام التشغيل Ubuntu مع برامج تشغيل مثبتة يدويًا، وهو فرق يتضاعف خلال التدريب لعدة أيام يؤدي إلى توفير كبير في الوقت والتكلفة.
من يحتاج إلى نظام DGX OS مقابل Ubuntu القياسي؟
نظام DGX OS ليس مناسبًا للجميع، ومن المهم فهم متى يضيف قيمة. إذا كنت باحثًا منفردًا ولديك GPU واحد يجري تجارب من دفاتر ملاحظات Jupyter، فإن Ubuntu القياسي مع مجموعة أدوات CUDA المثبتة يدويًا يعد مناسبًا تمامًا. من شأن الحمل الزائد لميزات المؤسسة في نظام DGX OS أن يزيد من التعقيد دون فائدة.
يصبح نظام DGX OS مقنعًا عندما يكون لديك العديد من وحدات GPU أو العقد، أو عندما يتشارك العديد من المستخدمين في الأجهزة، أو عندما تحتاج إلى بيئات قابلة للتكرار عبر التطوير والإنتاج، أو عندما تتطلب متطلبات الامتثال ميزات أمان مثل Secure Boot (التمهيد الآمن) وتسجيل التدقيق. في هذه السيناريوهات، فإن الوقت الذي يتم توفيره في الإعداد، وتقليل انحراف التكوين، وراحة البال من مجموعات البرامج التي تم التحقق من صحتها، كلها عوامل تبرر الاستثمار.
نظام تشغيل DGX على Lenovo ThinkStation PGX
في توسع كبير لنظام DGX البيئي، عقدت NVIDIA شراكة مع Lenovo لجلب نظام DGX OS إلى ThinkStation PGX، وهو نظام من فئة محطات العمل مصمم لتطوير الذكاء الاصطناعي. يجمع ThinkStation PGX بين NVIDIA GPUs وتصميم محطة عمل Lenovo والإدارة الحرارية والبنية التحتية الداعمة، بينما يوفر DGX OS تجربة البرامج التي كانت متاحة سابقًا فقط على الأجهزة التي تحمل علامة NVIDIA التجارية.
تعتبر هذه الشراكة مهمة لأنها تجلب قدرات الذكاء الاصطناعي للمؤسسات إلى شكل يمكن وضعه تحت المكتب. يمكن الآن للفرق التي تحتاج إلى برنامج من فئة DGX ولكن لا يمكنها تبرير حامل مركز البيانات أن تنشر أنظمة ThinkStation PGX في بيئات مكتبية بنفس المكدس الذي تم التحقق منه والذي يعمل على أنظمة DGX في مركز البيانات.
الإعداد والخطوات الأولى
يعتمد بدء استخدام DGX OS على أجهزتك. في أنظمة NVIDIA DGX، يأتي نظام التشغيل مثبتًا مسبقًا. على الأجهزة الشريكة المدعومة مثل ThinkStation PGX، يمكنك تثبيت DGX OS من صورة USB قابلة للتشغيل مقدمة من خلال بوابة مؤسسة NVIDIA.
بعد التثبيت، الخطوة الأولى هي تسجيل النظام مع خادم ترخيص NVIDIA لتنشيط دعم المؤسسات والوصول إلى NGC. بعد ذلك، تحقق من مكدس GPU عن طريق تشغيل مجموعة التحقق المضمنة:
nvidia-smidgxos-validate --full
يؤدي هذا إلى إجراء فحص شامل لبرامج التشغيل والمكتبات والوصلات البينية والتخزين. بمجرد اجتياز التحقق من الصحة، اسحب حاوية NGC الأولى وقم بتشغيل اختبار للتأكد من أن كل شيء يعمل كما هو متوقع. من هناك، يمكنك تكوين حسابات المستخدمين، وإعداد Slurm أو Kubernetes لجدولة المهام، والبدء في إعداد أعباء عمل الذكاء الاصطناعي لديك على منصة تم تصميمها خصيصًا لتشغيلها.