Workstation Logo
المنتجات
مختبرات الذكاء الاصطناعيوكلاء OpenAIوكلاء ClaudeGrok BotWorkstation CRM (WSL CRM)التسويقجميع المنتجات
حلول الذكاء الاصطناعي
محطات عمل الذكاء الاصطناعيAI SME Packagesذكاء اصطناعي خاصمجموعات GPUذكاء اصطناعي طرفيمختبر الذكاء الاصطناعي للمؤسساتالذكاء الاصطناعي حسب الصناعة
الخدمات
Platform ModernisationDigital EngineeringData Foundations & AIAutonomous Operationsاستشارات الذكاء الاصطناعيأتمتة DevOpsالأمن السيبرانيتطوير البرمجياتبناء الوكلاءإعداد MLOps
من نحن
الشركاءقصص العملاء
المقالات
الوثائق
WSL ProxyRing PromoterWSL VaultJobshoutSysOps 24/7
المدونة
اتصل بناLogin
Workstation

محطات عمل الذكاء الاصطناعي وبرمجيات الوكلاء المتعددة والبنية التحتية لوحدات GPU وحلول الوكلاء الأذكياء للشركات الحديثة.

اتصل بنا

حلول الذكاء الاصطناعي

محطات عمل الذكاء الاصطناعيAI SME Packagesذكاء اصطناعي خاصمجموعات GPUذكاء اصطناعي طرفيمختبر الذكاء الاصطناعي للمؤسساتالذكاء الاصطناعي حسب الصناعة

المنتجات

جميع المنتجاتWSL CRM و ERPالتسويقوكلاء OpenAIWSL ProxyRing PromoterWSL VaultJobshoutSysOps 24/7

الشركة

من نحنلماذا Workstationالشركاءقصص العملاءالأسعاراتصل

الموارد

المقالاتالتوثيقالمدونةبحثخريطة الموقع
مكتب المملكة المتحدة
77-79 Marlowes, Hemel Hempstead HP1 1LFالاتجاهات - اسلك المخرج 20 من الطريق M25 في لندن الخارجيةرقم الشركة: 11641870الاثنين - الجمعة: 9:00 ص - 6:00 م بتوقيت GMT
+44 7515 356 146
مكتب بلجيكا
Workstation SRL, Rue Vanderkindere 34, 1180 Uccle, BrusselsBE 0751.518.683الاثنين - الجمعة: 9:00 ص - 6:00 م بتوقيت CET
+32 492 45 67 46
مكتب الهند
#159 Sector 9, Pocket 1, DDA Flats, 110077 Dwarka, New Delhi
+91 98881 98841

© 2026 Workstation AI. جميع الحقوق محفوظة.

الخصوصيةملفات تعريف الارتباطشروط الخدمةخريطة الموقع الإلكتروني

Loading blog...

Home / Blog
AILLMMachine LearningKubernetesMLOpsDevOpsGPU

شرح نماذج اللغات الكبيرة: كيف تعمل LLMs وكيفية تشغيل نماذجك الخاصة على Kubernetes

دليل باللغة الإنجليزية البسيطة حول ماهية LLM، وكيفية عملها فعليًا، وكيفية استضافة واحدة ذاتيًا على Kubernetes مع Ollama وvLLM

Balinder Walia5 يونيو 202610 min read

دليل باللغة الإنجليزية البسيطة لنماذج اللغات الكبيرة - ما هي، وكيف تعمل فعليًا تحت الغطاء، وكيفية تشغيل النموذج الخاص بك على Kubernetes. مكتوب للمديرين والمهندسين غير التقنيين على حد سواء: قم بتصفح المقارنات، ثم قم بالدخول إلى YAML عندما تكون جاهزًا للنشر.

نماذج اللغات الكبيرة (LLMs) - التعلم العميق والشبكات العصبية والذكاء الاصطناعي التوليدي

النسخة المكونة من فقرة واحدة. نموذج اللغة الكبير عبارة عن آلة كبيرة جدًا لمطابقة الأنماط قرأت كمية هائلة من النص وتعلمت التنبؤ بالكلمة التي ستأتي بعد ذلك. من خلال التنبؤ بالكلمة التالية مرارًا وتكرارًا، يمكنه كتابة المقالات والإجابة على الأسئلة وتلخيص المستندات وإنشاء التعليمات البرمجية. إنها لا "تفهم" بالمعنى الإنساني - إنها إحصائيات على نطاق غير عادي - ولكن النتائج جيدة بما يكفي لتكون مفيدة حقًا، بشرط أن تعرف حدودها.

1. ما هو نموذج اللغة الكبير حقًا؟

تخيل الإكمال التلقائي على هاتفك. تكتب "سأتصل بك عندما أصل" ويقترح عليك "المنزل". هذا نموذج لغوي صغير: لقد شاهد الكثير من الرسائل النصية وتعلم الكلمات التي تميل إلى اتباعها. أ كبير نموذج اللغة هو نفس الفكرة التي تم تحسينها بمعامل الملايين - لم يتم تدريبها على النصوص الخاصة بك ولكن على شريحة كبيرة من الإنترنت العام والكتب والأكواد والوثائق.

الكلمة "كبير" يقوم بعمل حقيقي. تحتوي هذه النماذج على مليارات الأرقام الداخلية (تسمى حدود) التي يتم ضبطها أثناء التدريب. عندما يقول الأشخاص أن النموذج هو "7B" أو "70B"، فإنهم يقصدون 7 مليار أو 70 مليار معلمة. المزيد من المعلمات يعني عمومًا المزيد من القدرات — ورغبة أكبر في استخدام الذاكرة والحوسبة.

نموذج عقلي مفيد للمديرين: LLM هو مساعد خريج لا يكل وجيد القراءة. لقد قرأ أكثر من أي إنسان على الإطلاق، وقام بالصياغة بسرعة، ولا يشعر بالملل أبدًا - لكنه في بعض الأحيان يذكر أشياء بثقة تامة وهي ببساطة خاطئة، ولا يتذكر الأمس إلا إذا قمت بتذكيره.

2. كيف يعملون في الواقع

تحت غطاء محرك السيارة هناك خمس أفكار. لا تحتاج إلى الرياضيات لمتابعتها، فكل منها له تشبيه يومي.

2.1 الرموز — تقطيع النص إلى أجزاء

النماذج لا تقرأ الكلمات بأكملها. يقومون بتقسيم النص إلى الرموز: قطع مشتركة من الشخصيات. قد يصبح "Kubernetes". Kub + ernetes; قد يكون "الجري". run + ning. تقريبا، 1 رمز ≈ 0.75 كلمة إنجليزية، لذا فإن 1000 رمز يساوي حوالي 750 كلمة. هذا مهم تجاريًا: فاتورة API المستضافة لكل رمز مميز ونموذج نافذة السياق (المقدار الذي يمكن "رؤيته" مرة واحدة) يتم قياسه بالرموز المميزة.

2.2 التضمين – تحويل الكلمات إلى إحداثيات للمعنى

يتم تحويل كل رمز إلى قائمة طويلة من الأرقام — التضمين - يمثل معناها كنقطة في الفضاء. الكلمات المستخدمة بطرق مماثلة تنتهي بالقرب من بعضها البعض. "الملك" و"الملكة" يجلسان بالقرب من بعضهما البعض؛ "الملك" و"الموزة" يجلسان متباعدين. هذه هي الطريقة التي يمكن بها للآلة التي تقوم بالحساب فقط أن تتلاعب معنى: لقد تحول المعنى إلى هندسة.

2.3 المحول و"الانتباه" - اختراق عام 2017

الهندسة المعمارية وراء كل LLM الحديثة هي محول. خدعتها الرئيسية تسمى انتباه: عند معالجة كلمة ما، ينظر النموذج إلى كل كلمة أخرى في الجملة ويقرر أي منها ذات صلة. في "الكأس لم يكن مناسبًا للحقيبة بسبب هو - هي "كان كبيرًا جدًا،" الاهتمام هو ما يجعل النموذج يدرك أن "ذلك" يشير إلى الكأس، وليس الحقيبة. الانتباه هو لماذا تتعامل هذه النماذج مع السياق، والفروق الدقيقة، والمراجع طويلة المدى بشكل جيد - ولماذا تحتاج إلى الكثير من الحساب، لأن كل كلمة تهتم بكل كلمة أخرى.

2.4 التدريب – ثلاث مراحل

  1. التدريب المسبق: يُعرض النموذج مليارات الجمل مع إخفاء الكلمة الأخيرة ويطلب منه تخمينها. أخطأ في فهم الأمر، وادفع المعلمات، وكرر ذلك - تريليونات المرات. هذا هو المكان الذي يستوعب فيه القواعد والحقائق وأنماط التفكير والرموز. وهو أيضًا الجزء المكلف، حيث يكلف ملايين الجنيهات في زمن GPU.
  2. الكون المثالى: يتم بعد ذلك تدريب النموذج الأولي على أمثلة منسقة لسلوك الأسئلة والأجوبة المفيد، بحيث يعمل كمساعد بدلاً من الإكمال التلقائي.
  3. محاذاة (RLHF): وأخيرًا، يقوم البشر بترتيب إجابات النموذج ويتم استخدام هذه التعليقات لجعله أكثر فائدة وصدقًا وأمانًا. ولهذا السبب يرفض نموذج الدردشة الطلبات الضارة ويتبنى أسلوبًا متسقًا.

2.5 الاستدلال – كيف يجيبك

عند إرسال مطالبة، يقوم النموذج بإنشاء الرد رمز واحد في وقت واحد: فهو يتنبأ بالرمز التالي الأكثر احتمالاً، ويلحقه، ثم يتنبأ بالرمز التالي، وما إلى ذلك - مثل شخص سريع وجيد القراءة يكتب كلمة بكلمة دون تخطيط الجملة بأكملها أولاً. إعداد يسمى درجة حرارة يتحكم في مدى المغامرة: درجة الحرارة المنخفضة تعطي إجابات آمنة وقابلة للتكرار (جيدة للكود والاستخراج)؛ درجة الحرارة المرتفعة تعطي إجابات إبداعية ومتنوعة (جيدة للعصف الذهني). تسمى عملية الرمز المميز هذه الاستدلالوهو الجزء الذي تدفع مقابله في الإنتاج — حيث يحرق كل طلب دورات GPU.

الوجبات الجاهزة للمدير. التدريب يبني النموذج مرة واحدة (عادة ما يدفع شخص آخر مقابل ذلك). الاستدلال هي التكلفة المتكررة التي تتحملها عند تشغيلها: وهي تتدرج مع عدد الأشخاص الذين يستخدمونها ومدة الإجابات. معظم "كم سيكلف الذكاء الاصطناعي لدينا؟" الأسئلة هي حقا أسئلة الاستدلال.

3. ما هي الأشياء الجيدة والسيئة في LLM

معرفة حواف الأداة يمنع حدوث أخطاء باهظة الثمن.

جيد حقا في كن حذرا مع
صياغة النص وإعادة كتابته وتلخيصههلوسة - اختراع حقائق أو اقتباسات أو API معقولة ولكنها خاطئة
شرح المفاهيم والإجابة على الأسئلة الشائعةقطع المعرفة — لا يعرف الأحداث بعد تاريخ تدريبه
كتابة ومراجعة الكودالحساب والعد الدقيق (استخدم أداة/آلة حاسبة بدلاً من ذلك)
تصنيف واستخراج وإعادة تنسيق البياناتأي شيء تكون فيه الإجابة الخاطئة الواثقة أمرًا خطيرًا دون مراجعة

الإصلاح لمعظم هذه هو RAG (جيل الاسترجاع المعزز): بدلاً من الوثوق بذاكرة النموذج، تقوم بإحضار المستندات ذات الصلة من أنظمتك الخاصة ولصقها في الموجه، وبالتالي يجيب النموذج من البيانات الخاصة بك. هذه هي الطريقة التي تقوم بها ببناء برنامج الدردشة الآلي على الويكي الداخلي الخاص بك دون أن يقوم النموذج باختلاق الأمور.

4. المفردات، فك شفرتها

شرط ماذا يعني ذلك باللغة الإنجليزية البسيطة
المعلمات (7ب/70ب)الأرقام الداخلية المضبوطة أكثر = أكثر ذكاءً ولكن أثقل.
نافذة السياقمقدار النص الذي يمكنه الاحتفاظ به في الذاكرة العاملة مرة واحدة (بالرموز المميزة).
الاستدلالقم بتشغيل النموذج للحصول على إجابة — تكلفة الحوسبة المتكررة.
التكميمضغط النموذج (على سبيل المثال إلى 4 بت) بحيث يتناسب مع أجهزة GPU الأصغر حجمًا مع مقايضة صغيرة للجودة.
الكون المثالىمزيد من التدريب على الأمثلة الخاصة بك لتخصص السلوك.
RAGتغذية النموذج بمستنداتك في وقت الاستعلام بحيث يجيب من الحقائق وليس من الذاكرة.
VRAMذاكرة GPU. أكبر قيد منفرد على النماذج التي يمكنك تشغيلها.

5. لماذا تقوم بتشغيل LLM الخاص بك؟

تعد APIs المستضافة (OpenAI وAnthropic وغيرها) أسرع طريقة للبدء وهي ممتازة. ولكن هناك أربعة أسباب تدفع المؤسسات إلى اختيار الاستضافة الذاتية لنموذج ذو أوزان مفتوحة مثل Llama أو Mistral أو Qwen أو Gemma:

  • خصوصية البيانات والامتثال. البيانات الحساسة لا تترك شبكتك أبدًا - وهي مهمة للرعاية الصحية والمالية والقانونية والقطاع العام.
  • التكلفة على نطاق واسع. فوق حجم طلب ثابت معين، يمكن أن يكون GPU الذي تمتلكه أرخص لكل رمز مميز من دفع API.
  • السيطرة والاستقرار. لا يتغير النموذج أبدًا تحتك، ولا تخضع لقيود أسعار البائع أو عمليات الإيقاف.
  • الكمون والاستخدام دون اتصال بالإنترنت. الاستدلال بجوار تطبيقك، أو محليًا دون الاعتماد على الإنترنت.

المقايضة هي ذلك أنت الآن تمتلك الأجهزة والقياس والموثوقية - وهو بالضبط ما يجيده Kubernetes.

6. واقع الأجهزة (اقرأ هذا قبل النشر)

يجب أن تتناسب أوزان LLM مع ذاكرة GPU (VRAM). قاعدة تقريبية:

حجم النموذج الدقة الكاملة (FP16) كمي (4 بت)
7–8B (مثل ميسترال 7B، Llama 3 8B)~16 GB VRAM~5–6 GB VRAM
13-14 ب~28 GB VRAM~10 GB VRAM
70 ب~140 GB (متعدد GPU)~40 GB VRAM

يهيمن محركان للخدمة على عمليات النشر الحقيقية:

  • Ollama - الأسهل على المنحدر. رائعة للتطوير والأدوات الداخلية وعقد CPU أو GPU المفردة. يسحب النماذج الكمية بأمر واحد.
  • vLLM - العمود الفقري للإنتاج. إنتاجية عالية، وتجميع العديد من الطلبات، وكشف ملف API متوافق مع OpenAI لذلك يعمل الكود الموجود لديك مع تغيير عنوان URL من سطر واحد. (يعد Hugging Face TGI بديلاً قريبًا.)

7. نشر LLM الخاص بك على Kubernetes

يفترض كل شيء أدناه وجود مجموعة تحتوي على عقدة GPU واحدة على الأقل و البرنامج المساعد لجهاز NVIDIA المثبتة، مما يعرض GPUs كمورد قابل للجدولة nvidia.com/gpu. سوف نبنيها قطعة قطعة.

7.1 مساحة اسم ومكان لتخزين أوزان النماذج

ملفات النماذج كبيرة الحجم (جيجابايت) وبطيئة التنزيل، لذلك نقوم بتخزينها مؤقتًا على ملف المطالبة بالحجم المستمر بدلاً من إعادة السحب عند كل إعادة تشغيل للجراب.

apiVersion: v1
kind: Namespace
metadata:
  name: llm
---
apiVersion: v1
kind: PersistentVolumeClaim
metadata:
  name: model-cache
  namespace: llm
spec:
  accessModes:
    - ReadWriteOnce
  resources:
    requests:
      storage: 100Gi          # weights are big; size generously
  # storageClassName: fast-ssd   # use an SSD class if your cluster offers one

7.2 الخيار أ — Ollama (البداية السهلة)

يعد Ollama مثاليًا للنشر الأول أو للأداة الداخلية. يؤدي هذا إلى تشغيله باستخدام GPU واحد؛ حذف nvidia.com/gpu حد تشغيل CPU فقط على عقدة سمين.

apiVersion: apps/v1
kind: Deployment
metadata:
  name: ollama
  namespace: llm
  labels:
    app: ollama
spec:
  replicas: 1
  selector:
    matchLabels:
      app: ollama
  template:
    metadata:
      labels:
        app: ollama
    spec:
      containers:
        - name: ollama
          image: ollama/ollama:latest
          ports:
            - containerPort: 11434
          resources:
            requests:
              cpu: "2"
              memory: 8Gi
            limits:
              nvidia.com/gpu: 1        # remove this line for CPU-only
              memory: 16Gi
          volumeMounts:
            - name: models
              mountPath: /root/.ollama
          readinessProbe:
            httpGet:
              path: /
              port: 11434
            initialDelaySeconds: 10
            periodSeconds: 10
      volumes:
        - name: models
          persistentVolumeClaim:
            claimName: model-cache
---
apiVersion: v1
kind: Service
metadata:
  name: ollama
  namespace: llm
spec:
  selector:
    app: ollama
  ports:
    - port: 80
      targetPort: 11434

بمجرد تشغيل الكبسولة، اسحب النموذج إلى ذاكرة التخزين المؤقت وقم بالدردشة معه:

# pull a quantized model into the PVC (one-off)
kubectl -n llm exec deploy/ollama -- ollama pull llama3

# ask it something from inside the cluster
kubectl -n llm exec deploy/ollama -- \
  ollama run llama3 "Explain Kubernetes in one sentence."

7.3 الخيار ب — vLLM (إنتاجية الإنتاج، متوافقة مع OpenAI)

بالنسبة لحركة المرور الحقيقية، يخدم vLLM العديد من الطلبات المتزامنة بكفاءة ويتحدث لهجة OpenAI API. تحتاج النماذج المسورة (مثل Llama) إلى رمز Hugging Face، الذي يتم تخزينه باعتباره سرًا.

apiVersion: v1
kind: Secret
metadata:
  name: hf-token
  namespace: llm
type: Opaque
stringData:
  token: "hf_xxxxxxxxxxxxxxxxxxxxxxxx"   # your Hugging Face access token
---
apiVersion: apps/v1
kind: Deployment
metadata:
  name: vllm-mistral
  namespace: llm
  labels:
    app: vllm-mistral
spec:
  replicas: 1
  selector:
    matchLabels:
      app: vllm-mistral
  template:
    metadata:
      labels:
        app: vllm-mistral
    spec:
      containers:
        - name: vllm
          image: vllm/vllm-openai:latest
          args:
            - "--model"
            - "mistralai/Mistral-7B-Instruct-v0.3"
            - "--max-model-len"
            - "8192"
            - "--gpu-memory-utilization"
            - "0.90"
          ports:
            - containerPort: 8000
          env:
            - name: HUGGING_FACE_HUB_TOKEN
              valueFrom:
                secretKeyRef:
                  name: hf-token
                  key: token
          resources:
            limits:
              nvidia.com/gpu: 1
          volumeMounts:
            - name: cache
              mountPath: /root/.cache/huggingface
          readinessProbe:
            httpGet:
              path: /health
              port: 8000
            initialDelaySeconds: 60      # first start downloads weights
            periodSeconds: 15
            failureThreshold: 40
      volumes:
        - name: cache
          persistentVolumeClaim:
            claimName: model-cache
---
apiVersion: v1
kind: Service
metadata:
  name: vllm-mistral
  namespace: llm
spec:
  selector:
    app: vllm-mistral
  ports:
    - port: 80
      targetPort: 8000

نظرًا لأن vLLM متوافق مع OpenAI، فإن رمز التطبيق يحتاج فقط إلى عنوان URL الموجود في المجموعة - بدون تغييرات في SDK:

curl http://vllm-mistral.llm.svc.cluster.local/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mistralai/Mistral-7B-Instruct-v0.3",
    "messages": [{"role": "user", "content": "Summarise our refund policy."}],
    "temperature": 0.2
  }'

7.4 تعريضه بالدخول

apiVersion: networking.k8s.io/v1
kind: Ingress
metadata:
  name: llm-api
  namespace: llm
  annotations:
    nginx.ingress.kubernetes.io/proxy-read-timeout: "300"   # long generations
spec:
  ingressClassName: nginx
  rules:
    - host: llm.internal.example.com
      http:
        paths:
          - path: /
            pathType: Prefix
            backend:
              service:
                name: vllm-mistral
                port:
                  number: 80

7.5 القياس – ولماذا يختلف مع GPUs

يمكنك القياس تلقائيًا، لكن تذكر تحتاج كل نسخة متماثلة إلى GPU الخاص بها بالكامل - لا يمكنك مشاركة واحدة بشكل جزئي في الحالة البسيطة، ولا يوجد أي تغيير في الحجم يتجاوز GPUs الموجودة لديك فعليًا. قم بالقياس على قائمة الانتظار أو إشارة معدل الطلب (KEDA ممتازة هنا) بدلاً من CPU.

apiVersion: autoscaling/v2
kind: HorizontalPodAutoscaler
metadata:
  name: vllm-mistral
  namespace: llm
spec:
  scaleTargetRef:
    apiVersion: apps/v1
    kind: Deployment
    name: vllm-mistral
  minReplicas: 1
  maxReplicas: 4          # never exceed the number of GPUs in the cluster
  metrics:
    - type: Resource
      resource:
        name: cpu
        target:
          type: Utilization
          averageUtilization: 70
  # For real LLM scaling, prefer KEDA on a queue depth or
  # requests-per-second metric exported by vLLM, not CPU.

8. قائمة مرجعية عملية للطرح

  1. النموذج الأولي على API المستضاف للتحقق من صحة حالة الاستخدام قبل شراء GPUs.
  2. اختر نموذجًا ذو أوزان مفتوحة الذي يناسب أجهزتك (ابدأ بالنموذج 7-8B، كميًا).
  3. ابدأ بـ Ollama للطيار الداخلي. تخرج ل vLLM عندما تحتاج إلى الإنتاجية.
  4. أضف RAG على مستنداتك الخاصة لتقليل الهلوسة وتحديث الإجابات.
  5. إبقاء الإنسان في الحلقة عندما تحمل الإجابة الخاطئة تكلفة حقيقية.
  6. قياس تكلفة الاستدلال وزمن الوصول لكل طلب - هذا هو اقتصاديات وحدتك الحقيقية.
خلاصة القول. LLM هو التنبؤ بالكلمة التالية على نطاق يصبح مفيدًا حقًا. تعامل معه باعتباره مساعدًا رائعًا ولكن غير موثوق به: اعتمد عليه في الصياغة والتلخيص والتصنيف والترميز؛ التحقق من أي شيء مهم؛ قم بتأريضها في بياناتك الخاصة باستخدام RAG؛ وعندما تتطلب الخصوصية أو التكلفة أو التحكم ذلك، قم بتشغيل Kubernetes الخاص بك مع Ollama للبدء وvLLM للتوسع.