دليل باللغة الإنجليزية البسيطة لنماذج اللغات الكبيرة - ما هي، وكيف تعمل فعليًا تحت الغطاء، وكيفية تشغيل النموذج الخاص بك على Kubernetes. مكتوب للمديرين والمهندسين غير التقنيين على حد سواء: قم بتصفح المقارنات، ثم قم بالدخول إلى YAML عندما تكون جاهزًا للنشر.

1. ما هو نموذج اللغة الكبير حقًا؟
تخيل الإكمال التلقائي على هاتفك. تكتب "سأتصل بك عندما أصل" ويقترح عليك "المنزل". هذا نموذج لغوي صغير: لقد شاهد الكثير من الرسائل النصية وتعلم الكلمات التي تميل إلى اتباعها. أ كبير نموذج اللغة هو نفس الفكرة التي تم تحسينها بمعامل الملايين - لم يتم تدريبها على النصوص الخاصة بك ولكن على شريحة كبيرة من الإنترنت العام والكتب والأكواد والوثائق.
الكلمة "كبير" يقوم بعمل حقيقي. تحتوي هذه النماذج على مليارات الأرقام الداخلية (تسمى حدود) التي يتم ضبطها أثناء التدريب. عندما يقول الأشخاص أن النموذج هو "7B" أو "70B"، فإنهم يقصدون 7 مليار أو 70 مليار معلمة. المزيد من المعلمات يعني عمومًا المزيد من القدرات — ورغبة أكبر في استخدام الذاكرة والحوسبة.
نموذج عقلي مفيد للمديرين: LLM هو مساعد دراسات عليا لا يكل وجيد القراءة. لقد قرأ أكثر من أي إنسان على الإطلاق، وقام بالصياغة بسرعة، ولا يشعر بالملل أبدًا - لكنه في بعض الأحيان يذكر أشياء بثقة تامة وهي ببساطة خاطئة، ولا يتذكر الأمس إلا إذا قمت بتذكيره.
2. كيف يعملون في الواقع
تحت غطاء محرك السيارة هناك خمس أفكار. لا تحتاج إلى الرياضيات لمتابعتها، فكل منها له تشبيه يومي.
2.1 الرموز — تقطيع النص إلى أجزاء
النماذج لا تقرأ الكلمات بأكملها. يقومون بتقسيم النص إلى الرموز: قطع مشتركة من الشخصيات. قد يصبح "Kubernetes". Kub + ernetes; قد يكون "الجري". run + ning. تقريبا، 1 رمز ≈ 0.75 كلمة إنجليزية، لذا فإن 1000 رمز يساوي حوالي 750 كلمة. هذا مهم تجاريًا: فاتورة واجهات برمجة التطبيقات المستضافة لكل رمز مميز ونموذج نافذة السياق (المقدار الذي يمكن "رؤيته" مرة واحدة) يتم قياسه بالرموز المميزة.
2.2 التضمين – تحويل الكلمات إلى إحداثيات للمعنى
يتم تحويل كل رمز إلى قائمة طويلة من الأرقام — التضمين - يمثل معناها كنقطة في الفضاء. الكلمات المستخدمة بطرق مماثلة تنتهي بالقرب من بعضها البعض. "الملك" و"الملكة" يجلسان بالقرب من بعضهما البعض؛ "الملك" و"الموزة" يجلسان متباعدين. هذه هي الطريقة التي يمكن بها للآلة التي تقوم بالحساب فقط أن تتلاعب معنى: لقد تحول المعنى إلى هندسة.
2.3 المحول و"الانتباه" - اختراق عام 2017
الهندسة المعمارية وراء كل LLM الحديثة هي محول. خدعتها الرئيسية تسمى انتباه: عند معالجة كلمة ما، ينظر النموذج إلى كل كلمة أخرى في الجملة ويقرر أي منها ذات صلة. في "الكأس لم يكن مناسبًا للحقيبة بسبب هو - هي "كان كبيرًا جدًا،" الاهتمام هو ما يجعل النموذج يدرك أن "ذلك" يشير إلى الكأس، وليس الحقيبة. الانتباه هو لماذا تتعامل هذه النماذج مع السياق، والفروق الدقيقة، والمراجع طويلة المدى بشكل جيد - ولماذا تحتاج إلى الكثير من الحساب، لأن كل كلمة تهتم بكل كلمة أخرى.
2.4 التدريب – ثلاث مراحل
- التدريب المسبق: يُعرض النموذج مليارات الجمل مع إخفاء الكلمة الأخيرة ويطلب منه تخمينها. أخطأ في فهم الأمر، وادفع المعلمات، وكرر ذلك - تريليونات المرات. هذا هو المكان الذي يستوعب فيه القواعد والحقائق وأنماط التفكير والرموز. وهو أيضًا الجزء المكلف، حيث يكلف ملايين الجنيهات الاسترلينية في وقت GPU.
- الكون المثالى: يتم بعد ذلك تدريب النموذج الأولي على أمثلة منسقة لسلوك الأسئلة والأجوبة المفيد، بحيث يعمل كمساعد بدلاً من الإكمال التلقائي.
- محاذاة (RLHF): وأخيرًا، يقوم البشر بترتيب إجابات النموذج ويتم استخدام هذه التعليقات لجعله أكثر فائدة وصدقًا وأمانًا. ولهذا السبب يرفض نموذج الدردشة الطلبات الضارة ويتبنى أسلوبًا متسقًا.
2.5 الاستدلال – كيف يجيبك
عند إرسال مطالبة، يقوم النموذج بإنشاء الرد رمز واحد في وقت واحد: فهو يتنبأ بالرمز التالي الأكثر احتمالاً، ويلحقه، ثم يتنبأ بالرمز التالي، وما إلى ذلك - مثل شخص سريع وجيد القراءة يكتب كلمة بكلمة دون تخطيط الجملة بأكملها أولاً. إعداد يسمى درجة حرارة يتحكم في مدى المغامرة: درجة الحرارة المنخفضة تعطي إجابات آمنة وقابلة للتكرار (جيدة للكود والاستخراج)؛ درجة الحرارة المرتفعة تعطي إجابات إبداعية ومتنوعة (جيدة للعصف الذهني). تسمى عملية الرمز المميز هذه الاستدلالوهو الجزء الذي تدفع مقابله في الإنتاج — حيث يحرق كل طلب دورات وحدة معالجة الرسومات.
3. ما هي الأشياء الجيدة والسيئة في ماجستير إدارة الأعمال
معرفة حواف الأداة يمنع حدوث أخطاء باهظة الثمن.
| جيد حقا في | كن حذرا مع |
|---|---|
| صياغة النص وإعادة كتابته وتلخيصه | هلوسة — اختراع حقائق أو اقتباسات أو واجهات برمجة التطبيقات (APIs) معقولة ولكنها خاطئة |
| شرح المفاهيم والإجابة على الأسئلة الشائعة | قطع المعرفة — لا يعرف الأحداث بعد تاريخ تدريبه |
| كتابة ومراجعة الكود | الحساب والعد الدقيق (استخدم أداة/آلة حاسبة بدلاً من ذلك) |
| تصنيف واستخراج وإعادة تنسيق البيانات | أي شيء تكون فيه الإجابة الخاطئة الواثقة أمرًا خطيرًا دون مراجعة |
الإصلاح لمعظم هذه هو RAG (جيل الاسترجاع المعزز): بدلاً من الوثوق بذاكرة النموذج، تقوم بإحضار المستندات ذات الصلة من أنظمتك الخاصة ولصقها في الموجه، وبالتالي يجيب النموذج من البيانات الخاصة بك. هذه هي الطريقة التي تقوم بها ببناء برنامج الدردشة الآلي على الويكي الداخلي الخاص بك دون أن يقوم النموذج باختلاق الأمور.
4. المفردات، فك شفرتها
| شرط | ماذا يعني ذلك باللغة الإنجليزية البسيطة |
|---|---|
| المعلمات (7ب/70ب) | الأرقام الداخلية المضبوطة أكثر = أكثر ذكاءً ولكن أثقل. |
| نافذة السياق | مقدار النص الذي يمكنه الاحتفاظ به في الذاكرة العاملة مرة واحدة (بالرموز المميزة). |
| الاستدلال | قم بتشغيل النموذج للحصول على إجابة — تكلفة الحوسبة المتكررة. |
| التكميم | ضغط النموذج (على سبيل المثال إلى 4 بت) بحيث يتناسب مع وحدات معالجة الرسومات الأصغر حجمًا مع مقايضة جودة صغيرة. |
| الكون المثالى | مزيد من التدريب على الأمثلة الخاصة بك لتخصص السلوك. |
| خرقة | تغذية النموذج بمستنداتك في وقت الاستعلام بحيث يجيب من الحقائق وليس من الذاكرة. |
| VRAM | ذاكرة GPU. أكبر قيد منفرد على النماذج التي يمكنك تشغيلها. |
5. لماذا تدير ماجستير إدارة الأعمال الخاص بك؟
تُعد واجهات برمجة التطبيقات المستضافة (OpenAI وAnthropic وغيرها) أسرع طريقة للبدء وهي ممتازة. ولكن هناك أربعة أسباب وراء اختيار المؤسسات لاستضافة نموذج ذو أوزان مفتوحة مثل Llama أو Mistral أو Qwen أو Gemma:
- خصوصية البيانات والامتثال. البيانات الحساسة لا تترك شبكتك أبدًا - وهي مهمة للرعاية الصحية والمالية والقانونية والقطاع العام.
- التكلفة على نطاق واسع. إذا تجاوز حجم طلب ثابت معين، يمكن أن تكون وحدة معالجة الرسومات (GPU) التي تمتلكها أرخص لكل رمز مميز من دفع واجهة برمجة التطبيقات (API).
- السيطرة والاستقرار. لا يتغير النموذج أبدًا تحتك، ولا تخضع لقيود أسعار البائع أو عمليات الإيقاف.
- الكمون والاستخدام دون اتصال بالإنترنت. الاستدلال بجوار تطبيقك، أو محليًا دون الاعتماد على الإنترنت.
المقايضة هي ذلك أنت الآن تمتلك الأجهزة والقياس والموثوقية - وهذا بالضبط ما يجيده Kubernetes.
6. واقع الأجهزة (اقرأ هذا قبل النشر)
يجب أن تتناسب أوزان LLM مع ذاكرة GPU (VRAM). قاعدة تقريبية:
| حجم النموذج | الدقة الكاملة (FP16) | كمي (4 بت) |
|---|---|---|
| 7–8B (مثل ميسترال 7B، اللاما 3 8B) | ~16 جيجا بايت VRAM | ~5-6 جيجا بايت VRAM |
| 13-14 ب | ~ 28 جيجا بايت VRAM | ~ 10 جيجا بايت VRAM |
| 70 ب | ~140 جيجابايت (وحدة معالجة الرسومات المتعددة) | ~ 40 جيجا بايت VRAM |
يهيمن محركان للخدمة على عمليات النشر الحقيقية:
- أولاما - الأسهل على المنحدر. رائعة للتطوير، والأدوات الداخلية، ووحدة المعالجة المركزية (CPU) أو عقد وحدة معالجة الرسومات المفردة. يسحب النماذج الكمية بأمر واحد.
- vLLM - العمود الفقري للإنتاج. إنتاجية عالية، وتجميع العديد من الطلبات، وكشف ملف واجهة برمجة التطبيقات المتوافقة مع OpenAI لذلك يعمل الكود الموجود لديك مع تغيير عنوان URL من سطر واحد. (يعد Hugging Face TGI بديلاً قريبًا.)
7. نشر ماجستير إدارة الأعمال الخاص بك على Kubernetes
يفترض كل شيء أدناه وجود مجموعة تحتوي على عقدة GPU واحدة على الأقل و البرنامج المساعد لجهاز NVIDIA المثبتة، مما يعرض وحدات معالجة الرسومات كمورد قابل للجدولة nvidia.com/gpu. سوف نبنيها قطعة قطعة.
7.1 مساحة اسم ومكان لتخزين أوزان النماذج
ملفات النماذج كبيرة الحجم (جيجابايت) وبطيئة التنزيل، لذلك نقوم بتخزينها مؤقتًا على ملف المطالبة بالحجم المستمر بدلاً من إعادة السحب عند كل إعادة تشغيل للجراب.
apiVersion: v1
kind: Namespace
metadata:
name: llm
---
apiVersion: v1
kind: PersistentVolumeClaim
metadata:
name: model-cache
namespace: llm
spec:
accessModes:
- ReadWriteOnce
resources:
requests:
storage: 100Gi # weights are big; size generously
# storageClassName: fast-ssd # use an SSD class if your cluster offers one
7.2 الخيار أ – أولاما (البداية السهلة)
يعد Ollama مثاليًا للنشر الأول أو للأداة الداخلية. يؤدي هذا إلى تشغيله باستخدام وحدة معالجة رسومات (GPU) واحدة؛ حذف nvidia.com/gpu حد لتشغيل وحدة المعالجة المركزية فقط على عقدة سمين.
apiVersion: apps/v1
kind: Deployment
metadata:
name: ollama
namespace: llm
labels:
app: ollama
spec:
replicas: 1
selector:
matchLabels:
app: ollama
template:
metadata:
labels:
app: ollama
spec:
containers:
- name: ollama
image: ollama/ollama:latest
ports:
- containerPort: 11434
resources:
requests:
cpu: "2"
memory: 8Gi
limits:
nvidia.com/gpu: 1 # remove this line for CPU-only
memory: 16Gi
volumeMounts:
- name: models
mountPath: /root/.ollama
readinessProbe:
httpGet:
path: /
port: 11434
initialDelaySeconds: 10
periodSeconds: 10
volumes:
- name: models
persistentVolumeClaim:
claimName: model-cache
---
apiVersion: v1
kind: Service
metadata:
name: ollama
namespace: llm
spec:
selector:
app: ollama
ports:
- port: 80
targetPort: 11434
بمجرد تشغيل الكبسولة، اسحب النموذج إلى ذاكرة التخزين المؤقت وقم بالدردشة معه:
# pull a quantized model into the PVC (one-off)
kubectl -n llm exec deploy/ollama -- ollama pull llama3
# ask it something from inside the cluster
kubectl -n llm exec deploy/ollama -- \
ollama run llama3 "Explain Kubernetes in one sentence."
7.3 الخيار ب — vLLM (إنتاجية الإنتاج، متوافقة مع OpenAI)
بالنسبة لحركة المرور الحقيقية، يخدم vLLM العديد من الطلبات المتزامنة بكفاءة ويتحدث لهجة OpenAI API. تحتاج النماذج المسورة (مثل Llama) إلى رمز Hugging Face، الذي يتم تخزينه باعتباره سرًا.
apiVersion: v1
kind: Secret
metadata:
name: hf-token
namespace: llm
type: Opaque
stringData:
token: "hf_xxxxxxxxxxxxxxxxxxxxxxxx" # your Hugging Face access token
---
apiVersion: apps/v1
kind: Deployment
metadata:
name: vllm-mistral
namespace: llm
labels:
app: vllm-mistral
spec:
replicas: 1
selector:
matchLabels:
app: vllm-mistral
template:
metadata:
labels:
app: vllm-mistral
spec:
containers:
- name: vllm
image: vllm/vllm-openai:latest
args:
- "--model"
- "mistralai/Mistral-7B-Instruct-v0.3"
- "--max-model-len"
- "8192"
- "--gpu-memory-utilization"
- "0.90"
ports:
- containerPort: 8000
env:
- name: HUGGING_FACE_HUB_TOKEN
valueFrom:
secretKeyRef:
name: hf-token
key: token
resources:
limits:
nvidia.com/gpu: 1
volumeMounts:
- name: cache
mountPath: /root/.cache/huggingface
readinessProbe:
httpGet:
path: /health
port: 8000
initialDelaySeconds: 60 # first start downloads weights
periodSeconds: 15
failureThreshold: 40
volumes:
- name: cache
persistentVolumeClaim:
claimName: model-cache
---
apiVersion: v1
kind: Service
metadata:
name: vllm-mistral
namespace: llm
spec:
selector:
app: vllm-mistral
ports:
- port: 80
targetPort: 8000
نظرًا لأن vLLM متوافق مع OpenAI، فإن رمز التطبيق يحتاج فقط إلى عنوان URL الموجود في المجموعة - بدون تغييرات في SDK:
curl http://vllm-mistral.llm.svc.cluster.local/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "mistralai/Mistral-7B-Instruct-v0.3",
"messages": [{"role": "user", "content": "Summarise our refund policy."}],
"temperature": 0.2
}'
7.4 تعريضه بالدخول
apiVersion: networking.k8s.io/v1
kind: Ingress
metadata:
name: llm-api
namespace: llm
annotations:
nginx.ingress.kubernetes.io/proxy-read-timeout: "300" # long generations
spec:
ingressClassName: nginx
rules:
- host: llm.internal.example.com
http:
paths:
- path: /
pathType: Prefix
backend:
service:
name: vllm-mistral
port:
number: 80
7.5 القياس - ولماذا يختلف مع وحدات معالجة الرسومات
يمكنك القياس تلقائيًا، لكن تذكر تحتاج كل نسخة طبق الأصل إلى وحدة معالجة الرسومات الخاصة بها بالكامل - لا يمكنك مشاركة واحدة بشكل جزئي في الحالة البسيطة، وليس هناك أي فائدة في التوسع خارج نطاق وحدات معالجة الرسومات الموجودة لديك فعليًا. قم بالقياس على قائمة الانتظار أو إشارة معدل الطلب (KEDA ممتازة هنا) بدلاً من وحدة المعالجة المركزية.
apiVersion: autoscaling/v2
kind: HorizontalPodAutoscaler
metadata:
name: vllm-mistral
namespace: llm
spec:
scaleTargetRef:
apiVersion: apps/v1
kind: Deployment
name: vllm-mistral
minReplicas: 1
maxReplicas: 4 # never exceed the number of GPUs in the cluster
metrics:
- type: Resource
resource:
name: cpu
target:
type: Utilization
averageUtilization: 70
# For real LLM scaling, prefer KEDA on a queue depth or
# requests-per-second metric exported by vLLM, not CPU.
8. قائمة مرجعية عملية للطرح
- النموذج الأولي على واجهة برمجة التطبيقات المستضافة للتحقق من صحة حالة الاستخدام قبل شراء وحدات معالجة الرسومات.
- اختر نموذجًا ذو أوزان مفتوحة الذي يناسب أجهزتك (ابدأ بالنموذج 7-8B، كميًا).
- ابدأ مع أولاما للطيار الداخلي. تخرج ل vLLM عندما تحتاج إلى الإنتاجية.
- أضف خرقة على مستنداتك الخاصة لتقليل الهلوسة وتحديث الإجابات.
- إبقاء الإنسان في الحلقة عندما تحمل الإجابة الخاطئة تكلفة حقيقية.
- قياس تكلفة الاستدلال وزمن الوصول لكل طلب - هذا هو اقتصاديات وحدتك الحقيقية.