الإجابة المختصرة: المعيار الحاكم في اختيار خادم GPU هو ذاكرة البطاقة (VRAM) لا عدد الأنوية ولا حجم الذاكرة العادية. إن لم يتسع النموذج في ذاكرة البطاقة فلن يعمل مهما بلغت قوة بقية الخادم. ابدأ من حجم النموذج الذي ستشغّله، ثم اختر البطاقة، ثم بقية الموارد.
لماذا الـ VRAM هو القيد الأول؟
حين تشغّل نموذج ذكاء اصطناعي، يجب أن تُحمَّل أوزانه كاملة في ذاكرة البطاقة قبل أن تبدأ أي عملية. إن لم تتسع، فلن يعمل النموذج — لا ببطء بل لن يعمل أصلاً، وستحصل على خطأ نفاد ذاكرة. هذا يختلف جذرياً عن المعالج والذاكرة العادية حيث النقص يعني بطئاً لا توقفاً.
ولهذا فإن ترتيب القرار معكوس عمّا اعتاده مشتري الخوادم:
- ما النموذج الذي ستشغّله؟ وبأي دقة عددية؟
- كم VRAM يحتاج؟ هذا يحدد البطاقة.
- كم مستخدماً متزامناً؟ هذا يحدد كم تحتاج من ذاكرة إضافية للسياق.
- بقية الموارد تأتي أخيراً لتخدم البطاقة لا العكس.
كيف تقدّر حاجتك من الذاكرة
قاعدة تقريبية تكفي للتخطيط: احسب عدد معاملات النموذج مضروباً في عدد البايتات لكل معامل حسب الدقة، ثم أضف هامشاً للسياق والتشغيل.
| الدقة العددية | بايت لكل معامل | نموذج بـ7 مليارات معامل | نموذج بـ13 ملياراً | الملاحظة |
|---|---|---|---|---|
| FP16 / BF16 | 2 | ~14GB | ~26GB | أعلى جودة، أكبر استهلاكاً |
| 8-bit | 1 | ~7GB | ~13GB | توازن جيد في الغالب |
| 4-bit | ~0.5 | ~4GB | ~7GB | الأوفر، مع تنازل محدود في الجودة |
ثم أضف من 20 إلى 40 بالمئة فوق حجم الأوزان لذاكرة السياق ومخزون المفاتيح والقيم وأعباء التشغيل. وكلما زاد طول السياق وعدد الطلبات المتزامنة زاد هذا الهامش.
خطأ شائع: حساب حجم الأوزان فقط ثم اختيار بطاقة بالحجم نفسه بالضبط. النتيجة نفاد ذاكرة عند أول طلب بسياق طويل، أو انهيار عند تزامن مستخدمَين. اترك هامشاً دائماً.
اختيار البطاقة حسب المهمة
بطاقة NVIDIA Tesla L4
بطاقة موجّهة للاستدلال (تشغيل النماذج لخدمة المستخدمين) ومعالجة الوسائط. كفاءتها في استهلاك الطاقة عالية، وهي الخيار المنطقي حين يكون هدفك تشغيل نموذج لا تدريبه: مساعد محادثة، أو تصنيف نصوص، أو معالجة صور، أو ترميز فيديو.
بطاقة NVIDIA RTX A6000
ذاكرة أكبر وقدرة حسابية أعلى. تصبح ضرورية حين يتجاوز نموذجك ما تتسع له البطاقة الأصغر، أو حين تنتقل من التشغيل إلى الضبط الدقيق والتدريب، أو حين تعالج نماذج رؤية وصور بأحجام كبيرة.
الخطط المتاحة ومواصفاتها
كل الخطط أدناه تعمل على معالجات AMD EPYC 9684X مع ذاكرة DDR5 4800MHz وتخزين Micron 9400 NVMe. رتّبناها بحسب ذاكرة البطاقة لأنها المعيار الحاكم:
خطط Tesla L4
| ذاكرة البطاقة | أنوية | ذاكرة الخادم | شهرياً | سنوياً | تناسب |
|---|---|---|---|---|---|
| 6GB | 8 | 16GB | 180 دولاراً | 1,985 دولاراً | نماذج صغيرة أو مكمَّمة، تجارب |
| 12GB | 12 | 32GB | 258 دولاراً | 2,815 دولاراً | نموذج متوسط في الإنتاج |
| 16GB | 32 | 64GB | 365 دولاراً | 4,015 دولاراً | حمل أعلى ومستخدمون متزامنون |
| 24GB | 48 | 96GB | 485 دولاراً | 5,250 دولاراً | نماذج أكبر بدقة أعلى |
خطط RTX A6000
| ذاكرة البطاقة | أنوية | ذاكرة الخادم | شهرياً | سنوياً | تناسب |
|---|---|---|---|---|---|
| 8GB | 12 | 32GB | 299 دولاراً | 3,290 دولاراً | استدلال بقدرة حسابية أعلى |
| 16GB | 24 | 48GB | 410 دولاراً | 4,500 دولاراً | ضبط دقيق لنماذج متوسطة |
| 32GB | 40 | 64GB | 560 دولاراً | 6,000 دولار | نماذج كبيرة أو تدريب |
| 48GB | 60 | 128GB | 740 دولاراً | 8,175 دولاراً | أثقل الأحمال المتاحة |
لاحظ عند المقارنة: خطة بذاكرة بطاقة 16GB متاحة في العائلتين بسعرين مختلفين — الفرق في القدرة الحسابية للبطاقة وعدد الأنوية وحجم ذاكرة الخادم، لا في حجم الـ VRAM. اختر بحسب ما يقيّدك: إن كان القيد حجم النموذج فاذهب إلى VRAM أكبر، وإن كان القيد سرعة المعالجة فاذهب إلى البطاقة الأقوى. الأسعار قابلة للتغيير؛ راجع صفحة خوادم GPU.
الاستئجار أم الشراء؟
حساب بسيط يحسم المسألة لمعظم الحالات:
| الوجه | الاستئجار | الشراء |
|---|---|---|
| الدفعة الأولى | اشتراك شهري | ثمن البطاقة والخادم كاملاً |
| التقادم التقني | على المزود | عليك |
| الكهرباء والتبريد | مشمولة | تكلفة مستمرة كبيرة |
| تغيير الفئة | ترقية أو تخفيض متى شئت | إعادة شراء |
| وقت البدء | فوري تقريباً | أسابيع إلى أشهر |
| المنطقي متى؟ | مشروع لم يستقر حمله بعد | حمل ثابت مرتفع لسنوات |
القاعدة العملية: استأجر حتى يستقر حملك. معظم المشاريع تكتشف بعد شهرين أن حاجتها الحقيقية أصغر أو أكبر مما قدّرت، والاستئجار يجعل هذا الاكتشاف رخيصاً بدل أن يكون خطأً مكلفاً في عتاد مشترى.
ما تسأل عنه قبل الطلب
- كم VRAM بالضبط؟ وهل البطاقة مخصصة لك بالكامل أم مقسَّمة بين مستخدمين؟ هذا أهم سؤال في الموضوع كله.
- ما طراز البطاقة؟ لا تكتفِ بكلمة «GPU».
- هل لديك وصول جذر لتثبيت التعريفات والمكتبات؟ بعض البيئات المقيّدة تمنع ذلك.
- ما سرعة التخزين وحجمه؟ مجموعات البيانات والنماذج تشغل مساحة كبيرة، وتحميلها من قرص بطيء يهدر وقت البطاقة.
- ما سياسة الاستخدام المستمر؟ هل يُسمح بتشغيل البطاقة على حمل كامل لأيام متصلة؟
- هل يمكن الترقية بلا إعادة بناء؟ مهم إن كان مشروعك في مرحلة نمو.
حالات استخدام عملية
- تشغيل نموذج لغوي لخدمة داخلية. ابدأ بنموذج مكمَّم على أصغر خطة تتسع له مع هامش، وراقب استهلاك الذاكرة أسبوعاً قبل أن ترقّي.
- معالجة الوسائط وترميز الفيديو. بطاقات الاستدلال الموجّهة تؤدي هذا بكفاءة عالية بتكلفة أقل من بطاقات التدريب.
- الضبط الدقيق على بياناتك. يحتاج ذاكرة بطاقة أكبر بكثير من التشغيل — خطط لذلك من البداية ولا تفترض أن خطة التشغيل ستكفي.
- البحث الأكاديمي. الاستئجار الشهري يناسب دورة المشروع البحثي أفضل من شراء عتاد يتقادم. للجهات التعليمية راجع أيضاً استضافة الجامعات.
- تشغيل مساعد أو أداة داخلية للشركة. راجع استضافة مساعدات الذكاء الاصطناعي.
أسئلة شائعة
ما أهم مواصفة في خادم GPU؟
ذاكرة البطاقة (VRAM). إن لم يتسع النموذج فيها فلن يعمل أصلاً، بينما نقص المعالج أو الذاكرة العادية يسبب بطئاً لا توقفاً.
كم يكلف استئجار خادم GPU؟
تبدأ الخطط من 180 دولاراً شهرياً ببطاقة بذاكرة 6 جيجابايت و8 أنوية و16 جيجابايت ذاكرة، وترتفع إلى 740 دولاراً لأكبر خطة بذاكرة بطاقة 48 جيجابايت. راجع صفحة خوادم GPU.
كم VRAM أحتاج لنموذج بسبعة مليارات معامل؟
نحو 14 جيجابايت بدقة FP16، أو نحو 7 جيجابايت بدقة 8-bit، أو نحو 4 جيجابايت بدقة 4-bit — مضافاً إليها 20 إلى 40 بالمئة لذاكرة السياق وهامش التشغيل.
ما الفرق بين بطاقة الاستدلال وبطاقة التدريب؟
بطاقات الاستدلال مصممة لتشغيل النماذج بكفاءة طاقة عالية، أما بطاقات التدريب فتوفر ذاكرة أكبر وقدرة حسابية أعلى تلزم للضبط الدقيق والتدريب. تشغيل نموذج شيء وتدريبه شيء آخر تماماً في المتطلبات.
هل أستطيع تدريب نموذج على أصغر خطة؟
غالباً لا. التدريب والضبط الدقيق يستهلكان ذاكرة بطاقة أضعاف ما يستهلكه التشغيل. خطط للفئة الأكبر إن كان التدريب هدفك.
هل البطاقة مخصصة لي وحدي؟
اسأل صراحة قبل الطلب — الفرق بين بطاقة كاملة وحصة منها كبير في الأداء. وهذا سؤال يجب طرحه على أي مزود لا على مزود بعينه.
هل أستطيع البدء صغيراً والترقية لاحقاً؟
نعم، وهذا هو الأسلوب الموصى به: ابدأ بأصغر خطة تتسع لنموذجك مع هامش، وراقب الاستهلاك، ثم رقِّ بناءً على قياس لا على تقدير.
ابدأ من حجم نموذجك لا من السعر
احسب VRAM الذي تحتاجه بالجدول أعلاه، ثم اختر الخطة المطابقة من خوادم GPU. وإن لم تكن متأكداً من متطلبات نموذجك، تواصل مع الفريق التقني واذكر اسم النموذج وطريقة تشغيله المتوقعة.