استضفت الذكاء الاصطناعي ذاتيا اسبوعا: النموذج كان الجزء السهل

محمد قدري · 17 اغسطس 2026 · 12 دقيقة قراءة · الاسعار محققة في 17 اغسطس 2026

طرحت سؤالا على نموذج محلي على حاسوبي MacBook وذهبت لاعداد القهوة. بعد دقيقتين كان لا يزال يكتب. فاستأجرت معالجا رسوميا واحدا في السحابة، وحمّلت عليه عدة عائلات من النماذج المفتوحة، وامضيت اسبوعا في ما ظننته اختبارا للنماذج. لم يكن كذلك. ما علّمني اياه الاسبوع فعلا هو ان ما نسميه ببساطة "النموذج" هو منظومة هندسية كاملة، وان النموذج نفسه هو الجزء السهل. هذه هي القصة، مكتوبة كي يتمكن قارئ بلا خلفية في الذكاء الاصطناعي من متابعة كل خطوة، وتنتهي حيث يقع عملي اليومي: ما علّمتني اياه النماذج الخام الاقل تقييدا عن تصميم ضوابط الحماية لوكلاء الذكاء الاصطناعي.

معالج رسومي على طاولة عمل تطفو فوقه طبقات شفافة معنونة: منظومة التشغيل، النموذج، محرك الاستدلال، التكميم، وذاكرة المعالج، وتدور حوله اسماء Gemma 4 و gpt-oss و Qwen و DeepHat
معالج رسومي واحد، مجموعة من النماذج المفتوحة، والطبقات التي يخفيها المنتج المُدار عن العين.

ظننت انني اختبر النماذج

كانت الخطة بسيطة. كان حاسوبي MacBook ابطأ من ان يشغّل نماذج محلية جدية، فاستأجرت جهاز g2-standard-8 على Google Cloud: 8 انوية معالجة افتراضية، و 32 غيغابايت من الذاكرة العادية RAM، ومعالج رسومي واحد من نوع NVIDIA L4 بذاكرة خاصة به سعتها 24 غيغابايت تسمى ذاكرة العرض VRAM. افصل بين هاتين الذاكرتين في ذهنك: الذاكرة RAM هي المخزن الذي تجهّز فيه المواد، وذاكرة العرض VRAM هي الورشة نفسها حيث يعمل النموذج فعلا. للاستدلال السريع على المعالج وحده، تريد ان يتّسع النموذج مع السياق العامل داخل الورشة، و 24 غيغابايت هي الايجار الواقعي للفئة المتوسطة.

وصلت النماذج بسرعة: Gemma 4، و gpt-oss من OpenAI، وعدة نسخ من Qwen بينها نسخة برمجة منزوعة قيود الرفض، ونموذج امن متخصص اسمه DeepHat. الاسئلة نفسها التي كانت تستغرق استراحة قهوة من دقيقتين لكل اجابة على حاسوبي عادت خلال ثوان على المعالج L4. بدا اليوم الاول انتصارا. اما بقية الاسبوع فقد فككت تصوري لما كنت استأجر المعالج من اجله اصلا.

اربعة وعشرون غيغابايت تغيّر طريقة تفكيرك

على واجهة برمجية لا تفكر في الذاكرة ابدا. اما على معالجك انت، فاربعة مصطلحات تكف عن كونها تفاصيل جانبية وتصبح قرارات يومية. تخيّل ما تفعله كاستئجار ورشة مجهّزة بالكامل بالساعة، بدلا من شراء آلات ستستخدمها لمشروع واحد. هذا الاستئجار هو قرار المعالج السحابي كله، والمصطلحات الاربعة مجرد حقائق عن الورشة.

المعاملات هي الادوات المعلّقة على الجدار. "نموذج 12B" هو ورشة معلّق فيها اثنا عشر مليار اداة. المزيد من الادوات ينجز مهام اكثر، لكن كل اداة تحتاج مساحة على الجدار، وتلك المساحة هي ذاكرة العرض VRAM. القاعدة العملية: كل مليار اداة يحتاج نحو 2 غيغابايت بالحجم الكامل (FP16)، ونحو 1 غيغابايت بدقة 8 بت، ونحو 0.5 غيغابايت بدقة 4 بت [8].

التكميم هو النسخة المضغوطة المحمولة من كل اداة. المهمة نفسها، بدقة اقل قليلا، وربع المساحة. ملاحظة صدق واحدة: 4 بت ليست شيئا واحدا؛ فصيغ GGUF Q4 و AWQ و GPTQ و MXFP4 طرائق مختلفة بتكاليف جودة مختلفة، ولهذا يشحن gpt-oss صيغته الخاصة MXFP4 بدلا من تكميم عام.

نافذة السياق هي المخطط المبسوط على الطاولة. كلما طال الرسم الذي يبقيه النموذج مفتوحا، غطّى مساحة اكبر من الطاولة، مساحة مقتطعة من الادوات. تقنيا، تلك المساحة هي ذاكرة KV المؤقتة: بضعة آلاف من الكلمات تكلّف 1 الى 2 غيغابايت، وطول كتاب قد يتجاوز 8 غيغابايت [8]. بطاقة تعلن نافذة بسعة 262,000 توكن ستُحمّل على معالج بسعة 24 غيغابايت، لكنك لن تبسط مخططا بهذا الحجم بجانب الادوات. المواصفات سقوف، لا وعود.

التوكنات في الثانية هي القطع المنجزة في الساعة. الارقام المنشورة لورش من فئة 7 الى 9 مليار اداة بدقة 4 بت على بطاقات من فئة 24 غيغابايت تتجمّع حول 40 توكن في الثانية فاكثر [9]. لم اسجّل الانتاجية بدقة ولن اختلق ارقاما؛ ما رصدته هو الفارق اعلاه بين استراحة القهوة والثواني، على كل نموذج شغّلته.

عند 32B توقف التكميم عن كونه مفردة

حتى نحو 12 مليار معامل، تبدو الورشة واسعة والقواعد اعلاه تفاصيل. ثم دفعت باتجاه نموذج من فئة 32B، فتحوّل التكميم من مفردة الى تخطيط للسعة.

النموذج الذي اردته كان qwen2.5-coder:32b، نموذج البرمجة 32B الذي رجوت ان اقود به جلسة برمجة حقيقية. استبعده الحساب قبل ان اهدر عليه جلسة: اثنان وثلاثون مليار معامل بدقة 4 بت هي نحو 18 غيغابايت من الاوزان، وحالما اردت سياقا عاملا واقتطع محرك التشغيل حصته من الـ 24 غيغابايت، لم تبق طاولة للمخطط. كان البديل تفريغا جزئيا الى المعالج المركزي CPU على حساب توليد ابطأ بكثير؛ وبدلا من ان امضي الامسية في ذلك، فعلت ما اخبرني به الحساب ونزلت الى نموذج برمجة 14B. هذه المقايضة، التخلي عن المعاملات لاستعادة السياق ومساحة الاحتياط، هي درس هذا القسم كله: على معالج واحد بسعة 24 غيغابايت، حجم النموذج ليس تفضيلا، بل ميزانية.

الحساب يفسّر الجدار. اثنان وثلاثون مليار اداة بدقة 4 بت هي نحو 18 غيغابايت من الاوزان قبل ان يقتطع المخطط ومحرك التشغيل حصتيهما من ورشة سعتها 24 غيغابايت؛ اترك اقل من 2 الى 4 غيغابايت هامشا وستدخل سريعا في نفاد الذاكرة، او تقليص السياق، او التفريغ الى المعالج المركزي، بحسب محرك التشغيل. هذه هي اللحظة التي يتوقف فيها تخطيط السعة عن كونه مفردة.

طاولة عمل لمعالج بسعة 24 غيغابايت تملؤها اوزان نموذج 32B بدقة 4 بت بنحو 18 غيغابايت، والسياق وذاكرة KV المؤقتة بنحو 4 غيغابايت، وحمل محرك التشغيل بنحو 1.5 غيغابايت، ويتبقى اقل من 0.5 غيغابايت من مساحة الاحتياط
على بطاقة بسعة 24 غيغابايت، اوزان 32B وحدها تاخذ ثلاثة ارباع الطاولة. السياق ومحرك التشغيل ياخذان الباقي.

النموذج لم يكن سوى نصف المنتج

هذا هو الاكتشاف الذي اعاد تنظيم هذا المقال كله. المحادثة مع نموذج محلي تعمل في اليوم الاول. ثم وجّهت opencode، وهو اطار برمجة مفتوح المصدر، الى نقطة الوصول الخاصة بي بدلا من واجهة برمجية مدفوعة، وحاولت ان اعمل بالطريقة التي اعمل بها مع Claude Code. كان الفرق فوريا، ولم يكن ذكاء النموذج. كان كل ما يلتف حول النموذج مما لا يظهره لك منتج مصقول ابدا: توجيه النظام، وتوزيع السياق، واوصاف الادوات، وصيغة استدعاء الادوات، والتحليل، واعادة المحاولة، وحلقة التخطيط، والحالة عبر الادوار.

الجدار الاول لم يكن الذكاء، بل الرفض. رفض qwen2.5-coder العادي مهام الامن الهجومي رفضا صريحا، وهو ما كان عائقا قاطعا للعمل الامني الذي كنت اختبره، فانتقلت الى نسخة منزوعة قيود الرفض (huihui_ai/qwen2.5-coder-abliterate:14b) ازيل منها كثير من سلوك الرفض ذاك. الدرس الاول، قبل اي استدعاء اداة: سلوك الرفض جزء من سلوك النموذج، لا حاجز امني، ولهذا بالضبط يمكن لنسخة معدّلة من النموذج الاساسي نفسه ان تعطي اجابة مختلفة.

الجدار الثاني كان السلوك. حين وُجّه عبر اطار التشغيل الى ملفات حقيقية، تخبّط النموذج الصغير في المهام متعددة الخطوات، وحاد عن الصيغة، وانتج شذرات مبنية على هيئة JSON حيث كنت اريد تعديلات نصية بسيطة. لم يكن حلي توجيها افضل للنموذج؛ كان عقد اخراج ضمن ملف اطار التشغيل، كتلة من التعليمات المخصصة تقيّد الطريقة المسموح له بها للرد. لاحظ الكلمة التي لا استعملها: هذا قيد سلوكي، لا ضابط حماية. ضابط الحماية، لاحقا في هذا المقال، يعني تحكما قابلا للانفاذ: هوية، وصلاحية، وسياسة، وتحقق، ومفتاح ايقاف. الخلط بينهما خطا معماري سهل الوقوع فيه. ما علّمني اياه الحل هو ان ما يبدو "سوء تصرف من النموذج" هو عادة النموذج مضافا اليه قالب المحادثة ومحرك التشغيل واطار التشغيل، وان الحل الدائم لهذا النوع من اعطال الواجهة كان في طبقة اطار التشغيل التي اتحكم بها، لا في تغيير الاوزان.

حادثة الـ JSON تلك علّمتني ادرس دروس الاسبوع: ما يبدو سلوكا للنموذج هو غالبا سلوك النموذج مضافا اليه قالب المحادثة ومحرك التشغيل واطار التشغيل. اربع طبقات، كل واحدة قادرة على ثني المخرَج، ومن الخارج لا يمكنك ان تعرف ايها فعل. المنظومة التي تشغّلها فعلا تبدو هكذا:

منظومة الذكاء الاصطناعي الخفية، من الاعلى الى الاسفل: اطار التشغيل (توجيه النظام، السياق، الادوات، اعادة المحاولة)، النموذج (الاوزان)، محرك الاستدلال (اولاما او vLLM، القالب، التجميع)، التكميم (Q4، Q8، MXFP4)، وذاكرة المعالج (ميزانية 24 غيغابايت من ذاكرة العرض). الواجهات البرمجية تخفي المنظومة، والاستضافة الذاتية تجعلك تشغّلها.
المنظومة التي تشغّلها فعلا. حين يقول احدهم ان النموذج فعل كذا، اي طبقة قد تكون هي الفاعل الحقيقي.

حين يقول احدهم "النموذج فعل كذا"، اي طبقة من تلك المنظومة قد تكون الفاعل الحقيقي. الواجهات البرمجية تخفي المنظومة. الاستضافة الذاتية تجعلك تشغّلها، وذلك هو التعلّم.

لم يكن الفرق الاكبر في القدرة، بل في الاحتكاك

المقارنة الصادقة مع منتجات الصف الاول ليست درجة في اختبار قياسي. مع Claude او GPT، كان يمكنني عادة ان اصف نية، حتى لو صغتها بتهاون، فيستنتج النظام ما اقصده. اما مع عدة اعدادات محلية، فوجدت نفسي اصف عقد الواجهة بدلا من ذلك: كيف يتصرف بالضبط، وباي صيغة يجيب بالضبط، واي اداة يستدعي بالضبط.

ابين مثال كان عمل البرمجة اعلاه. مع Claude Code تعاملت مع منتج: سلّمت هدفا مصوغا بتراخ، وكان شيء آخر قد قرر مسبقا النموذج، وميزانية السياق، وربط الادوات، واعادة المحاولة. اما محليا فكنت اشغّل المنتج واستخدمه في آن واحد، اركّب النموذج ومحرك التشغيل واطار التشغيل بنفسي قبل ان تنجو النية نفسها من الرحلة. هذا ليس Claude مقابل Qwen؛ بل منتج مُدار متكامل عموديا مقابل منظومة تركّبها انت. بالنسبة للمهام التي جربتها، لم تكن قدرة النموذج الخام هي ما فاجاني. بل الاحتكاك في التكامل، والاحتكاك هو المنتج.

المنتج المُدار مقابل المنظومة المستضافة ذاتيا: في الجانب المُدار تتعامل مع المنتج فقط والمنظومة مخفية؛ في الجانب المستضاف ذاتيا تقود اطار التشغيل ومحرك التشغيل والنموذج والمعالج بنفسك. محليا انت المستخدم والمشغّل معا.
استخدام الذكاء الاصطناعي ليس كتشغيله. محليا انت الاثنان معا.

ما علّمني اياه كل نموذج

ما شغّلتهلماذا جربتهماذا حدث
Gemma 4 12Bنموذج يومي عام، والصوراتّسع في L4 بيسر بدقة 4 بت؛ خياري الافتراضي
gpt-oss-20bالاستدلال واستخدام الادواتخليط خبراء، يشحن MXFP4؛ بدا مقتدرا على نحو لافت مقارنة بمدى يسر تشغيله على L4
Qwen3.5-9Bنموذج صغير متعدد الاستخداماتنموذجي الصغير المفضّل في هذه التجربة
qwen2.5-coder:32bاردت اختبار نموذج برمجة اكبرلم يتّسع مع سياق عامل على 24 غيغابايت؛ نزلت الى 14B
qwen2.5-coder-abliterate:14bالنسخة العادية رفضت مهام الامن التي جربتهالم تعد حالات الرفض المختبَرة تظهر؛ احتجت عقد اخراج في اطار التشغيل للبقاء على الصيغة
DeepHat-V1-7Bمختبر الامن وضوابط الحماية (في LM Studio)خريطة سطح الاعطال لقسم ضوابط الحماية

هذه هي التجربة، لا ورقة مواصفات. اعداد المعاملات وسقوف السياق موجودة على بطاقة كل نموذج [1][2][3][4]؛ لم اقس التوكنات في الثانية ولن اختلق ارقاما.

Gemma 4 12B (من Google) متعدد الوسائط بسياق 256 الف توكن [2]، يتّسع في L4 بيسر بدقة 4 بت، وصار نموذجي اليومي للعمل العام ولاي شيء يتعلق بالصور.

gpt-oss-20b (من OpenAI) يضم 21 مليار معامل مع 3.6 مليار نشطة فقط لكل توكن، ويُشحن مكمّما مسبقا بصيغة MXFP4 فيعمل ضمن 16 غيغابايت [1]. هذا هو خليط الخبراء يعمل تماما كما وعد شرحنا لخليط الخبراء: كل الاحدى والعشرين مليار اداة معلّقة على الجدار وتحتسب مساحتها، لكن لا يُلتقط منها الا المليارات القليلة ذات الصلة بالمهمة، ما يعني حسابا اقل لكل توكن مقارنة بنموذج كثيف بالحجم نفسه، فيمكن ان يبدو سريعا؛ وهذا ليس سبب صغره.

Qwen3.5-9B (من Alibaba) يحشر نافذة اصلية بسعة 262 الف توكن في 9 مليارات معامل [3]، وهو نموذجي الصغير المفضّل في هذه التجربة، مع تحفّظ المخطط المذكور اعلاه.

النسخ منزوعة قيود الرفض وغير المقيّدة هي التي علّمتني اكثر شيء، لا لانني اردت مخرجاتها بل لانني احتجت ان اراها. تشغيل huihui_ai/qwen2.5-coder-abliterate:14b بجانب نظيره المحكوم هو ما حوّل عبارة "ضوابط الحماية مهمة" من شعار الى قائمة تدقيق.

DeepHat-V1-7B هو المتخصص: نسخة مضبوطة بدقة من Qwen2.5-Coder-7B للامن السيبراني، مبنية للعمل الامني الهجومي والدفاعي، بسياق 131 الف توكن [4]. شغّلته لغرض القسم التالي بالضبط.

اولاما يُحسّن الراحة، و vLLM يُحسّن الخدمة

اولاما تثبيت واحد وامر واحد لكل نموذج، والنسخ المكمّمة تُدار نيابة عنك؛ مبني حول راحة المطوّر، وللتعلّم يصعب التغلّب عليه. اما vLLM فمصمّم حول كفاءة الخدمة: تقنية PagedAttention تدير ذاكرة المخطط في صفحات بدلا من كتلة متصلة واحدة، والتجميع المستمر يبقي المعالج ممتلئا عبر طلبات كثيرة، ودعم التخزين المؤقت للبادئة والاخراج المبنيّن هما سبب اختلاف سلوكه تحت الحمل، لا مجرد كونه اسرع [11]. المقارنة التي استشهد بها تُظهر المقايضة المتوقعة: vLLM يتقدم في زمن اول توكن والانتاجية متعددة المستخدمين، واولاما يفضّل بساطة المستخدم الواحد [11]. توجد ادوات اخرى لوقت لاحق، فـ SGLang و TGI هما الاسمان اللذان ستلتقيهما حين يشتد التزامن. شغّلت الاثنين على L4 وبقي التقسيم كما هو: اولاما للاستخدام اليومي، و vLLM حين اردت خدمة عدة طلبات معا بدلا من واحد تلو الآخر.

السلوك الخام غيّر طريقة تفكيري في ضوابط الحماية

اشغّل وكلاء ذكاء اصطناعي في الانتاج، وكل ما انشره يعود الى اطروحة واحدة: الاستقلالية يجب ان تُكتسب، وتُحكَم، وتكون قابلة للسحب. الحوكمة المختبَرة فقط على نموذج واجهة برمجية مُوسَط بشدة قد لا تلتقي ابدا ببعض انماط الاعطال التي ينبغي لبنيتك المحيطة ان تكون مستعدة لاحتوائها؛ سطح الاعطال اوسع مما سيُظهره لك ذلك النموذج. لذلك اجريت تقييما خصاميا على نسخ اقل تقييدا، بينها نسخة البرمجة منزوعة قيود الرفض اعلاه و DeepHat، وعاملت مخرجاتها كخريطة لسطح الاعطال الذي يجب ان تتحكم به ضوابط حمايتي. هذا هو الانضباط الذي يوصي به عمل OWASP في امن الوكلاء: اختبار خصامي مع تحقق دفاعي مستمر، يقوم به من يبنون انظمة محكومة. لاكون صريحا: هذا عمل تشخيصي، لا توصية بوضع نماذج غير محمية قرب المستخدمين.

ثلاثة دروس. اولا، رفض النموذج طبقة واحدة فقط من منظومة امان، ويجب الا يكون ابدا الطبقة التي تعتمد عليها بنيتك؛ فالاوزان المفتوحة قد تُدرّب لاحقا او تُغلّف على نحو مختلف جدا عما يُظهره اي واجهة برمجية. ثانيا، ضوابط الحماية الحرجة يجب ان توجد خارج النموذج، لان التحكمات التي تعيش داخل النموذج وحده تختفي حين يتغير النموذج. المنظومة المفتوحة تشحن القطع: Llama Guard، و NVIDIA NeMo Guardrails، ومصنّف gpt-oss-safeguard من OpenAI [5]؛ ومشاريع مثل Forge [7] تبلّغ عن مكاسب كبيرة من تغليف النماذج الصغيرة بضوابط حماية صارمة لاستدعاء الادوات، مقيسة ذاتيا، فاستشهد بالاتجاه لا بالارقام. ثالثا، مستوى التحكم يعمل بجانب منظومة الطبقات اعلاه، لا داخلها: هوية، وصلاحية، وسياسة مدخلات، وسياسة ادوات، وتحقق من المخرجات، وقابلية رصد، ومفتاح ايقاف.

منظومة النموذج يحيط بها مستوى تحكم خارجي: الهوية والمصادقة، والصلاحية، والسياسة والحوكمة، والتحقق من المدخلات، والتحقق من المخرجات، وقابلية الرصد والتدقيق، ومفتاح الايقاف. رفض النموذج ليس حاجزا امنيا؛ التحكمات الحقيقية تعيش خارج النموذج.
مستوى التحكم يعمل بجانب المنظومة لا داخلها. رفض النموذج ليس حاجزا امنيا.

تلك البنية مقال قائم بذاته، وهو مقال مركز عمليات الوكلاء، وهذا الاسبوع من قراءة النماذج الخام كان يعايره. الانضباط حول نموذج صغير محكوم يتفوق على الامل حول نموذج كبير غير مقيّد.

الاقتصاد، بلا رومانسية

خطّط لميزانية الجهاز كله، لا لبند المعالج وحده. مكوّن المعالج L4 وحده يكلّف 0.56 دولار في الساعة عند الطلب و 0.34 دولار في الساعة بسعة spot في منطقة us-central1، مقروءة من دليل الفوترة في Google في 17 اغسطس 2026 [6]؛ ومع نوى المعالجة والذاكرة وقرص الاقلاع في g2-standard-8، خطّط لنحو 0.85 الى 0.90 دولار في الساعة عند الطلب شاملا، ونحو نصف ذلك بسعة spot. تقديرات تخطيطية، لا اقتباسات من الدليل: راجع الصفحة الحيّة. لقرّاء الخليج، القراءة نفسها من الدليل تضع L4 بسعة spot في الدمام قرب 0.54 دولار في الساعة، والتزام ثلاث سنوات في الدوحة قرب 0.31 دولار [6].

اسبوعي من الامسيات مع عطلة نهاية اسبوع طويلة بسعة spot كلّف اقل من عشرين دولارا شاملا. المعادلة الحقيقية هي الكلفة لكل توكن مفيد: كلفة البنية مقسومة على التوكنات التي تمررها فعلا. معالج يعمل دائما بمعدل استخدام عشرة بالمئة هو حنين مكلف؛ ولمعظم الاحمال المتقطعة قليلة الحجم، يصعب التغلّب على الواجهات البرمجية. تكسب الاستضافة الذاتية قيمتها مع معدل استخدام مستمر، ومع بيانات لا يجوز لها ان تغادر، ومع الوصول الخام للنموذج اعلاه، الذي لا توفّره الواجهات المُدارة السائدة بالطريقة نفسها.

فحص تقريبي سريع لذاكرة العرض

للتخطيط الحقيقي، استعمل الحاسبات المجتمعية الكاملة اولا: حاسبة ذاكرة العرض على Hugging Face، وحاسبة llm-calc المفتوحة المصدر [10]، فهي تنمذج التفاصيل التي لا تستطيعها هذه الصفحة. النسخة ادناه لعبة تعليمية تطبّق القواعد التقريبية اعلاه فقط، لتتحقق مبدئيا وانت تقرا. ثق بحكمها الى رقم دلالي واحد، لا الى الكسر العشري ابدا.

تقديرات فقط: الاستخدام الفعلي يتغير بحسب البنية، ودقة ذاكرة KV المؤقتة، ومنظومة الخدمة. للارقام الدقيقة لكل نموذج وتكميم، استعمل الحاسبات الكاملة [10].

ابنِ نسختك الخاصة من المختبر

انشئ الجهاز (بسعة spot، مع تقبّل ان Google قد تستعيده):

gcloud compute instances create llm-lab \
  --zone=us-central1-a --machine-type=g2-standard-8 \
  --provisioning-model=SPOT --instance-termination-action=STOP \
  --image-family=debian-12 --image-project=debian-cloud \
  --boot-disk-size=100GB --maintenance-policy=TERMINATE

ادخل عبر SSH وثبّت مشغّل NVIDIA بمثبّت Google نفسه:

curl -O https://raw.githubusercontent.com/GoogleCloudPlatform/compute-gpu-installation/main/linux/install_gpu_driver.py
sudo python3 install_gpu_driver.py

اذا لم يُظهر nvidia-smi شيئا بعد انتهاء المثبّت، اعد الاقلاع مرة قبل تنقيح اي شيء آخر. ثم اولاما، ونموذج يتّسع مع مساحة احتياط:

curl -fsSL https://ollama.com/install.sh | sh
ollama pull gemma4:12b   # or: ollama pull qwen3.5:9b
ollama run gemma4:12b

لا تفتح منافذ الجدار الناري؛ استعمل نفقا بدلا من ذلك: gcloud compute ssh llm-lab --zone=us-central1-a -- -L 11434:localhost:11434، ثم وجّه opencode او متصفحك الى localhost:11434. حين يُستعاد spot، الراية اعلاه توقف الجهاز بدلا من حذفه؛ وinstances start يعيد اقلاعه من القرص الدائم نفسه، بنماذجك وملفاتك المحمّلة سليمة. والامر الذي يحمي محفظتك:

gcloud compute instances stop llm-lab --zone=us-central1-a

الايقاف ينهي فوترة الحوسبة؛ اما الاقراص المحتفظ بها والموارد الثابتة فتظل تُحتسب حتى تُحذف، فحين ينتهي المختبر، احذف الجهاز وقرصه واي عنوان IP محجوز.

اسئلة يجيب عنها هذا المقال

ما ارخص طريقة لتجربة الاستضافة الذاتية؟ معالج رسومي سحابي بسعة spot. مكوّن المعالج L4 نحو 0.34 دولار في الساعة بسعة spot في us-central1 [6]؛ وامسية من التجارب قد تكلّف بضعة دولارات.

ماذا يفعل التكميم فعلا؟ يخزّن الاوزان ببتات اقل: تقريبا 2 غيغابايت لكل مليار معامل بدقة FP16، و 1 غيغابايت بدقة 8 بت، و 0.5 غيغابايت بدقة 4 بت [8]، و 4 بت نفسها تاتي بصيغ غير متبادلة.

لماذا خيّب نموذجي المحلي امالي مقابل Claude او GPT؟ غالبا ليست الاوزان وحدها. فاطار التشغيل وقالب المحادثة ومحرك التشغيل والتدريب اللاحق تشكّل التجربة الى جانب النموذج، والمنتج المُدار يقرر كثيرا منها نيابة عنك؛ اما الاستضافة الذاتية فتجعلك تشغّلها كلها.

اولاما ام vLLM؟ اولاما يُحسّن راحة المطوّر؛ و vLLM يُحسّن كفاءة الخدمة والتزامن [11].

لماذا تختبر نماذج مفتوحة اقل تقييدا؟ التقييم الخصامي: رسم خريطة سطح الاعطال الذي يجب ان تتحكم به ضوابط حمايتك الخارجية، مع ابقاء تلك الضوابط خارج النموذج حيث تصمد عند تبديله.

المراجع

  1. OpenAI: بطاقة نموذج gpt-oss-20b - 21 مليار معامل، 3.6 مليار نشطة، MXFP4، يعمل ضمن 16 غيغابايت.
  2. Google: بطاقة نموذج Gemma 4 12B - احجام من E2B الى 31B، سياق 128 الف / 256 الف، متعدد الوسائط.
  3. Alibaba: بطاقة نموذج Qwen3.5-9B - 9 مليارات معامل، سياق اصلي 262,144 توكن.
  4. DeepHat: بطاقة نموذج DeepHat-V1-7B - نسخة مضبوطة بدقة من Qwen2.5-Coder-7B للامن السيبراني، سياق 131 الف.
  5. OpenAI: gpt-oss-safeguard-20b - نسخة مصنّف امان مفتوحة من gpt-oss.
  6. Google Cloud: اسعار المعالجات الرسومية - ارقام L4 مقروءة من دليل الفوترة الحيّ، 2026-08-17 (us-central1 عند الطلب 0.56 دولار/ساعة، spot 0.3359 دولار/ساعة؛ me-central2 spot 0.5376 دولار/ساعة؛ me-central1 التزام 3 سنوات 0.3062 دولار/ساعة).
  7. Forge: المستودع ونتائج التقييم - طبقة ضوابط حماية لاستدعاء الادوات؛ الارقام من مجموعة اختبار المشروع نفسه المكوّنة من 26 سيناريو.
  8. SitePoint: تشغيل نماذج محلية في 2026؛ DataNorth: دليل النماذج المستضافة ذاتيا - قواعد تقريبية للذاكرة لكل معامل ولذاكرة KV المؤقتة.
  9. LocalLLM.in: متطلبات ذاكرة العرض لاولاما؛ MarkTechPost: افضل النماذج المحلية على معالج واحد بسعة 24 غيغابايت - تقديرات انتاجية لبطاقات فئة 24 غيغابايت.
  10. حاسبات مجتمعية: حاسبة ذاكرة العرض (Hugging Face Space)؛ llm-calc.
  11. Allen Kuo: مقارنة Gemma 4 على vLLM مقابل اولاما - انقسام بين زمن اول توكن والتزامن مقابل بساطة المستخدم الواحد.