شرح مبسط لتقنية خليط الخبراء (MoE): لماذا 2.8 تريليون معامل في Kimi K3 لا تعني ما تظنه؟
دليل من الصفر لفهم كيف تبقى نماذج الذكاء الاصطناعي العملاقة رخيصة: الخبراء، والموجه، والرقمان الأهم من رقم العنوان.
يوصف نموذج Kimi K3 بأنه نموذج بحجم 2.8 تريليون معامل.
المفاجأة؟ حوالي 98% من هذه المعاملات نائمة في كل مرة يجيبك فيها النموذج، وذلك حسب أرقام الشركة المصنعة نفسها [14].
هذا ليس خللا. هذا أكبر تحول في تصميم الذكاء الاصطناعي الحديث. وفي هذا المقال نشرحه من الصفر. بلا رياضيات، وبلا خلفية مسبقة. وفي النهاية ستعرف أيضا المصطلحات التقنية الحقيقية.
سياق الخبر في سطر واحد: في 16 يوليو أعلن مختبر Moonshot الصيني عن Kimi K3 باعتباره أكبر نموذج مفتوح الأوزان في التاريخ [14]. كلمة «مفتوح» تعني أن أي شخص يستطيع تحميل ملفات النموذج مجانا.
ما هي المعاملات (Parameters) في نموذج الذكاء الاصطناعي؟
نموذج الذكاء الاصطناعي هو كومة ضخمة من الأرقام القابلة للضبط. مليارات منها. عملية تدريب طويلة وآلية تضبط هذه الأرقام شيئا فشيئا حتى يصبح النموذج قادرا على توقع الكلمة التالية بدقة. هذه العملية اسمها التدريب (Training)، وهذه الأرقام اسمها المعاملات (Parameters).
عندما تقرأ «نموذج بحجم 70 مليار معامل»، فالمعنى ببساطة: كومة من 70 مليار رقم مضبوط.
والسؤال الذي تدور حوله هذه القصة كلها: لكي يكتب النموذج كلمة واحدة من الإجابة، هل يجب أن تعمل كل هذه الأرقام؟
ما هو النموذج الكثيف (Dense Model)؟ كل معامل يعمل في كل كلمة
النماذج الكلاسيكية تجيب: نعم. لكتابة كلمة واحدة، يعمل كل معامل في النموذج. العلماء يسمون هذا النموذج الكثيف (Dense). كثيف تعني: كل شيء نشط، طوال الوقت.
تخيل مصنعا يجب أن يلمس فيه كل عامل كل منتج. حتى كوب قهوة واحد يحتاج إلى جميع الموظفين السبعين ألفا. النظام يعمل، لكنه بطيء ومكلف جدا. لهذا كان النموذج الأكبر يعني دائما نموذجا أبطأ وأغلى.
ما هو نموذج خليط الخبراء (Mixture of Experts)؟
بين عامي 2021 و2024 عادت فكرة قديمة من التسعينيات: توقفوا عن إجبار كل معامل على العمل في كل كلمة.
كلمة واحدة قبل الشرح. النموذج مبني كمكدس من خطوات معالجة متكررة. كل خطوة في هذا المكدس اسمها طبقة (Layer).
داخل كل طبقة يحدث أمران. أولا، كلمات جملتك تنظر إلى بعضها البعض، مثل اجتماع فريق يتشارك فيه الجميع السياق. ثم تذهب كل كلمة لتعالج وحدها، مثل عودة كل موظف إلى مكتبه ليفكر بعد الاجتماع. هذا الجزء الثاني، عمل المكتب، هو الجزء المكلف. وفيه تعيش أغلب المعاملات.
الفكرة: قسم جزء عمل المكتب إلى كتل صغيرة كثيرة. أضف صانع قرار صغيرا. مع كل كلمة، يختار صانع القرار كتلا قليلة لتستيقظ وتعمل. والباقي يظل نائما ولا يكلف شيئا.
المصطلحات: الكتل الصغيرة اسمها الخبراء (Experts). صانع القرار اسمه الموجه (Router). والتصميم كله اسمه خليط الخبراء (Mixture of Experts) أو اختصارا MoE. عندما ترى «MoE» في الأخبار، فالمعنى هو هذا بالضبط: نموذج كبير لا يعمل منه إلا جزء صغير مع كل كلمة.
مثال حقيقي من Mixtral، النموذج الذي أصدره مختبر Mistral الفرنسي في ديسمبر 2023 [6]. كل طبقة فيها 8 خبراء، والموجه يختار 2 منهم. النموذج يخزن 47 مليار معامل، لكن كل كلمة لا تستخدم إلا حوالي 13 مليارا. أنت تخزن نموذجا كبيرا، وتدفع ثمن نموذج صغير.
صورة تساعد على الفهم: النموذج الكثيف يطبخ كل وجبة من خزانة مطبخ منزلية صغيرة. أما نموذج MoE فيتسوق في سوبرماركت ضخم، لكنه يملأ سلة صغيرة واحدة لكل طبق.
لمحة تاريخية، لأن هذه الفكرة ليست جديدة وليست من بلد واحد. نشر مفهوم خليط الخبراء عام 1991 [1]. وأحيته Google للذكاء الاصطناعي الحديث عام 2017 [2].
وبحلول 2020-2021 كانت Google تدرب نماذج فيها آلاف الخبراء وأكثر من تريليون معامل [3][4]. وتقول Google إن نماذج Gemini تستخدم MoE [13]. ثم جعلت Mistral الفرنسية الفكرة مشهورة في النماذج المفتوحة [6].
واليوم، نماذج Llama 4 من Meta [11] و gpt-oss من OpenAI [12] و Grok من xAI [7] و DBRX من Databricks [8] كلها نماذج MoE أيضا. هذه هندسة عالمية، وليست سرا لدولة واحدة.
خرافة الخبراء: خبراء MoE ليسوا متخصصين كالبشر
هنا يخطئ معظم من يشرح هذه التقنية، بما في ذلك صورة السوبرماركت التي رسمتها لك قبل قليل.
كنت ستتوقع «خبير رياضيات» و«خبير شعر». لكن هذا ليس ما يحدث. فحص الباحثون ما يجري داخل Mixtral فلم يجدوا متخصصين واضحين في المواد [6]. بل وجدوا الخبراء يتخصصون في أشياء غريبة: المسافات البادئة في أكواد البرمجة، وكلمة «self» في لغة Python، وسلاسل الكلمات المتجاورة. وحتى في أول دراسة عام 2017 كانت الأنماط أحيانا مفهومة لكنها لم تكن أبدا مواد دراسية: خبير ظل يستقبل الصفات، وخبير آخر ظل يستقبل كلمات مثل «a» و«the» [2]. أنماط تخدم الآلة، وليست تخصصات يختارها إنسان.
لماذا؟ لأن أحدا لا يوزع الأدوار. أثناء التدريب، يتعلم الموجه ببساطة أن إرسال قطع الكلمات المتشابهة إلى نفس الخبير يقلل الأخطاء. العلماء يسمون هذا تخصص الخبراء (Expert Specialization)، والحقيقة الأهم أنه تخصص ناشئ: لا أحد يصممه، بل يظهر من تلقاء نفسه.
ثلاثة أخطاء شائعة أخرى، نصححها في سطر واحد لكل منها:
- نموذج MoE ليس عدة نماذج صغيرة يختار بينها مدير. التوجيه يحدث في العمق، مع كل كلمة، وفي كل طبقة.
- لا يمكنك إخراج خبير واحد واستخدامه كنموذج صغير مستقل. الأجزاء لا تعمل إلا معا.
- MoE لا يوفر الذاكرة. كل الخبراء يجب أن يظلوا محملين في الذاكرة. ما يوفره هو العمل المبذول لكل كلمة. وهذا العمل له اسم: الحوسبة (Compute).
الخبراء الدقيقون والخبير المشترك: تصميم DeepSeek
في يناير 2024، بعد أسابيع من ظهور Mixtral، نشر مختبر DeepSeek الصيني تصميما دفع الفكرة أبعد [9]. DeepSeek لم يخترع MoE. بل طور طريقة تنظيم الخبراء. كانت Google قد جربت آلاف الخبراء [3]، لكن كل كلمة كانت لا تزال تستخدم خبيرا كبيرا واحدا أو اثنين. وكانت Microsoft قد جربت عام 2022 خبيرا مساعدا لا ينام [5]. جمع DeepSeek الفكرتين وطورهما:
أولا. قسم كل خبير إلى قطع أصغر بكثير، وأيقظ عددا أكبر منها مع كل كلمة، بنفس إجمالي العمل. بدلا من 8 إدارات كبيرة، تخيل 256 فريقا صغيرا. صار عدد الطرق الممكنة لتجميع الفرق المناسبة لكل كلمة أكبر بكثير.
ثانيا. أبق خبيرا أو اثنين لا ينامان أبدا. يريان كل كلمة ويتوليان العمل المشترك الممل، حتى لا تكرره الفرق الصغيرة. مثل موظف الاستقبال في الفندق.
المصطلحات: هذا هو خليط الخبراء الدقيق (Fine-grained MoE)، والجزء الذي لا ينام اسمه الخبير المشترك (Shared Expert).
النتيجة كانت سباقا، بين المختبرات كلها، نحو استخدام جزء أصغر فأصغر من النموذج لكل كلمة:
إذن، هل هذه فكرة صينية؟ لا. الفكرة هندسة عالمية مشتركة. ما فعلته المختبرات الصينية هو دفع المؤشر إلى أقصاه، ونشر تقارير تقنية كاملة عن ذلك، وإتاحة الملفات للجميع. والتأثير اليوم يسير في الاتجاهين.
لماذا يهم هذا السباق إلى هذا الحد؟ لأن نموذجا بهذا الحجم لا يعيش على شريحة واحدة. إنه موزع على عشرات شرائح الحاسوب في مركز بيانات، وكل كلمة يجب أن تسافر بين هذه الشرائح لتصل إلى خبرائها. وكل رحلة تكلف وقتا وكهرباء. كلما قل عدد أجزاء النموذج التي توقظها كل كلمة، قلت الرحلات وصغرت الفاتورة. هذا هو السبب الخفي لانتصار الكفاءة: التكلفة الحقيقية للذكاء الاصطناعي ليست حجم النموذج، بل حركة المرور داخل مركز البيانات.
تنبيه واحد: النسبة الأقل ليست تلقائيا أفضل. إنها مؤشر قابل للضبط. أدره أكثر من اللازم وستنخفض الجودة، ويحتاج الموجه إلى موازنة دقيقة حتى لا يبقى بعض الخبراء بلا عمل.
ملاحظة صدق: أرقام Kimi K3 لا تزال من الشركة نفسها [14]. حتى وقت كتابة هذا المقال، كان مقررا نشر ملفات النموذج للعموم في 27 يوليو ولم تكن متاحة بعد للفحص المستقل. سنحدث هذا المقال بمجرد أن تصبح الملفات عامة ويمكن تأكيد الأرقام.
المعاملات النشطة والمعاملات الكلية: ما الفرق؟
الآن الخلاصة. رقمان يصفان كل نموذج حديث، وكل منهما يجيب عن سؤال مختلف.
المعاملات الكلية (Total Parameters) تحدد كمية الذاكرة اللازمة لحمل النموذج. المعاملات النشطة (Active Parameters) تحدد السرعة وتكلفة كل كلمة. خذ نموذجا كليته 30 مليارا ونشطه 3 مليارات. يحتاج ذاكرة نموذج كبير. ويجري بسرعة نموذج صغير جدا. ويفكر بمستوى بينهما: أفضل بوضوح من نموذج صغير، ولا يساوي نموذجا كبيرا.
المعاملات النشطة تحدد السرعة. والمعاملات الكلية تحدد الذاكرة. لهذا تبدو نماذج MoE الحديثة أصغر بكثير مما توحي به أرقام عناوين الأخبار.
ثلاثة أشياء تذكرها
- المعاملات الكلية تخبرك بالذاكرة المطلوبة.
- المعاملات النشطة تخبرك بالسرعة وتكلفة كل إجابة.
- النسبة النشطة الأقل ليست تلقائيا أفضل. هي مفيدة فقط إذا بقيت الجودة عالية.
في المرة القادمة التي يصدر فيها نموذج جديد، تجاوز رقم العنوان وابحث عن الرقمين معا: المعاملات الكلية، والمعاملات النشطة. الرقم الثاني هو القصة الحقيقية. وبمجرد أن تفهم هذا الفرق، تصبح عناوين أخبار الذكاء الاصطناعي أسهل بكثير في القراءة. تتوقف عن السؤال «كم حجم النموذج؟» وتبدأ بالسؤال «كم يعمل منه فعليا لكل كلمة؟»
يبقى سؤال واحد يستحق مقالا مستقلا:
إذا كان النموذج بهذه الكفاءة لكل كلمة، فلماذا لا تزال محادثة بمليون كلمة صعبة إلى هذا الحد؟
لأن عنق الزجاجة ليس في الخبراء. إنه في مكان آخر.
في الجزء الثاني: لماذا السياق الطويل صعب - ذاكرة KV و MLA و Kimi Delta Attention، بنفس البساطة.
العنوان يقول 2.8 تريليون. القصة في الـ 2%.
أسئلة وأجوبة سريعة
ما هو نموذج خليط الخبراء في جملة واحدة؟
نموذج ذكاء اصطناعي كبير مقسم إلى أجزاء صغيرة كثيرة، حيث يوقظ صانع قرار صغير أجزاء قليلة فقط لكل كلمة، فيعمل نموذج ضخم بتكلفة نموذج صغير.
هل يتخصص الخبراء في مواد مثل الرياضيات أو الشعر؟
لا. الباحثون الذين فحصوا الداخل وجدوا أنماطا مثل المسافات البادئة في الأكواد والكلمات الشائعة، وليست مواد بشرية. لا أحد يوزع الأدوار، بل تظهر أنماط التوجيه من تلقاء نفسها أثناء التدريب.
هل Kimi K3 فعلا أكبر نموذج في العالم؟
لا أحد يستطيع الجزم. إنه أكبر نموذج مفتوح أعلن عنه حتى الآن، بحجم 2.8 تريليون معامل حسب أرقام الشركة نفسها. المختبرات المغلقة مثل OpenAI و Anthropic و Google لا تنشر أحجام نماذجها الكبرى.
هل خليط الخبراء اختراع صيني؟
لا. الفكرة من عام 1991، وسعتها Google، وجعلها مختبر فرنسي مشهورة في النماذج المفتوحة، ونماذج أمريكية مثل Llama 4 و gpt-oss تستخدمها اليوم. المختبرات الصينية دفعت الكفاءة إلى أقصاها ونشرت أكثر التفاصيل.
ما الذي أبحث عنه عند إصدار نموذج جديد؟
رقمان. المعاملات الكلية تخبرك بالذاكرة المطلوبة. المعاملات النشطة تخبرك بالسرعة والتكلفة لكل كلمة. الرقم الثاني عادة هو القصة الحقيقية.
المصادر والمراجع
مرقمة حسب موضع دعمها لهذا المقال. المصادر بالإنجليزية.
- Jacobs, Jordan, Nowlan, Hinton: Adaptive Mixtures of Local Experts, Neural Computation, 1991.
- Shazeer et al.: Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer, 2017.
- Fedus, Zoph, Shazeer: Switch Transformers, 2021.
- Lepikhin et al.: GShard, 2020.
- Rajbhandari et al.: DeepSpeed-MoE, Microsoft, 2022.
- Jiang et al.: Mixtral of Experts, Mistral AI, 2024.
- Grok-1, xAI, 2024.
- DBRX, Databricks, 2024.
- Dai et al.: DeepSeekMoE, 2024.
- DeepSeek-V3 Technical Report, 2024.
- Llama 4, Meta, 2025.
- gpt-oss model card, OpenAI, 2025.
- Google announcement of Gemini 1.5, 2024.
- Kimi K3 tech blog, Moonshot AI, 2026.
عن هذا المقال: كتبه محمد قادري، مدير تقني يعمل في عمليات شبكات الاتصالات ويبني ويشغل أنظمة وكلاء الذكاء الاصطناعي بشكل عملي. تم التحقق من كل رقم أعلاه مقابل الورقة العلمية الأصلية أو الإصدار الرسمي المذكور، وأرقام Kimi K3 معلمة كادعاءات من الشركة حتى يتم التحقق المستقل من الملفات المنشورة. سيحدث هذا المقال عند اكتمال ذلك الفحص. آخر تحديث: 27 يوليو 2026.