لماذا السياق الطويل صعب: ذاكرة KV و MLA و Kimi Delta Attention بشرح مبسط
تخزين محادثة طويلة قد يكلف ذاكرة أكثر من التفكير نفسه. الدفتر المتضخم، والملخص المضغوط، والسبورة التي لا تكبر - من الصفر.
تعلن شركات الذكاء الاصطناعي اليوم عن نماذج «تتذكر» مليون كلمة من المحادثة.
المفاجأة هي الثمن. في المحادثة الطويلة، قد يستهلك تخزين المحادثة ذاكرة أكبر مما يستهلكه التفكير نفسه.
انتهى الجزء الأول من هذه السلسلة بسؤال: إذا كان نموذج خليط الخبراء بهذه الكفاءة لكل كلمة، فأين تختبئ تكلفة محادثة المليون كلمة؟ هذه هي الإجابة. ليست في الخبراء. بل في الملاحظات التي يحتفظ بها النموذج عن محادثتك.
هذا هو الجزء الثاني. شرح الجزء الأول خليط الخبراء، الحيلة التي تجعل النماذج الضخمة رخيصة لكل كلمة. ولا تحتاج إلى قراءته لمتابعة هذا الجزء.
ما هي الوحدة النصية (Token)؟ وما هي نافذة السياق؟
النماذج لا تقرأ جملا كاملة. بل تقرأ قطعا صغيرة، كلمة أو جزءا من كلمة في كل مرة. كل قطعة اسمها وحدة نصية (Token).
وكمية المحادثة التي يستطيع النموذج الرجوع إليها اسمها نافذة السياق (Context Window). «نافذة سياق بمليون وحدة نصية» تعني: يستطيع النظر في نحو مليون قطعة من محادثتك دفعة واحدة.
والسؤال: كيف يرجع للخلف دون أن يعيد قراءة كل شيء من الصفر مع كل كلمة جديدة؟
ذاكرة KV: دفتر النموذج المتضخم
عندما يكتب النموذج الكلمة رقم 1000، يجب أن ينظر في كل الكلمات السابقة. إعادة قراءة كل شيء مع كل كلمة جديدة ستكون بطيئة جدا. لذلك يحتفظ النموذج بملاحظات عن كل كلمة رآها.
هذه الملاحظات لها اسم: ذاكرة KV (KV Cache).
الملاحظات مفيدة، لكنها تكبر مع كل كلمة. إلى أي حد؟ خذ تصميم الملاحظات الأصلي (يسميه الباحثون الانتباه Attention، ونسخته القياسية هي MHA). لو استخدم نموذج بأبعاد DeepSeek-V3 هذا التصميم القياسي - وهو ما لا يفعله V3 نفسه كما سنرى - لاحتاجت ملاحظات محادثة واحدة من نحو 32,000 وحدة نصية (نحو 25,000 كلمة) إلى قرابة 131 جيجابايت من الذاكرة [2][3]. أي أكثر من إجمالي ذاكرة معظم أجهزة الحاسوب المحمولة، لتذكر محادثة واحدة.
هذه هي التكلفة الخفية للسياق الطويل. جعل تفكير النموذج رخيصا (الجزء الأول) لا يحلها، لأن الدفتر يخص المحادثة، لا النموذج.
الحل الشائع: مشاركة الملاحظات (GQA)
داخل النموذج، هناك «قراء» صغار كثيرون يفحصون الملاحظات في الوقت نفسه. الحل الأوسع استخداما، والقياسي في Llama ومعظم النماذج الغربية منذ 2023: اجعل مجموعات من القراء تتشارك مجموعة ملاحظات واحدة بدلا من أن يحتفظ كل قارئ بملاحظاته. تسميه Llama ونظيراتها GQA، الانتباه بالاستعلام المجمع [1]. يقلص الدفتر عدة مرات. مفيد، لكن الدفتر ما زال يكبر مع كل كلمة.
حل DeepSeek: ضغط الملاحظات (MLA)
ذهب DeepSeek أبعد في 2024. لا تخزن الملاحظات الكاملة أصلا. خزن ملخصا مضغوطا صغيرا، وأعد بناء الأجزاء المفيدة عند الحاجة. مثل الاحتفاظ بصفحة واحدة من ملاحظات مكتوبة واضحة من اجتماع بدلا من التسجيل الكامل.
قلصوا حجم الدفتر بنسبة 93% مقارنة بنموذجهم السابق، وبقيت الإجابات بنفس الجودة [2]. سماه DeepSeek باسم MLA، الانتباه الكامن متعدد الرؤوس. وشحن في DeepSeek-V2 و V3، النموذجين اللذين فاجآ الصناعة كلها في 2024 و 2025 [2][3].
حل Kimi: استبدل الدفتر بسبورة (KDA)
نشر مختبر Moonshot، صانع Kimi، خطوة أجرأ: تخلص من الدفتر المتضخم كليا. احتفظ بسبورة صغيرة ثابتة الحجم، وأعد الكتابة عليها باستمرار. تأتي كلمة جديدة: اكتب، أو اكتب فوق القديم، أو امسح. الدفتر لا يكبر أبدا، مهما طالت المحادثة.
الجزء الذكي: مناطق السبورة المختلفة تنسى بسرعات مختلفة. ركن يحمل حقيقة مهمة من الصفحة الأولى يستطيع الاحتفاظ بها حتى النهاية. ومنطقة تتابع تفاصيل محلية صغيرة تمسح نفسها وتعيد الاستخدام.
تسميه Moonshot باسم KDA، Kimi Delta Attention [4]. وفكرة السبورة نفسها فكرة عملت عليها مختبرات كثيرة لسنوات (الانتباه الخطي، Mamba، عائلة DeltaNet). مساهمة Moonshot المنشورة هي النسيان الدقيق، إضافة إلى وصفة عملية: ثلاث طبقات سبورة لكل طبقة دفتر كامل. هذا يحفظ بعض الذاكرة المثالية ويقلص تكلفة الدفتر بنسبة تصل إلى 75% [4]. وتقول Moonshot إن هذا التصميم هو ما يشغل نافذة المليون وحدة نصية في Kimi K3 [6].
قطعتان أخيرتان في لغز Kimi K3
فكرتان أصغر تكملان التصميم، وكلتاهما موصوفتان في مواد Moonshot نفسها [6].
أولا، النموذج العملاق موزع على عشرات الشرائح. وكل كلمة يجب أن تسافر بين الشرائح لتصل إلى أجزاء النموذج التي تعالجها («الخبراء» من الجزء الأول). يضغط Kimi K3 كل كلمة إلى شكل أصغر قبل أن تسافر، ويفكها عند الوصول. حقيبة أصغر، رحلات أرخص. تسميه Moonshot باسم Stable LatentMoE.
ثانيا، النماذج العميقة تشوه المعلومات ببطء وهي تمر عبر طبقاتها الكثيرة - مثل رسمة قطة تنسخ مرة بعد مرة في صف طويل، حتى تختفي القطة. الحل الكلاسيكي، المستخدم في كل مكان منذ 2015، يمرر الرسمة الأصلية بجانب النسخ؛ وهذه هي الوصلات المتبقية (Residual Connections) [5]. يستخدم Kimi K3 نسخة مطورة. كل طبقة تستطيع أيضا النظر للخلف إلى عدة طبقات سابقة وسحب ما تحتاجه، لا مجرد النسخ من الطبقة التي قبلها مباشرة. تسميه Moonshot باسم Attention Residuals [6].
ماذا يعني هذا عمليا
ثلاثة أشياء تذكرها
- السياق الطويل مشكلة ذاكرة، لا مشكلة تفكير. الدفتر يكبر مع المحادثة.
- ضغط الملاحظات (MLA) يحفظ رجوعا مثاليا للخلف بجزء بسيط من الذاكرة.
- السبورة الثابتة (KDA) لا تكبر أبدا، لكنها يجب أن تختار ما تنساه. ومزج الاثنين هو أفضل نهج معروف اليوم.
عندما تعلن شركة عن نافذة سياق بمليون وحدة نصية، السؤال الحقيقي: أي تصميم دفتر يجعلها ميسورة التكلفة؟
تفصيلة أخيرة تستحق الانتباه: لم تظهر أي قطعة من قطع K3 من العدم. نشر Kimi Delta Attention قبل K3 بتسعة أشهر [4]. وجاءت Attention Residuals قبله بأشهر. اختبر المختبر قطعه علنا، ثم جمعها. هكذا يبدو البحث المفتوح - ولهذا يستطيع مقال من جزأين مثل هذا شرح نموذج من الطراز الأول أصلا.
بهذا نغلق تكلفتي الذكاء الاصطناعي الحديث: الجزء الأول غطى التفكير، والجزء الثاني غطى التذكر. إذا كان جزء ثالث سيفيد - كيف تدرب هذه النماذج بتكلفة منخفضة - أخبرني على LinkedIn.
العنوان يقول مليون وحدة نصية. القصة في من يحمل الدفتر.
أسئلة وأجوبة سريعة
ما هي ذاكرة KV Cache بكلمات بسيطة؟
الملاحظات التي يحتفظ بها نموذج الذكاء الاصطناعي عن كل كلمة رآها في محادثتك، حتى لا يعيد قراءة كل شيء مع كل كلمة جديدة. تكبر هذه الملاحظات مع المحادثة وتصبح أكبر تكلفة ذاكرة في المحادثات الطويلة.
لماذا يصبح الذكاء الاصطناعي أبطأ وأغلى في المحادثات الطويلة؟
لأن ملاحظات النموذج (ذاكرة KV) تكبر مع كل كلمة. في محادثة واحدة من 32,000 وحدة نصية، يحتاج نموذج بأبعاد DeepSeek-V3 مع الانتباه القياسي إلى نحو 131 جيجابايت للملاحظات وحدها.
ما هو Multi-head Latent Attention؟
حل DeepSeek للملاحظات المتضخمة: خزن ملخصا مضغوطا صغيرا بدلا من الملاحظات الكاملة وأعد بناء الأجزاء المفيدة عند الحاجة. قلص حجم الدفتر بنسبة 93% مقارنة بنموذجهم السابق وبقيت الإجابات بنفس الجودة.
ما هو Kimi Delta Attention؟
حل Moonshot: استبدال الدفتر المتضخم بسبورة ثابتة الحجم يعاد الكتابة عليها باستمرار، وتنسى مناطقها المختلفة بسرعات مختلفة. عند مزجها بنسبة ثلاثة إلى واحد مع طبقات الدفتر الكامل، تنخفض تكلفة الدفتر بنسبة تصل إلى 75%.
هل نافذة السياق بمليون وحدة نصية حقيقية؟
الرقم حقيقي كسعة، لكن السؤال الهندسي هو تكلفة تشغيله. تصميمات مثل MLA و KDA وجدت بالضبط لجعل نوافذ المليون ميسورة التكلفة؛ ونسخة Kimi K3 موصوفة من الشركة حتى يتم فحص ملفاتها بشكل مستقل.
المصادر والمراجع
مرقمة حسب موضع دعمها لهذا المقال. المصادر بالإنجليزية.
- Ainslie et al.: GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints, 2023.
- DeepSeek-V2 Technical Report, 2024.
- DeepSeek-V3 Technical Report, 2024.
- Kimi Linear Technical Report (Kimi Delta Attention), Moonshot AI, 2025.
- He, Zhang, Ren, Sun: Deep Residual Learning for Image Recognition, 2015.
- Kimi K3 tech blog, Moonshot AI, 2026.
ملاحظة رقم 131 جيجابايت: محسوب من أبعاد الانتباه المنشورة لنموذج DeepSeek-V3 (2 × 128 بعدا × 2 بايت × 128 رأسا × 61 طبقة × 32,768 وحدة نصية) كتكلفة الانتباه القياسي؛ بينما يتجنبها DeepSeek-V3 نفسه باستخدام MLA. عن هذا المقال: كتبه محمد قادري، وتم التحقق من كل رقم مقابل الورقة العلمية أو الإصدار الرسمي المذكور، وأرقام Kimi K3 معلمة كادعاءات من الشركة حتى الفحص المستقل. آخر تحديث: 27 يوليو 2026.
الجزء الأول من السلسلة: شرح مبسط لتقنية خليط الخبراء (MoE).