ذكاء اصطناعيقراءة دقيقتين

DeepSeek تنشر V4.1-Flash برخصة MIT مع ذاكرة KV cache أصغر بنحو 4 مرات

المغزى

حجم الذاكرة المطلوبة للتشغيل هو ما يفصل غالبًا بين نموذج كبير ونموذج يمكن تشغيله فعليًا، ورخصة MIT تعني تشغيله في أي مكان دون API أو إذن من أحد.

نشرت DeepSeek نموذج V4.1-Flash على Hugging Face برخصة MIT، وظهر ضمن قائمة النماذج الأكثر رواجًا على المنصة. وبحسب بطاقة النموذج، يضم 552 مليار parameter في بنيته الأساسية، ودُرّب على 45 تريليون token من بيانات متعددة الوسائط، وتبلغ نافذة سياقه مليون token.

لكنه لا يشغّل كل هذه الـ parameters في كل خطوة: يستخدم 8 مليارات فقط أثناء قراءة المدخلات، و16 مليارًا أثناء توليد النص. وسجّل 90.6 على اختبار Terminal-Bench 2.1، و74.2 على DeepSWE v1.1.

الرقم الذي يحدد العتاد

الـ KV cache هو الذاكرة التي يحتفظ بها النموذج أثناء التوليد، وتكبر مع كل token يدخل السياق. وهي في الغالب ما يحدد حجم ذاكرة الـ VRAM المطلوبة للتشغيل، أكثر من حجم النموذج نفسه.

في V4.1-Flash أصبح حجم هذه الذاكرة 890 بايت لكل token. واعتمدت DeepSeek في ذلك على تخزين الذاكرة بدقة FP4، وعلى جعل عدة طبقات في النموذج تتشارك الـ cache نفسه. والنتيجة تخفيض بنحو 4 مرات مقارنة بـ DeepSeek V4-Flash.

حين تنخفض الذاكرة المطلوبة إلى الربع، ينخفض معها العتاد اللازم للتشغيل. وتضيق المسافة بين نموذج لا تستطيع تشغيله إلا الشركات الكبرى ونموذج يمكن لفريق صغير تشغيله على خادمه.

أما رخصة MIT فتعني أن الأوزان متاحة للاستخدام والتعديل دون قيود تُذكر. وبالنسبة للفرق في مصر والخليج، يعني ذلك إمكانية تشغيل النموذج على خادم محلي، دون API ودون بطاقة دفع أجنبية، ودون جهة خارجية تملك قرار قطع الخدمة.

المصادر

  1. بطاقة النموذج على Hugging Face
  2. قائمة النماذج الأكثر رواجًا على Hugging Face

من عدد الأربعاء 12 ربيع الآخر - 23 سبتمبر

أخبار ذات صلة

أخبار الأربعاء 12 ربيع الآخر - 23 سبتمبر