نموذج Edge0-35B يعمل بأقل من 3 جيجابايت من الذاكرة بتحميل الـ experts من الـ SSD عند الحاجة
تكلفة الجهاز القادر على تشغيل نموذج جيد محليًا قد تتحول من بطاقة رسوميات بنحو ألفي دولار إلى حاسوب محمول بقرص SSD سريع، مع بقاء النموذج في مرحلة preview.
تقول بطاقة نموذج Edge0-35B-A3B Preview على Hugging Face إنه يعمل بأقل من 3 GiB من الذاكرة النشطة، رغم أن حجمه 35 مليار parameter. نُشر المستودع في 8 سبتمبر 2026، وكان وقت القراءة ثاني أكثر النماذج رواجًا على المنصة، بـ 2,433 إعجابًا و17,853 تنزيلًا.
النموذج من نوع MoE، أي Mixture of Experts. وهو مقسوم إلى 256 جزءًا متخصصًا تسمى experts، موزعة على 40 طبقة، ولا يعمل منها لكل توكن إلا 4. والطبيعي في هذا النوع أن تُحمّل كل الـ experts في الذاكرة، لأن أيًا منها قد يُطلب في أي لحظة.
العكس تمامًا
يترك Edge0 الملف كله على قرص الـ SSD، ويجلب الـ expert حين يطلبه الـ router، وهو الجزء الذي يقرر أي experts تعمل لكل توكن. وبذلك تحمل الذاكرة ما يعمل الآن فقط، لا عدد الـ parameters كله.
المشكلة الواضحة أن القراءة من القرص أبطأ، فقد يتوقف النموذج منتظرًا. وحلها المطورون بما سموه prerouter: جزء مدرّب يتوقع الـ expert التالي قبل خطوة، فتجري القراءة بينما يحسب النموذج ما قبلها. وبحسب البطاقة، رفع ذلك سرعة التوليد بنسبة تصل إلى 59%.
النتيجة 15 توكن في الثانية عند التوليد، و140 عند معالجة المدخلات. والنموذج مضغوط إلى 4-bit، وتقول البطاقة إن تقنية Recover-LoRA تُبقي نسخة int4 على بعد 3.9 نقاط فقط من نسخة fp16. والنموذج الأساسي هو Qwen3.6-35B-A3B، والرخصة Apache 2.0، ومعه نسخة أصغر اسمها Edge0-8b-a1b.
ما يتغير هنا هو سؤال تكلفة الجهاز القادر على تشغيل نموذج جيد محليًا. فقد لا يعود الجواب بطاقة رسوميات بنحو ألفي دولار، بل حاسوبًا محمولًا بقرص SSD سريع. غير أن كلمة preview في اسم النموذج تعني أنه لم يُعدّ بعد للاستخدام في بيئات الإنتاج.