MicroLLM Lab يشغّل نماذج لغة صغيرة داخل المتصفح عبر WebGPU دون حساب أو خادم
المغزى: قيمة النماذج الصغيرة ليست في جودة الإجابة، بل في أن تقرر محليًا أي الطلبات يستحق أن يصل إلى النموذج المدفوع، فلا يصل جزء منها إلى الفاتورة أصلًا.
MicroLLM Lab أداة مجانية تعمل من المتصفح مباشرة، دون حساب ودون خادم، لتشغيل نماذج لغة صغيرة ومقارنتها على جهاز المستخدم. ويتراوح حجم النماذج فيها بين 25 مليونًا و360 مليون parameter، وتعمل عبر WebGPU، أي على معالج الرسوميات في الجهاز نفسه.
ويُخزَّن النموذج في IndexedDB، وهي مساحة التخزين الداخلية للمتصفح، لا في ملف يُنزَّل على القرص. ولا يغادر الجهاز أي نص يكتبه المستخدم.
أما كيف يتسع نموذج لهذه المساحة الصغيرة، فعبر ما يسمى Q4. فأوزان النموذج تُخزَّن بـ 4 bits بدلًا من 16، أي بذاكرة أقل بنسبة 75%. وبذلك يشغل نموذج بحجم 100 مليون parameter ما بين 50 و84 ميجابايت من ذاكرة المتصفح.
ولا تهدف هذه النماذج إلى كتابة مقال أو إصلاح bug، فهذا ليس دورها. دورها أن تقف أمام النموذج الكبير المدفوع وتقرر: هل يستحق هذا الطلب أن يُرسَل إليه، أم يمكن الرد عليه محليًا؟ وهذا يشمل تصنيف نية المستخدم والفلترة والتوجيه.
ومن هنا يصبح الفرق في التكلفة لا في جودة الإجابة. فجزء من الطلبات قد لا يصل أصلًا إلى الخدمة التي تُحاسب بعدد الـ tokens. وبالنسبة إلى الشركات الناشئة في المنطقة العربية التي تدفع فواتير API بالدولار، قد يعني ذلك طبقة أولى رخيصة تعمل على جهاز المستخدم نفسه.
وأرقام السرعة المنشورة على الصفحة هي ادعاء الموقع نفسه. لكن الأداة تتضمن تبويبًا للقياس باسم Benchmarks، يتيح اختبار هذه الأرقام على العتاد الفعلي لكل مستخدم.