Privatemode تنشر طريقة تحوّل GLM-5.3-Flash إلى classifier عبر احتمالات أول token
تصنيف النصوص والمستندات المصوّرة لم يعد يتطلب تدريب نموذج خاص، بل endpoint لنموذج عام وقراءة احتمالاته، مقابل تكلفة أعلى من النموذج المتخصص.
نشرت شركة Privatemode في 24 سبتمبر 2026 طريقة لتحويل نموذج محادثة عام إلى classifier يتخذ قرارًا واحدًا، مع كود مفتوح بترخيص MIT مكتوب بلغة Python. وطبّقتها على GLM-5.3-Flash، النموذج المفتوح من شركة Zhipu الصينية، الذي صدر في 25 أغسطس 2026 وتجاوزت تحميلاته 4.3 مليون.
تقوم الطريقة على ثلاث خطوات. تُرقَّم الخيارات المتاحة داخل prompt بصيغة تشبه JSON، ويكون آخر سطر فيه choice_index:، فيصبح أول token يولّده النموذج هو رقم الخيار. ثم لا يُقرأ الـ token الناتج نفسه، بل الاحتمالات التي وضعها النموذج على كل رقم في هذا الموضع، وتُعاد معايرتها (normalize) لتصبح نسبًا مجموعها واحد. والنتيجة قرار مصنّف مع نسبة لكل خيار، من forward pass واحد دون انتظار إجابة نصية.
وبحسب اختبارات الشركة على 28 مجموعة بيانات نصية، جاء GLM-5.3-Flash مساويًا لنموذجها المتخصص Jev، بفارق وسيط 0.7 نقطة مئوية ليس ذا دلالة إحصائية. وبلغ زمن الاستجابة 180 ميلي ثانية من ألمانيا و299 من الولايات المتحدة. أما التكلفة فبلغت 62 يورو لكل مليون قرار، مقابل 16 يورو لـ Jev، أي نحو أربعة أضعاف.
لكن النموذج العام يقدّم ما لا يقدّمه المتخصص، وهو الصور. فقد حقق 70.2% في تصنيف المستندات الممسوحة على مجموعة RVL-CDIP، بينما لا يتعامل Jev ولا Laya مع الصور أصلًا.
ويعني ذلك للمطورين في المنطقة أن تجربة تصنيف مستندات عربية مصوّرة صارت ممكنة عبر endpoint وقراءة الـ logprobs، دون تدريب نموذج خاص. ويبقى الفارق في التكلفة هو الثمن الواضح لهذه المرونة.