Sebastian Raschka يقيس تاريخ تصنيف النصوص: bag-of-words تحقق 89.9% وأحدث نموذج 96.47%
الفارق بين الطريقة الأبسط والنموذج الأكبر قد يكون بضع نقاط وقد يكون صفرًا، ولا يظهر إلا بالقياس على بيانات المنتج نفسه، قبل الالتزام بتكلفة API على كل طلب.
استعرض الباحث Sebastian Raschka تاريخ تصنيف النصوص كاملًا، وقاس كل طريقة على مجموعة البيانات نفسها، وهي مراجعات الأفلام من IMDb. واستخدام البيانات نفسها هو ما يجعل المقارنة عادلة.
وجاءت النتائج على النحو التالي:
- bag-of-words مع logistic regression: 89.9%
- شبكة LSTM مكتوبة من الصفر: 85.66%
- شبكة CNN: 90.07%
- ULMFiT: 95.4%
- BERT وModernBERT: نحو 95%
- GPT-2 بحجم 124 مليون parameter: نحو 92%
- أحدث نموذج: 96.47%
واللافت في الجدول هو المقارنة بين الرقمين الأول والثاني. فشبكة LSTM، التي كانت من أكثر التقنيات تقدمًا في وقتها، جاءت أقل من bag-of-words بنحو 4 نقاط.
وفكرة bag-of-words بسيطة إلى حد لافت. فهي تعدّ الكلمات في النص دون أي اعتبار للترتيب أو السياق، وتعطي كل كلمة رقمًا، ثم يتعلم نموذج logistic regression أي الكلمات ترجّح أي تصنيف. وبهذه الطريقة لا تفرّق الخوارزمية بين جملتين تحملان الكلمات نفسها بترتيب مختلف. ومع ذلك حققت 89.9%.
ويخلص الكاتب إلى أن bag-of-words مع logistic regression ما زالت أول ما يجربه في أي مسألة لتصنيف النصوص، لأنها الأسهل في التنفيذ.
وبالنسبة إلى فرق المنتجات والمطورين في بداية طريقهم، يطرح ذلك سؤالًا عمليًا قبل ربط المنتج بـ API مدفوع لكل طلب: كم نقطة يضيف النموذج الكبير فعلًا على البيانات الخاصة بالمنتج؟ فقد يكون الفارق 6 نقاط، وقد يكون صفرًا، ولا يظهر ذلك إلا بالقياس.