ذكاء اصطناعيقراءة دقيقتين

Sebastian Raschka يقيس تاريخ تصنيف النصوص: bag-of-words تحقق 89.9% وأحدث نموذج 96.47%

المغزى

الفارق بين الطريقة الأبسط والنموذج الأكبر قد يكون بضع نقاط وقد يكون صفرًا، ولا يظهر إلا بالقياس على بيانات المنتج نفسه، قبل الالتزام بتكلفة API على كل طلب.

استعرض الباحث Sebastian Raschka تاريخ تصنيف النصوص كاملًا، وقاس كل طريقة على مجموعة البيانات نفسها، وهي مراجعات الأفلام من IMDb. واستخدام البيانات نفسها هو ما يجعل المقارنة عادلة.

وجاءت النتائج على النحو التالي:

  • bag-of-words مع logistic regression: 89.9%
  • شبكة LSTM مكتوبة من الصفر: 85.66%
  • شبكة CNN: 90.07%
  • ULMFiT: 95.4%
  • BERT وModernBERT: نحو 95%
  • GPT-2 بحجم 124 مليون parameter: نحو 92%
  • أحدث نموذج: 96.47%

واللافت في الجدول هو المقارنة بين الرقمين الأول والثاني. فشبكة LSTM، التي كانت من أكثر التقنيات تقدمًا في وقتها، جاءت أقل من bag-of-words بنحو 4 نقاط.

وفكرة bag-of-words بسيطة إلى حد لافت. فهي تعدّ الكلمات في النص دون أي اعتبار للترتيب أو السياق، وتعطي كل كلمة رقمًا، ثم يتعلم نموذج logistic regression أي الكلمات ترجّح أي تصنيف. وبهذه الطريقة لا تفرّق الخوارزمية بين جملتين تحملان الكلمات نفسها بترتيب مختلف. ومع ذلك حققت 89.9%.

ويخلص الكاتب إلى أن bag-of-words مع logistic regression ما زالت أول ما يجربه في أي مسألة لتصنيف النصوص، لأنها الأسهل في التنفيذ.

وبالنسبة إلى فرق المنتجات والمطورين في بداية طريقهم، يطرح ذلك سؤالًا عمليًا قبل ربط المنتج بـ API مدفوع لكل طلب: كم نقطة يضيف النموذج الكبير فعلًا على البيانات الخاصة بالمنتج؟ فقد يكون الفارق 6 نقاط، وقد يكون صفرًا، ولا يظهر ذلك إلا بالقياس.

المصادر

  1. مقال Sebastian Raschka بكل الأرقام وروابط الـ notebooks

من عدد الأربعاء 19 ربيع الآخر - 30 سبتمبر

أخبار ذات صلة

فرق ومنتجات

مقال على Hacker News: المشاريع المكررة تنتشر على منصات التواصل المهني لأن النقد يظهر في ملف صاحبه

حين يدفع الناقد ثمن نقده من سمعته المهنية وتبقى المجاملة مجانية، يصبح غياب التعليقات السلبية على أي عمل منشور دليلًا على تصميم المنصة لا على جودة العمل.

19 ربيع الآخر - 30 سبتمبر
ذكاء اصطناعي

اختبار على 16 نموذجًا: جملة واحدة في الـ prompt خفضت الحقول المختلقة في استخراج البيانات من 70.7% إلى 20.2%

من يستخرج بيانات بنموذج لغوي دون تعليمة صريحة للحقول الغائبة قد يحصل على حقل مختلق من كل ثلاثة حقول ناقصة، بشكل سليم لا يلفت النظر. وخدمة مدفوعة واحدة كانت أسوأ من معظم النماذج.

17 ربيع الآخر - 28 سبتمبر

أخبار الأربعاء 19 ربيع الآخر - 30 سبتمبر