ذكاء اصطناعيقراءة دقيقتين

مقال ينتقد موجة النماذج التي تعيد نسبة ثقة: الرقم لا يعني شيئًا دون calibration وتكلفة للخطأ

المغزى

نسبة الثقة قد تؤدي وظيفة نفسية أكثر منها هندسية، إذ تمنح شعورًا بالتحكم في المخاطرة دون قياسها، ويظهر ذلك بعد الإطلاق حين يُسأل عن مصدر الحد الفاصل.

نُشر يوم 27 سبتمبر 2026 على مدونة “i hate the future” مقال بعنوان “the normalization of inexplicable failures”، ينتقد موجة النماذج التي تعيد قيمة محددة مع نسبة ثقة مرافقة لها. وأقوى ما فيه سؤال بسيط: ماذا يفعل المستخدم بهذه النسبة فعلًا؟

فبحسب المقال، يحتاج الاستخدام المسؤول لنسبة الثقة إلى أمرين، ولا يأتي أي منهما مع النموذج.

الأول هو الـ calibration، أي التحقق من أن قول النموذج إن ثقته 80% يعني فعلًا أنه يصيب في 80 حالة من كل 100. والرقم الظاهر على الشاشة لا يعني ذلك تلقائيًا، فهو مخرج من مخرجات النموذج مثل الإجابة تمامًا، ويحتاج إلى قياس مستقل.

والثاني نموذج لتكلفة الخطأ. فالخطأ في تصنيف تذكرة دعم فني يختلف عن الخطأ في تصنيف عملية دفع. ومن دون رقم لهذه التكلفة لا يمكن اختيار حد فاصل، أو threshold، على أي أساس مدروس.

ويلاحظ الكاتب أن من يشترون هذه الحلول غالبًا لا يجرون evals ولا يملكون ground truth، أي بيانات مرجعية معروفة الإجابة، بل يرسلون أسئلة غامضة ويستلمون ردودًا غامضة. ويضيف أن من يملك evals وpipeline لبيانات مرجعية يكون قد قطع أغلب الطريق نحو ضبط حل خاص به.

ويشير كذلك إلى أن المواد التسويقية للمزودين تتحدث عن نتائج المعايير القياسية، لا عن مدى دقة معايرة نسب الثقة.

والنتيجة أن نسبة الثقة قد تؤدي وظيفة نفسية أكثر منها هندسية، إذ تمنح شعورًا بالسيطرة على المخاطرة دون أن تكون المخاطرة قد قيست. ولا يظهر ذلك في العرض التجريبي، بل بعد الإطلاق، حين يسأل أحدهم عن مصدر رقم 80% ولا يجد في الفريق من يجيب.

المصادر

  1. المقال الأصلي: the normalization of inexplicable failures

من عدد الاثنين 17 ربيع الآخر - 28 سبتمبر

أخبار ذات صلة

أخبار الاثنين 17 ربيع الآخر - 28 سبتمبر