Trail of Bits تعيد حساب اختبار 1Password لإصلاح الثغرات بالذكاء الاصطناعي: من 26% إلى 86%
تصميم التجربة يحدد الرقم قبل أن تبدأ، وقراءة المنهجية قبل النتيجة هي الفرق بين رأي مبني على قياس ورأي مبني على ظروف لا يعمل بها أحد.
نشرت 1Password في 6 أغسطس 2026 اختبارًا باسم FLAWED، خلاصته المعلنة أن النماذج تنتج إصلاحًا سليمًا للثغرات في 26% من الحالات فقط. انتشر الرقم على نطاق واسع، وبُنيت عليه آراء عن حدود الذكاء الاصطناعي في العمل الأمني.
وفي 15 سبتمبر 2026 نشرت شركة Trail of Bits مراجعة للاختبار نفسه بعنوان يصفه بأنه مضلل. ولم تقل إن الرقم مزوّر، بل إنه قيس في ظروف لا يعمل بها أحد.
حددت المراجعة أربع مشكلات:
- العينة تضم 6 ثغرات اختيرت لأن إصلاحها معقد، وتتراوح نسب النجاح داخلها بين 3% و60%.
- اثنتان من التعليمات تطلبان من الـ agent تطبيق الإصلاح الخاطئ، وتمثلان 22% من البيانات.
- في أكثر من ثلث التجارب، أي 36%، كان الـ agent ممنوعًا من بناء الكود أو تشغيله لاختباره.
- شُغّلت النماذج بإعدادات مختلفة، فكان GPT-5.5 على المستوى medium وOpus 4.8 على المستوى high.
وحين أعادت Trail of Bits الحساب على التجارب التي سُمح فيها للـ agent بالاختبار ولم يُطلب منه الإصلاح الخاطئ، وجدت أن 2,634 إصلاحًا من أصل 3,067، أي 86%، منعت استغلال الثغرة. البيانات نفسها، بشروط مختلفة.
وللمقارنة، تذكر المراجعة خط أساس بشريًا: في الظروف المثالية يفشل الإصلاح الأول لدى البشر مرة من كل 8 مرات.
ما تكشفه القضية ليس كذبًا، بل أثر تصميم التجربة. فمنع الاختبار أو توجيه النموذج نحو إصلاح خاطئ يحدد جزءًا كبيرًا من النتيجة قبل أن يبدأ القياس. وبالنسبة للفرق التي تقرر مدى اعتمادها على هذه الأدوات، يصبح السؤال عن الشروط التي قيس بها أي رقم جزءًا من فهم الرقم نفسه.