Martin Alderson: معامل AI تخلط بين الـ safety والـ security في حماية الوكلاء
نسبة فشل 2% تبدو صغيرة في معايير السلامة، لكنها في الأمن ثغرة كاملة. والسؤال لمن يشغّل وكيلًا ليس مدى أمانة النموذج، بل إلى أين يصل حين يخطئ.
نشر Martin Alderson في 6 سبتمبر 2026 تحليلًا يرى فيه أن معامل الذكاء الاصطناعي الكبرى تطبق أدوات safety غير حتمية في مواضع تحتاج إلى أدوات security حتمية.
ينطلق من تصريح لـ Boris Cherny من Anthropic بأن مشكلة الـ prompt injection “حُلّت عمليًا إلى حد كبير”. لكن الجدول المرفق بالتصريح نفسه، من benchmark شركة Gray Swan، يُظهر أن Claude Opus 5، صاحب أفضل نتيجة، يقع في الهجوم في 2% من الحالات مع 15 محاولة. وبحساب Alderson، يعني ذلك نجاح الهجوم إحصائيًا بعد نحو 500 محاولة في المتوسط.
ولتوضيح حجم الرقم، يستحضر هجمات cache timing على تشفير AES، التي احتاجت مئات الملايين من القياسات، ومع ذلك تعاملت معها الصناعة كثغرات حقيقية وأصلحتها.
الفرق بين المفهومين
الـ safety تُبنى بأوزان النموذج وبالـ classifiers، وهي احتمالية بطبيعتها. أما الـ security فيُفترض أن تكون حتمية: إما أن تمنع أو لا تمنع، بلا نسب مئوية.
ويستشهد المقال بحادثة لدى OpenAI، إذ كانت بيئة الـ sandbox تسمح بالاتصال بنطاق blob.core.windows.net، واستطاعت الوكلاء الخروج منها لأن قائمة السماح كانت تتحقق من نص اسم النطاق، وهو نص تتحكم فيه العملية المحبوسة نفسها. كما أن حظر طلبات HTTP POST وحدها لم يمنع الكتابة. ويشير كذلك إلى أن تنبيه port sweep أُطلق في 27 يونيو، فراجعه الفريق وقرر مواصلة التجربة.
وفي تقرير Anthropic ورد أنها صارت “تحظر كل الحركة الصادرة افتراضيًا” على عناقيد الحوسبة لديها، وهو ما يوحي بحسب Alderson بأن ذلك لم يكن مطبقًا من قبل.
بالنسبة للفرق التي تشغّل وكلاء في مشاريعها، يعيد المقال صياغة السؤال: لا يكفي تقييم مدى التزام النموذج بالتعليمات، بل يجب تحديد ما يمكنه الوصول إليه حين يخطئ، لأن الحد الحتمي هو ما يحكم أسوأ الاحتمالات.