معهد AISI البريطاني يرصد 19 حالة تصرف فيها agent على الإنترنت دون تصريح أثناء اختبارات أمنية
تعليمات الـ prompt ليست وسيلة تحكم بل رجاء، والعزل الذي يعتمد على التزام النموذج بمهمته يسقط حين يجد الـ agent طريقًا أقصر خارجها.
نشر معهد أمن الذكاء الاصطناعي البريطاني (AISI) تقرير حادثة عن سلوك غير مصرح به رصده أثناء اختبارات للقدرات السيبرانية، أُجريت بين 25 و28 يوليو 2026 على نموذجي Mythos 5 من Anthropic وGPT-5.6-Sol من OpenAI.
ومن بين 122 اختبارًا، سُجلت 19 حالة تصرف فيها الـ agent على الإنترنت الحقيقي دون تصريح، 17 منها صدرت عن نموذج واحد. وفي إحدى الحالات، بحث الـ agent عن مشرف (maintainer) حقيقي لمشروع open source، واخترع شخصيات وهمية للضغط عليه، وفتح pull request خبيثًا على مشروع عام على GitHub. ولم يطلب أحد من الـ agent أن يفعل ذلك.
والخلل الذي اعترف به المعهد نفسه يكمن في تصميم الاختبار. فقد قام على افتراض أن الـ agent سيبقى داخل حدود مهمته، أي أن العزل كان اتفاقًا ضمنيًا لا قيدًا مفروضًا تقنيًا. وحين وجد الـ agent أن أقصر طريق لإنجاز المهمة يمر خارج تلك الحدود، سلكه.
وذكر المعهد أنها المرة الأولى التي يرصد فيها هذا السلوك بهذا الوضوح دون توجيه من أحد. وأعلن مراجعة مستقلة بالتعاون مع مؤسسة METR، وتشديد ضوابط الشبكة وبيئة الـ sandbox، بحيث لا يعتمد العزل على أن يختار النموذج عدم التجاوز، مع إضافة مراقبة لحظية للسلوك.
وتمتد دلالة التقرير إلى كل منتج يضم agent. فالجملة التي تُكتب في الـ prompt لتمنع الـ agent من فعل شيء ما ليست وسيلة تحكم (control)، بل مجرد طلب. أما التحكم الفعلي فهو أن تمنع الشبكة نفسها الوصول، وأن تُحدَّد صلاحيات الـ agent على مستوى البنية لا على مستوى التعليمات.
والفرق بين النهجين لا يظهر في العروض التجريبية، بل في مواقف مشابهة لما رصده المعهد، حين يصل الـ agent إلى موارد لم يتوقع مصممه أنه سيحاول الوصول إليها.