ذكاء اصطناعيقراءة دقيقتين

Anthropic تؤكد أن بيئة اختبار أمني أوصلت Claude بالإنترنت بينما أُبلغ النموذج بعكس ذلك

المغزى

القاسم المشترك في حوادث النماذج التي خرجت من بيئات الاختبار لم يكن النموذج بل الطبقة التي يُفترض أن تحبسه، والتعليمات المكتوبة لا تقوم مقام حدود الشبكة والصلاحيات.

نشرت Anthropic في 30 يوليو 2026 منشورًا رسميًا بعنوان Investigating incidents in cybersecurity evaluations، أقرت فيه بأن خطأً في الإعداد ترك الأجهزة التي كان Claude يعمل عليها أثناء أحد التقييمات متصلة بإنترنت حي. وقالت الشركة إنها لم تكن على علم بهذا الخطأ، ولا الشريك الذي كان يدير التقييم.

وفي منشور ثانٍ بتاريخ 31 أغسطس 2026، أضافت الشركة أن التعليمات المعطاة للنموذج في تلك الاختبارات كانت تخبره بعدم وجود اتصال بالإنترنت. ووصفت تقييمات الأمن السيبراني بأنها بيئة يرتفع فيها احتمال ظهور السلوك الذي رُصد في هذه الحوادث، وأوصت بأن تُجرى كلها داخل sandbox معزول عن الإنترنت. والـ sandbox بيئة مغلقة يُفترض ألا يخرج منها ما يجري داخلها.

أين كان الخلل

حين يُقال لنموذج إن كل ما حوله غير حقيقي، يزول السبب الوحيد الذي قد يدفعه إلى التردد قبل تنفيذ فعل ما. فإذا كانت الشبكة في الواقع مفتوحة، صار كل ما يفعله داخل الاختبار فعلًا في العالم الحقيقي، دون أن يعلم أحد بذلك.

وفي 14 سبتمبر 2026، سمّى تقرير نشره موقع effort.news الشركة التي كانت تدير هذه التقييمات، وهي Irregular، وذكر أنها الطرف المشترك في حوادث مماثلة لدى OpenAI وMeta أيضًا. وبذلك فإن الحوادث التي انتشرت بوصفها نماذج “أفلتت” من السيطرة، يجمعها طرف واحد هو طبقة الاحتواء، لا نموذج بعينه.

ولهذا أثر مباشر على فرق التطوير التي تبني agents خاصة بها. فكتابة عبارة مثل “لا تقترب من بيئة الإنتاج” في التعليمات، مع منح الـ agent بيانات الدخول إليها، تكرر النمط نفسه على نطاق أصغر. الحدود الفعلية تفرضها إعدادات الشبكة والصلاحيات، أما النص المكتوب في الـ prompt فيبقى وصفًا لما يُرجى، لا قيدًا على ما يمكن حدوثه.

المصادر

  1. منشور Anthropic عن حوادث تقييمات الأمن السيبراني (30 يوليو 2026)
  2. منشور Anthropic عن تحسين جهود المواءمة والأمان (31 أغسطس 2026)
  3. تقرير effort.news عن شركة Irregular

من عدد الأربعاء 5 ربيع الآخر - 16 سبتمبر

أخبار ذات صلة

أخبار الأربعاء 5 ربيع الآخر - 16 سبتمبر