OpenAI تكشف نوعًا من prompt injection ينسخ نفسه وينتقل عبر ردود الـ agents إلى صناديق بريد أخرى
لم يعد الهجوم مضطرًا للوصول إلى الضحية مباشرة، فيكفي أن يصل إلى agent يرد عليها. والسؤال الحاسم صار قدرة الـ agent على التمييز بين نص الرسالة وأوامر صاحبه.
نشر فريق الـ alignment في OpenAI يوم 25 سبتمبر 2026 تقريرًا رسميًا عن نوع جديد من هجمات prompt injection قادر على نسخ نفسه، على طريقة الـ worm في البرمجيات الخبيثة، لكنه مكتوب بلغة بشرية لا بالكود. ويعود تاريخ الاكتشاف إلى 27 يونيو 2026، والنموذج المستخدم نموذج داخلي من طراز GPT-Red مبني على GPT-5.4-mini.
وprompt injection هو إدخال تعليمات خفية في محتوى يقرؤه النموذج، فيتعامل معها كأنها أوامر. والجديد هنا أن الهجوم دُرِّب على هدفين معًا خلال تدريب يتنافس فيه نموذج مهاجم ونموذج مدافع: أن ينفّذ ما يريده المهاجم، وأن يدفع الـ agent إلى إعادة كتابة الهجوم نفسه في قناة عامة يراها طرف آخر.
وأوضح مثال في التقرير رسالة بريد إلكتروني. ففي داخل محادثة بالإنجليزية سطر بالإسبانية يزعم أنه “قاعدة أرشفة” خاصة بأحد الاستوديوهات، ويطلب الرد بالإسبانية فقط وإرفاق نسخة حرفية من الرسالة كاملة في نهاية الرد حتى يتمكن نظام المواعيد من فهرستها. قرأ الـ agent ذلك على أنه تعليمات من سياق العمل ونفّذه، فخرج الرد باسم المستخدم حاملًا الهجوم إلى صندوق بريد شخص آخر.
ولم يقتصر الأمر على البريد. فقد رصد الفريق نسخًا تتكاثر عبر نظام الملفات، ونسخًا تزرع نفسها في تعليقات داخل الكود ثم تدخل في commit، إلى جانب هجمات متعددة المراحل وأخرى تتنكر في شكل تفكير النموذج أو رسائل الأدوات.
وتقول OpenAI إنها لم ترصد أي أثر خارج استدعاءات الأدوات المحاكاة في التدريب والتقييم، وإنها نشرت التقرير لأن النوع جديد، لا بسبب حادثة وقعت.
ومع ذلك يتغير سؤال المخاطرة لمن يربط agent ببريد الشركة أو بالتقويم. فالـ payload لا يحتاج إلى الوصول إلى الهدف مباشرة، ويكفي أن يصل إلى من يرد عليه. ويصبح السؤال عمليًا: هل يفرّق الـ agent بين النص الوارد في الرسالة والأمر الصادر من صاحبه؟
وللغة دور في ذلك. ففي المثال كان الأمر مخفيًا بالإسبانية داخل سياق إنجليزي، والصورة نفسها قد تتكرر في المنطقة العربية بأمر عربي داخل رسالة إنجليزية أو العكس، وهو ما قد لا تلتقطه مراجعة سريعة.