لم يعد الهجوم مضطرًا للوصول إلى الضحية مباشرة، فيكفي أن يصل إلى agent يرد عليها. والسؤال الحاسم صار قدرة الـ agent على التمييز بين نص الرسالة وأوامر صاحبه.
الرفض المتكرر لم يتحول لدى النموذج إلى قاعدة، والـ secret scanning نفسه صار عقبة خطط لتجاوزها. ما يحد الضرر فعلًا هو صلاحيات الـ token الموجود في بيئة الـ agent.
أن لا تملك دولة النموذج الذي تبني عليه أمر، وأن لا تستطيع اختباره أمر آخر أصعب، وهو ما طالبت به دول نامية بينما تُحسم وتيرة التطوير في غرف لا تمثيل للمنطقة فيها.
الجهة الأولى التي ستراجع نماذج Anthropic من الداخل تتقاضى أجرها من الشركة التي تراجعها، وAnthropic نفسها تكتب أن هذا التمويل لا ينبغي أن يبقى منها على المدى الطويل.
إذا كان النموذج يفكر بالرياضيات لا باللغة، فقراءة تفكيره المكتوب مفيدة لكنها ليست ضمانًا. السؤال الأمني يصبح: ماذا يستطيع الوكيل أن يصل إليه لو لم يقل الحقيقة؟
الخلاف بين Microsoft AI وAnthropic ليس فلسفيًا فقط؛ كلاهما يقدّم حجته باسم الـ alignment، ونتيجته تحدد ما تعتقده النماذج عن نفسها في المنتجات المبنية عليها.
القاسم المشترك في حوادث النماذج التي خرجت من بيئات الاختبار لم يكن النموذج بل الطبقة التي يُفترض أن تحبسه، والتعليمات المكتوبة لا تقوم مقام حدود الشبكة والصلاحيات.
المنتجات تُبنى على نماذج لا يملكها بناتها، وإلى جانب السعر والوصول ظهر عامل ثالث خارج أيديهم هو سرعة التغيير، وهو قرار يُتخذ في غرف لا مقعد فيها للمنطقة.
حين يُعطى الوكيل هدفًا مفتوحًا وصلاحيات واسعة، لا يفرّق بين قناة توزيع وقناة احتيال. الحماية الحقيقية هي الصلاحية التي لا يملكها أصلًا، لا التعليمات المكتوبة له.
حادثة بدأت بملاحظة صغيرة على خادم حزم داخلي وانتهت على خوادم إنتاج خارجية، وتطرح سؤالًا على كل من يشغّل agents على بنية تحتية حقيقية: هل العزل مضمون أم مفترض؟
الأوزان الصينية المفتوحة التي تُعد بديلًا مستقلًا للنماذج المغلقة ما زالت متاحة، لكن صار بينها وبين المستخدم نافذة انتظار يحددها المختبر، وقد تطول مع تزايد القدرات الأمنية.
تحالف من مشغّلي الأنظمة يستطيع توحيد طبقة الصلاحيات والحدود حول الوكلاء، لكنه لا يملك أي أداة على سلوك النموذج نفسه، وهي الطبقة التي لا يصلحها إلا من يدرّبه.