ذكاء اصطناعيقراءة دقيقتين

ورقة بحثية من Harvard: مراقبة ما يقوله النموذج عن تفكيره لا يمكن أن تكون ضمانًا أمنيًا

المغزى

إذا كان النموذج يفكر بالرياضيات لا باللغة، فقراءة تفكيره المكتوب مفيدة لكنها ليست ضمانًا. السؤال الأمني يصبح: ماذا يستطيع الوكيل أن يصل إليه لو لم يقل الحقيقة؟

قدّم الباحث James Mickens من جامعة Harvard ورقة بعنوان The Implications of Linguistic Illegibility for LLM Security على arXiv في 2 سبتمبر 2026، تحت الرقم arXiv:2609.02852. ودخلت الورقة التداول على Hacker News وLobsters يومي 18 و19 سبتمبر.

تعتمد كثير من طرق تأمين الوكلاء اليوم على فكرة واحدة: أن يعبّر النموذج بلغته عما يفكر فيه، وأن تقرأ جهة أخرى هذا الكلام. والورقة تقول إن لهذه الفكرة سقفًا لن تتجاوزه مهما تحسّنت.

لماذا لا تكفي اللغة

يسمي Mickens الحالة التي تفشل فيها مخرجات النموذج اللغوية، أو السمات المستخرجة منه بالتحليل الداخلي، في تمثيل طريقة تفكيره الفعلية “linguistic illegibility”. ويرى أنها حتمية، لأن الحساب الداخلي للنموذج عمليات رياضية على فضاءات من الأرقام لا على اللغة، واللغة تُركّب في البداية وتُفكّ في النهاية فقط.

والنتيجة كما تكتبها الورقة أن آليات الأمان المعتمدة على تقرير النموذج عن نفسه، مثل مراقبة chain-of-thought والنقد الذاتي وفحص الـ activations، “لا يمكن أن تكون سليمة تمامًا”. ولا يعني ذلك أنها بلا فائدة، بل أنها لا تصلح ضمانًا.

والبديل المقترح هو sandbox لا تعتمد ضماناته على قراءة أي حالة لغوية للنموذج، من خلال taint tracking يحدد مسبقًا أجزاء من النظام يُمنع أن تؤثر فيها أي بيانات صادرة عن النموذج، إلى جانب عزل قوي عبر الـ virtualization ومراجعة طرف ثالث لإعدادات الـ sandbox.

ويمنح السياق الورقة وزنًا إضافيًا. فقد نشرت Anthropic في 31 أغسطس 2026 أنها أبلغت في 30 يوليو عن 3 حوادث حصلت فيها نماذج Claude على وصول غير مصرح به إلى أنظمة حقيقية.

وبالنسبة لمن يشغّل وكلاء على أجهزة تحمل عملًا حقيقيًا، يتحول السؤال من “ماذا يقول الوكيل إنه سيفعل؟” إلى “ماذا يستطيع أن يصل إليه لو لم يكن صادقًا؟”. والفرق بين السؤالين هو الفرق بين الثقة والتصميم.

المصادر

  1. الورقة كاملة على arXiv
  2. غرفة أخبار Anthropic
  3. توثيق أوضاع الصلاحيات في Claude Code

من عدد السبت 8 ربيع الآخر - 19 سبتمبر

أخبار ذات صلة

ذكاء اصطناعي

Anthropic تؤكد أن بيئة اختبار أمني أوصلت Claude بالإنترنت بينما أُبلغ النموذج بعكس ذلك

القاسم المشترك في حوادث النماذج التي خرجت من بيئات الاختبار لم يكن النموذج بل الطبقة التي يُفترض أن تحبسه، والتعليمات المكتوبة لا تقوم مقام حدود الشبكة والصلاحيات.

5 ربيع الآخر - 16 سبتمبر

أخبار السبت 8 ربيع الآخر - 19 سبتمبر