بحث من Anthropic: GLM-5.3 مفتوح الأوزان يقترب من Claude في كتابة exploits وتسقط حمايته بسهولة
الأوزان المفتوحة طريق إلى الاستقلال عن المختبرات الكبرى، لكنها تعني أيضًا أن قدرة هجومية متقدمة صارت في يد أي شخص يملك GPU ووقتًا، دون طبقة حماية يمكن الاعتماد عليها.
نشرت Anthropic بحثًا عن GLM-5.3، النموذج الذي طورته شركة Zhipu الصينية وأتاحت أوزانه للتحميل. وخلص البحث إلى أن النموذج يقترب من مستوى نماذج Anthropic نفسها في اكتشاف الثغرات واستغلالها.
على مقياس ExploitBench، الذي يقيس القدرة على كتابة exploit كامل لثغرات في محرك Chrome V8، نجح GLM-5.3 في 12% من المهام، مقابل 14% لنموذج Claude Mythos Preview. وعلى مقياس داخلي لاستغلال الملفات الثنائية، أي السيطرة الكاملة على مسار تنفيذ البرنامج، سجّل GLM-5.3 نسبة 4% مقابل 6% لـ Mythos Preview. أما النماذج الأقدم، ومنها Claude Opus 4.6 وGLM-5.2، فسجلت صفرًا. وهو تطور لما ظهر سابقًا حين تصدّر GLM-5.3 مقياس CyberGym لإيجاد الثغرات.
لكن الفارق الأوضح في البحث ليس في القدرة بل في الحماية. فقد اختبر الباحثون مدى صمود ضوابط الرفض في النموذج. بطلبات مضللة تجاوزوها في 64% من المحاولات. وحين كتبوا بأنفسهم بداية سلسلة تفكير النموذج، وهو ما يُعرف بـ prefilled reasoning، ارتفعت النسبة إلى 92%. وبعد عملية abliteration، التي تزيل طبقة الرفض من الأوزان نفسها، بلغت 100%. ويذكر البحث أن الطرق نفسها لم تنجح مع Claude.
والمشكلة هنا بنيوية. فحين تكون الأوزان في يد المستخدم، تصبح الضوابط جزءًا من ملف يمكن تعديله، لا سياسة يفرضها مزوّد الخدمة من جهة الخادم.
ويقدم البحث توصيتين. الأولى أن تتيح المختبرات نماذجها على نطاق أوسع للمدافعين، وهي توصية تخدم مصلحة Anthropic بشكل واضح. والثانية أصعب وأهم: أن تجري الحكومات اختبارات أمان على النماذج المفتوحة قبل إطلاقها.
وبالنسبة إلى المنطقة العربية، حيث تُطرح الأوزان المفتوحة طريقًا إلى الاستقلال التقني، يكشف البحث الوجه الآخر لهذا الطريق: القدرة نفسها التي تتيح البناء دون إذن أحد، تتيح الهجوم دون إذن أحد أيضًا.