ذكاء اصطناعيقراءة دقيقتين

اختبار Real-SWE على كود شركات مغلق: أفضل نموذج يحل 38.8% فقط من المهام

المغزى

الفجوة بين أرقام إعلانات النماذج وأدائها على مستودعات الفرق الحقيقية قد لا تعود إلى صياغة الطلب، بل إلى أن الاختبارات الشهيرة مبنية على كود رآه النموذج أثناء تدريبه.

نُشرت نتائج اختبار جديد لقياس قدرة نماذج الذكاء الاصطناعي على البرمجة اسمه Real-SWE، وأفضل نموذج فيه لم يحل سوى 38.8% من المهام.

الفرق بين Real-SWE والاختبارات المعروفة أنه يعمل على كود شركات مغلق، غير منشور على الإنترنت. والمهام نفسها لها أثر عملي مباشر في أنظمة تلك الشركات، مثل الفوترة والضرائب ونقل بيانات العملاء بين الأنظمة.

وجاءت النتائج على النحو التالي:

  • Fable 5.1: 38.8%
  • GPT-6 Astra: 33.8%
  • Gemini 3.8 Flash: 31.2%
  • GLM 5.3: 28.8%
  • Grok 4.6: 23.8%
  • Kimi K3: 18.8%
  • GPT-5.6 Sol: 16.2%

وكل رقم في الجدول متوسط لنتيجة pass@1، أي نسبة المهام التي يحلها النموذج من المحاولة الأولى، محسوبًا على 8 تجارب مستقلة لكل مهمة، مع فاصل ثقة 95%. أي أن النتائج ليست محاولة واحدة قد تصيب بالمصادفة.

والصفحة نفسها لا تقارن نتائجها بـ SWE-bench أو غيره. لكن الأرقام التي تُعلن مع إصدارات النماذج عادة أعلى من ذلك بكثير، والتفسير المعقول أن الاختبارات الشهيرة مبنية على مستودعات مفتوحة، وأن النموذج قد يكون رآها أثناء تدريبه. ويغلق Real-SWE هذا الاحتمال بالعمل على كود لم يُنشر أصلًا.

وهذا يفسر تجربة يعرفها كثير من المطورين: الفرق بين الرقم المكتوب في إعلان النموذج والأداء الذي يظهر على مستودع الفريق. فقد لا يكون السبب ضعفًا في صياغة الطلبات، بل أن الرقم المعلن قيس على كود مألوف للنموذج. وبالنسبة للفرق التي تختار نموذجها من جداول الإعلانات، يصبح قياس النماذج على جزء من كودها الخاص أقرب إلى الواقع من أي ترتيب منشور.

المصادر

  1. صفحة Real-SWE وجدول النتائج الكامل
  2. النقاش على Hacker News
  3. لوحة نتائج SWE-bench للمقارنة
  4. لوحة LMArena للمقارنة

من عدد الأحد 2 ربيع الآخر - 13 سبتمبر

أخبار ذات صلة

أخبار الأحد 2 ربيع الآخر - 13 سبتمبر