اختبار SWE-bench Verified يقترب من التشبع وأعلى 3 نماذج تتقارب في حدود نقطة واحدة
حين يتجاوز الجميع 95% في اختبار واحد، يصبح الرقم دليلًا على الانتماء إلى المجموعة لا على التفوق، ويصعب معه التمييز بين نموذج أرخص قريب فعلًا ونموذج لا يرى الاختبار الفرق بينهما.
اختبار SWE-bench Verified هو الرقم الذي تستشهد به معظم شركات الذكاء الاصطناعي عند إعلان نماذجها للبرمجة. لكنه، بحسب لوحات تجميع النتائج مثل llm-stats، لم يعد يفرّق بوضوح بين النماذج في القمة. فأعلى 3 نماذج حاليًا متقاربة في حدود نقطة واحدة، فوق 95%.
وهذه الأرقام مأخوذة من لوحات تجميعية، لا من اللوحة الرسمية على swebench.com، ولذلك تُقرأ بوصفها مؤشرًا تقريبيًا لا رقمًا نهائيًا. غير أن الفكرة الأساسية لا تعتمد على رقم بعينه.
فهذه الظاهرة تسمى saturation، أي التشبع. الاختبار يقيس فرقًا حقيقيًا بين النماذج إلى أن يُستنفد هذا الفرق، ثم يصبح ما يقيسه أقرب إلى الضوضاء. وتقارب النماذج هنا لا يعني أنها متساوية، بل أن الاختبار نفسه صار سهلًا عليها جميعًا.
والدليل أن النماذج نفسها حين تُختبر على النسخة الأصعب، SWE-bench Pro، تعود الفروق لتظهر بوضوح، وقد تصل إلى عشرات النقاط بين المتصدر ونماذج تقدّم نفسها منافسة له.
وبذلك تتغير قراءة الإعلانات. فعبارة “فوق 95% على SWE-bench Verified” لا تعني أن النموذج هو الأفضل، بل أنه ضمن المجموعة المتقدمة.
ويكتسب هذا أهمية خاصة عند اختيار نموذج أرخص لخفض الفاتورة بسبب قرب رقمه من النموذج الأغلى. فهذا القرب قد يكون حقيقيًا، وقد يكون ناتجًا عن عجز الاختبار عن رؤية الفرق، والحالتان تبدوان متطابقتين في الجدول. ولهذا تلجأ فرق كثيرة إلى اختبار النماذج على مهام من مستودعاتها الخاصة، لأنها تكشف ما لا تكشفه الجداول المنشورة.