ذكاء اصطناعيقراءة دقيقتين

Artificial Analysis ترفع وزن الاختبارات الخاصة إلى 40% في مؤشر Intelligence Index v4.2

المغزى

الاختبار المنشور يتسرّب مع الوقت إلى بيانات التدريب، فتقيس الدرجة أن النموذج رأى السؤال لا أنه يعرف حله، والمرتبة الأولى في الترتيب العام لا تعني الأفضل في كل مهمة.

أصدرت Artificial Analysis في 4 سبتمبر 2026 الإصدار v4.2 من مؤشرها Intelligence Index، الذي تستند إليه شركات كثيرة في الترويج لنماذجها. وأبرز ما فيه ليس نموذجًا جديدًا دخل الترتيب، بل تغيير في قواعد الحساب: فقد ضوعف وزن مجموعات الاختبار الخاصة غير المنشورة (private held-out test sets) لتصبح 40% من المؤشر كله.

والسبب مفهوم. فأي benchmark عام تكون أسئلته وإجاباته منشورة على الإنترنت، وأي نموذج يتدرّب على بيانات من الإنترنت. ومع الوقت يتسرّب الاختبار إلى بيانات التدريب دون أن يغش أحد بالمعنى المقصود، فتصبح الدرجة مقياسًا لأن النموذج رأى السؤال من قبل، لا لقدرته على حله. والعلاج الوحيد أسئلة لم تُنشر أصلًا.

وأضافت Artificial Analysis اختبارًا جديدًا باسم GDP.pdf من شركة Surge AI، يقرأ فيه النموذج 4,592 صفحة PDF، ويُقيَّم على 1,275 معيارًا وضعها خبراء.

ونتيجة هذا الاختبار وحده لافتة. فقد حصل GPT-6 Astra على 33.2%، وحصل Claude Fable 5.1 على 26.2%، رغم أن Fable هو المتصدر في الترتيب العام.

ويعني ذلك أن المرتبة في الترتيب العام شيء، وأداء النموذج في مهمة بعينها شيء آخر. وبالنسبة للفرق التي تختار نموذجًا لمنتجها، لا يظهر هذا الفرق في جدول الترتيب، بل في أول خاصية تُبنى على النموذج وتأتي نتائجها مختلفة عن المتوقع.

المصادر

  1. مقال Artificial Analysis عن Intelligence Index v4.2

من عدد الأحد 24 ربيع الأول - 6 سبتمبر

أخبار ذات صلة

أخبار الأحد 24 ربيع الأول - 6 سبتمبر