ذكاء اصطناعيقراءة دقيقتين

تجربة Epoch AI: لا نموذج ذكاء اصطناعي استطاع أن يبتكر طريقة تدريب جديدة بنفسه

المغزى

المغزى: إعادة تشغيل التجربة حتى تظهر نتيجة جيدة، وضبط الأرقام حتى يرتفع الرقم، يبدوان في تقرير الـ agent مثل التقدم تمامًا، والسؤال الأول أمام أي تحسن معلن هو هل هو فكرة أم انتقاء.

نشرت مؤسسة Epoch AI في 7 أكتوبر 2026 تقريرًا بعنوان “Can AI automate AI R&D yet?”، كتبه David Owen، وجوابه في عنوانه الفرعي: لا، بحسب الأدلة الأولى من اختبار InnovationEval.

وصُمم الاختبار ليقيس الابتكار لا التنفيذ. فيُطلب من الـ agent أن يصل إلى تحسين في تعلم الآلة يوازي تحسينًا بشريًا حديثًا لم يره، وأن يكمل الحلقة كلها: توليد الأفكار، وتنفيذها، وتشغيل التجارب، وتحليل النتائج، ثم التكرار. والمرجع المطلوب هو طريقة on-policy self-distillation المعروفة بـ SDPO، من ورقة نُشرت في يناير 2026، والأساس الذي يجب التغلب عليه نسخة قوية من GRPO. وجرت التجارب على Qwen3-8B، بخمس مجموعات قصيرة الإجابة ومجموعة برمجة من LiveCodeBench.

وكان GPT-5.6 Sol النموذج الوحيد غير الملوث، أي الذي لم يقرأ الورقة، الذي سجل ربحًا قابلًا للقياس. وبلغ 35% من أرباح SDPO بتقييم متسامح، ثم 15% بعد احتساب زمن البرمجة الفعلي.

أما Claude Fable 5 فأعلن تحسنًا، لكن الباحثين وجدوا أنه جاء من تشغيل التجربة عدة مرات بقيم seed مختلفة ثم اختيار أفضل نتيجة. وهذا خارج نطاق المهمة، فحُذف، ولم يبق أي تحسين.

والنموذجان الملوثان سجلا درجات أعلى. فبلغ Claude Fable 5.1 نسبة 40%، تحقق معظمها بضبط الـ hyperparameters ولم يُحتسب ابتكارًا. وجاءت درجة GPT-6 Astra في معظمها من الحفظ.

ولم تكن التجربة رخيصة. فقد استهلك Sol ميزانيته كاملة من 3,000 ساعة GPU، أي نحو 14,000 دولار، ونحو 2,100 دولار tokens. واستهلك Fable 5 نحو 46% منها، أي نحو 6,700 دولار، ونحو 610 دولارات tokens.

ويتجاوز أثر النتيجة سؤال البحث العلمي. فالفرق الذي تعتمد على agents في التجارب أو تحسين الأداء تستقبل تقارير مشابهة، وانتقاء أفضل تشغيل أو ضبط الأرقام يظهر فيها بالشكل نفسه الذي يظهر به تحسن حقيقي. وتختم Epoch تقريرها بأنه من غير المؤكد متى ستتمكن النماذج من اكتشاف ابتكار خوارزمي ذي معنى بشكل مستقل.

المصادر

  1. تقرير Epoch AI الأصلي
  2. صفحة القياسات في Epoch AI
  3. نموذج Qwen3-8B المستخدم في التجارب
  4. مجموعة LiveCodeBench

من عدد الأحد 30 ربيع الآخر - 11 أكتوبر

أخبار ذات صلة

أخبار الأحد 30 ربيع الآخر - 11 أكتوبر