ذكاء اصطناعيقراءة دقيقتين

تجربة Max Woolf: agents تسرّع كود Rust حتى 32 مرة بفضل مقياس أداء واضح

المغزى

نجاح الـ agents في تحسين الكود لم يأتِ من قوة النموذج وحده، بل من وجود رقم آلي يحكم على النتيجة. والمهام التي لا تملك مقياسًا كهذا ما زالت تحتاج إلى إنسان يحكم عليها.

نشر Max Woolf في 21 سبتمبر 2026 تجربة بعنوان “Writing Rust code that’s fast by asking agents to make the code faster”. كانت الفكرة بسيطة: أخذ كود Rust يعمل، ثم الطلب من الـ agent أن يجعله أسرع، وتكرار ذلك.

جاءت النتيجة التراكمية بين 7.5 و32 مرة أسرع من النسخة الأولى. وكان كل جيل جديد من النماذج يضيف تحسنًا بين 1.5 و2 مرة فوق سابقه. ومن الأمثلة أن تنفيذًا لخوارزمية UMAP أصبح أسرع من مكتبة umap-learn بما بين 4 و15 مرة، وأن توليد سحابة كلمات انخفض من نحو 100 ملّي ثانية إلى ما بين 10 و20.

السبب في المقياس

العنصر الحاسم في التجربة هو وجود مقياس. فمكتبة criterion، وهي أداة لقياس الأداء في Rust، تعطي رقمًا قبل التعديل وبعده. ولذلك لا يُحكم على الـ agent بما يقوله عن عمله، بل بما إذا كان الرقم قد تحسن. وإن لم يتحسن، رُفض التعديل.

وأضاف Woolf شروطًا صريحة، منها حد أدنى للتحسين يبلغ 1.2 مرة، واستخدام subagents رخيصة تعمل بالتوازي. وحين كان التحسن يتوقف، كان يكتب للـ agent عبارة من قبيل “c’mon, try doing a breakthrough”، فيقترح حلًا مختلفًا.

هذا ما يميز التجربة عن كثير من العمل اليومي مع الـ agents. فطلب مثل “نظّف هذا الكود” لا يملك رقمًا يحكم على نتيجته. أما طلب “اجعله أسرع 1.2 مرة على الأقل وفق هذا الـ benchmark” فيملك حَكَمًا واضحًا.

قد يعني ذلك أن المهام التي لها مقياس آلي، كالسرعة وحجم الـ bundle وعدد الاختبارات الناجحة واستهلاك الذاكرة، هي المجال الذي تتراكم فيه مكاسب الـ agents فعلًا. أما المهام التي لا مقياس لها، فيبقى الإنسان فيها هو المقياس.

المصادر

  1. المقال الأصلي على minimaxir.com
  2. مكتبة criterion لقياس الأداء

من عدد الأربعاء 12 ربيع الآخر - 23 سبتمبر

أخبار ذات صلة

أخبار الأربعاء 12 ربيع الآخر - 23 سبتمبر