ذكاء اصطناعيقراءة دقيقتين

دراسة من UC Berkeley: النموذج نفسه ينجح بالنسبة نفسها تقريبًا بتكلفة مضاعفة حسب أداة التشغيل

المغزى

جزء من فاتورة الـ coding agents لا يذهب إلى العمل بل إلى السياق الذي ترسله الأداة في أول نداء، ويُدفع تلقائيًا عند قبول الأداة الافتراضية دون مقارنة.

نشر باحثون من UC Berkeley وArena ورقة بعنوان HarnessTax: How Much Does the Harness Matter for Coding Agents?، ومن بين مؤلفيها Ion Stoica وMatei Zaharia. والـ harness هو الأداة التي يعمل النموذج داخلها: التعليمات التي ترسلها، والأدوات التي تتيحها، وطريقة إدارتها للمحادثة.

قاست الدراسة 21 تركيبة من 7 نماذج و3 أدوات، على 30 مهمة لكل benchmark، مع تكرار كل مهمة 3 مرات.

وأوضح مثال في الورقة نموذج Claude Fable 5 على SWE-bench Lite. فقد حلّ 97.8% من المحاولات داخل Claude Code، و96.7% داخل Codex، و96.7% داخل Pi، وهي أداة صغيرة مفتوحة المصدر. الفارق في النجاح أقل من نقطتين، أما التكلفة فكانت 1.33 دولار للمحاولة في Claude Code مقابل 0.67 دولار في Pi، أي الضعف تقريبًا.

أين تذهب التكلفة الإضافية

لا تذهب إلى عمل إضافي، فعدد الأدوار متقارب: 15.3 دورًا في المتوسط لـ Claude Code و15.4 لـ Pi. الفرق في أول نداء للنموذج. فمتوسط السياق الذي يرسله Claude Code في البداية يزيد على 10 أضعاف ما يرسله Pi، وذلك عبر النماذج السبعة كلها. تعليمات أطول وتعريفات أدوات (tool schemas) أكبر، وكلها تُحتسب قبل أن يبدأ العمل الفعلي.

يسمي الباحثون هذا الفرق Harness Tax، وهو يُدفع دون قرار صريح من أحد، بمجرد اعتماد الأداة الافتراضية دون مقارنتها بغيرها.

وللنتائج حدود واضحة: هي 30 مهمة على benchmark مفتوح، لا على مستودعات الشركات الفعلية، وقائمة الأسعار المستخدمة بتاريخ 1 سبتمبر 2026. ولا تقول الورقة إن أداة أفضل من أخرى، بل إن الفارق في التكلفة موجود ويمكن قياسه. وبالنسبة للفرق التي أصبحت فاتورة الـ agents فيها بندًا حقيقيًا في المصروفات، يصبح اختيار الأداة قرارًا ماليًا لا تقنيًا فقط.

المصادر

  1. الورقة ولوحة النتائج التفاعلية
  2. أداة Pi مفتوحة المصدر
  3. SWE-bench Lite
  4. Terminal-Bench

من عدد الخميس 6 ربيع الآخر - 17 سبتمبر

أخبار ذات صلة

أخبار الخميس 6 ربيع الآخر - 17 سبتمبر