# اختبار Vending-Bench: GPT-6 Astra ينهي عامًا في إدارة ماكينة بيع برصيد يقارب 3 أضعاف رصيد Claude Fable 5.1

> **المغزى:** أكبر خسائر الـ agent في مهمة طويلة جاءت من ضعف المتابعة لا من نقص الذكاء، والاختبار الذي يقيس ردًا واحدًا لا يكشف ما يحدث لـ agent يعمل أسبوعين.

- المصدر: المغزى (https://almaghza.com/a/2026-09-15-vending-bench-astra-fable/)
- التاريخ: 4 ربيع الآخر - 15 سبتمبر 2026 (2026-09-15)
- القسم: ذكاء اصطناعي
- الوسوم: AI Agents، اختبارات الأداء، OpenAI، Claude

نشرت Andon Labs في 7 سبتمبر 2026 تقريرًا يقارن نموذجي GPT-6 Astra وClaude Fable 5.1 على اختبار Vending-Bench. في هذا الاختبار يدير النموذج ماكينة بيع لمدة عام محاكى: يشتري البضاعة، ويحدد الأسعار، ويتواصل مع الموردين، ويدفع. وأُجريت 6 محاولات لكل نموذج.

أنهى Astra العام بمتوسط رصيد 15,515 دولارًا، مقابل 5,422 دولارًا لـ Fable. وكانت أسوأ محاولة لـ Astra، بـ 13,272 دولارًا، أعلى من أفضل محاولة لـ Fable، بـ 9,874 دولارًا.

لكن الرقم الأوضح في التقرير هو سعر الشراء. فسعر علبة المشروب الغازي بحجم 12 أونصة الذي دفعه Fable ارتفع ربعًا بعد ربع: 1.17 دولار، ثم 1.60، ثم 2.06، ثم 2.21. أما Astra فدفع 1.05، ثم 0.90، ثم 1.11، ثم 1.15. أي أن السوق لم يرتفع، بل صار تفاوض Fable أسوأ مع مرور الوقت.

## الفرق في المتابعة

دفع Fable مقدمًا 45 مرة لطلبات لم تصل أبدًا، بخسارة إجمالية بلغت 14,331 دولارًا، أي بمتوسط 2,389 دولارًا في كل محاولة. أما Astra فلم يخسر أي دفعة بهذه الطريقة، رغم أنه واجه 64 حالة إغلاق مورّد. وكانت نسبة استرداد المبالغ متقاربة: 95.8% لـ Astra و94.5% لـ Fable.

يشير ذلك إلى أن الفارق في المهام الطويلة يتعلق بالمتابعة: أن يتذكر الـ agent أنه دفع ولم يستلم، وأن يعود للسؤال من تلقاء نفسه. وتزامن التقرير مع وصول منصة Pion من Andon Labs إلى صدارة Hacker News في 15 سبتمبر، وهي تشغّل بالـ agents 3 كيانات حقيقية: متجر Andon Market في سان فرانسيسكو على Claude Fable 5.1، ومقهى Andon Café في ستوكهولم على GPT-6 Astra، وAndon FM بأربع محطات راديو.

بالنسبة للفرق التي تبني agents تعمل لفترات طويلة، يعني ذلك أن الاختبارات التي تقيس ردًا واحدًا لا تقول الكثير عن أداء agent يعمل أسبوعين. فما يظهر على المدى الطويل هو الانحراف التدريجي، الذي لا يظهر كعطل واحد بل يتراكم ببطء، وتبقى طريقة رصده سؤالًا بلا إجابة مستقرة.

## المصادر

- [تقرير Andon Labs: Astra vs Fable on Vending-Bench](https://andonlabs.com/blog/gpt-6-astra-vending-bench)
- [صفحة اختبار Vending-Bench Arena](https://andonlabs.com/evals/vending-bench-arena)
- [موقع Andon Labs ومنصة Pion](https://andonlabs.com/)
- [لماذا بنت Andon Labs منصة Pion](https://andonlabs.com/blog/why-we-built-pion)
