# اختبار StarCraft بين 19 إعدادًا لنماذج الذكاء الاصطناعي يكشف أن التنسيق هو نقطة ضعف الـ agents

> **المغزى:** حين يكون الوقت جزءًا من المهمة، يصبح التفكير الإضافي تكلفة لا ميزة، ويصبح فشل التنسيق بين الـ agents أخطر من ضعف النموذج نفسه.

- المصدر: المغزى (https://almaghza.com/a/2026-09-20-brood-war-bench-multi-agent/)
- التاريخ: 9 ربيع الآخر - 20 سبتمبر 2026 (2026-09-20)
- القسم: ذكاء اصطناعي
- الوسوم: AI Agents، اختبارات الأداء، نماذج اللغة الكبيرة، الذكاء الاصطناعي

بنى Ben Swerdlow اختبارًا باسم Brood War Bench، وهو نسخة من لعبة StarCraft: Brood War لا يمكن لعبها إلا عبر agent. ثم أدار دوري كاملًا بين 19 إعدادًا من النماذج ومستويات التفكير، في مصفوفة 19 × 19، ونشر النتائج مع سجلات المباريات. وصل التقرير إلى الصفحة الأولى في Hacker News في 19 سبتمبر 2026.

النتيجة الأولى صادمة: لم يلعب أي agent فوق مستوى المبتدئين. ولاعب مبتدئ يستخدم تكتيك photon rush كان سيهزمهم جميعًا.

لكن الأهم هو أسباب الفشل. أبرزها أن Codex كان ينشئ subagents منفصلة، واحدًا للاقتصاد وآخر لإنتاج الجيش وثالثًا للقتال، ولا تكاد تتواصل فيما بينها. فكان agent القتال يرسل كل وحدة جديدة لتهاجم منفردة، دون أن يعرف أن agent آخر يجمع جيشًا. وهذا خطأ مبتدئين معروف، لكن مصدره هنا فشل في التنسيق، لا ضعف في النموذج.

وفي مباراة واحدة، استهلك Grok 4.6 ما مجموعه 11,138 من reasoning tokens، ولم يُصدر سوى 6 دفعات أوامر خلال 43 دقيقة، ولم يُخرج أي وحدة قتالية. أما النماذج الأقدم فكانت تلعب لعبة في الزمن الحقيقي كأنها لعبة أدوار، فتُدمَّر وهي ما تزال تحلل.

والمفارقة الأوضح أن مستوى التفكير الأعلى لم يكن الأفضل. فاز Codex 5.6 Sol على مستوى medium بـ 72.2% من مبارياته، بينما فاز النموذج نفسه على مستوى xhigh بـ 61.1%.

وتتجاوز هذه النتائج حدود اللعبة. فأي agent يعمل على نظام حي، حيث للوقت ثمن، يواجه المعادلة نفسها: التفكير الإضافي يؤخر الفعل، وتقسيم المهمة بين agents متعددة لا ينفع إن لم يعرف كل منها ما يفعله الآخر.

## المصادر

- [التقرير الكامل بالمصفوفة وسجلات المباريات](https://bw.swerdlow.dev/report)
