Fireworks AI: فاتورة الـ agent تنمو أسرع من عدد الخطوات لأن التفكير السابق يُحتسب في كل خطوة
من يقدّر تكلفة ميزة تعتمد على agent بضرب سعر الطلب في عدد الخطوات يقلل الرقم الحقيقي، والفرق لا يظهر في تجربة من 3 خطوات بل في مهمة من 30.
نشرت Fireworks AI يوم 23 سبتمبر 2026 إعلانًا عن نموذج جديد اسمه Ember-1 مبني على Kimi K3، ووصل المقال إلى صدارة Hacker News يوم 27 سبتمبر. لكن الأرقام التي نشرتها عن تكلفة الـ agents أهم من النموذج نفسه.
فنماذج التفكير مثل Kimi K3 تنفق أغلب الـ tokens التي تولّدها على التفكير الداخلي، وأحيانًا أكثر من 90% منها، لا على الإجابة التي يراها المستخدم. وهذا في حد ذاته ثمن الجودة.
وتبدأ المشكلة في العمل متعدد الخطوات. فكل خطوة جديدة تُرسل إلى النموذج ومعها كل التفكير الذي سبقها، فيُقرأ تفكير الخطوة الأولى ويُحتسب مرة ثانية في الخطوة الثانية، وثالثة في الثالثة. ولذلك ينمو الـ context بشكل تربيعي تقريبًا مع عدد الخطوات، لا خطيًا.
وجرّب الفريق أولًا الحل البديهي، أي خفض مستوى الـ reasoning effort، فتراجعت الجودة أكثر مما يحتمل. فدرّبوا نسخة تتعلم التفكير باختصار بدل التفكير أقل، عبر أكثر من 50 تجربة تدريب و200 تقييم.
والنتيجة بحسب الشركة أن التفكير قصر بنسبة تتراوح بين 35% و50% دون تراجع في الدقة، على 7 معايير وعلى traffic حقيقي لعميلين. ففي SWE-bench Verified انتقلت النتيجة من 93.2% إلى 92.2% مع خفض التكلفة 15.5%. وفي DeepSWE ارتفعت من 66.4% إلى 75.2% مع خفض 23.7%. وفي Terminal-Bench 2.1 ارتفعت من 80.9% إلى 82.0% مع خفض 51.9%.
وحُسبت هذه التكاليف على أسعار Kimi K3 المعلنة: 3 دولارات لكل مليون token من المدخلات غير المخزنة، و0.30 دولار للمخزنة، و15 دولارًا للمخرجات. أما سعر Ember-1 نفسه فلم يُنشر بعد على صفحة أسعار Fireworks.
والأثر يتجاوز هذا النموذج. فمن يقدّر تكلفة ميزة على أساس سعر الطلب مضروبًا في عدد الخطوات يحصل على رقم أقل من الحقيقة، والفجوة لا تظهر في تجربة قصيرة، بل في agent يعمل 30 خطوة.