# مشروع livenerf يقيس بالأرقام ما إذا كان أداء Claude Opus 5.5 يتراجع بعد إطلاقه

> **المغزى:** الإحساس بتراجع جودة نموذج لا يثبت شيئًا، لكن عدّاد الـ tokens قد يفعل. فخفض مستوى التفكير يغيّر الاستهلاك بأكثر مما يغيّر الدقة.

- المصدر: المغزى (https://almaghza.com/a/2026-09-30-livenerf-opus-5-5-nerf-measurement/)
- التاريخ: 19 ربيع الآخر - 30 سبتمبر 2026 (2026-09-30)
- القسم: ذكاء اصطناعي
- الوسوم: Claude، Anthropic، اختبارات الأداء، نماذج اللغة الكبيرة، الذكاء الاصطناعي

يتكرر بين المطورين سؤال لا يُحسم عادة: هل يتراجع أداء النموذج بعد أسابيع من إطلاقه؟ مشروع مفتوح المصدر اسمه livenerf يحاول الإجابة عنه بالقياس بدل الانطباع. بدأ العدّ يوم إطلاق Claude Opus 5.5 في 22 سبتمبر 2026، وبحسب آخر تحديث في ملف المشروع بتاريخ 29 سبتمبر، اكتمل 6 أيام من أصل 30. وأول نتيجة ممكنة متوقعة نحو 24 أكتوبر.

المشكلة الأولى أن النموذج لا يمكن جعله deterministic، أي يعطي النتيجة نفسها كل مرة، فإعدادات الـ sampling لم تعد متاحة ووضع التفكير لا يمكن إيقافه. لذلك ثبّت المشروع كل ما عدا ذلك: prompts مجمّدة، وأداة CLI مثبتة على نسخة واحدة، ومصحّحون محددون، وسجلات محفوظة بشكل دائم. وهو مبني على Inspect، إطار التقييم المفتوح من UK AI Security Institute، ويعتمد في الإحصاء على ورقة Anthropic المعنونة Adding Error Bars to Evals.

والجزء الأذكى في طريقة اختيار الأسئلة. فحص المشروع 2,336 سؤالًا، كل واحد أربع مرات. فتبين أن Opus 5.5 يجيب نحو 93% منها صحيحًا من المحاولة الأولى، وأن 97% من الأسئلة إما يجيبها صحيحًا دائمًا أو خطأً دائمًا. وهذه لا تفيد في رصد أي تغيّر لأنها لا تتحرك، فبقي 78 سؤالًا فقط يجيبها النموذج مرة ويخطئ مرة، وصارت هي أداة القياس.

ووجد المشروع ما هو أهم. فعند خفض الـ reasoning effort، أي مستوى التفكير المخصص لكل طلب، كان الفرق في الدقة نحو 8 نقاط، بينما بلغ الفرق في الـ output tokens نحو 62%. أي أن أي خفض خفي لمستوى الجهد سيظهر في عدّاد الـ tokens قبل أن يظهر في الإحساس بالجودة.

ويذكر المشروع حدوده بنفسه. فحين جُرّب استبدال Opus 5 بـ Opus 5.5، لم تلاحظ الأداة الفرق، أي أنها لا تستطيع كشف تبديل نموذج بآخر من العائلة نفسها. ويبقى السؤال الأصلي بلا إجابة حتى تكتمل الأيام الثلاثون.

## المصادر

- [مستودع livenerf على GitHub](https://github.com/ninjahawk/livenerf)
- [ملف README للمشروع](https://raw.githubusercontent.com/ninjahawk/livenerf/main/README.md)
- [إطار التقييم Inspect من UK AI Security Institute](https://inspect.aisi.org.uk/)
- [ورقة Adding Error Bars to Evals](https://arxiv.org/abs/2411.00640)
