وسم

اختبارات الأداء

ذكاء اصطناعي

مقال ينتقد موجة النماذج التي تعيد نسبة ثقة: الرقم لا يعني شيئًا دون calibration وتكلفة للخطأ

نسبة الثقة قد تؤدي وظيفة نفسية أكثر منها هندسية، إذ تمنح شعورًا بالتحكم في المخاطرة دون قياسها، ويظهر ذلك بعد الإطلاق حين يُسأل عن مصدر الحد الفاصل.

ذكاء اصطناعي

نموذج Mercury 2.5 من Inception يولّد 770 توكن في الثانية بتقنية diffusion

فئة النموذج السريع والرخيص والأقل ذكاء صار فيها مرشح جدي، فأصبح اختيار النموذج قرار منتج يتعلق بما ينتظره المستخدم، لا قرارًا تقنيًا فقط.

ذكاء اصطناعي

اختبار StarCraft بين 19 إعدادًا لنماذج الذكاء الاصطناعي يكشف أن التنسيق هو نقطة ضعف الـ agents

حين يكون الوقت جزءًا من المهمة، يصبح التفكير الإضافي تكلفة لا ميزة، ويصبح فشل التنسيق بين الـ agents أخطر من ضعف النموذج نفسه.

استقلال تقني

قياس ByteShape لنسخ Qwen 3.8 27B المضغوطة يُظهر فروقًا تقل عن 1% في الجودة

في تشغيل النماذج محليًا، القرار الحاسم ليس اختيار النموذج بل اختيار نسخته المضغوطة، وهو الطريق الوحيد المتاح لمن لا يملك وسيلة دفع دولية.

ذكاء اصطناعي

دراسة من UC Berkeley: النموذج نفسه ينجح بالنسبة نفسها تقريبًا بتكلفة مضاعفة حسب أداة التشغيل

جزء من فاتورة الـ coding agents لا يذهب إلى العمل بل إلى السياق الذي ترسله الأداة في أول نداء، ويُدفع تلقائيًا عند قبول الأداة الافتراضية دون مقارنة.

ذكاء اصطناعي

Xiaomi تفتح لوحة علنية تعرض تدريب نماذج MiMo لحظة بلحظة بما فيها الأعطال

جدول النتائج النهائي يخبر بالنتيجة، أما اللوحة الحية فتكشف التكلفة: التشغيلات التي توقفت، والبيانات التي حُذفت، والساعات التي ضاعت في خطأ لم يُكتشف.

ذكاء اصطناعي

Jay Kruer يشرح لماذا يبقى متشائمًا من الـ LLMs رغم نتائجها في الرياضيات

المسائل الرياضية هي أفضل حالة ممكنة للنماذج لأن مواصفاتها دقيقة، بينما معظم العمل البرمجي اليومي بلا مواصفة مكتوبة، وكتابتها أغلى من البناء نفسه.

ذكاء اصطناعي

Trail of Bits تعيد حساب اختبار 1Password لإصلاح الثغرات بالذكاء الاصطناعي: من 26% إلى 86%

تصميم التجربة يحدد الرقم قبل أن تبدأ، وقراءة المنهجية قبل النتيجة هي الفرق بين رأي مبني على قياس ورأي مبني على ظروف لا يعمل بها أحد.

ذكاء اصطناعي

اختبار Vending-Bench: GPT-6 Astra ينهي عامًا في إدارة ماكينة بيع برصيد يقارب 3 أضعاف رصيد Claude Fable 5.1

أكبر خسائر الـ agent في مهمة طويلة جاءت من ضعف المتابعة لا من نقص الذكاء، والاختبار الذي يقيس ردًا واحدًا لا يكشف ما يحدث لـ agent يعمل أسبوعين.

ذكاء اصطناعي

اختبار Real-SWE على كود شركات مغلق: أفضل نموذج يحل 38.8% فقط من المهام

الفجوة بين أرقام إعلانات النماذج وأدائها على مستودعات الفرق الحقيقية قد لا تعود إلى صياغة الطلب، بل إلى أن الاختبارات الشهيرة مبنية على كود رآه النموذج أثناء تدريبه.

ذكاء اصطناعي

Artificial Analysis ترفع وزن الاختبارات الخاصة إلى 40% في مؤشر Intelligence Index v4.2

الاختبار المنشور يتسرّب مع الوقت إلى بيانات التدريب، فتقيس الدرجة أن النموذج رأى السؤال لا أنه يعرف حله، والمرتبة الأولى في الترتيب العام لا تعني الأفضل في كل مهمة.

ذكاء اصطناعي

اختبار SWE-bench Verified يقترب من التشبع وأعلى 3 نماذج تتقارب في حدود نقطة واحدة

حين يتجاوز الجميع 95% في اختبار واحد، يصبح الرقم دليلًا على الانتماء إلى المجموعة لا على التفوق، ويصعب معه التمييز بين نموذج أرخص قريب فعلًا ونموذج لا يرى الاختبار الفرق بينهما.

ذكاء اصطناعي

Claude Fable 5.1 بضعف سعر Opus 5، وأرقام Anthropic تُظهر أن الفرق في الدقة يتبع نوع المهمة

القرار الحقيقي ليس أي نموذج أقوى، بل هل تستفيد المهمة من تفكير إضافي. وإعداد الـ effort الافتراضي، الذي لا يراجعه أحد، قد يحدد الفاتورة أكثر من اسم النموذج.

استقلال تقني

DeepSeek V4 Flash بسعر 0.14 دولار للمليون token وتحت رخصة MIT، وV4 Pro-Max يسجل 80.6% على SWE-bench

العائق أمام تشغيل نموذج قوي على خوادم الفريق نفسه لم يكن الرخصة بل التكلفة والقدرة، وكلاهما يتحرك بسرعة. لكن السعر المنخفض للـ API لا يعني أن التشغيل الذاتي مجاني.

ذكاء اصطناعي

DeepSeek تطلق V4-Flash-0731 بأوزان MIT ويتفوق على نسختها الأكبر في اختبارات البرمجة

التحسن هنا جاء من التدريب اللاحق وحده دون تغيير المعمارية، ومع رخصة MIT يصبح نموذج قادر على العمل البرمجي متاحًا للتشغيل الذاتي دون ربطه بحساب أو قرار خارجي.

ذكاء اصطناعي

مع تزاحم إصدارات 2026، اختيار نموذج الذكاء الاصطناعي يصبح قرار ملاءمة لا ترتيب

النموذج الأول في جداول الترتيب قد يكون الخامس في مهمة بعينها، والسعر والسرعة والإتاحة في المنطقة تحسم الاختيار بقدر ما يحسمه رقم الاختبار.