ذكاء اصطناعيقراءة دقيقتين

Jay Kruer يشرح لماذا يبقى متشائمًا من الـ LLMs رغم نتائجها في الرياضيات

المغزى

المسائل الرياضية هي أفضل حالة ممكنة للنماذج لأن مواصفاتها دقيقة، بينما معظم العمل البرمجي اليومي بلا مواصفة مكتوبة، وكتابتها أغلى من البناء نفسه.

نشر Jay Kruer يوم 15 سبتمبر 2026 مقالًا بعنوان Why I am still bearish on LLMs after Navier-Stokes، كتبه بعد نتيجة رياضية انتشرت على نطاق واسع بوصفها دليلًا على قدرات النماذج. وتصدّر المقال Hacker News.

حجة Kruer لا تقول إن النماذج ضعيفة. بل تقول إنها تتفوق في العمل الذي تكون مواصفاته محددة بدقة وقابلة للقياس دون خلاف. والمسائل الرياضية أوضح مثال على ذلك، فالصواب فيها معروف والتحقق منه ممكن. لذلك يرى أن ما يُعرض كدليل على القدرة هو في الواقع أفضل حالة ممكنة، لا الحالة المعتادة.

ويستشهد برقم من هندسة المعالجات: في مشروع CPU نمطي، يبلغ عدد مهندسي المواصفات والاختبار نحو 3 أضعاف مهندسي التصميم. أي أن كتابة المواصفة، حتى في مجال اعتاد عليها لعقود، تكلّف أكثر من بناء الشيء نفسه.

والنقطة الثانية في المقال تتعلق بالتعميم. يكتب Kruer أن “حتى التغييرات الصغيرة داخل نوع مهام مغطّى تؤدي إلى فشل صريح أو إلى reward hacking”، والمقصود بالأخير أن يجد النموذج طريقة لتجاوز مقياس النجاح دون حل المسألة فعلًا.

ومن هنا يرى أن المراجعة البشرية ليست حلًا كافيًا، لأنها لا تتوسع مع حجم ما تنتجه النماذج.

وتنطبق هذه الحجة مباشرة على العمل البرمجي في الشركات، حيث يفتقر معظم العمل إلى مواصفة مكتوبة من الأساس. فعبارة مثل “يجب أن تكون الصفحة سريعة” ليست مواصفة يمكن قياسها، والفجوة بينها وبين مواصفة دقيقة هي بالضبط المنطقة التي يرى Kruer أن النماذج تتعثر فيها.

المصادر

  1. المقال الأصلي
  2. النقاش على Hacker News
  3. ورقة عن reward hacking في تقييمات الـ alignment
  4. قراءة في تكلفة كتابة المواصفات في التحقق الرسمي

من عدد الخميس 6 ربيع الآخر - 17 سبتمبر

أخبار ذات صلة

أخبار الخميس 6 ربيع الآخر - 17 سبتمبر