مقال: وصف نماذج اللغة بأنها مجرد آلات لتوقع الكلمة التالية يعيق فهم ما تفعله
بعد التدريب بالمكافأة لا يتعلم النموذج ما كتبه الناس، بل ما نجح حين جرّبه بنفسه، وهذا يفسر قدرته على ما لم يره ويفسر أيضًا حدود ما يتحسن فيه.
نُشر في 4 سبتمبر 2026 مقال بعنوان “Next-token predictor is the wrong mental model for LLMs”، يجادل بأن وصف نماذج اللغة الكبيرة بأنها “مجرد آلات تتوقع الكلمة التالية” صحيح تقنيًا، لكنه يعيق فهم ما يحدث فعلًا.
وتقوم حجة المقال على الفرق بين مرحلتين من التدريب.
في مرحلة الـ pre-training، يتدرب النموذج على نصوص موجودة فعلًا. يرى جملة ناقصة ويحاول إكمالها بالكلمة التي وردت في النص الأصلي. وهنا يكون وصف “التوقع” دقيقًا تمامًا.
أما في مرحلة الـ post-training، وتحديدًا ما يُعرف بـ RLVR، أي التعلم المعزز بمكافأة قابلة للتحقق، فتتغير الصورة. يولّد النموذج بنفسه سلاسل جديدة لم تكن موجودة في أي بيانات. ثم تُقاس النتيجة: هل الحل صحيح، هل الكود يعمل. والسلسلة التي تؤدي إلى نتيجة جيدة ترتفع احتمالية تكرارها.
وبهذا لا يتعلم النموذج ما كتبه الناس، بل ما نجح حين جرّبه بنفسه.
ويستعين المقال بتشبيه من الشطرنج. فمحرك تدرب على مباريات كبار اللاعبين فقط يتوقع نقلة. أما محرك تدرب باللعب ضد نفسه ملايين المرات فهو يختار نقلة تفوز. وتسمية الثاني “متوقع نقلات” لا تصف ما يفعله.
ولهذا الفرق أثر عملي على من يبني فوق هذه النماذج. فمن يفهمها كآلات توقع سيستغرب قدرتها على حل مسائل لم تر مثلها. ومن يفهم أنها تدربت بالتجربة والمكافأة سيلاحظ أمرًا آخر: أنها تتحسن أساسًا فيما يمكن قياسه والتحقق منه.
ويترك ذلك سؤالًا مفتوحًا لم يجد المقال له إجابة حاسمة: ما الذي يحسّن أداء النماذج في المهام التي لا توجد طريقة واضحة لقياس نتائجها.