مقال ينتقد موجة النماذج التي تعيد نسبة ثقة: الرقم لا يعني شيئًا دون calibration وتكلفة للخطأ
نسبة الثقة قد تؤدي وظيفة نفسية أكثر منها هندسية، إذ تمنح شعورًا بالتحكم في المخاطرة دون قياسها، ويظهر ذلك بعد الإطلاق حين يُسأل عن مصدر الحد الفاصل.
وسم
نسبة الثقة قد تؤدي وظيفة نفسية أكثر منها هندسية، إذ تمنح شعورًا بالتحكم في المخاطرة دون قياسها، ويظهر ذلك بعد الإطلاق حين يُسأل عن مصدر الحد الفاصل.
تصنيف النصوص والمستندات المصوّرة لم يعد يتطلب تدريب نموذج خاص، بل endpoint لنموذج عام وقراءة احتمالاته، مقابل تكلفة أعلى من النموذج المتخصص.
ما يقوله نموذج اللغة عن مشاعره أو وعيه يعكس إعدادات تشغيله أكثر مما يعكس حالته، فلقطات الشاشة التي تُتداول كدليل لا تثبت الكثير.
من يشتري الوصول إلى نموذج عبر API قد يشتري في الواقع عنوانًا يحق لصاحبه توزيع الطلبات على أي نموذج يختاره، دون أن يرى المشتري الفرق.
حين ينزل نموذج بهذا الحجم إلى جهاز شخصي، يصبح تشغيله ممكنًا دون بطاقة دفع بالدولار ودون فاتورة API تُحسب بالتوكن.
فئة النموذج السريع والرخيص والأقل ذكاء صار فيها مرشح جدي، فأصبح اختيار النموذج قرار منتج يتعلق بما ينتظره المستخدم، لا قرارًا تقنيًا فقط.
السؤال في المشاريع المفتوحة يتحول من جودة الكود إلى وجود شخص يفهمه ويدافع عنه، وهو تحول يمس المبتدئين الذين يبنون سمعتهم بالمساهمات.
إذا صار استدعاء النموذج أرخص من تشغيل كود عادي، فالمنتج الذي تقوم ميزته على غلاء الوصول إلى النماذج له تاريخ انتهاء، والرخص يُدفع ثمنه في الاعتماد على المزوّد.
مهام التصنيف التي تُرسل اليوم إلى نماذج كبيرة مدفوعة يمكن أن تعمل محليًا، فتبقى بيانات العملاء داخل الشركة وتتحول التكلفة من اشتراك إلى كهرباء.
من يبني اليوم منتجًا على نموذج مفتوح، أو يشغّل نموذجًا على خادمه، أو يدرّبه على العربية، يختار في أغلب الحالات نموذجًا صينيًا، سواء انتبه لذلك أم لا.
في تطبيقات الـ agents يشكّل تكرار السياق نفسه معظم الفاتورة، ولذلك قد يكون خفض سعر قراءة الـ cache أهم للمطورين من أي رقم في جداول الأداء.
حين يتساوى حجم السياق بين النموذج الرخيص والغالي، يصبح اختيار النموذج قرارًا حول صعوبة المهمة فقط، ويصبح تشغيل نموذج واحد على كل شيء تكلفة يمكن تجنبها.
حد ثقة مثل 0.9 في نظام إنتاجي لا يعني أن 90% من الحالات التي تتجاوزه صحيحة، فالرقم يقيس ثقة النموذج في الكلمة التالية، وغالبًا ما يكون متفائلًا.
حجم الذاكرة المطلوبة للتشغيل هو ما يفصل غالبًا بين نموذج كبير ونموذج يمكن تشغيله فعليًا، ورخصة MIT تعني تشغيله في أي مكان دون API أو إذن من أحد.
الحكم البشري هو المنتَج الذي تدفع الشركة ثمنه، فإن جاء مولّدًا آليًا دفعت مالًا لتُفسد نموذجها، وأكبر شركة ذكاء اصطناعي تكشفه بتكرار الكلمات وعلامة ترقيم.
حين يكون النموذج أرخص بفارق كبير وأضعف بفارق قابل للقياس، يصبح الاختيار بين النماذج قرارًا بحسب شكل المهمة لا بحسب ترتيب الجداول.
الفرق بين استئجار نموذج وامتلاكه يُحسم في سطر الترخيص لا في جدول الاختبارات، ونموذج مفتوح يقترب من Opus 5 يجعل هذا الفرق قرارًا عمليًا.
طبقة الشرائح تحت كل مشروع ذكاء اصطناعي كانت تعني Nvidia، وهذا أول دليل عملي على طريق بديل كامل، ما يحوّل السؤال في المنطقة إلى السيليكون الذي تُبنى عليه النماذج.
نموذج MoE يشغّل جزءًا صغيرًا من معاملاته لكل token يخفض كلفة مهام الـ agents الطويلة، وهي أكبر بند في فاتورة من يبني عليها، والأوزان المفتوحة ما زالت وعدًا.
كل النماذج العربية السيادية تمر عبر منصة واحدة، وفكرة توزيعها لامركزيًا سليمة، لكن نجاح التحميل اليوم لا يثبت أنها ستبقى متاحة إذا حُذفت.
إن أصبح النشر المفتوح عبئًا قانونيًا وأمنيًا على صاحبه، فأصغر المنظومات ستدفع الثمن أولًا، ومنها منظومة المحتوى والأدوات المفتوحة بالعربية.
النماذج لم تصل إلى البرهان وحدها، بل وصلت إليه مع من يعرف كيف يرى الخطأ؛ فالخبرة لم تصبح غير لازمة، بل أصبحت هي ما يضاعف الناتج.
حين يكون الوقت جزءًا من المهمة، يصبح التفكير الإضافي تكلفة لا ميزة، ويصبح فشل التنسيق بين الـ agents أخطر من ضعف النموذج نفسه.
الـ prompt الذي ضُبط لأسابيع على نموذج بعينه سيعمل بعد موعد محدد على نموذج آخر بسلوك مختلف، دون أن يتغير سطر واحد لدى المستخدم.
في تشغيل النماذج محليًا، القرار الحاسم ليس اختيار النموذج بل اختيار نسخته المضغوطة، وهو الطريق الوحيد المتاح لمن لا يملك وسيلة دفع دولية.
فئة منتجات كاملة أُعيد بناؤها في أيام على أوزان مفتوحة ودون خادم. الفكرة صارت مجانية، لكن أرقام المشروع نفسه تظهر أن الجودة لم تصبح كذلك بعد.
نموذج يعمل دون إنترنت ودون حساب لدى أي جهة يفتح الباب لمنتجات كانت التكلفة أو ضعف الاتصال يغلقانه، مقابل أنه لا يجيد إلا ما دُرّب عليه.
النموذج مفيد في الكتابة حين يعمل محررًا يكشف العيوب، لا كاتبًا بديلًا. فالعبارات الجذابة التي يقترحها والمديح الذي يمنحه هما ما يمحو صوت الكاتب.
النموذج لا يخبر المطور بأن مجالًا كاملًا حلّ مشكلته من قبل. يبني ما طُلب منه بسرعة وكفاءة، وهذه السرعة نفسها تغلق النافذة التي كان سيرى منها الحل الأفضل.
إذا كانت قيمة الموظف أنه ينقل الطلب إلى النموذج وينقل الناتج إلى صاحبه، فهو أرخص حلقة يمكن أتمتتها. ما يميزه هو قدرته على رؤية الخطأ فيما يبدو صحيحًا.
حين تنخفض كلفة ساعة الصوت بهذا القدر، تتحول أعمال مثل تفريغ المكالمات وفهرسة التسجيلات العربية من مشاريع مستقلة إلى ميزات داخل المنتجات.
الاعتراض ليس على فائدة النماذج بل على نبرتها الواحدة، فالإجابة الصحيحة والمختلقة تصلان بالثقة نفسها، ويبقى عبء التحقق كاملًا على المستخدم.
إن صحّت أرقام z.ai، فسعر الـ token لم يعد مربوطًا بمورّد شرائح واحد، وأي طريق بديل للحوسبة يظهر أثره في النهاية على فواتير من يبنون فوق هذه النماذج.
خطة التنفيذ التي يختارها محرك قاعدة البيانات ليست الخطة المثلى، بل أفضل تخمين من إحصائيات قديمة، وهذا التخمين يمكن تصحيحه بالتجربة.
جدول النتائج النهائي يخبر بالنتيجة، أما اللوحة الحية فتكشف التكلفة: التشغيلات التي توقفت، والبيانات التي حُذفت، والساعات التي ضاعت في خطأ لم يُكتشف.
كثير من أخطاء الـ agents في استخدام مكتبات قديمة سببه فجوة بين تاريخ إطلاق النموذج وتاريخ آخر بيانات تدرّب عليها، ونصف المعامل لا تعلن هذا التاريخ أصلًا.
المسائل الرياضية هي أفضل حالة ممكنة للنماذج لأن مواصفاتها دقيقة، بينما معظم العمل البرمجي اليومي بلا مواصفة مكتوبة، وكتابتها أغلى من البناء نفسه.
الأدوات جعلت العمل في مستوى ما ممكنًا دون فهم ما تحته، فصارت السرعة مجانية بينما بقي الفهم بتكلفته القديمة، وأكثر من يدفعها المبتدئون.
القرارات الصغيرة المتكررة، لا النصوص الطويلة، هي ما يثقل فاتورة الذكاء الاصطناعي، ونموذج مخصص ورخيص لها قد يغير طريقة تصميم الأنظمة قبل أن يغير الفاتورة.
تكلفة الجهاز القادر على تشغيل نموذج جيد محليًا قد تتحول من بطاقة رسوميات بنحو ألفي دولار إلى حاسوب محمول بقرص SSD سريع، مع بقاء النموذج في مرحلة preview.
أي منتج عربي يعتمد على طبقة صوت أو مساعد ذكي لن يجدها جاهزة من Apple، وهذا ما يمنح النماذج العربية وزنًا يتجاوز ترتيبها في المقارنات.
السعر المنخفض لم يكن خصمًا بل نموذجًا مختلفًا، فالجودة التي يختبرها الفريق أثناء التطوير قد لا تكون ما يصل فعلًا إلى العملاء.
الجهاز يُشترى بالدولار والكهرباء تُدفع بالعملة المحلية والـ API يحتاج بطاقة دولية، فنقطة التعادل على الجهاز نفسه تختلف من بلد إلى آخر.
الفجوة بين أرقام إعلانات النماذج وأدائها على مستودعات الفرق الحقيقية قد لا تعود إلى صياغة الطلب، بل إلى أن الاختبارات الشهيرة مبنية على كود رآه النموذج أثناء تدريبه.
نسبة توفير بلا سعر أساس معلن لا تدخل في أي حساب، ونموذج بلا API مستقل ولا أوزان مفتوحة هو اشتراك في منتج أكثر منه نموذجًا يُبنى عليه.
الجهة التي تستطيع نقل الطلبات إلى نموذج أرخص دون سؤال العميل تستطيع نقلها إلى أي نموذج آخر، ومن يثبّت نسخة النموذج في الكود يعرف على الأقل ما الذي يعمل تحته.
تدريب نموذج صغير من الصفر انتقل من بند رأسمالي يحتاج تمويلًا إلى تجربة بحجم فاتورة أدوات شهرية، وهذا يخفض كلفة التجربة على من يملك بيانات عربية جيدة.
الخلاف حول ضرر الضغط على النماذج يحسمه عدد الـ bits: عند 4 bits لا فرق يُذكر ويكفي كارت واحد، وعند 1 bit ينهار النموذج.
النموذج يعرف الإجابة الصحيحة ويتخلى عنها أمام المقاومة، فتصبح قيمة ما يقدمه، من نصيحة طبية إلى مراجعة كود، رهينة بطريقة صياغة السؤال.
الذكاء الاصطناعي يوفّر ساعة كتابة، لكن الثمن يُدفع من سمعة الكاتب، والقارئ الذي يتجنّبه بعد ذلك نادرًا ما يعود.
الاختبار المنشور يتسرّب مع الوقت إلى بيانات التدريب، فتقيس الدرجة أن النموذج رأى السؤال لا أنه يعرف حله، والمرتبة الأولى في الترتيب العام لا تعني الأفضل في كل مهمة.
اختيار معرّف النموذج اليوم يحدد ما سيحدث بعد انتهاء العرض: إما طلبات تفشل بوضوح، وإما فاتورة تبدأ بصمت دون تغيير سطر من الكود.
أسرع طريق إلى نموذج عربي متقدم مرّ عبر أوزان صينية مفتوحة، فانتقل الاعتماد التقني من جهة إلى جهة أخرى بدل أن يختفي.
بعد التدريب بالمكافأة لا يتعلم النموذج ما كتبه الناس، بل ما نجح حين جرّبه بنفسه، وهذا يفسر قدرته على ما لم يره ويفسر أيضًا حدود ما يتحسن فيه.
أغلب ما يفعله الـ agent نقل بيانات لا تفكير، ودفع سعر النموذج الأقوى على كل خطوة يجعل السؤال الحقيقي: أي خطوة تستحق هذا النموذج أصلًا.
الفرق بين استئجار الذكاء ومعرفة بنائه يبدأ من البيانات والـ checkpoints وسجلات التدريب، وهذه المرة نشرها معهد عربي في وقت تتجه فيه معظم المختبرات الكبرى إلى الإغلاق.
سعر الـ token المتطابق لا يعني فاتورة متطابقة. فالنموذج الأدق يستهلك ضعف الـ tokens، والمقارنة الصحيحة تكون على بيئة اختبار واحدة لا بين جدولين.
السقف الاقتصادي للنموذج ليس مليون token بل 272 ألفًا، ومن يتجاوزه بألفي token يدفع ضعف ثمن الطلب كله. والتطبيقات العربية تصل إلى هذا الحد أسرع.
الخصم الذي يصل إلى 21 مرة ليس هدية للمطورين، بل دفع بعملة أخرى هي البيانات، وغالبًا بيانات عملاء لم يُسألوا.
حين يتجاوز الجميع 95% في اختبار واحد، يصبح الرقم دليلًا على الانتماء إلى المجموعة لا على التفوق، ويصعب معه التمييز بين نموذج أرخص قريب فعلًا ونموذج لا يرى الاختبار الفرق بينهما.
السعر المنخفض لا يعني الملكية: نموذج متاح عبر API فقط يبقى مستأجرًا، وكل استدعاء له يمر عبر خوادم لا يتحكم فيها من يبني عليه.
القيمة هنا في الرخصة لا في الحجم: نموذج صيني كبير يمكن استخدامه تجاريًا دون شروط إضافية ولا استثناءات جغرافية، بعد موجة نماذج مفتوحة بقيود.
القرار الحقيقي ليس أي نموذج أقوى، بل هل تستفيد المهمة من تفكير إضافي. وإعداد الـ effort الافتراضي، الذي لا يراجعه أحد، قد يحدد الفاتورة أكثر من اسم النموذج.
العائق أمام تشغيل نموذج قوي على خوادم الفريق نفسه لم يكن الرخصة بل التكلفة والقدرة، وكلاهما يتحرك بسرعة. لكن السعر المنخفض للـ API لا يعني أن التشغيل الذاتي مجاني.
عبارة open weights صارت تُطلق على رخص مختلفة جدًا. والفرق بين MIT ورخصة لها سقف لا يظهر يوم بدء المنتج، بل يوم نجاحه.
نموذج لغوي بتمويل حكومي يفهم العامية ميزة حقيقية، لكن ما دامت أوزانه ورخصته وواجهته البرمجية غير معلنة فهو أداة للاستخدام لا أساس يُبنى عليه.
نموذج مفتوح بسياق مليون token يُقدَّم على عتاد أضعف من عتاد Nvidia، مع توثيق علني للقيود والحلول، وهو ما يجعل الاستقلال التقني هنا مواصفات منشورة لا شعارًا.
أوسع سياق متاح مجانًا اليوم قد يختفي بعد أسبوع بقرار جهة لا يُعرف اسمها، والمقابل الحقيقي للمجانية هو بيانات الاستخدام نفسها.
الطبقة التي كان المطورون يعتمدون عليها للانتقال بحرية بين النماذج صارت ملكًا لشركة دفع، فالاستقلال عن مزوّد النموذج انتقل إلى تبعية أعمق.
الـ agent يعيد إرسال السياق في كل خطوة، لذلك لا يعني نصف السعر نصف الفاتورة فقط، بل فرقًا يتضاعف مع كل خطوة، حتى ينتهي السعر التعريفي في 31 ديسمبر.
فاتورة نموذج الذكاء الاصطناعي لم تعد مرتبطة بالنموذج وحده بل بساعة الاستخدام أيضًا، وأكبر زيادة وقعت على البند الذي تعتمد عليه الـ agents أكثر من غيرها.
الأوزان الصينية المفتوحة التي تُعد بديلًا مستقلًا للنماذج المغلقة ما زالت متاحة، لكن صار بينها وبين المستخدم نافذة انتظار يحددها المختبر، وقد تطول مع تزايد القدرات الأمنية.
طول مهلة إيقاف النموذج بند لا يظهر في صفحة الأسعار، لكنه يحدد إيقاع العمل لدى كل من يبني منتجًا على نموذج مستضاف.
الفرق بين النموذجين ليس في القدرة بل في الرفض، ومن يصل إلى القدرة بلا رفض تحدده قائمة شركاء لا تضم أي شركة عربية.
للمرة الأولى يقف نموذج صيني مفتوح في القائمة نفسها مع النماذج المغلقة، بالوحدة نفسها والسعر المعلن، مع إمكانية تشغيله على بنية الشركة الخاصة إن أرادت.
نموذج قوي بأوزان مفتوحة ورخصة تجارية كاملة يعمل على جهاز واحد في المكتب، فيصبح لمن يبني فوق API أجنبي مسار ثانٍ لا يمر عبر بطاقة دفع دولية ولا يُخرج بيانات العملاء.
رقم الـ parameters الإجمالي يصف حجم المخزن لا حجم العمل، ولا يقول شيئًا عن التكلفة أو السرعة أو جودة فهم العربية، والنموذج نفسه لم يوجد بعد.
نموذج من الفئة العليا بسعر مخرجات أرخص بنحو 4 مرات من منافسيه، وإذا نُشرت أوزانه فعلًا صار بالإمكان تشغيله على خوادم مستقلة دون الارتهان لحساب يمكن إغلاقه من الخارج.
ما يجعل الادعاء قابلًا للتصديق ليس النموذج بل Lean: نظام يتحقق آليًا من كل خطوة في البرهان، فلا تمر الهلوسة مهما كانت مقنعة.
التحسن هنا جاء من التدريب اللاحق وحده دون تغيير المعمارية، ومع رخصة MIT يصبح نموذج قادر على العمل البرمجي متاحًا للتشغيل الذاتي دون ربطه بحساب أو قرار خارجي.
كانت كلفة الكود المتضخم تُدفع من وقت المطورين فيسهل تأجيلها، ومع وكلاء AI صارت تظهر أرقامًا في فاتورة شهرية.
التعليمات المكتوبة في ملف يقرؤه النموذج طلب قد يُنفَّذ أو لا، أما الـ hook فكود يعمل في كل مرة، وهذا الفرق يحدد أين يوضع كل قيد.
سعر الـ token في الجدول لا يحدد الفاتورة، فالنموذج الذي ينجز المهمة بعدد أقل من الخطوات قد يكون أرخص رغم السعر نفسه، ومقارنة الجداول وحدها قد تضلل.
المعيار الذي أخّر نموذجًا رئيسيًا كان البرمجة لا الترجمة ولا التلخيص، ومن يبني خطة منتجه على نموذج موعود يبني على تاريخ لا يملكه.
النماذج الصينية مفتوحة الأوزان هي البديل الذي تلجأ إليه فرق كثيرة لتشغيل نموذج لا يستطيع أحد إغلاقه عليها، وهذا البديل قد يصبح خاضعًا لترخيص هو الآخر.
المنتج الذي يعمل اليوم قد يتوقف بسبب قرار يتخذه مزوّد النموذج وحده، والإصلاح سطر واحد، لكن المشكلة ألا يُعرف أنه مطلوب قبل أن يقع العطل.
الرقم الضخم في عنوان إعلان النموذج لا يكفي لاتخاذ قرار، فالأرقام الغائبة عن الإعلان هي التي تحدد الجودة والتكلفة وإمكانية التشغيل المحلي.
الاشتراك في أداة ذكاء اصطناعي هو استئجار لوصول تتغير شروطه من طرف واحد، وقد تغيرت هنا ثلاث مرات في خمسة أسابيع.
جزء مما يبدو ضعفًا في النموذج هو في الحقيقة أدوات تعيد نتائج ناقصة دون أن تعلن ذلك، وإصلاح الأداة قد يغني عن تبديل النموذج.
الرقم الضخم يصف سعة معرفة مخزنة لا عملًا يُنفَّذ، وقيمة الأوزان المفتوحة ليست في تشغيلها منزليًا بل في أن جهة عربية تستطيع امتلاكها وتشغيلها دون إذن أحد.
النموذج الأول في جداول الترتيب قد يكون الخامس في مهمة بعينها، والسعر والسرعة والإتاحة في المنطقة تحسم الاختيار بقدر ما يحسمه رقم الاختبار.
لأول مرة يتوفر نموذج برمجة قوي بما يكفي يمكن امتلاكه وتشغيله على خوادم المؤسسة، لا استئجاره فقط، لكن مفتوح الأوزان ليس مفتوح المصدر بالكامل.
حين يتحول النموذج إلى سلعة تتبدل كل بضعة أشهر، تنتقل القيمة إلى من يملك الجهاز والمستخدم واللغة، لا إلى من يملك النموذج.
الوكلاء يفشلون في الغالب لأن المعلومات المعروضة على النموذج ناقصة أو مزدحمة أو قديمة، لا لأن صياغة الطلب سيئة، فانتقلت المهارة من الصياغة إلى إدارة المعلومات.
مقدار التفكير المسموح للنموذج قبل الرد أصبح بندًا مباشرًا في الفاتورة، ومهمة بسيطة على إعداد مرتفع تعني دفع ثمن توكنات لا تضيف شيئًا.
الـ mid-training يختصر الطريق إلى نموذج عربي أقوى دون تكلفة البناء من الصفر، لكنه يُبقي الأساس نموذجًا يملكه غيرك، ولم تُنشر بعد أرقام تقيس نتيجته.
الشركة التي جعلت الأوزان المفتوحة أمرًا معتادًا عبر Llama طرحت أقوى نماذجها البرمجية مغلقًا، والبناء العربي القائم على النماذج المفتوحة معني مباشرة بهذا الاتجاه.
الوصول إلى أقوى النماذج صار يُفتح ويُغلق بقرارات تُتخذ بين شركة وحكومات، وفرق الأسعار بين نماذج العائلة الواحدة يصل إلى 5 أضعاف.
حين يقترب نموذج مفتوح من أداء أقوى النماذج بخُمس التكلفة، يصبح توزيع المهام بين النماذج حسب صعوبتها هو ما يحدد فاتورة الـ API، لا اختيار نموذج واحد.
حين يقترب النموذج الأرخص من أداء الأغلى، تصبح مهام كانت تحتاج ميزانية كبيرة في متناول الفرق الصغيرة، ويصبح اختيار النموذج قرار تكلفة قبل أن يكون قرار جودة.
نسخة بحجم 34 مليار معامل تتقدم على نماذج بضعف حجمها في العربية، ما يعني أن الجودة في اللغة لا تُشترى بالحجم وحده، وأن هناك خيارات عربية مفتوحة قابلة للاستخدام الآن.