Financial Times: ByteDance تدرّب نموذجًا بحجم 10 تريليون parameter
رقم الـ parameters الإجمالي يصف حجم المخزن لا حجم العمل، ولا يقول شيئًا عن التكلفة أو السرعة أو جودة فهم العربية، والنموذج نفسه لم يوجد بعد.
نشرت صحيفة Financial Times في 7 أغسطس 2026، نقلًا عن 3 مصادر مطلعة، أن ByteDance تجري pre-training لنموذج يصل حجمه إلى 10 تريليون parameter، عبر فريق Seed الذي يضم نحو 2,000 شخص.
ويعادل هذا الرقم نحو 3 أضعاف Kimi K3 البالغ 2.8 تريليون، ويتجاوز Mythos 5 من Anthropic البالغ 8 تريليون. لكن أمرين يغيّران معنى الرقم.
الأول أن أغلب هذه النماذج من نوع Mixture-of-Experts، أي أنها مقسمة إلى أجزاء متخصصة، ولا يعمل منها على كل token إلا جزء صغير. فنموذج Qwen3.8-Max مثلًا يبلغ حجمه الإجمالي 2.4 تريليون parameter، لكن 95 مليارًا فقط تنشط لكل token. أي أن الرقم الإجمالي يصف حجم المخزن، لا حجم العمل الفعلي.
والثاني أن النموذج ما زال في مرحلة الـ pre-training، وهي مرحلة تستغرق عادة من 3 إلى 6 أشهر، يليها fine-tuning، ثم قد يُطلق وقد لا يُطلق. أي أن الحديث يدور عن شيء لم يوجد بعد.
ومع ذلك ينتشر الرقم كأنه إنجاز محقق، وهو في الحقيقة نية معلنة عبر مصادر مجهولة.
ويهم هذا التمييز القارئ العربي تحديدًا، لأن كثيرًا مما يُكتب بالعربية عن هذه النماذج يكتفي بترجمة العنوان والرقم. وعند اختيار نموذج لمنتج ما، لا يقول عدد الـ parameters شيئًا عن تكلفة الاستخدام، ولا عن السرعة، ولا عن مدى إتقان النموذج للغة العربية. هذه أسئلة تجيب عنها لوحات المقارنة القائمة على الأداء الفعلي، لا الأرقام المعلنة قبل الإطلاق.
ولا يُعرف بعد إن كان النموذج سيخرج قويًا أم لا، ولا متى سيخرج، إن خرج أصلًا.
المصادر
من عدد الأحد 26 صفر - 9 أغسطس