z.ai تشغّل GLM-5.3-Flash على أكثر من 100,000 شريحة صينية وتقول إن تكلفة الـ token تقارب Nvidia
إن صحّت أرقام z.ai، فسعر الـ token لم يعد مربوطًا بمورّد شرائح واحد، وأي طريق بديل للحوسبة يظهر أثره في النهاية على فواتير من يبنون فوق هذه النماذج.
نشرت z.ai، المعمل الصيني المطور لنماذج GLM، يوم 17 سبتمبر 2026 مقالًا بعنوان Toward Recursive Self-Improvement: How GLM Built Its Own Inference Infrastructure. ويشرح فيه كيف شغّل نموذج GLM-5.3-Flash بالكامل على عنقود من أكثر من 100,000 شريحة ذكاء اصطناعي صينية الصنع، دون Nvidia.
وبحسب z.ai، طُرح النموذج أولًا على منصتي OpenCode وOpenRouter دون الكشف عن هويته، باسم Ox-Alpha، وأصبح خلال أسبوع الأكثر استخدامًا على المنصتين، بمعالجة أكثر من 62 تريليون token في ستة أيام. ولا يذكر المقال اسم الشركة المصنعة للشرائح، ولا أي رقم للتكلفة بالدولار.
كيف شُغّل النموذج
تتميز هذه الشرائح بذاكرة وbandwidth أقل، ومكتبات kernels ناقصة، ووثائق غير مكتملة. ولذلك اعتمد الفريق على الضغط: quantization بصيغة W8A8، وذاكرة cache تمزج بين INT8 وFP8 وBF16، وفصل مراحل الـ Encode والـ Prefill والـ Decode عن بعضها.
والجزء الذي تسميه z.ai بداية الـ Recursive Self-Improvement، أي تحسين النظام لنفسه، هو أن معظم هذا العمل أنجزه Infra Agent يعمل بنموذج GLM-5.3 نفسه. وتقول الشركة إن المدة من أول تشغيل ناجح إلى بيئة الإنتاج كانت أقل من أسبوعين، وإن أداء الخدمة الإجمالي تحسّن بنحو 3 أضعاف، وإن كفاءة استخدام العتاد وتكلفة الـ token وصلتا إلى مستويات مماثلة لبطاقات Nvidia الشائعة.
هذه الأرقام صادرة عن z.ai نفسها، ولم يُعِد طرف مستقل قياسها حتى الآن.
إن ثبتت، فالمعنى أن تكلفة الـ token التي يدفعها المطورون اليوم، والمرتبطة إلى حد كبير بشركة شرائح واحدة، قد يصبح لها مسار بديل. وأثر ذلك لا يظهر في المعامل بقدر ما يظهر في فواتير الشركات التي تبني منتجاتها على هذه النماذج. ويبقى موقع المنطقة العربية من هذا السباق سؤالًا مفتوحًا، وهي تبني على نماذج لا تملكها وتستأجر حوسبة لا تملكها.