مقالة Tokens too cheap to meter: تكلفة التوكن تنخفض نحو 2.5 رتبة عشرية سنويًا
إذا صار استدعاء النموذج أرخص من تشغيل كود عادي، فالمنتج الذي تقوم ميزته على غلاء الوصول إلى النماذج له تاريخ انتهاء، والرخص يُدفع ثمنه في الاعتماد على المزوّد.
تصدرت مقالة بعنوان “Tokens too cheap to meter” على موقع jyn.dev موقع Hacker News في 23 سبتمبر 2026، بـ 331 نقطة. وتقول المقالة إن تكلفة الـ inference، أي تشغيل النموذج للحصول على إجابة، تنخفض بنحو 2.5 رتبة عشرية في السنة. أي أن العمل نفسه يكلف كل عام جزءًا من نحو 300 من تكلفته في العام السابق.
وهذه الأرقام تقديرات الكاتب واتجاهات عامة، وليست أسعارًا منشورة من مزود بعينه.
وتفكك المقالة هذا الانخفاض إلى ثلاثة مصادر يتضاعف أثرها معًا:
- كفاءة الـ GPU تتضاعف كل سنتين تقريبًا.
- النماذج أصبحت أكفأ بنحو 100 مرة لكل مهمة.
- معمارية MoE، التي تشغّل جزءًا فقط من النموذج لكل طلب، تسمح بوضع 5 أضعاف التوكنز في الذاكرة نفسها.
والنتيجة التي يتجه إليها الكاتب أن استدعاء النموذج حين يصبح أرخص من تشغيل كود عادي، تنقلب الحسابات كلها. فلا يعود الذكاء الاصطناعي ميزة إضافية بسعر أعلى، بل جزءًا من البنية الأساسية مثل قاعدة البيانات.
ولهذا أثر مباشر على منتجات SaaS. فالمنتج الذي تقوم ميزته التنافسية على أن الوصول إلى النماذج مكلف وأنه حل هذه المشكلة، قد تكون لميزته تاريخ انتهاء. ومن يؤجل فكرة بسبب غلاء الـ inference قد يكون يحسب بأسعار العام الماضي.
لكن الكاتب يضيف أن الخنادق التنافسية في البرمجيات تضعف، وأن القيمة في النهاية تذهب إلى من يملك العتاد والسحابة. أي أن هذا الرخص ليس مجانيًا، بل يُدفع ثمنه في صورة أخرى: اعتماد أعمق على مزود واحد.