Anthropic تخفّض قراءة الـ cache في Sonnet 5.5 للنصف، وHaiku 5.5 يضاعف سعره فوق 100,000 token
المغزى: في Haiku 5.5 تُحسب قراءات الـ cache ضمن طول الـ prompt، فالـ cache الذي يُضاف للتوفير قد يدفع الطلب فوق الحد، فيُسعّر الطلب كله بخمسة أضعاف.
خفّضت Anthropic سعر قراءة الـ cache في Claude Sonnet 5.5 من 0.20 إلى 0.10 دولار لكل مليون token. وتقول ملاحظات إصدار الـ API بتاريخ 7 أكتوبر 2026 إن هذا هو التغيير الوحيد، وإن أسعار كتابة الـ cache وباقي الأسعار لم تتغير.
والسبب تغيّر المضاعِف. فقراءة الـ cache كانت تُسعّر بـ 0.1 من سعر الدخل، وصارت على Sonnet 5.5 وOpus 5.5 بـ 0.05، بينما بقيت باقي الموديلات على 0.1. وسعر الدخل في Sonnet 5.5 دولاران للمليون، والخرج 10. وفي Opus 5.5 الدخل 4 دولارات وقراءة الـ cache 0.20.
ولهذا البند وزن عند من يشغّل agent. فالـ system prompt وتعريفات الأدوات وسجل المحادثة يُعاد إرسالها في كل خطوة، لذلك تشكّل قراءات الـ cache أغلب فاتورة الدخل.
الحد في Claude Haiku 5.5
جدول أسعار Haiku 5.5 فيه صفّان حسب طول الـ prompt. حتى 100,000 token يكون الدخل 0.10 دولار والخرج 0.50 وقراءة الـ cache 0.01 لكل مليون. وفوق 100,000 يصبح الدخل 0.50 والخرج 2.50 وقراءة الـ cache 0.05، أي خمسة أضعاف في البنود الثلاثة.
وتنص صفحة الأسعار، في قسم Long context pricing، على أن طول الـ prompt يُحسب بكل الـ tokens الداخلة، بما فيها قراءات الـ cache وكتاباته. فالـ cache الذي يُضاف لخفض التكلفة يدخل في الحساب الذي قد يرفع الطلب فوق الحد.
وتنص الصفحة أيضًا على أن كل طلب يُسعّر وحده، وأن الطلب الذي يتجاوز الحد يدفع الأسعار الأعلى حتى لو كان جزء منه cache hit. فالفرق بين طلب من 99,000 token وطلب من 101,000 لا يكون 2% في التكلفة، بل خمسة أضعاف على الطلب كله.
وسبق أن أطلقت Anthropic موديل Haiku 5.5 بسعر مطابق لـ GPT-6 Luna، لكن هذا البند لا يظهر في إعلانات الإطلاق، بل في صفحة الأسعار. ويعني ذلك أن الفاتورة الفعلية لتطبيقات الـ agents تتوقف على متوسط طول الطلب أكثر مما يتوقف على السعر المعلن في السطر الأول من الجدول.