Google تطلق Gemini 3.8 Live للمحادثة الصوتية بسعر 0.018 دولار لدقيقة الكلام
ساعة كلام كاملة من agent صوتي تكلف نحو دولار واحد، مع تبديل تلقائي بين 97 لغة في منتصف المكالمة، وهو ما كان يكسر المساعدات الصوتية مع العربية المختلطة بالإنجليزية.
أعلنت Google في 15 سبتمبر 2026 عن نموذجين للمحادثة الصوتية المباشرة: Gemini 3.8 Live وGemini 3.8 Live Extended Thinking.
وبحسب صفحة التسعير الرسمية، يكلف الصوت الداخل 3 دولارات لكل مليون token، أو 0.005 دولار للدقيقة، ويكلف الصوت الخارج 12 دولارًا لكل مليون token، أو 0.018 دولار للدقيقة. أما النص فسعره 0.75 دولار للمليون داخلًا و4.50 دولار خارجًا. وتتوفر طبقة مجانية تتيح التجربة من AI Studio. وبحساب مباشر، تكلف ساعة كاملة من الكلام الصادر عن النموذج نحو 1.08 دولار.
الجديد في نسخة Extended Thinking أن النموذج يفكر أثناء الكلام، بدل أن يصمت ليفكر ثم يرد، ويستخدم عبارات مثل “دعني أرى” لتغطية لحظة التفكير، كما يفعل الناس في المكالمات الهاتفية.
97 لغة في مكالمة واحدة
تقول Google إن النموذج يدعم 97 لغة، مع تبديل تلقائي بينها في منتصف المكالمة وثبات اللهجة. وهذه النقطة تحديدًا تهم المنطقة العربية، إذ يمزج كثير من المتحدثين العربية بالإنجليزية داخل الجملة الواحدة، وكان ذلك من أكثر ما يُفشل المساعدات الصوتية بالعربية.
وتذكر Google نتائج على عدة اختبارات: 82.6 على مؤشر Speech to Speech Quality من Artificial Analysis، و68.6% على τ-Voice، و35.1% على τ-Voice-banking، و97.7% على Big Bench Audio. وهذه أرقام أعلنتها الشركة عن نموذجها، ولم يقسها طرف مستقل بعد. ولم تنشر Google حجم الـ context window لنماذج Live على صفحة النماذج.
ما يتغير هنا اقتصادي قبل أن يكون تقنيًا. فخدمة عملاء صوتية كانت تحتاج فريقًا كاملًا، قد تصبح مسألة كتابة تعليمات وحساب دقائق، بشرط أن يصمد الأداء الفعلي بالعربية أمام القياس المستقل.