ذكاء اصطناعيقراءة دقيقتين

Google تطلق نموذجي gemini-3.5-transcribe للتفريغ الصوتي مع كشف اللغة على مستوى كل جملة

المغزى

الاجتماعات التقنية العربية تخلط العربية بالإنجليزية داخل الجملة الواحدة، والنموذج الذي يحدد اللغة مرة واحدة للملف كله يتعثر فيها. الكشف لكل جملة يغير طريقة العمل من الأساس.

أطلقت Google رسميًا في 26 أغسطس 2026 نموذجين للتفريغ الصوتي ضمن Gemini API. الأول gemini-3.5-transcribe، ويعمل على الملفات المسجلة. والثاني gemini-3.5-transcribe-live، ويعمل على البث المباشر عبر WebSockets من خلال الـ Live API.

وأبرز ما في الإعلان أن كشف اللغة يجري على مستوى النطق (utterance)، أي على مستوى كل جملة منطوقة، لا على مستوى الملف كله. وتقول Google إنه يغطي أكثر من 85 لغة.

ولهذه التفصيلة أهمية خاصة في المنطقة العربية. فالاجتماعات التقنية فيها نادرًا ما تجري بلغة واحدة، إذ يتنقل المتحدث بين العربية والإنجليزية داخل الجملة نفسها، كأن يطلب مراجعة الـ pull request قبل أي شيء آخر بجملة نصفها عربي ونصفها مصطلحات إنجليزية.

والنموذج الذي يحدد اللغة مرة واحدة للملف بأكمله يتعثر في هذه الحالة: إما أن يفرّغ العربية جيدًا ويخطئ في الإنجليزية، وإما العكس. أما الكشف على مستوى كل جملة فيسمح له بالتبديل داخل الحديث، وهذا اختلاف في طريقة العمل لا مجرد تحسين في الدقة.

ويضم النموذجان أيضًا الميزات المعتادة في هذا النوع من الأدوات: فصل المتحدثين، وتوقيت كل كلمة، وقاموسًا مخصصًا تُضاف إليه أسماء المنتجات حتى لا تُكتب خطأ.

لكن ما لم يتضح بعد هو الأداء مع اللهجات. فدعم “أكثر من 85 لغة” لا يعني بالضرورة فهم العامية المصرية أو اللهجات الخليجية، ولم تُنشر نتائج اختبار عليها حتى الآن.

المصادر

  1. سجل تغييرات Gemini API، مدخل 26 أغسطس 2026
  2. توثيق التفريغ الصوتي في Gemini API
  3. توثيق الـ Live API للبث المباشر
  4. Google AI Studio
  5. صفحة أسعار Gemini API

من عدد الثلاثاء 19 ربيع الأول - 1 سبتمبر

أخبار ذات صلة

أخبار الثلاثاء 19 ربيع الأول - 1 سبتمبر