ذكاء اصطناعيقراءة دقيقتين

OpenAI تطلق GPT-Live لمحادثة صوتية full-duplex تسمع وتتكلم في الوقت نفسه

المغزى

حين تتحول الواجهة من الكتابة إلى الكلام، يصبح السؤال هل يفهم النموذج العربية المنطوقة لا المكتوبة، والفجوة هناك في بيانات العامية المفرّغة.

أعلنت OpenAI في 8 يوليو 2026 عن GPT-Live، وهو جيل جديد من نماذج الصوت مبني على معمارية full-duplex. ويأتي في نسختين: GPT-Live-1 للمشتركين في الخطط المدفوعة Go وPlus وPro، وGPT-Live-1 mini للمستخدمين المجانيين. ولم تُتح له واجهة API بعد.

والأنظمة الصوتية المعتادة تعمل بنمط half-duplex، أي قناة واحدة واتجاه واحد في كل مرة. يتكلم المستخدم فينتظر النظام، ثم يقدّر أنه انتهى، ثم يفكر ويرد. وإذا قاطعه المستخدم أثناء الرد فهو لا يسمعه أصلًا، لأنه في وضع الكلام لا الاستماع. ولهذا تشبه هذه المحادثات الحديث عبر جهاز لاسلكي، لكل طرف دوره ولا تداخل.

أما full-duplex فتعني أن القناتين تعملان معًا، فيسمع النظام وهو يتكلم. ويتيح ذلك أن يُصدر إشارات متابعة أثناء كلام المستخدم، وأن يسكت حين يتوقف المستخدم للتفكير، وأن يتوقف إذا قوطع ثم يكمل من النقطة الجديدة. والصعوبة التقنية ليست في السمع والكلام معًا، بل في القرار الذي يجب اتخاذه كل جزء من الثانية: هل هذه مقاطعة، أم مجرد إشارة إلى أن المستخدم يتابع.

ويعمل GPT-Live بنموذج GPT-5.5 في الخلفية. وإذا احتاج سؤال إلى بحث أو تفكير أعمق، يحيله إلى نموذج أقوى ثم يعود بالإجابة وسط المحادثة، فيفصل بذلك سرعة الرد عن عمق التفكير.

وبالنسبة للمستخدم العربي، يغيّر انتقال الواجهة إلى الصوت طبيعة السؤال. فلم يعد السؤال هل يفهم النموذج العربية، بل هل يفهم العربية المنطوقة. والعربية المكتوبة، ومعظمها فصحى، متاحة بكميات ضخمة. أما المنطوقة فعامية، والمفرّغ منها قليل لأن التفريغ عمل يدوي مكلف. ويزيد على ذلك خلط العربية بالإنجليزية في الجملة الواحدة، كما في “الـ meeting اتأجل”.

وتشير هذه الصورة إلى أن الفجوة ليست في النماذج نفسها، بل في بيانات الكلام العامي المفرّغ. ومن يملك هذه البيانات يملك أصلًا نادرًا مع تحوّل الواجهات إلى الصوت. وتوجد مصادر مفتوحة في هذا الاتجاه، منها نموذج Cohere Transcribe Arabic، ومنصة Fanar، ومجموعة بيانات SADA.

المصادر

  1. إعلان OpenAI الرسمي عن GPT-Live
  2. تغطية TechCrunch
  3. تغطية SiliconANGLE
  4. نموذج Cohere Transcribe Arabic على Hugging Face
  5. موقع Fanar من QCRI
  6. مجموعة بيانات SADA السعودية على Kaggle
  7. بحث يرسم خريطة تقنيات الصوت العربي

من عدد الجمعة 25 محرم - 10 يوليو

أخبار ذات صلة

ذكاء اصطناعي

Google تطلق نموذجي gemini-3.5-transcribe للتفريغ الصوتي مع كشف اللغة على مستوى كل جملة

الاجتماعات التقنية العربية تخلط العربية بالإنجليزية داخل الجملة الواحدة، والنموذج الذي يحدد اللغة مرة واحدة للملف كله يتعثر فيها. الكشف لكل جملة يغير طريقة العمل من الأساس.

19 ربيع الأول - 1 سبتمبر

أخبار الجمعة 25 محرم - 10 يوليو