OpenAI تطلق GPT-Live لمحادثة صوتية full-duplex تسمع وتتكلم في الوقت نفسه
حين تتحول الواجهة من الكتابة إلى الكلام، يصبح السؤال هل يفهم النموذج العربية المنطوقة لا المكتوبة، والفجوة هناك في بيانات العامية المفرّغة.
أعلنت OpenAI في 8 يوليو 2026 عن GPT-Live، وهو جيل جديد من نماذج الصوت مبني على معمارية full-duplex. ويأتي في نسختين: GPT-Live-1 للمشتركين في الخطط المدفوعة Go وPlus وPro، وGPT-Live-1 mini للمستخدمين المجانيين. ولم تُتح له واجهة API بعد.
والأنظمة الصوتية المعتادة تعمل بنمط half-duplex، أي قناة واحدة واتجاه واحد في كل مرة. يتكلم المستخدم فينتظر النظام، ثم يقدّر أنه انتهى، ثم يفكر ويرد. وإذا قاطعه المستخدم أثناء الرد فهو لا يسمعه أصلًا، لأنه في وضع الكلام لا الاستماع. ولهذا تشبه هذه المحادثات الحديث عبر جهاز لاسلكي، لكل طرف دوره ولا تداخل.
أما full-duplex فتعني أن القناتين تعملان معًا، فيسمع النظام وهو يتكلم. ويتيح ذلك أن يُصدر إشارات متابعة أثناء كلام المستخدم، وأن يسكت حين يتوقف المستخدم للتفكير، وأن يتوقف إذا قوطع ثم يكمل من النقطة الجديدة. والصعوبة التقنية ليست في السمع والكلام معًا، بل في القرار الذي يجب اتخاذه كل جزء من الثانية: هل هذه مقاطعة، أم مجرد إشارة إلى أن المستخدم يتابع.
ويعمل GPT-Live بنموذج GPT-5.5 في الخلفية. وإذا احتاج سؤال إلى بحث أو تفكير أعمق، يحيله إلى نموذج أقوى ثم يعود بالإجابة وسط المحادثة، فيفصل بذلك سرعة الرد عن عمق التفكير.
وبالنسبة للمستخدم العربي، يغيّر انتقال الواجهة إلى الصوت طبيعة السؤال. فلم يعد السؤال هل يفهم النموذج العربية، بل هل يفهم العربية المنطوقة. والعربية المكتوبة، ومعظمها فصحى، متاحة بكميات ضخمة. أما المنطوقة فعامية، والمفرّغ منها قليل لأن التفريغ عمل يدوي مكلف. ويزيد على ذلك خلط العربية بالإنجليزية في الجملة الواحدة، كما في “الـ meeting اتأجل”.
وتشير هذه الصورة إلى أن الفجوة ليست في النماذج نفسها، بل في بيانات الكلام العامي المفرّغ. ومن يملك هذه البيانات يملك أصلًا نادرًا مع تحوّل الواجهات إلى الصوت. وتوجد مصادر مفتوحة في هذا الاتجاه، منها نموذج Cohere Transcribe Arabic، ومنصة Fanar، ومجموعة بيانات SADA.
المصادر
من عدد الجمعة 25 محرم - 10 يوليو