Tencent تفتح مصدر AuK، نموذج صوت بحجم 1.5B بترخيص MIT يجمع مهام عدة أدوات
نموذج واحد مفتوح يعدّل الكلام المسجّل وينظّفه ويحوّل النص إلى صوت، وقد يخفض تكلفة إنتاج المحتوى الصوتي إذا ثبت أداؤه بالعربية، وهو ما لم تذكره بطاقته.
فتحت Tencent في 7 سبتمبر 2026 مصدر نموذج AuK، وهو نموذج أساسي للصوت حجمه 1.5B، بترخيص MIT. ومعه نسخة مقطّرة اسمها AuK-Flash تُنهي التوليد في 4 خطوات فقط.
وما يميّز النموذج أنه يتلقى الأوامر بلغة طبيعية. فبدل أن تكون لكل مهمة أداة وواجهة مستقلة، تُنفَّذ المهام كلها بالنموذج نفسه. وتشمل، بحسب البطاقة الرسمية:
- تحويل النص إلى صوت بنبرة شخص من عيّنة قصيرة، أو بوصف الصوت بالكلام دون عيّنة.
- تعديل المحتوى: استبدال كلام مسجّل أو إضافته أو حذفه دون إعادة التسجيل، وتعديل كلمات أغنية مع الحفاظ على اللحن.
- تعديل خصائص الصوت: الطبقة والسرعة ومستوى الصوت.
- تعديل غير لفظي: المشاعر والطابع الصوتي وإزالة اللهجة وإضافة الأنفاس والضحك أو حذفها.
- التنظيف والفصل: إزالة الضوضاء والصدى، وفصل المتكلمين، وفصل الغناء عن الموسيقى.
وترخيص MIT هو ما يصنع الفرق العملي هنا، إذ يسمح باستخدام النموذج في منتج تجاري دون إذن ودون مقابل.
وتكمن أهمية ذلك في أن كلفة المحتوى الصوتي لا تأتي من التسجيل الأول، بل من التعديل. فأي تعديل صغير كان يعني إعادة التسجيل، وإعادة التسجيل تعني استوديو ووقتًا ومالًا. ونموذج يستبدل كلمة داخل تسجيل قائم يغيّر هذه المعادلة.
لكن البطاقة الرسمية لا تذكر اللغات المدعومة. ولذلك لا يمكن الجزم بجودة أدائه بالعربية قبل تجربته فعليًا، والعرض التجريبي متاح مجانًا على Hugging Face لهذا الغرض.