Tencent تطلق HunyuanOCR-1.5 مفتوح الأوزان لقراءة المستندات محليًا عبر llama.cpp
معالجة المستندات على جهاز الفريق نفسه تُسقط تكلفة كل صفحة وتُبقي الوثيقة داخل الشركة. لكن صفحة النموذج لا تذكر العربية بالاسم، ولم تُختبر عليها بعد.
نشرت Tencent نموذج HunyuanOCR-1.5 مفتوح الأوزان على Hugging Face، وآخر تحديث لبطاقته في 28 أغسطس 2026. وهو نموذج OCR صغير ومتخصص يعمل من البداية إلى النهاية (end-to-end)، ويجمع في نموذج واحد عدة مهام: تحليل المستندات (document parsing) لاستخراج النص والجداول والمعادلات، ورصد النص داخل الصور، واستخراج حقول محددة، وترجمة النص المكتوب داخل الصورة نفسها.
والجانب العملي أن النموذج يعمل عبر llama.cpp بصيغة GGUF، أي على معالج CPU أو بطاقة رسومات عادية، دون حاجة إلى خادم. ويقرأ صورًا حتى دقة 4K، بسياق يصل إلى 128 ألف token.
ويغير ذلك معادلة العمل مع المستندات. فالنمط الشائع اليوم أن تمر كل ورقة عبر API خارجي، فيُدفع مقابل كل صفحة، وتنتقل الوثيقة نفسها إلى خادم لا يملكه صاحبها. أما التشغيل المحلي فيُسقط بند التكلفة هذا، ويُبقي المستند داخل الجهاز. وهذا فرق له وزنه حين تتضمن المستندات عقودًا أو فواتير أو بيانات عملاء.
لكن ما لم يتضح بعد هو دعم العربية. فبطاقة النموذج الرسمية تصفه بأنه multilingual، لكن اللغات المذكورة فيها بالاسم هي الإنجليزية والصينية فقط، ولا ذكر للعربية.
وبالتالي تبقى جودته على المستندات العربية، المطبوعة منها والمكتوبة بخط اليد، سؤالًا مفتوحًا لم تُنشر عنه نتائج حتى الآن، وهو ما سيحدد قيمته الفعلية للفرق في المنطقة.