ذكاء اصطناعيقراءة دقيقتين

Tencent تطلق EVIE بترخيص Apache 2.0 للبحث في المستندات المصوّرة دون OCR

المغزى

البحث في الوثائق الممسوحة ضوئيًّا لم يعد يمر بخطوة الـ OCR، وهي أضعف حلقة في النصوص العربية، وأصبح فهرس مليون صفحة في حدود 3.81 جيجابايت.

نشرت Tencent في 7 سبتمبر 2026 على Hugging Face نموذجًا باسم EVIE للبحث داخل المستندات المصوّرة، بنسختين: 8B و4.5B، وبترخيص Apache 2.0 المفتوح.

الطريقة المعتادة للبحث في ملف PDF مصوّر تمر بثلاث خطوات: OCR لاستخراج النص من الصورة، ثم تحويل النص إلى embeddings، أي تمثيلات رقمية تسمح بالبحث بالمعنى، ثم البحث نفسه. والخطوة الأولى هي نقطة الضعف في النصوص العربية تحديدًا، لأن أي خطأ في قراءة السطر ينتقل إلى كل ما يُبنى عليه.

كيف يعمل النموذج

يتخطى EVIE خطوة الـ OCR كليًّا. فهو يحوّل صورة الصفحة نفسها إلى embedding، ويحتفظ بمتّجه لكل جزء منها بدل ضغط الصفحة كلها في متّجه واحد. وبذلك تبقى الجداول والعناوين وموضع الكلمة في الصفحة حاضرة في التمثيل، ولا تضيع في التحويل إلى نص.

وبحسب بطاقة النموذج، سجّل EVIE نتيجة 66.75 على اختبار ViDoRe V3، في المركز الأول على قائمته، و92.18 على النسختين V1 وV2.

أما التغيير الأكبر فيتعلق بالتخزين. فهذا النوع من التمثيل يستهلك عادة نحو 750 متّجهًا للصفحة الواحدة، وهو ما يجعل الفكرة مكلفة. ويتضمن EVIE خطوة ضغط تخفض العدد إلى 32 متّجهًا، فيصبح فهرس مليون صفحة في حدود 3.81 جيجابايت.

ويبقى تحفظ أساسي: اختبار ViDoRe لا يتضمن نصوصًا عربية. فهذه الأرقام لا تثبت أداء النموذج على العربية، لكنها تشير إلى أن المسار الذي يتخطى الـ OCR أصبح الأقوى في هذا النوع من البحث.

وفي المنطقة العربية أرشيفات ورقية كثيرة مصوّرة منذ سنوات ولم تُفهرس، لأن كلفة فهرستها كانت أعلى من قيمتها. ومع نموذج مفتوح بهذا الحجم من التخزين، تصبح تجربة فهرستها أقل كلفة بكثير.

المصادر

  1. بطاقة نموذج EVIE-8B على Hugging Face
  2. بطاقة نموذج EVIE-4.5B على Hugging Face
  3. الكود على GitHub

من عدد الاثنين 25 ربيع الأول - 7 سبتمبر

أخبار ذات صلة

أخبار الاثنين 25 ربيع الأول - 7 سبتمبر