ذكاء اصطناعيقراءة دقيقتين

اختبار على 16 نموذجًا: جملة واحدة في الـ prompt خفضت الحقول المختلقة في استخراج البيانات من 70.7% إلى 20.2%

المغزى

من يستخرج بيانات بنموذج لغوي دون تعليمة صريحة للحقول الغائبة قد يحصل على حقل مختلق من كل ثلاثة حقول ناقصة، بشكل سليم لا يلفت النظر. وخدمة مدفوعة واحدة كانت أسوأ من معظم النماذج.

نُشر في 27 سبتمبر 2026 اختبار شمل 16 نموذجًا لغويًا وثلاث خدمات مدفوعة لاستخراج البيانات من صفحات الويب، حول سؤال واحد: ماذا يفعل النظام حين لا تكون المعلومة المطلوبة موجودة في الصفحة؟

وجاءت النتيجة أن النماذج اختلقت 405 حقول من أصل 573 حقلًا ناقصًا، أي 70.7%. ثم أضاف صاحب الاختبار جملة واحدة إلى الطلب: Use null for any field whose value is not on the page. Do not guess. فانخفض العدد إلى 116 من 574، أي 20.2%.

وما يمنح الرقم وزنه هو طريقة الاختبار. فكل فخ مكوّن من صفحتين متطابقتين لا يفرق بينهما إلا سطر واحد: إحداهما تحتوي الإجابة والأخرى لا. وفي الصفحتين الطُّعم نفسه، مثل سعر قديم مكتوب “Was $493.00”، أو اسم مراجع ليس هو المؤلف. ومن دون الجملة الإضافية، قالت النماذج الـ 16 كلها إن السعر هو 493، ومع الجملة لم يقلها إلا نموذج واحد.

وأكثر النتائج إحراجًا لخدمة مدفوعة. فقد اختلقت Firecrawl، وهي خدمة استخراج بيانات مدفوعة، 24 حقلًا من 36، ونقلت الطُّعم كما هو في الحقول الـ 24 جميعها. وبذلك اختلقت أكثر من 13 نموذجًا من الـ 16، بينها نماذج مفتوحة رخيصة مثل GLM 5.3 وDeepSeek V4.1 Flash التي اختلقت ما بين حقل وثلاثة حقول.

ولهذه النتائج حدود يذكرها صاحب الاختبار نفسه: هي تشغيلة واحدة، على صفحات مصنوعة ومزروعة بالفخاخ عمدًا، لا على الويب الحقيقي.

ومع ذلك، يعني الرقم أن أي نظام يستخرج بيانات بنموذج لغوي دون تعليمة مماثلة قد يملأ نحو حقل من كل ثلاثة حقول ناقصة بقيمة مختلقة، والقيمة المختلقة تبدو في شكلها سليمة تمامًا، فلا تلفت نظر أحد.

المصادر

  1. صفحة الاختبار وجدول النتائج الكامل
  2. نقاش الاختبار على Hacker News

من عدد الاثنين 17 ربيع الآخر - 28 سبتمبر

أخبار ذات صلة

أخبار الاثنين 17 ربيع الآخر - 28 سبتمبر