استقلال تقنيقراءة دقيقتين

قياس ByteShape لنسخ Qwen 3.8 27B المضغوطة يُظهر فروقًا تقل عن 1% في الجودة

المغزى

في تشغيل النماذج محليًا، القرار الحاسم ليس اختيار النموذج بل اختيار نسخته المضغوطة، وهو الطريق الوحيد المتاح لمن لا يملك وسيلة دفع دولية.

نشرت ByteShape في 14 سبتمبر 2026 قياسًا لنموذج Qwen 3.8 27B، وحدّثته في 18 سبتمبر، ووصل إلى Hacker News في اليوم نفسه. شمل القياس 5 نسخ مضغوطة بصيغة GGUF، على 6 بطاقات رسوميات: RTX 3090 و4080 و4090 و5060 Ti و5090 وRTX Pro 6000.

وأبرز الأرقام أن النسخة المسماة GPU-5 تحقق 99.63% من جودة النسخة الأصلية بدقة BF16، بينما تحقق النسخة GPU-4 نسبة 98.72% في ملف أصغر بكثير.

ولفهم هذه الأرقام يلزم فهم الضغط نفسه. لكي يتسع نموذج كبير في ذاكرة بطاقة رسوميات عادية، تُخفَّض دقة الأرقام التي تمثل أوزانه، وهي عملية تسمى quantization. لكن طرق الضغط ليست متساوية. فقد توجد نسختان من النموذج نفسه، لا يتجاوز الفرق بينهما في الجودة 1%، بينما يبلغ الفرق في الحجم عدة جيجابايت.

ومعنى ذلك أن القرار الذي يتخذه من يشغّل نموذجًا محليًا ليس بين نموذج كبير وآخر صغير، بل بين نسختين من النموذج نفسه، قد تفقد إحداهما جزءًا من قدرته دون مكسب يستحق.

وللمسألة بعد يتجاوز الأداء. نموذج صيني مفتوح، يعمل على بطاقة يملكها صاحبها داخل شبكته الخاصة، لا يحتاج إلى بطاقة دفع أجنبية، ولا تخرج بياناته من مكانها. وبالنسبة لمن لا يملك وسيلة دفع دولية في المنطقة، قد يكون هذا المسار هو المتاح فعليًا للوصول إلى نموذج بهذه القدرة.

المصادر

  1. قياس ByteShape الكامل بكل النسخ والبطاقات

من عدد الأحد 9 ربيع الآخر - 20 سبتمبر

أخبار ذات صلة

أخبار الأحد 9 ربيع الآخر - 20 سبتمبر