# تجربة Quesma: نسخة 17 GB من Qwen3.8 27B تساوي النسخة الكاملة على Terminal-Bench

> **المغزى:** الخلاف حول ضرر الضغط على النماذج يحسمه عدد الـ bits: عند 4 bits لا فرق يُذكر ويكفي كارت واحد، وعند 1 bit ينهار النموذج.

- المصدر: المغزى (https://almaghza.com/a/2026-09-09-quesma-qwen-quantization-benchmark/)
- التاريخ: 27 ربيع الأول - 9 سبتمبر 2026 (2026-09-09)
- القسم: استقلال تقني
- الوسوم: Qwen، تشغيل النماذج محليًا، اختبارات الأداء، نماذج اللغة الكبيرة

نشرت Quesma تجربة كلّفت نحو 3,000 دولار من وقت الـ GPUs، ووصلت إلى صدارة Hacker News في 8 سبتمبر 2026. والسؤال الذي أرادت الإجابة عنه: هل يضر الـ quantization بجودة النموذج فعلًا؟

والـ quantization هو خفض دقة الأرقام التي تمثل أوزان النموذج، حتى يصغر حجمه ويتسع في ذاكرة بطاقة رسوميات عادية.

النموذج المختبر هو Qwen3.8 27B. نسخته الكاملة بدقة BF16 حجمها 55 GB، وهي خارج قدرة أي بطاقة عادية. وقارنت التجربة بينها وبين نسخ مضغوطة بأحجام متدرجة: Q8_0 بحجم 29 GB، وQ4_K_M بحجم 17 GB، وUD-Q2_K_XL بحجم 10.7 GB، وUD-IQ1_S بحجم 6.2 GB. واستُخدمت اختبارات GPQA Diamond وIFBench وTerminal-Bench 2.1.

النتيجة الأبرز أن نسخة Q4_K_M جاءت مساوية للنسخة الكاملة على Terminal-Bench 2.1، وهو اختبار يقيس تنفيذ مهام فعلية في الـ terminal لا الإجابة عن أسئلة معرفية. وتتسع هذه النسخة في بطاقة بذاكرة 24 GB مثل RTX 4090، مع مساحة متبقية لسياق يقارب 64 ألف token. فالـ KV-cache بدقة F16 يستهلك نحو 2.3 GB لكل 32 ألف token.

في الطرف الآخر يصل الضغط إلى حد. فعند 1 bit، جاءت إجابات النموذج على GPQA Diamond قريبة من مستوى التخمين العشوائي، وكان التفكير الأطول يزيد النتيجة سوءًا.

والتفسير أن خفض الدقة يبقى حتى نقطة معينة مجرد ضوضاء لا تؤثر في الإجابة. وبعدها قد يكسر توكن خاطئ واحد خطوة منطقية كاملة، ويُبنى كل ما يليها على الخطأ.

وتنبّه التجربة إلى تفاصيل عملية: استُخدمت نسخ Unsloth مع llama.cpp ببناء 16 أغسطس 2026، لأن البناءات الأقدم لا تعمل مع هذا النموذج. كما أن إعداد reasoning effort يؤثر كثيرًا، وقيمته الافتراضية xhigh قد تدفع النموذج إلى تفكير زائد.

وبهذه النتائج يصبح تشغيل نموذج بهذا المستوى محليًا ممكنًا على بطاقة واحدة، دون الاعتماد على API أجنبية تتطلب بطاقة دفع دولية.

## المصادر

- [التجربة كاملة على مدونة Quesma](https://quesma.com/blog/qwen38-27b-quantizations-benchmarked/)
- [نموذج Qwen3.8-27B على Hugging Face](https://huggingface.co/Qwen/Qwen3.8-27B)
