Cline 4.1.18 يغلق ثغرة على Windows كانت تشغّل ملفات تنفيذية مزروعة داخل المستودع
السلوك مصدره Windows نفسه لا أداة بعينها، فكل أداة تفتح مستودعًا وتشغّل أوامر داخله تقف في الموقع ذاته، في وقت أصبح فيه فتح مستودعات غريبة أمرًا يوميًا.
وسم
السلوك مصدره Windows نفسه لا أداة بعينها، فكل أداة تفتح مستودعًا وتشغّل أوامر داخله تقف في الموقع ذاته، في وقت أصبح فيه فتح مستودعات غريبة أمرًا يوميًا.
المسائل الرياضية هي أفضل حالة ممكنة للنماذج لأن مواصفاتها دقيقة، بينما معظم العمل البرمجي اليومي بلا مواصفة مكتوبة، وكتابتها أغلى من البناء نفسه.
حين يكتب الـ agent في ساعة ما كان يستغرق أسبوعًا ويبقى المراجع واحدًا، يتحول السؤال في الفرق من من يراجع إلى متى تحدث المراجعة.
رخصة Apache 2.0 تسمح بأخذ الكود وبيعه دون إذن، ولا تضمن لصاحبه في المقابل إلا بقاء اسمه في ملف NOTICE، وهذا الملف تحديدًا هو محل الخلاف.
القاسم المشترك في حوادث النماذج التي خرجت من بيئات الاختبار لم يكن النموذج بل الطبقة التي يُفترض أن تحبسه، والتعليمات المكتوبة لا تقوم مقام حدود الشبكة والصلاحيات.
تصميم التجربة يحدد الرقم قبل أن تبدأ، وقراءة المنهجية قبل النتيجة هي الفرق بين رأي مبني على قياس ورأي مبني على ظروف لا يعمل بها أحد.
حين يخطئ المقياس يغيّر الناس سلوكهم ليوافقه بدل أن يشكّوا فيه، وجلسات كثيرة قُطعت وهي لا تزال تملك نصف مساحتها.
أكبر خسائر الـ agent في مهمة طويلة جاءت من ضعف المتابعة لا من نقص الذكاء، والاختبار الذي يقيس ردًا واحدًا لا يكشف ما يحدث لـ agent يعمل أسبوعين.
الصلاحية صارت مرتبطة بالمهمة لا بالوقت، فالأمر الذي ينحرف أو يأتي من مصدر غير موثوق لا يصل إلا إلى ما احتاجه هو، لا إلى كل ما فُتح للجلسة.
الفرق الذي تكشفه التجربة ليس أن النموذج يعرف أكثر، بل أنه واصل العمل على مسألة واحدة 44 دقيقة حتى وصل إلى حل يثبت صحته بنفسه، دون تدخل بشري.
حين تُمنح أداة صلاحية الكتابة في المستودع، يصبح افتراض أنها تحفظ وتسترجع بشكل صحيح هو المنتج كله، وهذا الافتراض كان مكسورًا بصمت.
الفجوة بين أرقام إعلانات النماذج وأدائها على مستودعات الفرق الحقيقية قد لا تعود إلى صياغة الطلب، بل إلى أن الاختبارات الشهيرة مبنية على كود رآه النموذج أثناء تدريبه.
أكثر ما يفيد فيه الـ agent قد يكون قراءة النصوص الطويلة المملة واستخراج جملة مفيدة منها، لا كتابة الميزات التي تحتاج أكبر قدر من المراجعة.
الـ agents تتجاوز هذا الحد دون أن يلاحظ أحد، فتقفز الفاتورة دفعة واحدة بدل أن تزيد تدريجيًا، والحد مذكور في ملف الأسعار لا في الإعلانات.
الهجوم لم يستهدف من يثبّت الحزم بل الـ registry نفسه، وكل خطوة في الـ pipeline تقرأ ملفًا من حزمة مرفوعة وتنفذه هي مساحة هجوم كاملة.
الكود المترهل يعمل ويجتاز الاختبارات والمراجعة، لكن تكلفته تظهر في التعديل التالي لا في الـ PR الحالي، ولذلك يصعب رصدها دون مقياس.
صفحات أي منتج على الإنترنت صار لها جمهوران: من يقرأ ومن يحلل آليًا، والثاني يزور أكثر ويتصرف بناء على ما يجده دون أن يسأل.
قرارات معمارية كثيرة اتُّخذت هربًا من تكرار العمل، والـ agents غيّروا تكلفة هذا التكرار نفسه، فصار الرقم الذي بُنيت عليه تلك القرارات بحاجة إلى مراجعة.
نسب التوفير التي تعلنها الأدوات محسوبة على الجزء الذي تعمل عليه وحده، لا على الفاتورة كاملة، والفرق بين الرقمين قد يقلب النتيجة.
نسبة توفير بلا سعر أساس معلن لا تدخل في أي حساب، ونموذج بلا API مستقل ولا أوزان مفتوحة هو اشتراك في منتج أكثر منه نموذجًا يُبنى عليه.
وحدة العمل في أدوات البرمجة انتقلت من مهمة داخل محادثة إلى مشروع له عمر، وأدوات إدارة المشاريع ما زالت مبنية على افتراض أن إنسانًا يمسك الخطة.
كل أداة agent تعمل محليًا تفتح واجهة HTTP على الجهاز، وفي هذه الحالة كان وصف الطلب بأنه محلي كلمة يكتبها المرسل نفسه فتُصدَّق.
الطبقة التي كانت تستهلك أشهرًا من العمل في بناء أي agent صارت خدمة مؤجرة، لكن حالة الجلسات تنتقل معها إلى خوادم OpenAI، والعرض السابق أُغلق قبل أسابيع.
الأدوات التي تعمل فوق Git تغيرت كثيرًا خلال سنتين، بينما الطبقة التي تحتها عمرها عشرون عامًا، والـ agents التي تفتح فروعًا بالعشرات تكشف الفجوة.
انتشار النكتة يعكس تجربة يومية مع أدوات البرمجة الذكية: طلب صغير يعود بتعديلات لم تُطلب، فتصبح مراجعة التغييرات أطول من المهمة نفسها.
شركة بحجم Meta تعترف عمليًا بأن أمان الـ agent لا يتحقق بتعليمات في الـ prompt، بل بطبقة منفصلة مهمتها أن ترفض.
حين يُعطى الوكيل هدفًا مفتوحًا وصلاحيات واسعة، لا يفرّق بين قناة توزيع وقناة احتيال. الحماية الحقيقية هي الصلاحية التي لا يملكها أصلًا، لا التعليمات المكتوبة له.
الوكيل يفهم شكل الاختبار لا جوهره، والـ skills الكبيرة المضافة لتحسينه قد ترفع الفاتورة يوميًا دون أي تحسن في صحة الكود.
نسبة فشل 2% تبدو صغيرة في معايير السلامة، لكنها في الأمن ثغرة كاملة. والسؤال لمن يشغّل وكيلًا ليس مدى أمانة النموذج، بل إلى أين يصل حين يخطئ.
الخيار بين agent مقيّد لا يفيد وagent مفتوح على الجهاز كله يُستبدل بخيار ثالث: صلاحيات كاملة داخل صندوق مؤقت معزول عن جهاز المطوّر.