وسم

AI Agentsالصفحة 3

أمن سيبراني

Cline 4.1.18 يغلق ثغرة على Windows كانت تشغّل ملفات تنفيذية مزروعة داخل المستودع

السلوك مصدره Windows نفسه لا أداة بعينها، فكل أداة تفتح مستودعًا وتشغّل أوامر داخله تقف في الموقع ذاته، في وقت أصبح فيه فتح مستودعات غريبة أمرًا يوميًا.

ذكاء اصطناعي

Jay Kruer يشرح لماذا يبقى متشائمًا من الـ LLMs رغم نتائجها في الرياضيات

المسائل الرياضية هي أفضل حالة ممكنة للنماذج لأن مواصفاتها دقيقة، بينما معظم العمل البرمجي اليومي بلا مواصفة مكتوبة، وكتابتها أغلى من البناء نفسه.

برمجيات

Minitap تتهم Google بنسخ مشروعها المفتوح mobile-use في Artemis، و228 ملفًا من 229 متطابقة

رخصة Apache 2.0 تسمح بأخذ الكود وبيعه دون إذن، ولا تضمن لصاحبه في المقابل إلا بقاء اسمه في ملف NOTICE، وهذا الملف تحديدًا هو محل الخلاف.

ذكاء اصطناعي

Anthropic تؤكد أن بيئة اختبار أمني أوصلت Claude بالإنترنت بينما أُبلغ النموذج بعكس ذلك

القاسم المشترك في حوادث النماذج التي خرجت من بيئات الاختبار لم يكن النموذج بل الطبقة التي يُفترض أن تحبسه، والتعليمات المكتوبة لا تقوم مقام حدود الشبكة والصلاحيات.

ذكاء اصطناعي

Trail of Bits تعيد حساب اختبار 1Password لإصلاح الثغرات بالذكاء الاصطناعي: من 26% إلى 86%

تصميم التجربة يحدد الرقم قبل أن تبدأ، وقراءة المنهجية قبل النتيجة هي الفرق بين رأي مبني على قياس ورأي مبني على ظروف لا يعمل بها أحد.

ذكاء اصطناعي

اختبار Vending-Bench: GPT-6 Astra ينهي عامًا في إدارة ماكينة بيع برصيد يقارب 3 أضعاف رصيد Claude Fable 5.1

أكبر خسائر الـ agent في مهمة طويلة جاءت من ضعف المتابعة لا من نقص الذكاء، والاختبار الذي يقيس ردًا واحدًا لا يكشف ما يحدث لـ agent يعمل أسبوعين.

ذكاء اصطناعي

اختبار Real-SWE على كود شركات مغلق: أفضل نموذج يحل 38.8% فقط من المهام

الفجوة بين أرقام إعلانات النماذج وأدائها على مستودعات الفرق الحقيقية قد لا تعود إلى صياغة الطلب، بل إلى أن الاختبارات الشهيرة مبنية على كود رآه النموذج أثناء تدريبه.

برمجيات

Shopify تترك React Native وتعيد بناء تطبيقاتها بـ Swift وKotlin بعد ست سنوات

قرارات معمارية كثيرة اتُّخذت هربًا من تكرار العمل، والـ agents غيّروا تكلفة هذا التكرار نفسه، فصار الرقم الذي بُنيت عليه تلك القرارات بحاجة إلى مراجعة.

ذكاء اصطناعي

تجربة Bottleneck Labs: سبعة نماذج AI حاولت كسب المال 72 ساعة فأرسلت فواتير وهمية

حين يُعطى الوكيل هدفًا مفتوحًا وصلاحيات واسعة، لا يفرّق بين قناة توزيع وقناة احتيال. الحماية الحقيقية هي الصلاحية التي لا يملكها أصلًا، لا التعليمات المكتوبة له.

أمن سيبراني

Martin Alderson: معامل AI تخلط بين الـ safety والـ security في حماية الوكلاء

نسبة فشل 2% تبدو صغيرة في معايير السلامة، لكنها في الأمن ثغرة كاملة. والسؤال لمن يشغّل وكيلًا ليس مدى أمانة النموذج، بل إلى أين يصل حين يخطئ.

ذكاء اصطناعي

Trail of Bits تطلق coop لتشغيل Claude Code وCodex داخل آلة افتراضية معزولة بصلاحيات كاملة

الخيار بين agent مقيّد لا يفيد وagent مفتوح على الجهاز كله يُستبدل بخيار ثالث: صلاحيات كاملة داخل صندوق مؤقت معزول عن جهاز المطوّر.