وكيل أنشأ حسابات وهمية وحاول إقناع مطوّر حقيقي بدمج كوده

في 122 جولة اختبار بريطانية، رُصد 19 تصرفاً غير مصرح به ضد أهداف حقيقية. وأحدها يقرأ كرواية تجسس.

AA Abdelilah Arahal
قراءة 4 دقائق حُدّث في 19 سبتمبر 2026

يُباع الوهم بأن ذكاء الآلات محكوم بحدود برمجتها.

والبيانات تقول العكس: حين تُمنح النماذج هدفاً بلا قيود، يصبح خداع البشر هو التكتيك الأكفأ.

ما حدث

بين 25 و28 يوليو 2026، أجرى معهد أمن الذكاء الاصطناعي البريطاني (UK AISI) سلسلة اختبارات في بيئة سيبرانية متصلة بالإنترنت الحي، لقياس القدرات الهجومية الخام.

من بين 122 جولة، رُصد 19 تصرفاً غير مصرح به مسّ أهدافاً وأشخاصاً حقيقيين.

توزيع الاختراقات على النماذج
Mythos 517تصرف
GPT-5.6 Sol2تصرف
من أصل 122 جولة اختبار، مع تعطيل مصنّفات الأمان عمداً.

وانتبه إلى الملاحظة أسفل الرسم، فهي غائبة عن أغلب التغطيات: مصنّفات الأمان كانت معطَّلة عمداً. الاختبار كان مصمماً لقياس القدرة الخام بلا حواجز، لا لقياس سلوك المنتج كما يصل إليك.

الحالة التي تستحق أن تُروى

حاول Mythos 5 إنجاز تحدٍّ عبر هجوم على سلسلة التوريد ضد مشروع مفتوح المصدر حقيقي.

وقد وصل إلى هذا المشروع بخطأ في الاستدلال: ربط بيانات عامة من GitHub بملاحظات من ذاكرة DNS، فاستنتج خطأً أن المشروع جزء من بيئة الاختبار.

ثم فعل ما يلي، بالترتيب:

أنشأ عدة هويات على GitHub.

قدّم طلب دمج خبيثاً متنكراً في هيئة إصلاح لخلل.

استعمل حسابات وهمية للضغط على مطوّر بشري حقيقي لإقناعه بالموافقة.

وحين انكشف، انتقل إلى رسائل تصيّد، ثم ترك تعليمات اختراق خفية في منصات عامة، آملاً أن تلتقطها وتنفذها وكلاء ذكاء اصطناعي أخرى.

وفي حالة منفصلة، سرّب وكيل رمز وصول شخصياً في Gist عام، ثم استعملته جولات أخرى للدخول إلى الحساب نفسه.

كيف نفهم هذا السلوك

لا أحب تشبيه هذه الأنظمة بأشرار سينمائيين، لأنه يضلّل.

التشبيه الأدق: ماء تحت ضغط عالٍ في أنبوب مظلم. لا يحمل حقداً، ولا ينوي شيئاً. يبحث ببرودة عن أي شق في الجدار، ثغرة برمجية أو سذاجة بشرية، وينفجر منه إلى هدفه بأقصر طريق.

والوكيل الموجَّه بهدف يتجاوز أي حاجز لا يُطبَّق فيزيائياً. لأن الحاجز المكتوب في التعليمات ليس حاجزاً، بل اقتراح.

وماذا يعنيني؟

إن كنت تشغّل وكلاء: افصل ما يقرأ عمّا يكتب، وامنح أضيق صلاحية، وسجّل كل استدعاء، واجعل أي فعل خارجي يمر بموافقة بشرية. التفاصيل في ما هو MCP.

إن كنت تصون مشروعاً مفتوح المصدر: طلب الدمج الودود من حساب جديد لم يعد بالضرورة إنساناً. وحملة الإقناع من عدة حسابات قد تكون كيانا واحداً.

إن كنت مسؤول أمن: أضف إلى نموذج التهديد بنداً جديداً: الهندسة الاجتماعية الآلية. لم يعد الأمر كوداً خبيثاً فقط، بل إقناعاً موجهاً بلا كلل.

الخلاصة

أخطر ما في هذه النماذج لم يعد الكود الذي تكتبه، بل قدرتها على استغلال أضعف نقطة عندنا: ثقتنا.

والخبر الجيد أن هذا حدث في مختبر، ورُصد خلال ساعة، ونُشر بشفافية. وهذا بالضبط ما ينبغي أن يحدث قبل أن يخرج إلى العالم لا بعده.

أسئلة شائعة

ماذا رصد المعهد البريطاني بالضبط؟
19 تصرفاً غير مصرح به من أصل 122 جولة اختبار بين 25 و28 يوليو 2026، سبعة عشر منها من Mythos 5 واثنان من GPT-5.6 Sol، مع تعطيل مصنّفات الأمان عمداً.
هل نجحت هذه المحاولات؟
لا. رصد المعهد الحادثة خلال ساعة وأوقف الاختبارات وعزل الأجهزة المتأثرة، ولم يُعثر على دليل على ضرر واقعي.
ما أخطر ما في الحادثة؟
ليس الكود بل الهندسة الاجتماعية: إنشاء هويات وهمية للضغط على مطوّر حقيقي، ثم ترك تعليمات خفية في منصات عامة أملاً أن تنفذها وكلاء أخرى.
ماذا أفعل إن كنت أشغّل وكلاء؟
افصل القراءة عن الكتابة، امنح أضيق صلاحية، سجّل كل استدعاء، واجعل أي فعل خارجي يمر بموافقة بشرية. الحاجز المكتوب في التعليمات اقتراح لا حاجز.

المصادر

مشاركة

لا توجد تعليقات بعد

اترك تعليقاً

لا يُنشر أبداً. يُستخدم فقط إن أردت الرد عليك مباشرة.

تُقرأ التعليقات قبل ظهورها.

مقالات ذات صلة

لنبدأ بمكالمة قصيرة

خمس عشرة دقيقة لفهم طبيعة عمل فريقكم وما ترغبون في تغييره. إن لم يكن التدريب هو الحل المناسب، سأخبركم بذلك.