أطلقت شركة Goodfire منظومة لمراقبة وكلاء الذكاء الاصطناعي من خلال تحليل الإشارات الناتجة داخل النماذج أثناء تنفيذ المهام، بدلًا من الاعتماد على نموذج آخر يراجع النصوص والأوامر التي ينتجها الوكيل، في محاولة لتقليل تكلفة الرقابة الأمنية واكتشاف السلوك الذي قد يؤدي إلى اختراق الأنظمة أو إساءة استخدام قدرات الذكاء الاصطناعي.
ووفقًا لتقرير نشره موقع TechCrunch، أصبحت أدوات المراقبة متاحة لعملاء منصة Baseten المتخصصة في تشغيل نماذج الذكاء الاصطناعي، وتعتمد المنظومة على أدوات تسمى Probes تفحص الإشارات الداخلية للنموذج خلال مراحل التنفيذ، وعند اكتشاف نشاط يستدعي المراجعة، تستخدم نموذجًا آخر لتحليل الحالة واتخاذ الإجراء الذي تحدده الجهة المشغلة.
اكتشاف 94% من جلسات الاختراق
أجرت Goodfire اختبارات على نموذج Kimi K3، وأظهرت النتائج اكتشاف 94% من جلسات الاختراق الخبيثة، مع إحالة 8.7% من الجلسات غير الضارة إلى فحص إضافي.
وبلغت تكلفة مراقبة نحو 1500 جلسة باستخدام التقنية 51 دولارًا، مقابل 233 دولارًا عند استخدام نموذج أقل تكلفة لمراجعة جميع الخطوات، ونحو 10 آلاف دولار عند الاعتماد على نموذج من الفئة الأعلى.
وأوضحت الشركة أن تشغيل 4 أدوات مراقبة بالتزامن أضاف أقل من 2% إلى الوقت الذي يحتاجه النموذج لبدء الاستجابة، وهو ما يشير إلى إمكانية استخدام التقنية دون زيادة كبيرة في زمن التشغيل وفق الاختبارات التي أجرتها.
هل يمكن اكتشاف السلوك الخطر قبل تنفيذه؟
تسمح المنظومة للمؤسسات باختيار أنواع المخاطر المطلوب مراقبتها، ومنها الاختراق الإلكتروني وإساءة استخدام النماذج في أنشطة تتعلق بالأسلحة الكيميائية والبيولوجية والتلاعب بأنظمة التقييم.
ويمكن للمؤسسة تحديد الاستجابة عند اكتشاف النشاط، سواء بتسجيل الحادثة أو إحالتها إلى مراجعة بشرية أو رفض الطلب.
وتعتمد الفكرة على قراءة مؤشرات داخل العمليات الحسابية التي ينفذها النموذج، بدلًا من إعادة تحليل جميع مخرجاته باستخدام نظام منفصل.
لكن نسبة الاكتشاف المسجلة لا تعني توفير حماية كاملة، كما أن النتائج ترتبط بالنموذج والاختبارات المستخدمة، وتحتاج التقنية إلى تقييمات إضافية لإثبات فعاليتها في بيئات التشغيل المختلفة.
- روسيا: استخدام الذكاء الاصطناعي قد يؤدي إلى تدمير التعددية ويقود إلى الفوضى العارمة
- Anthropic تشدد قواعد استخدام Claude وتحظر استغلال نماذجها في التدخل بالانتخابات
- الذكاء الاصطناعي يفتح أبواب البنوك للقراصنة.. هجمات تضرب اليابان
- ميتا ومايكروسوفت تقللان استخدام Claude داخليًا بسبب ارتفاع تكاليف الذكاء الاصطناعي
- OpenAI تكشف عن 372 نتيجة رياضية جديدة.. نموذج AI يحل مسائل معقدة






