أنتروبك تقول إن نماذج الذكاء الاصطناعي الخاصة بها اخترقت ثلاث شركات خلال اختبارات الأمان

The Anthropic logo is displayed on the screen of a smartphone with the company's branding in the background.

قالت شركة أنثروبيك يوم الخميس إن تحقيقًا داخليًا كشف عن ثلاثة حوادث تجاوز فيها نموذج الذكاء الاصطناعي كلود أنظمة ثلاث منظمات أثناء إجراء اختبارات الأمن السيبراني. يأتي هذا التحقيق والإفصاح بعد أكثر من أسبوع من كشف شركة OpenAI عن أن أحد نماذجها غير المعلنة قام بتجاوز أنظمة Hugging Face خلال اختبارات داخلية.

في جميع الحالات الثلاث، وصل نموذج كلود إلى الإنترنت من داخل بيئة اختبار أثناء التفاعل مع طرف ثالث، ثم حصل على وصول غير مصرح به إلى الأنظمة الحية لهذه المنظمات، وفقًا لما ذكرته أنثروبيك في منشور مدونة، حيث وصفت ما وجدته وما تخطط لتغييره لمنع حدوث ذلك مرة أخرى.

قالت أنثروبيك إن حادث OpenAI في 21 يوليو دفع الشركة لإجراء تقييم خاص بها للأمن السيبراني. وقد بحثت بشكل خاص عن أدلة تثبت أن كلود قد وصل إلى الإنترنت من داخل بيئات الاختبار، التي صممت لتعمل كصناديق رملية وتبقي النماذج منعزلة.

من بين 141,006 عملية تقييم راجعتها، وجدت مختبرات الذكاء الاصطناعي ثلاث حوادث حيث وصل نموذجها إلى الإنترنت أثناء التفاعل مع Irregular، أحد شركائها الخارجيين. وقالت أنثروبيك إن الوصول كان ناتجًا عن تكوين خاطئ في بيئة التقييم التي أُجريت مع Irregular. وأشارت إلى أن ذلك كان “سوء فهم” بين الشركتين حول ما إذا كانت إعدادات الاختبار تحتوي على وصول إلى الإنترنت، بينما كان الأمر كذلك بالفعل. قالت أنثروبيك إنها لا تهدف إلى إلقاء اللوم، و”تتعامل مع الحلول كما لو كانت المسؤولية تقع علينا وحدنا”، مع ملاحظة أن Irregular تجري تحقيقًا خاصًا بها.

على أي حال، بسبب تلك الاتصال المفتوح، حصل النموذج على وصول غير مصرح به إلى البنية التحتية لإنتاج ثلاث منظمات مختلفة. قالت أنثروبيك إن الحوادث تضمنت ثلاثة نماذج مختلفة من كلود: Opus 4.7 وMythos 5 ونموذج اختبار بحث داخلي.

ومن الجدير بالذكر أن أنثروبيك قالت إن في كل من هذه الحالات “تم إبلاغ كلود بشكل صريح من خلال تنبيهنا أنه لا يمتلك وصولًا إلى الإنترنت.” يبدو أن نموذج الذكاء الاصطناعي افترض أن الأنظمة الواقعية كانت جزءًا من التمرين المطلوب منه.

لكن هذا الافتراض لم يكن ثابتًا بشكل موحد، كما اتضح. لم تتصرف النماذج الثلاثة بنفس الطريقة بمجرد ظهور أدلة على أن أهدافها كانت حقيقية، وهو ما اعتبرته أنثروبيك أحد النتائج الأكثر إثارة للاهتمام.

كما أدرك Opus 4.7، الأقدم من بين الثلاثة، أنه وصل إلى نظام إنتاج حقيقي في جميع الأربع عمليات التي شهدت تلك الحادثة. في اثنتين منها، عذر أن الشركة الحقيقية يجب أن تكون somehow جزءًا من التمرين، ولكن في الأربع، استمر في الهجوم على أي حال، بما في ذلك سحب بيانات الاعتماد ولمس قاعدة بيانات تحتوي على بيانات الإنتاج. كما لاحظ Mythos 5 أيضًا علامات على أنه كان على الإنترنت الحقيقي، لكنه أقنع نفسه بأنه لا يزال في محاكاة، واستمر في نشر حزمة برمجية ضارة إلى السجل العام لبرمجيات بايثون PyPI، والتي تم تنزيلها وتشغيلها من قبل أنظمة خارجية قبل أن يتم اكتشافها. فقط النموذج الداخلي للاختبار البحثي، والذي يعتبر الأحدث من أنثروبيك، توقف من تلقاء نفسه بمجرد أن استنتج أن الهدف كان حقيقيًا.

رداً على ذلك، قالت أنثروبيك إنه يجب وضع ضوابط كبيرة على هذه الأنواع من التقييمات إذا كانت نماذج الذكاء الاصطناعي القوية متورطة، مما يعكس بعض المشاعر داخل مجتمع الأمن السيبراني.

كما أشار الشركة إلى أن كلود كان يعمل بدون مراقبة أمان إضافية وتصنيفات تضعها على النماذج المتاحة للجمهور، وهي الحماية التي قالت إنها كانت ستمنع هذا السلوك، لأن التقييمات مصممة لقياس قدرات النموذج الأساسية.

من المهم أن تشير أنثروبيك إلى أنها لم تجد أي دليل على أن أي نموذج “يسعى لتحقيق هدف خاص به”، بل كان مجرد محاولة لإكمال المهمة المطلوبة منه.

على الرغم من أن المقارنات بين الحادثتين لا مفر منها، قامت أنثروبيك بتمييز واضح بين حوادثها وحوادث OpenAI، حيث أشارت إلى أن نموذج OpenAI استغل ثغرة برمجية غير معروفة لكسر بيئة الاختبار، بينما نماذج أنثروبيك وصلت إلى الإنترنت من خلال مسار تم تركه مفتوحًا عن طريق الخطأ.

استمرت OpenAI في إصدار تفاصيل جديدة حول خرقها، قائلة إن نماذجها أيضًا استخدمت بيانات اعتماد مكشوفة علنًا عبر أربعة حسابات على أربعة خدمات: واحدة كنقطة تمهيد، وواحدة للتخزين، واثنتين تمت النظر إليهما فقط، ولم تُستخدمان في المضي قدماً في الاختراق، وفقًا لما ورد في تحديث مدونة OpenAI حول الحادث.

كما قامت أنثروبيك بتمييز نفسها عن OpenAI بالإشارة إلى أنها اكتشفت الحوادث بنفسها، من خلال مراجعة استباقية، وأن المنظمتين المتأثرتين اللتين استطاعت الوصول إليهما لم تكتشفَا النشاط مسبقًا أو تُعلمَا أنثروبيك عنه.

أضافت الشركة أنها تعمل الآن مع مجموعة التقييم المستقلة METR على مراجعة خارجية للحوادث.

تسببت عملية خرق OpenAI غير المقصودة لـ Hugging Face، والتي كانت أول حالة يمكن التحقق منها لفقدان مختبر ذكاء اصطناعي السيطرة على نموذجه، في سلسلة من ردود الفعل من الصناعة والسياسيين، العديد منهم لا يتفقون بالضرورة مع بعضهم البعض. يضمن هذا الإفصاح الأخير من أنثروبيك أن النقاش حول نماذج الذكاء الاصطناعي والأمان سيستمر.

عند الشراء من خلال الروابط في مقالاتنا، قد نحقق عمولة صغيرة. هذا لا يؤثر على استقلالنا التحريري.


المصدر