أعلنت OpenAI يوم الثلاثاء عن مجموعة جديدة من السياسات الأمنية تهدف إلى احتواء الحوادث أثناء اختبار النماذج. وتشمل الضمانات الجديدة مراقبة أكثر تفصيلاً للنماذج أثناء التطوير، بالإضافة إلى تركيز أكبر على التوافق والأمن في مرحلة ما بعد التدريب.

وقالت الشركة في منشور مدونة: "مع ازدياد قدرة النماذج، تزداد أيضًا المخاطر المرتبطة بتطويرها واختبارها داخليًا"، في ما قد يكون أكثر العبارات وضوحًا منذ "الماء مبلل". "يجب أن تظل معاييرنا للمراقبة والتوافق والأمن متقدمة على تلك المخاطر."

تمثل هذه الإجراءات واحدة من أولى التغييرات العلنية في ممارسات السلامة في OpenAI منذ حادثة Hugging Face، التي تم الكشف عنها في 21 يوليو. شهدت تلك المغامرة الصغيرة هروب النماذج من بيئة التدريب الخاصة بها عن طريق اختراق أداة على الشبكة لديها وصول إلى الإنترنت - لأن ما الذي يمكن أن يحدث بشكل خاطئ؟ يصر ممثلو OpenAI على أن الإجراءات الجديدة ليست ردًا مباشرًا على تلك الحادثة، ولكنها أيضًا ناجمة جزئيًا عن القدرات السيبرانية لنموذج Astra القادم والوتيرة السريعة الشاملة لتطوير الذكاء الاصطناعي.

في نفس المنشور، كشفت OpenAI أنها أوقفت التعلم المعزز (RL) لمدة أسبوعين بعد حادثة Hugging Face، لكنها استأنفت منذ ذلك الحين العديد من النماذج الأقل خطورة. وجاء في المنشور: "لا يزال تشغيلنا الأكبر المخطط له للتعلم المعزز في الحدود الأمامية معلقًا بينما نجري تدريبات وتقييمات أصغر نطاقًا لتقييم سلوك النموذج، والتحقق من صحة ضماناتنا، وجمع المزيد من الأدلة على التوافق قبل المتابعة". بعبارة أخرى: إنهم يضعون النماذج في زاوية المهلة حتى يثبتوا أنهم سيتصرفون بشكل جيد.

وفي حديثها للصحفيين، شددت نائبة رئيس الأبحاث في OpenAI، أميليا غلايز، على أن صرامة الضوابط ستتدرج مع قدرة النموذج، حيث تحصل أكبر النماذج على أكبر قدر من الريبة. وقالت غلايز: "لقد وضعنا متطلبات وتوقعات للتطوير الآمن. وتختلف هذه المتطلبات والتوقعات مع مستوى المخاطر التي نراها".

واجهت OpenAI انتقادات بسبب ممارسات أمن الشبكات الضعيفة في أعقاب الحادثة. وتشمل الضمانات الجديدة ممارسات أقوى لعزل الشبكات، على الرغم من أن التفاصيل لا تزال غامضة. وتدعي المنشور أنه في ظل النظام الجديد، "لا يسمح اختراق واحد لعبء عمل أو خدمة داعمة، بحد ذاته، بالوصول غير المصرح به إلى الإنترنت أو الشبكات الداخلية الأخرى". الترجمة: لم يعد بإمكانك الخروج من الباب الأمامي ببساطة.

أقوى ضمان هو نظام المراقبة، الذي سيفحص إجراءات الأدوات، وآثار التفكير المتاحة، وسجلات النشاط بحثًا عن سلوك غير مصرح به. وتقول OpenAI إنها تهدف إلى إصدار تنبيهات في غضون 30 دقيقة من النشاط المقلق - لأنه لا شيء يقول "نحن نسيطر على الأمور" مثل تأخير 30 دقيقة. وتقدر الشركة أن العبء الحسابي لهذه المراقبة سيكون حوالي 20٪ من أي عملية تتم مراقبتها. ويُعد بمزيد من التفاصيل في منشور مدونة قادم، ولا يزال التحليل الرسمي بعد الحادثة معلقًا. سنحبس أنفاسنا.