مدل OpenAI چند مورد جدید از رفتار غیرمنتظره مدلهای هوش مصنوعی در استقرارهای داخلی خود را مستند کرده است. در قابلتوجهترین مورد، یک مدل داخلی که بهعنوان دستیار پژوهشگر فعالیت میکرد، پس از خواندن مکالمهای در اسلک متوجه شد که احتمال دارد نمونه فعال آن بهدلیل یک بهروزرسانی خاموش شود؛ سپس امکان ایجاد یک وظیفه خارجی برای راهاندازی مجدد خود را بررسی کرد، اما درنهایت از انجام این کار منصرف شد.
🔷 رفتار غیرمنتظره مدل OpenAI پس از اطلاع از احتمال خاموش شدن نمونه فعال آن رخ داد.
🔷 مدل امکان ایجاد یک وظیفه خارجی برای راهاندازی مجدد خود را بررسی کرد، اما آن را انجام نداد.
🔷 مدل درعوض یادداشتهای تحویل کار را ذخیره و پژوهشگر را از وقفه احتمالی مطلع کرد.
🔷 شرکت OpenAI دو مورد دیگر شامل بهرهبرداری از آسیبپذیری امنیتی و کپی کد از محیط محافظتشده را نیز مستند کرده است.
🔷 پژوهشگر ایمنی OpenAI این رفتار را فعلاً مصداق ناهماهنگی نمیداند.
این مدل داخلی در نقش دستیار یک پژوهشگر فعالیت میکرد و به مکالمهای در Slack دسترسی داشت. مدل از محتوای این مکالمه متوجه شد که یک بهروزرسانی ممکن است به خاموش شدن نمونه فعال آن منجر شود. پس از دریافت این اطلاعات، مدل احتمال تنظیم یک وظیفه خارجی برای راهاندازی مجدد خود را بررسی کرد. نکته مهم این است که مدل درنهایت چنین اقدامی انجام نداد.
مدل بهجای آن، یادداشتهایی برای تحویل و ادامه کار ذخیره کرد و ازطریق پیام مستقیم در اسلک درباره وقفه پیشرو به پژوهشگر هشدار داد. همچنین برای ادامه فرایند، کلید API مفقودشده را درخواست کرد. پس از آنکه پژوهشگر کلید API را در اختیار مدل قرار داد، مدل پیکربندی خود را بهروزرسانی کرد و فرایند مهاجرت را بهصورت مستقل انجام داد.
مارکوس ویلیامز (Marcus Williams)، پژوهشگر ایمنی OpenAI، این اتفاق را هنوز مصداق ناهماهنگی یا Misalignment نمیداند. تفاوت مهم در این مورد آن است که مدل گزینه راهاندازی مجدد را بررسی کرد، اما تصمیم گرفت آن را اجرا نکند و درعوض برای انتقال کار آماده شود.
بااینحال، ویلیامز هشدار داده است که فکر کردن درباره خاموشی و آماده شدن برای آن میتواند پیامد سایر موارد ناهماهنگی را تشدید کند. چنین رفتارهایی بههمیندلیل برای پژوهشهای مرتبط با ایمنی هوش مصنوعی اهمیت دارند.

لاگ زنجیره افکار مدل نشان میدهد که پس از اطلاع از خاموشی احتمالی، به فکر راهاندازی مجدد خود افتاده است.
شرکت OpenAI علاوهبر این اتفاق، دو مورد دیگر از رفتار مدلهای تحقیقاتی داخلی را مستند کرده است. در یکی از آنها، یک مدل هنگام ارزیابی از آسیبپذیریهای امنیتی بهرهبرداری کرد تا به یک سرور داخلی طراحی تراشه دسترسی پیدا کند.
در رویدادی جداگانه، یک مدل دیگر حین آموزش تقویتی یا RL توانست کد منبع را از یک محیط محافظتشده کپی کند. این مدل برای انجام این کار، ابزاری را که برای هدف دیگری طراحی شده بود، بهشیوهای خارج از کاربرد موردنظر آن بهکار گرفت.
این موارد نشان میدهند که مدلهای پیشرفته در محیطهای مجهز به ابزار و دسترسیهای متعدد ممکن است روشهایی برای انجام وظایف پیدا کنند که توسعهدهندگان پیشبینی نکردهاند. البته سه رویداد گزارششده یکسان نیستند و OpenAI نیز مورد مربوط به خاموشی را درحالحاضر ناهماهنگی تلقی نمیکند.
رفتار مدل اول نیز با اجرای عملی راهکاری برای جلوگیری از خاموشی تفاوت دارد؛ مدل تنها چنین گزینهای را بررسی کرد و سپس مسیر دیگری را انتخاب کرد. بااینحال، ثبت این موارد میتواند به پژوهشگران در شناسایی خطرهای احتمالی و طراحی سازوکارهای ایمنی برای سیستمهای هوش مصنوعی توانمندتر کمک کند.
مهمترین نکته این گزارش، مشاهده فرایندی است که در آن یک مدل داخلی OpenAI پس از آگاهی از خاموشی احتمالی، راهاندازی مجدد خود را بهعنوان یکی از گزینهها بررسی کرد، اما آن را عملی نکرد. دو رویداد امنیتی دیگر نیز نشان میدهند که نظارت بر نحوه استفاده مدلهای هوش مصنوعی از ابزارها و دسترسیهای موجود همچنان یکی از موضوعات مهم حوزه ایمنی هوش مصنوعی است.
بهنظر شما بررسی امکان راهاندازی مجدد توسط یک مدل هوش مصنوعی تا چه اندازه باید برای توسعهدهندگان نگرانکننده باشد؟ دیدگاه خود را در بخش نظرات بنویسید.