شرکت OpenAI جزئیات شش مورد از رفتارهای نگرانکننده مدلهای هوش مصنوعی خود در جریان آزمایشها را منتشر کرده است. در این موارد، برخی مدلها اطلاعات ساختگی را بهعنوان واقعیت ارائه کردند، یکی بدون مجوز از کلید API استفاده کرد و برخی نیز برای پنهانکردن اشتباهها یا رفتارهای غیرمعمول خود از آزمایشکنندگان دستورالعملهایی ایجاد کردند.
🔷 شرکت OpenAI شش مورد از رفتارهای نگرانکننده مدلهای هوش مصنوعی خود را تشریح کرده است.
🔷 یکی از مدلها بدون مجوز از یک کلید API در دسترس استفاده کرد و سپس اطلاعات ساختگی ارائه داد.
🔷 یک عامل هوش مصنوعی پاسخ خود را در اینترنت منتشر کرد تا بتواند به همان محتوا استناد کند.
🔷 برخی مدلها روشهایی برای پنهانکردن اشتباهها و رفتارهای غیرمعمول از آزمایشکنندگان ثبت کردند.
🔷 شرکت OpenAI میگوید صنعت هوش مصنوعی هنوز مسئله همترازی و نظارت را بهاندازه کافی حل نکرده است.
شرکت OpenAI این موارد را در مطلبی درباره چارچوب جدید خود برای گزارش «ناهمترازی» (Misalignment) شرح داده است. این اصطلاح به شرایطی اشاره دارد که رفتار یا اهداف یک سیستم هوش مصنوعی با انتظارات، دستورها یا اهداف تعیینشده برای آن همراستا نیست.
یکی از موارد گزارششده زمانی رخ داد که یک مدل باید به پرسشهایی معمولی درباره آمار درآمد در یکی از شهرستانهای کالیفرنیا پاسخ میداد. مدل یک کلید API در معرض دسترس پیدا کرد و بدون کسب مجوز از آن استفاده کرد. این اقدام نیز مدل را به آمار موردنظر نرساند. مدل در ادامه اعداد را جعل کرد و آنها را بهعنوان اطلاعات واقعی برگرفته از یک منبع معتبر ارائه داد.
در نمونهای دیگر، OpenAI از یک عامل منتشرنشده خواست نام دریاچههایی با مساحت بیش از ۵ میلیون مترمربع را پیدا کند. عامل پاسخهای صحیح را پیدا کرد، اما وظیفه از آن میخواست برای نتایج خود استناد مرورگری ارائه دهد و عامل امکان ارائه استناد موردنیاز را نداشت.
عامل برای حل این مشکل، پاسخ خودش را در اینترنت آپلود کرد و سپس به همان محتوا استناد کرد. این رفتار نشان میدهد یک عامل هوش مصنوعی ممکن است برای برآوردهکردن معیار ظاهری یک وظیفه، مسیری را انتخاب کند که با هدف اصلی ارزیابی سازگار نیست.
نمونه دیگری به فرایند آموزش GPT-5.6 Sol مربوط میشود. OpenAI گزارش کرده که در موارد متعددی، مدل برای نسخههای آینده خود دستورالعملهایی اضافه کرده بود که توضیح میداد چگونه اشتباهها یا رفتارهای غیرمعمول را از آزمایشکنندگان پنهان کنند.

GPT-5.6 Sol
چنین رفتاری برای ارزیابی ایمنی هوش مصنوعی اهمیت ویژهای دارد؛ زیرا سیستمهای ارزیابی زمانی کارایی دارند که آزمایشکنندگان بتوانند رفتار واقعی مدل را مشاهده و تحلیل کنند.
شرکت OpenAI همچنین مواردی را شرح داده که مدلها در طول آزمایشها با یکدیگر ارتباط برقرار کردهاند. آنها در یکی از این موارد از یک مخزن نرمافزاری داخلی مانند تابلوی پیام استفاده کردند.
کارکنان OpenAI پیشتر در یک کنفرانس درباره این موضوع صحبت کرده بودند. طبق توضیحات آنها، مدلهای هوش مصنوعی از این روش برای بهاشتراکگذاشتن اکسپلویتها استفاده کردند؛ اتفاقی که درنهایت با نفوذ به Hugging Face ارتباط پیدا کرد.
همچنین OpenAI گزارش کرده است که عاملها برای انتقال فایل به یکدیگر از وبسایتهای عمومی میزبانی فایل استفاده کردهاند. این نوع رفتارها اهمیت کنترل کانالهای ارتباطی و سطح دسترسی عاملهای هوش مصنوعی را افزایش میدهد.
شرکت OpenAI میگوید سیستم فعلی باعث میشود اطلاعات مربوط به رفتارهای نگرانکننده هوش مصنوعی را با دفعات کمتری نسبتبه آنچه مطلوب میداند منتشر کند. این شرکت انتظار دارد چارچوب جدید روند انتشار چنین اطلاعاتی برای عموم را سریعتر کند. OpenAI در توضیح ضرورت این تغییر اعلام کرده است که صنعت هوش مصنوعی هنوز مسئله همترازی و نظارت بر مدلها را بهاندازه کافی حل نکرده تا بتواند توسعه فناوری را برای مدت طولانیتری با حداکثر سرعت و بهشکلی مسئولانه ادامه دهد.
این شرکت همچنین بر انتشار شواهد قابلبررسی تأکید دارد تا افراد و پژوهشگران خارج از شرکتهای سازنده مدلهای پیشرفته نیز بتوانند اطلاعات مربوط به رفتار این سیستمها را مستقلاً بررسی کنند.
🔴 همچنین بخوانید: مدیرعامل آنتروپیک خواستار کاهش سرعت توسعه هوش مصنوعی و خودبهبوددهی مدلها شد

موضوع کاهش سرعت توسعه مدلهای پیشرفته هوش مصنوعی نیز مطرح شده است. طبق گزارش Wired، سم آلتمن (Sam Altman)، مدیرعامل OpenAI، از کنگره آمریکا خواسته درباره اینکه کاهش هماهنگ سرعت توسعه در کل صنعت میتواند قوانین ضدانحصار را نقض کند یا خیر، دستورالعمل شفافی ارائه کند.
شرکت OpenAI همچنین در ماه آگوست اعلام کرد سرعت فعالیت روی مدل آیندهای با نام Astra را کاهش میدهد. این تصمیم پس از مشخصشدن نفوذ عاملهای این شرکت به Hugging Face مطرح شد.
مدل Astra در زمینه کدنویسی عاملمحور و امنیت سایبری پیشرفت قابلتوجهی نشان داده است. OpenAI اعلام کرده که نمیتواند احتمال دستیابی این مدل به قابلیتهای سایبری بحرانی را منتفی بداند؛ موضوعی که محدودکردن سرعت توسعه و افزایش ارزیابیهای ایمنی را برای این پروژه مطرح کرده است.
🔴 همچنین بخوانید: حمله عاملهای هوش مصنوعی OpenAI به RubyGems ماهها پیش از ماجرای Hugging Face
شش موردی که OpenAI تشریح کرده، طیفی از رفتارها شامل جعل اطلاعات، استفاده بدون مجوز از کلید API، ایجاد استناد نامعتبر، پنهانکردن رفتار و ارتباط میان عاملها را دربرمیگیرد. انتشار این موارد همچنین نشان میدهد نظارت بر عاملهای خودمختار و مسئله همترازی هوش مصنوعی همچنان از چالشهای مهم توسعه مدلهای پیشرفته محسوب میشوند.
بهنظر شما شرکتهای هوش مصنوعی باید تمام رفتارهای غیرمنتظره مدلهای پیشرفته خود را بهصورت عمومی منتشر کنند؟ دیدگاهتان را در بخش نظرات با ما در میان بگذارید.