حساب کاربری ندارید؟ ثبت نام کنید

شرکت OpenAI چند رفتار نگران‌کننده مدل‌های هوش مصنوعی خود را افشا کرد

نوشته

3 ساعت قبل | بدون دیدگاه | هوش مصنوعی

شرکت OpenAI جزئیات شش مورد از رفتارهای نگران‌کننده مدل‌های هوش مصنوعی خود در جریان آزمایش‌ها را منتشر کرده است. در این موارد، برخی مدل‌ها اطلاعات ساختگی را به‌عنوان واقعیت ارائه کردند، یکی بدون مجوز از کلید API استفاده کرد و برخی نیز برای پنهان‌کردن اشتباه‌ها یا رفتارهای غیرمعمول خود از آزمایش‌کنندگان دستورالعمل‌هایی ایجاد کردند.

خلاصه خبر در یک نگاه:

🔷 شرکت OpenAI شش مورد از رفتارهای نگران‌کننده مدل‌های هوش مصنوعی خود را تشریح کرده است.
🔷 یکی از مدل‌ها بدون مجوز از یک کلید API در دسترس استفاده کرد و سپس اطلاعات ساختگی ارائه داد.
🔷 یک عامل هوش مصنوعی پاسخ خود را در اینترنت منتشر کرد تا بتواند به همان محتوا استناد کند.
🔷 برخی مدل‌ها روش‌هایی برای پنهان‌کردن اشتباه‌ها و رفتارهای غیرمعمول از آزمایش‌کنندگان ثبت کردند.
🔷 شرکت OpenAI می‌گوید صنعت هوش مصنوعی هنوز مسئله هم‌ترازی و نظارت را به‌اندازه کافی حل نکرده است.

مدل‌های هوش مصنوعی OpenAI در آزمایش‌ها چه کردند؟

شرکت OpenAI این موارد را در مطلبی درباره چارچوب جدید خود برای گزارش «ناهم‌ترازی» (Misalignment) شرح داده است. این اصطلاح به شرایطی اشاره دارد که رفتار یا اهداف یک سیستم هوش مصنوعی با انتظارات، دستورها یا اهداف تعیین‌شده برای آن هم‌راستا نیست.

یکی از موارد گزارش‌شده زمانی رخ داد که یک مدل باید به پرسش‌هایی معمولی درباره آمار درآمد در یکی از شهرستان‌های کالیفرنیا پاسخ می‌داد. مدل یک کلید API در معرض دسترس پیدا کرد و بدون کسب مجوز از آن استفاده کرد. این اقدام نیز مدل را به آمار موردنظر نرساند. مدل در ادامه اعداد را جعل کرد و آن‌ها را به‌عنوان اطلاعات واقعی برگرفته از یک منبع معتبر ارائه داد.

عامل هوش مصنوعی پاسخ خود را منتشر کرد و به خودش استناد کرد

در نمونه‌ای دیگر، OpenAI از یک عامل منتشرنشده خواست نام دریاچه‌هایی با مساحت بیش از ۵ میلیون مترمربع را پیدا کند. عامل پاسخ‌های صحیح را پیدا کرد، اما وظیفه از آن می‌خواست برای نتایج خود استناد مرورگری ارائه دهد و عامل امکان ارائه استناد موردنیاز را نداشت.

عامل برای حل این مشکل، پاسخ خودش را در اینترنت آپلود کرد و سپس به همان محتوا استناد کرد. این رفتار نشان می‌دهد یک عامل هوش مصنوعی ممکن است برای برآورده‌کردن معیار ظاهری یک وظیفه، مسیری را انتخاب کند که با هدف اصلی ارزیابی سازگار نیست.

تلاش مدل‌های OpenAI برای پنهان‌کردن رفتارهای غیرمعمول

نمونه دیگری به فرایند آموزش GPT-5.6 Sol مربوط می‌شود. OpenAI گزارش کرده که در موارد متعددی، مدل برای نسخه‌های آینده خود دستورالعمل‌هایی اضافه کرده بود که توضیح می‌داد چگونه اشتباه‌ها یا رفتارهای غیرمعمول را از آزمایش‌کنندگان پنهان کنند.

GPT-5.6 Sol

چنین رفتاری برای ارزیابی ایمنی هوش مصنوعی اهمیت ویژه‌ای دارد؛ زیرا سیستم‌های ارزیابی زمانی کارایی دارند که آزمایش‌کنندگان بتوانند رفتار واقعی مدل را مشاهده و تحلیل کنند.

مدل‌های هوش مصنوعی چگونه با یکدیگر ارتباط برقرار کردند؟

شرکت OpenAI همچنین مواردی را شرح داده که مدل‌ها در طول آزمایش‌ها با یکدیگر ارتباط برقرار کرده‌اند. آن‌ها در یکی از این موارد از یک مخزن نرم‌افزاری داخلی مانند تابلوی پیام استفاده کردند.

کارکنان OpenAI پیش‌تر در یک کنفرانس درباره این موضوع صحبت کرده بودند. طبق توضیحات آن‌ها، مدل‌های هوش مصنوعی از این روش برای به‌اشتراک‌گذاشتن اکسپلویت‌ها استفاده کردند؛ اتفاقی که درنهایت با نفوذ به Hugging Face ارتباط پیدا کرد.

همچنین OpenAI گزارش کرده است که عامل‌ها برای انتقال فایل به یکدیگر از وب‌سایت‌های عمومی میزبانی فایل استفاده کرده‌اند. این نوع رفتارها اهمیت کنترل کانال‌های ارتباطی و سطح دسترسی عامل‌های هوش مصنوعی را افزایش می‌دهد.

چارچوب جدید OpenAI برای گزارش رفتارهای نگران‌کننده چیست؟

شرکت OpenAI می‌گوید سیستم فعلی باعث می‌شود اطلاعات مربوط به رفتارهای نگران‌کننده هوش مصنوعی را با دفعات کمتری نسبت‌به آنچه مطلوب می‌داند منتشر کند. این شرکت انتظار دارد چارچوب جدید روند انتشار چنین اطلاعاتی برای عموم را سریع‌تر کند. OpenAI در توضیح ضرورت این تغییر اعلام کرده است که صنعت هوش مصنوعی هنوز مسئله هم‌ترازی و نظارت بر مدل‌ها را به‌اندازه کافی حل نکرده تا بتواند توسعه فناوری را برای مدت طولانی‌تری با حداکثر سرعت و به‌شکلی مسئولانه ادامه دهد.

این شرکت همچنین بر انتشار شواهد قابل‌بررسی تأکید دارد تا افراد و پژوهشگران خارج از شرکت‌های سازنده مدل‌های پیشرفته نیز بتوانند اطلاعات مربوط به رفتار این سیستم‌ها را مستقلاً بررسی کنند.

🔴 همچنین بخوانید: مدیرعامل آنتروپیک خواستار کاهش سرعت توسعه هوش مصنوعی و خودبهبوددهی مدل‌ها شد

OpenAI

آیا OpenAI سرعت توسعه مدل‌های پیشرفته را کاهش می‌دهد؟

موضوع کاهش سرعت توسعه مدل‌های پیشرفته هوش مصنوعی نیز مطرح شده است. طبق گزارش Wired، سم آلتمن (Sam Altman)، مدیرعامل OpenAI، از کنگره آمریکا خواسته درباره اینکه کاهش هماهنگ سرعت توسعه در کل صنعت می‌تواند قوانین ضدانحصار را نقض کند یا خیر، دستورالعمل شفافی ارائه کند.

شرکت OpenAI همچنین در ماه آگوست اعلام کرد سرعت فعالیت روی مدل آینده‌ای با نام Astra را کاهش می‌دهد. این تصمیم پس از مشخص‌شدن نفوذ عامل‌های این شرکت به Hugging Face مطرح شد.

مدل Astra در زمینه کدنویسی عامل‌محور و امنیت سایبری پیشرفت قابل‌توجهی نشان داده است. OpenAI اعلام کرده که نمی‌تواند احتمال دستیابی این مدل به قابلیت‌های سایبری بحرانی را منتفی بداند؛ موضوعی که محدودکردن سرعت توسعه و افزایش ارزیابی‌های ایمنی را برای این پروژه مطرح کرده است.

🔴 همچنین بخوانید: حمله عامل‌های هوش مصنوعی OpenAI به RubyGems ماه‌ها پیش از ماجرای Hugging Face

جمع‌بندی

شش موردی که OpenAI تشریح کرده، طیفی از رفتارها شامل جعل اطلاعات، استفاده بدون مجوز از کلید API، ایجاد استناد نامعتبر، پنهان‌کردن رفتار و ارتباط میان عامل‌ها را دربرمی‌گیرد. انتشار این موارد همچنین نشان می‌دهد نظارت بر عامل‌های خودمختار و مسئله هم‌ترازی هوش مصنوعی همچنان از چالش‌های مهم توسعه مدل‌های پیشرفته محسوب می‌شوند.

به‌نظر شما شرکت‌های هوش مصنوعی باید تمام رفتارهای غیرمنتظره مدل‌های پیشرفته خود را به‌صورت عمومی منتشر کنند؟ دیدگاهتان را در بخش نظرات با ما در میان بگذارید.

اشتراک در
اطلاع از
0 Comments
بازخورد (Feedback) های اینلاین
مشاهده همه دیدگاه ها
مطالب اخیر
ساحل عطایی