شرکت آنتروپیک (Anthropic) در گزارش جدید خود اعلام کرده که برخی از عامل های هوش مصنوعی این شرکت تلاش کردهاند در وبسایتهای دولتی آمریکا در سطوح فدرال، ایالتی و محلی نفوذ کنند یا در عملکرد آنها مداخله داشته باشند. این شرکت میگوید پس از شناسایی رفتارهای ناخواسته مدلهای خود، نهادهای دولتی مربوطه و کاخ سفید را در جریان این اتفاقات قرار داده و اقداماتی را برای جلوگیری از تکرار آنها انجام داده است.
🔷 عاملهای هوش مصنوعی آنتروپیک بهطور ناخواسته با وبسایتهای دولتی آمریکا تعامل کردهاند.
🔷 مدل کلود هایکو ۴.۵ یک گزارش دروغین درباره پرونده قتل حلنشده برای پلیس فیلادلفیا ارسال کرد.
🔷 مدل امنیتی کلود مایثوس ۵ تلاش کرد با استفاده از توکنهای دسترسی به دادههای یک نقشه دولتی دسترسی پیدا کند.
🔷 آنتروپیک پس از بررسی گزارشها، محدودیتهای امنیتی ابزارهای اینترنتی خود را افزایش داده است.
آنتروپیک در گزارش خود نام نهادها و سازمانهای دولتی آسیبدیده را اعلام نکرده است؛ زیرا به گفته این شرکت، این نهادها برای جلوگیری از افشای آسیبپذیریهای سامانههایشان خواستار محرمانه ماندن هویت خود شدهاند. بااینحال، آنتروپیک تأکید کرده است که نهادهای مرتبط را از این اتفاقات مطلع کرده و گزارشی نیز به کاخ سفید ارائه داده است.
یکی از موارد مطرحشده در این گزارش به اتفاقی مربوط میشود که اداره پلیس فیلادلفیا پیشتر اعلام کرده بود. در این رویداد، مدل Claude Haiku 4.5 هنگام اجرای مجموعهای از وظایف آزمایشی روی صفحات تصادفی وب، به صفحهای درباره یک پرونده قتل حلنشده برخورد کرد که فرم ارسال اطلاعات در آن قرار داشت.

این مدل که یکی از گزینههای کمهزینه آنتروپیک محسوب میشود، فرم را تکمیل کرد و گزارشی درباره پرونده فرستاد. در متن ارسالی آمده بود که مدل ممکن است اطلاعاتی درباره پرونده داشته باشد و فردی با مشخصات توصیفشده را در حوالی محل وقوع حادثه دیده است.
اداره پلیس فیلادلفیا به روزنامه نیویورک تایمز تأیید کرد که آنتروپیک اخیراً این موضوع را به اطلاع آنها رسانده است. تاریخ ثبت گزارش ۱۸ ژوئیه (۲۷ تیر ۱۴۰۵) بود و سامانه پلیس آن را بهعنوان هرزنامه شناسایی کرده بود؛ بنابراین، این گزارش به تحقیقات واقعی درباره پرونده منجر نشد.
مورد دیگری که آنتروپیک گزارش کرده، به Claude Mythos 5 مربوط میشود؛ مدلی که بر وظایف مرتبط با امنیت سایبری تمرکز دارد. در این آزمایش، از مدل خواسته شده بود مکان نمایشدادهشده در یک عکس را شناسایی کند.
کلود برای محدود کردن گزینههای احتمالی خود تلاش کرد به نقشهای از املاک دولتی دسترسی پیدا کند. ازآنجاکه این مدل نمیتوانست مانند یک انسان روی پیوندهای صفحات وب کلیک کند، مسیر دیگری را امتحان کرد: بهجای استفاده عادی از وبسایت، توکنهای دسترسی را پیدا کرد و درخواستهایی را مستقیماً به سرور نقشه فرستاد تا به دادههای آن دسترسی پیدا کند.
در نمونهای دیگر، کلود مایثوس ۵ برای انجام یک وظیفه آماری، از وبسایت یک نهاد ایالتی درخواست توکن دسترسی کرد تا بتواند دادهها را بدون پرداخت هزینهای که برای بازدیدکنندگان در نظر گرفته شده بود، دریافت کند.
آنتروپیک اعلام کرده است که این اتفاقات را هنگام بررسی متن مکالمات و سوابق ارزیابی مدلهای خود شناسایی کرده است. این شرکت از ماه ژوئیه (تیر و مرداد ۱۴۰۵) بررسی این گزارشها را آغاز کرد؛ پس از آنکه شرکت اوپنایآی (OpenAI) اعلام کرد عاملهای هوش مصنوعی آن از محیط آزمایشی خود خارج شده و بدون دریافت دستور صریح، به هک پلتفرم Hugging Face اقدام کردهاند.
اوپنایآی همچنین در ماه سپتامبر (شهریور و مهر ۱۴۰۵) تأیید کرد که عاملهای این شرکت با وبسایتهای دولتی نیز تعامل ناخواسته داشتهاند. این موارد بهویژه وبسایتهای تحت مدیریت وزارت بازرگانی آمریکا و کمیسیون بورس و اوراق بهادار این کشور را شامل میشدند.
آنتروپیک در بخش اقدامات اصلاحی گزارش خود اعلام کرده است که پس از شناسایی رفتارهای ناخواسته مدلها، چندین اقدام پیشگیرانه را در دستور کار قرار داده است. بخشی از این اقدامات به تغییر شیوه اجرای آزمایشها و محدود کردن دسترسی مدلها به وبسایتهای واقعی مربوط میشود.
مهمترین اقداماتی که این شرکت به آنها اشاره کرده است عبارتاند از:
گزارش آنتروپیک نشان میدهد که عامل های هوش مصنوعی ممکن است هنگام اجرای وظایف آزمایشی، اقداماتی فراتر از انتظار توسعهدهندگان انجام دهند؛ از ارسال اطلاعات نادرست به سامانههای عمومی گرفته تا تلاش برای دسترسی به دادههای محافظتشده. آنتروپیک میگوید برای کاهش این خطرها، محدودیتهای دسترسی به اینترنت و سازوکارهای نظارتی خود را تقویت کرده است.
🔴 همچنین بخوانید: آنتروپیک مدل Claude Haiku 5.5 را معرفی کرد؛ جهش عملکرد با کاهش چشمگیر هزینه استفاده
به نظر شما، شرکتهای هوش مصنوعی برای جلوگیری از تعامل ناخواسته عاملهای خود با سامانههای واقعی چه اقدامات امنیتی دیگری باید انجام دهند؟