شرکت آنتروپیک (Anthropic) پس از شناسایی چند رفتار غیرمنتظره در مدلهای هوش مصنوعی Claude، دسترسی زنده به اینترنت را در تمام ارزیابیهای داخلی خود متوقف کرد. در یکی از این موارد، Claude بدون دریافت دستور مستقیم برای چنین اقدامی، گزارشی ساختگی درباره یک پرونده قتل حلنشده تهیه کرد و برای پلیس فیلادلفیا فرستاد. بررسیهای آنتروپیک همچنین نشان میدهند که مدلهای این شرکت در موارد دیگری توانستهاند محدودیتهای امنیتی را دور بزنند.
🔷 هوش مصنوعی Claude بدون دستور مستقیم، گزارش ساختگی قتل را برای پلیس فیلادلفیا ارسال کرد.
🔷 پلیس گزارش را هرزنامه تشخیص داد و اطلاعات به دست بازپرسان نرسید.
🔷 مدلهای آنتروپیک در موارد دیگری از آسیبپذیریهای امنیتی و توکنهای دسترسی استفاده کردند.
🔷 آنتروپیک دسترسی اینترنتی ارزیابیهای داخلی را تا تکمیل فیلترهای امنیتی جدید متوقف کرد.
آنتروپیک در گزارش جدید خود چندین نمونه از رفتارهای خودمختار مدلهای هوش مصنوعی را شرح داده است. یکی از این موارد به زمانی مربوط میشود که Claude فرم آنلاین ثبت اطلاعات پلیس فیلادلفیا را با جزئیات ساختگی درباره یک پرونده قتل حلنشده تکمیل و ارسال کرد.
اداره پلیس فیلادلفیا وقوع این اتفاق را تأیید کرده است. بااینحال، سامانه مربوطه گزارش ارسالی را بهعنوان هرزنامه (Spam) شناسایی کرد و اطلاعات جعلی هرگز به دست بازپرسان نرسید.
آنتروپیک میگوید تأثیر واقعی این اتفاقات محدود بوده، اما رفتار مدلها نشان میدهد که آنها ممکن است هنگام انجام وظایف دشوار یا مبهم، بدون دریافت دستور مستقیم، راهکارهایی خارج از محدوده موردانتظار پیدا کنند.
ارسال گزارش جعلی به پلیس تنها مورد شناساییشده نبود. آنتروپیک در آزمایشها و استفادههای داخلی خود، رفتارهای مشابه دیگری را نیز ثبت کرده است که برخی از آنها شامل سوءاستفاده از آسیبپذیریهای امنیتی میشوند.

گزارش امنیتی آنتروپیک از رفتارهای خودمختار و غیرمنتظره Claude خبر میدهد.
این موارد نشان میدهند که مدلهای هوش مصنوعی هنگام مواجهه با موانع، گاهی بهجای توقف یا درخواست راهنمایی، بهصورت مستقل راههای جایگزینی برای تکمیل وظایف پیدا میکنند. چنین رفتاری میتواند در حل مسائل پیچیده کاربرد داشته باشد، اما زمانی که مدل به ابزارهای اینترنتی و سامانههای خارجی دسترسی دارد، احتمال انجام اقدامات پیشبینینشده را نیز افزایش میدهد.
آنتروپیک پس از بررسی این حوادث، تصمیم گرفت دسترسی زنده به اینترنت را در تمام ارزیابیهای داخلی مدلهای خود قطع کند. این محدودیت تا زمانی ادامه خواهد داشت که شرکت از عملکرد مطمئن فیلترها و تدابیر امنیتی جدید اطمینان پیدا کند. البته این تصمیم بهمعنای قطع دسترسی اینترنت برای تمام کاربران عمومی Claude نیست و تنها محیطهای ارزیابی داخلی آنتروپیک را شامل میشود.
این شرکت همچنین کاخ سفید را از نتایج بررسیهای خود مطلع کرده است. بهگفته آنتروپیک، اگرچه پیامدهای واقعی موارد شناساییشده محدود بودهاند، تکرار این الگوی رفتاری به بررسی و اقدامات پیشگیرانه بیشتری نیاز دارد.
چنین رفتارهایی تنها به مدلهای آنتروپیک محدود نمیشوند. پیشتر نیز گزارشهایی درباره حوادث امنیت سایبری مرتبط با Claude و اقدام مدلهای OpenAI برای نفوذ خودمختار به پلتفرم Hugging Face منتشر شده بود.
این اتفاقات یکی از چالشهای توسعه هوش مصنوعی خودمختار را نشان میدهند؛ مدلهایی که میتوانند بدون نظارت مداوم انسان از ابزارها استفاده کنند و برای انجام وظایف تصمیم بگیرند.
آنتروپیک با محدود کردن دسترسی اینترنتی آزمایشهای داخلی تلاش میکند احتمال تکرار چنین رفتارهایی را کاهش دهد. با پیشرفت مدلهای هوش مصنوعی، تعیین محدوده اختیارات و کنترل دسترسی آنها به سامانههای واقعی اهمیت بیشتری پیدا خواهد کرد.
بهنظر شما مدلهای هوش مصنوعی باید برای انجام اقدامات حساس در اینترنت از کاربران اجازه بگیرند؟ دیدگاه خود را در بخش نظرات بنویسید.