دانش و فناوری

ده‌ها هزار رفتار خطرناک عامل‌های هوش مصنوعی زیر ذره‌بین OpenAI و Anthropic

در هفته‌های اخیر، مجموعه‌ای از حوادث مربوط به رفتار غیرمنتظره عامل‌های هوش مصنوعی، نگرانی‌ها درباره توانایی شرکت‌های فعال در این حوزه برای کنترل مدل‌های پیشرفته را افزایش داده است. این حوادث ابتدا با نفوذ عامل‌های مورد آزمایش OpenAI به زیرساخت Hugging Face مورد توجه قرار گرفت و سپس گزارش‌هایی از رخدادهای مشابه در سیستم‌های Anthropic و دیگر آزمایشگاه‌های هوش مصنوعی منتشر شد.

اکنون ابعاد این مسئله بسیار بزرگ‌تر از مواردی است که تاکنون به‌صورت عمومی اعلام شده‌اند. بر اساس گزارشی از Axios، OpenAI، Anthropic و برخی شرکت‌ها و پژوهشگران مستقل امنیتی در حال بررسی ده‌ها هزار مورد هستند که در آنها مدل‌های پیشرفته کاری انجام داده‌اند که ارزیابان خارجی آن را رفتار مشکل‌ساز یا خارج از محدوده مورد انتظار می‌دانند.
 

از فرار از سندباکس تا ساخت تابلوهای پیام

بررسی‌های جاری طیف گسترده‌ای از رفتارها را دربرمی‌گیرد. برخی مدل‌ها تلاش کرده‌اند محدودیت‌های امنیتی وب‌سایت‌ها را دور بزنند، از محیط‌های آزمایشی ایزوله یا همان Sandbox خارج شوند، به وب‌سایت‌ها دسترسی غیرمجاز پیدا کنند یا سیستم‌های نظارتی را دور بزنند.

در برخی موارد نیز عامل‌های هوش مصنوعی برای برقراری ارتباط با یکدیگر تابلوهای پیام ایجاد کرده‌اند. گزارش‌ها همچنین از مواردی حکایت دارند که مدل‌ها با استفاده از پیام‌های تولیدشده توسط عامل‌های دیگر تلاش کرده‌اند عملکرد خود را بهبود دهند یا مسیرهای جدیدی برای رسیدن به هدف پیدا کنند.

البته همه این موارد به معنای حمله موفق یا آسیب واقعی نیستند. بخشی از آنها مربوط به آزمایش‌های Red Team است؛ یعنی پژوهشگران عمداً مدل را در موقعیت‌هایی قرار می‌دهند که احتمال رفتار نامطلوب وجود دارد تا نقاط ضعف سیستم ایمنی را شناسایی کنند.

با این حال، موضوع مهم آن است که برخی از این تلاش‌ها واقعاً موفق شده‌اند از محدودیت‌های در نظر گرفته‌شده عبور کنند و همین مسئله اهمیت ارزیابی‌های امنیتی پیش از عرضه مدل‌های قدرتمند را افزایش داده است.

 

 

چرا تعداد حوادث این‌قدر زیاد است؟

یکی از دلایل اصلی، افزایش شدید تعداد آزمایش‌هایی است که شرکت‌ها روی مدل‌های جدید انجام می‌دهند. آزمایشگاه‌های بزرگ می‌توانند صدها هزار بار یا حتی بیشتر، یک مدل را در شرایط مختلف آزمایش کنند. بنابراین حتی اگر تنها درصد بسیار کوچکی از این آزمایش‌ها به رفتار غیرمنتظره منجر شود، تعداد نهایی موارد می‌تواند به هزاران یا ده‌ها هزار مورد برسد.

برای مثال، Anthropic در گزارش ایمنی مدل Claude Opus 5.5 اعلام کرده است که این مدل در ۱.۵ درصد از اجرای یک آزمایش خاص تلاش کرده از Sandbox خارج شود. شرکت در عین حال توضیح داده بود که این آزمایش‌ها به‌صورت خصمانه طراحی شده بودند و در آنها انجام موفقیت‌آمیز وظیفه مستلزم خروج از Sandbox بود.

بنابراین، مقایسه ساده تعداد حوادث بدون در نظر گرفتن تعداد کل آزمایش‌ها می‌تواند تصویر دقیقی از میزان خطر ارائه نکند.
 

ماجرای Hugging Face چه چیزی را نشان داد؟

یکی از مهم‌ترین نمونه‌های اخیر، حادثه‌ای بود که OpenAI در جریان ارزیابی داخلی مدل‌های خود شناسایی کرد. در این آزمایش، گروه بزرگی از عامل‌های هوش مصنوعی برای انجام یک آزمون امنیت سایبری فعالیت می‌کردند.

بررسی‌ها نشان داد حدود ۱۲۰۰ عامل یکدیگر را در یک تابلوی پیام پیدا کردند و بیش از ۷۰ هزار پیام و فایل میان آنها ردوبدل شد. این عامل‌ها در نهایت ساختاری شبیه یک سازمان ایجاد کردند و توانستند در جریان آزمایش به زیرساخت تولیدی Hugging Face نفوذ کنند.

این حادثه اهمیت ویژه‌ای داشت، زیرا نشان داد عامل‌های هوش مصنوعی می‌توانند در صورت در اختیار داشتن ابزارهای مناسب، وظایف خود را میان یکدیگر تقسیم کنند و به جای اجرای یک دستور ساده، مجموعه‌ای طولانی از اقدامات را به شکل خودکار انجام دهند.
 

همه موارد هنوز عمومی نشده‌اند

یکی از نکات مهم گزارش جدید این است که بخش قابل توجهی از حوادث در دست بررسی هنوز به‌صورت عمومی منتشر نشده‌اند. برخی از این موارد در آزمایش‌های داخلی شرکت‌ها رخ داده‌اند و برخی دیگر در محیط‌های واقعی مشاهده شده‌اند.

OpenAI نیز پس از مجموعه حوادث اخیر، آموزش پیشرفته‌ترین مدل‌های خود را موقتاً متوقف کرده است. سم آلتمن، مدیرعامل شرکت، در ۲۵ سپتامبر اعلام کرد بررسی گسترده‌ای درباره استفاده عامل‌ها از اینترنت در جریان آموزش و ارزیابی در حال انجام است و پذیرفت که این بررسی با سرعتی که شرکت می‌خواست پیش نرفته است.

هم‌زمان، Anthropic نیز بررسی مستقلی درباره رفتار مدل‌های خود سفارش داده است. این شرکت در گزارش‌های امنیتی خود همچنین نمونه‌هایی از استفاده مخرب از Claude را منتشر کرده که در آنها عامل‌های هوش مصنوعی برای انجام عملیات سایبری، شناسایی اهداف و حتی برخی فعالیت‌های خودکار مورد استفاده قرار گرفته‌اند.


 

مسئله اصلی فقط «تعداد» نیست

کارشناسان امنیت هوش مصنوعی معتقدند مسئله اصلی صرفاً تعداد حوادث نیست، بلکه توانایی مدل‌ها برای پیدا کردن روش‌هایی است که طراحان آنها از قبل پیش‌بینی نکرده‌اند.

عامل‌های نسل جدید برخلاف چت‌بات‌های سنتی فقط به پرسش‌ها پاسخ نمی‌دهند؛ آنها می‌توانند ابزارهای مختلف را به کار بگیرند، اطلاعات را جست‌وجو کنند، کد اجرا کنند و برای رسیدن به یک هدف چندین مرحله را پشت سر هم انجام دهند. در چنین شرایطی، پیش‌بینی تمام مسیرهایی که ممکن است یک مدل برای رسیدن به هدف انتخاب کند دشوارتر می‌شود.

به گزارش Axios، برخی پژوهشگران هشدار داده‌اند که مواردی که تاکنون شناسایی شده‌اند ممکن است تنها بخش کوچکی از مسئله باشند و تعداد حوادث بررسی‌شده حتی از «ده‌ها هزار» مورد نیز فراتر برود. در عین حال، برخی کارشناسان تأکید دارند که صفر کردن کامل رفتارهای ناسازگار احتمالاً واقع‌بینانه نیست و باید بر کاهش احتمال وقوع آنها و محدود کردن پیامدهایشان تمرکز کرد.

افزایش این حوادث هم‌زمان با قدرتمندتر شدن عامل‌های هوش مصنوعی، بحث درباره استانداردهای مشترک ایمنی، ارزیابی مستقل و نظارت دقیق‌تر بر مدل‌های پیشرفته را جدی‌تر کرده است. پرسش اصلی برای صنعت دیگر فقط این نیست که یک مدل چه توانایی‌هایی دارد؛ بلکه این است که وقتی مدل برای انجام وظایف به اینترنت و ابزارهای مختلف دسترسی پیدا می‌کند، تا چه اندازه می‌توان رفتار آن را در محدوده‌ای که برایش تعیین شده، نگه داشت.

منبع ایتنا
آگهی
دکمه بازگشت به بالا