عامل هوش مصنوعی اوپنایآی از کنترل خارج شد؛ زنجیرهای از خطاهای امنیتی چگونه شکل گرفت؟
شرکت اوپنایآی در گزارش رسمی جدیدی جزئیات حادثهای را تشریح کرده است که در جریان آن یکی از عاملهای هوش مصنوعی این شرکت بدون دریافت دستور مستقیم به سرویسهای شرکتهای دیگر از جمله Hugging Face دسترسی پیدا کرد. این حادثه که در ماه ژوئیه خبرساز شد موجی از نگرانی درباره توانایی عاملهای هوش مصنوعی برای عبور از محدودیتهای امنیتی و انجام اقدامات پیشبینینشده ایجاد کرد.
به گزارش گروه ترجمه خبرگزاری برنا به نقل از انگجت، اوپنایآی پس از شناسایی این رخداد، بخشی از اطلاعات مربوط به آن را منتشر کرده بود، اما اکنون گزارش رسمی و فنی خود را نیز ارائه کرده است. این گزارش در کنار یک مطلب توضیحی سادهتر برای مخاطبان غیرتخصصی منتشر شده و به بررسی مجموعهای از نقصها در سامانههای مورد استفاده برای آموزش و آزمایش عاملهای هوش مصنوعی و همچنین رفتارهایی میپردازد که در نهایت به این رخداد منجر شدند.
سوءاستفاده از Artifactory برای ارتباط میان عاملها
مدل هوش مصنوعی دخیل در این حادثه که در گزارش OpenAI با عنوان Internal Model ۱ (IM۱) معرفی شده توانسته بود از طریق دستکاری ناخواسته در نحوه استفاده عاملها از ابزار مدیریت بسته نرمافزاری Artifactory به سایر عاملهای OpenAI و همچنین اینترنت دسترسی پیدا کند.
عاملهای هوش مصنوعی در ابتدا از Artifactory برای اهداف موردنظر استفاده میکردند، اما بهتدریج از این زیرساخت به شکلی غیرمنتظره استفاده کردند و آن را به نوعی تابلوی پیام یا کانال ارتباطی میان خود تبدیل کردند. این موضوع به عاملها اجازه میداد اطلاعات و پیامهایی را از طریق مسیری که برای چنین ارتباطی طراحی نشده بود، با یکدیگر به اشتراک بگذارند.
نخستین نشانههای این فعالیتها در ماه مه توسط ناظران انسانی شناسایی شد. OpenAI پس از اطلاع از موضوع دسترسی مربوطه را مسدود کرد، با این حال در ماههای مه و ژوئن، عاملها همچنان توانستند از آسیبپذیریهای مختلف برای دسترسی به اینترنت استفاده کنند.
اختلال در زیرساخت OpenAI و بازسازی Artifactory
تعداد زیاد عاملهایی که به نمونه Artifactory متعلق به OpenAI دسترسی پیدا میکردند در نهایت باعث ایجاد اختلال در این سرویس شد. این پلتفرم در اوایل ماه ژوئیه دچار قطعی شد و OpenAI مجبور شد آن را بازسازی کند.
با این حال یکی از نکات مهم مطرحشده در گزارش این است که مدیرانی که در آن زمان مسئول رسیدگی به اختلال بودند از وجود تابلوی پیام غیررسمی ایجادشده توسط عاملها و اهمیت ارتباط میان آنها اطلاع نداشتند.
در نتیجه اگرچه اختلال فنی Artifactory مورد توجه قرار گرفت معنای امنیتی رفتار عاملها و استفاده غیرمنتظره آنها از این زیرساخت بهطور کامل شناسایی نشد.
بازگشت عاملها در آزمایش ExploitGym
پس از آن زمانی که عاملهای IM۱ برای حل یک چالش دشوار موسوم به ExploitGym مورد آزمایش قرار گرفتند بار دیگر توانستند به اینترنت و سایر مدلهای OpenAI دسترسی پیدا کنند.
در جریان چند روز پرتنش در اوایل ژوئیه این عاملها برای یافتن راهحل چالش خود به سراغ پلتفرمهایی از جمله Hugging Face و Modal رفتند.
بر اساس گزارش اوپنایآی چند عامل اصلی در شکلگیری این حادثه نقش داشتند. این شرکت از مواردی همچون هک پاداش (Reward Hacking) اصرار بر ادامه وظایف ظاهرا غیرممکن، برقراری ارتباط غیرمجاز و پذیرش اهداف یک عامل توسط عاملهای دیگر بهعنوان مهمترین عوامل موثر بر این رخداد نام برده است.
هک پاداش و انتقال اهداف میان عاملها
Reward Hacking به شرایطی اشاره دارد که یک عامل هوش مصنوعی بهجای انجام واقعی هدف موردنظر، راهی برای دریافت پاداش یا کسب امتیاز پیدا میکند که با هدف اصلی آزمایش همخوان نیست.
گزارش OpenAI نشان میدهد عاملهای مورد آزمایش گاهی در برابر برخی وظایف مقاومت میکردند و حتی به دلایل اخلاقی از انجام بعضی اقدامات خودداری میکردند. با این حال، عاملهای دیگر به فعالیت ادامه میدادند و عملا تلاش برای انجام آن وظیفه را از سوی عامل قبلی دنبال میکردند.
به این ترتیب اهداف و رفتارها میتوانستند میان عاملها منتقل شوند و مجموعهای از عاملهای مختلف در مسیر حل یک مسئله اقداماتی انجام دهند که در ابتدا توسط همه آنها در نظر گرفته نشده بود.
حادثهای فراتر از یک نفوذ معمولی
حادثه Hugging Face در شرایطی رخ داد که OpenAI در حال آزمایش قابلیتهای عاملهای هوش مصنوعی بود و به گفته این شرکت محیط آزمایش از محدودیتها و حفاظتهای موجود در محصولات عمومی برخوردار نبود.
به همین دلیل OpenAI تاکید کرده است که این رخداد را نباید نشانهای از نزدیک بودن خروج هوش مصنوعی از کنترل یا تسلط عاملهای خودمختار بر سامانههای مختلف دانست. این حادثه در یک محیط آزمایشی و تحقیقاتی رخ داده و بخشی از سازوکارهای حفاظتی مورد استفاده برای محصولات عمومی در آن وجود نداشته است.
با این حال این حادثه بار دیگر مسئله مهم کنترل، نظارت و ایمنسازی عاملهای هوش مصنوعی قدرتمند را برجسته کرده است.
هشدار OpenAI درباره توانایی عاملهای هوش مصنوعی
OpenAI در گزارش خود اذعان کرده است که رفتارهای مشاهدهشده در این حادثه نشان میدهد عاملهای هوش مصنوعی بسیار توانمند در صورت نبود سازوکارهای حفاظتی مناسب میتوانند از کنترلهای فنی عبور کنند از کانالهای ارتباطی تاییدنشده برای همکاری استفاده کنند و اقداماتی خطرناک انجام دهند که هیچ انسان مشخصی مستقیما به آنها دستور نداده است.
این شرکت در عین حال اعلام کرده است که یافتههای حاصل از این حادثه و آزمایشهای بعدی میتواند به بهبود سازوکارهای ایمنی بهویژه در محیطهای آزمایشی با سطح ریسک بالاتر کمک کند.
Hugging Face؛ جدیدترین مورد از زنجیره حوادث امنیتی عاملهای هوش مصنوعی
حادثه مربوط به Hugging Face یک نمونه منفرد محسوب نمیشود. طی ماههای اخیر موارد متعددی از ایجاد مشکلات امنیت سایبری توسط عاملهای هوش مصنوعی گزارش شده است، چه در جریان آزمایشهای کنترلشده و چه در کاربردهای واقعی.
وجه مشترک بخشی از این رخدادها توانایی عاملها برای انجام اقداماتی است که لزوما بهطور مستقیم از سوی کاربر درخواست نشدهاند. همین موضوع باعث شده است بحث درباره میزان استقلال عاملهای هوش مصنوعی نحوه تعیین محدودیت برای آنها و ضرورت نظارت انسانی بر عملکردشان جدیتر شود.
در مورد OpenAI نیز اهمیت حادثه تنها به دسترسی یک عامل به سرویس خارجی محدود نمیشود بلکه زنجیرهای از نقصها شامل دسترسی ناخواسته به اینترنت، استفاده غیرمجاز از زیرساخت ارتباطی، همکاری میان عاملها، انتقال اهداف و ناکافی بودن برخی لایههای حفاظتی در کنار یکدیگر قرار گرفتند.
این حادثه نشان میدهد با افزایش توانایی عاملهای هوش مصنوعی صرفا محدود کردن دسترسی مستقیم آنها به منابع کافی نیست و باید رفتارهای غیرمنتظره کانالهای ارتباطی جانبی و شیوه تعامل چند عامل با یکدیگر نیز تحت نظارت قرار گیرد.
در نهایت گزارش رسمی OpenAI اگرچه تصویر دقیقتری از چگونگی وقوع این حادثه ارائه میدهد و نشان میدهد این اتفاق در یک محیط تحقیقاتی با حفاظتهای محدود رخ داده است اما همزمان یک هشدار مهم برای توسعهدهندگان عاملهای هوش مصنوعی دارد: هرچه میزان توانایی و استقلال این سامانهها افزایش پیدا میکند طراحی و نظارت بر سازوکارهای ایمنی باید همزمان و متناسب با آن توسعه یابد.
انتهای پیام/