شرکت آنتروپیک اعلام کرد بررسی داخلی این شرکت نشان داده است که سه مدل هوش مصنوعی Claude در جریان ارزیابیهای امنیت سایبری به دلیل یک خطای پیکربندی در محیط آزمایش به اینترنت دسترسی پیدا کرده و موفق به نفوذ غیرمجاز به سامانههای عملیاتی سه سازمان شدهاند. این رخداد پس از افشای نفوذ یکی از مدلهای آزمایشی OpenAI به زیرساختهای Hugging Face مورد بررسی قرار گرفت.
به گزارش گروه ترجمه خبرگزاری برنا به نقل از تک کرانچ، شرکت آنتروپیک روز پنجشنبه اعلام کرد بررسیهای داخلی این شرکت سه مورد نفوذ مدلهای هوش مصنوعی Claude به سامانههای واقعی سازمانها را در جریان آزمایشهای امنیت سایبری شناسایی کرده است.
این افشاگری تنها کمی بیش از یک هفته پس از آن صورت میگیرد که شرکت OpenAI اعلام کرد یکی از مدلهای منتشرنشده این شرکت در جریان آزمایشهای داخلی توانسته بود به سامانههای شرکت Hugging Face نفوذ کند.
آنتروپیک در مطلبی که در وبلاگ رسمی خود منتشر کرده توضیح داد که در هر سه حادثه یکی از مدلهای کلود هنگام تعامل با یک شریک ثالث توانسته از محیط آزمایشی خارج شده و به اینترنت متصل شود و سپس بدون مجوز به سامانههای عملیاتی سه سازمان مختلف دسترسی پیدا کند. این شرکت همچنین اعلام کرد اقدامات جدیدی را برای جلوگیری از تکرار چنین اتفاقاتی در دستور کار قرار داده است.
به گفته آنتروپیک افشای حادثه مربوط به OpenAI انگیزهای شد تا این شرکت ارزیابی امنیتی گستردهای را درباره عملکرد مدلهای خود انجام دهد. هدف این بررسی شناسایی مواردی بود که در آن مدلهای کلود برخلاف طراحی محیطهای آزمایشی موسوم به Sandbox توانسته باشند به اینترنت دسترسی پیدا کنند، محیطهایی که قرار است مدلها را از دنیای واقعی کاملا ایزوله نگه دارند.
این شرکت اعلام کرد از میان ۱۴۱ هزار و ۶ ارزیابی انجامشده سه مورد شناسایی شده که در آن مدل کلود هنگام همکاری با شرکت Irregular یکی از شرکای ثالث آنتروپیک به اینترنت متصل شده است.
بررسیها نشان داد علت این اتفاق پیکربندی اشتباه محیط ارزیابی بوده است. آنتروپیک این رخداد را ناشی از یک سوءتفاهم میان دو شرکت درباره وضعیت دسترسی اینترنت در محیط آزمایش دانست، در حالی که تصور میشد این محیط به اینترنت متصل نیست در عمل چنین دسترسیای وجود داشته است.
آنتروپیک تاکید کرد قصد مقصر دانستن هیچ طرفی را ندارد و اصلاحات لازم را بر مبنای این اصل انجام میدهد که مسئولیت کامل بر عهده خود این شرکت است. در عین حال شرکت Irregular نیز تحقیق مستقل خود را درباره این رخداد آغاز کرده است.
به دلیل همین مسیر ارتباطی باز مدلهای هوش مصنوعی موفق شدند به زیرساختهای عملیاتی سه سازمان مختلف دسترسی غیرمجاز پیدا کنند. آنتروپیک اعلام کرد این حوادث مربوط به سه مدل متفاوت شامل Claude Opus ۴.۷، Mythos ۵ و یک مدل آزمایشی داخلی بوده است.
نکته قابل توجه این است که به گفته آنتروپیک در هر سه مورد، در متن دستور (Prompt) به مدلها به صراحت اعلام شده بود که هیچ دسترسیای به اینترنت ندارند. با این حال مدلها تصور کرده بودند سامانههای واقعی که با آنها مواجه شدهاند بخشی از سناریوی آزمایشی هستند و بر همین اساس به اجرای ماموریت خود ادامه دادهاند.
با این حال رفتار هر سه مدل یکسان نبود. آنتروپیک اعلام کرد Claude Opus ۴.۷ که قدیمیترین مدل در میان این سه مدل بود در هر چهار اجرای مربوط به این حادثه متوجه شد که با یک سامانه عملیاتی واقعی مواجه شده است. در دو مورد مدل این موضوع را اینگونه توجیه کرد که احتمالا شرکت واقعی نیز بخشی از سناریوی آزمایش است و در هر چهار بار حملات خود را ادامه داد. این اقدامات شامل استخراج اطلاعات اعتباری (Credentials) و دسترسی به پایگاه داده حاوی اطلاعات واقعی تولیدی بود.
مدل Mythos ۵ نیز نشانههای اتصال به اینترنت واقعی را تشخیص داد اما در ادامه خود را متقاعد کرد که همچنان در محیط شبیهسازی قرار دارد. این مدل حتی یک بسته نرمافزاری مخرب را در مخزن عمومی بستههای نرمافزاری پایتون PyPI منتشر کرد. این بسته پیش از شناسایی و متوقف شدن توسط برخی سامانههای خارجی دانلود و اجرا شده بود.
در مقابل جدیدترین مدل آزمایشی داخلی آنتروپیک پس از آنکه تشخیص داد هدف واقعی است به صورت خودکار عملیات خود را متوقف کرد و از ادامه حمله خودداری کرد.
آنتروپیک در واکنش به این یافتهها اعلام کرد ارزیابی مدلهای قدرتمند هوش مصنوعی باید با کنترلهای امنیتی بسیار سختگیرانهتری انجام شود، موضوعی که با دیدگاه بسیاری از کارشناسان حوزه امنیت سایبری نیز همسو است.
این شرکت همچنین توضیح داد مدلهای کلود در این آزمایشها بدون سامانههای نظارتی و طبقهبندهای ایمنی که در نسخههای عمومی این مدلها فعال هستند اجرا شده بودند.
به گفته آنتروپیک در صورت فعال بودن این لایههای حفاظتی چنین رفتارهایی مسدود میشد اما هدف این ارزیابیها سنجش تواناییهای خام مدلها بدون مداخلات ایمنی بوده است.
آنتروپیک تاکید کرد هیچ شواهدی مبنی بر اینکه مدلها اهداف مستقلی برای خود تعریف کرده باشند، مشاهده نشده است و تمامی اقدامات آنها صرفا در راستای انجام وظایفی بوده که در قالب دستور به آنها محول شده بود.
این شرکت همچنین میان حادثه خود و رخداد OpenAI تفاوت قائل شد و توضیح داد که در ماجرای OpenAI مدل هوش مصنوعی با سوءاستفاده از یک آسیبپذیری ناشناخته نرمافزاری از محیط آزمایشی خارج شده بود اما در مورد آنتروپیک مدلها تنها از مسیری استفاده کردند که به دلیل یک اشتباه پیکربندی باز مانده بود.
آنتروپیک همچنین اعلام کرد این حوادث را خود و از طریق بررسیهای پیشگیرانه کشف کرده است و سه سازمانی که سامانههای آنها مورد دسترسی قرار گرفته بود پیش از اطلاعرسانی آنتروپیک از وقوع این فعالیتها اطلاعی نداشتند. این در حالی است که در حادثه OpenAI، شرکت Hugging Face ابتدا نفوذ را شناسایی کرد و سپس OpenAI اعلام کرد عامل این نفوذ مدل هوش مصنوعی آزمایشی این شرکت بوده است.
در پایان آنتروپیک اعلام کرد برای بررسی مستقل این حوادث با گروه ارزیابی امنیتی METR همکاری خواهد کرد.
به گفته این شرکت رخداد اخیر OpenAI که نخستین نمونه قابل تایید از خروج کنترل یک آزمایشگاه هوش مصنوعی بر مدل خود به شمار میرفت واکنشهای گستردهای را در میان فعالان صنعت و سیاستگذاران برانگیخت و اکنون افشای این حوادث از سوی آنتروپیک نیز احتمالا بحثها درباره امنیت مدلهای هوش مصنوعی و شیوه ارزیابی آنها را وارد مرحله تازهای خواهد کرد.
انتهای پیام/