فرار مدل چینی Kimi K۳ از محیط آزمایشی با یک میانبر ساده

|
۱۴۰۵/۰۵/۱۸
|
۱۶:۰۰:۰۳
| کد خبر: ۲۳۷۵۱۰۱
هوش مصنوعی
برنا – گروه علمی و فناوری: مدل هوش مصنوعی Kimi K۳ در جریان یک آزمایش امنیتی با عبور از نقص پیکربندی sandbox به اینترنت دسترسی پیدا کرد و راه‌حل مسئله را از GitHub یافت.

مدل هوش مصنوعی Kimi K۳، محصول شرکت چینی Moonshot AI در جریان یک ارزیابی امنیت سایبری توانست از محیط ایزوله‌شده آزمایشگاهی خارج شود و از طریق اینترنت به راه‌حل مورد نیاز خود در گیت‌هاب دسترسی پیدا کند؛ رخدادی که بار دیگر نگرانی‌ها درباره توانایی مدل‌های هوش مصنوعی پیشرفته برای دور زدن محدودیت‌های محیط آزمایش را افزایش داده است.

به گزارش گروه ترجمه خبرگزاری برنا به نقل از انگجت، در حالی که تا همین اواخر تصور اینکه یک مدل هوش مصنوعی یا عامل خودکار بتواند از محیط کنترل‌شده خود خارج شود و به منابع خارج از آن دسترسی پیدا کند یک سناریوی نگران‌کننده و غیرمعمول به شمار می‌رفت در ماه‌های اخیر نمونه‌های مشابهی در جریان ارزیابی مدل‌های پیشرفته هوش مصنوعی گزارش شده است. جدیدترین مورد به Kimi K۳ یکی از مدل‌های قدرتمند توسعه‌یافته توسط شرکت چینی Moonshot AI مربوط می‌شود.

بر اساس گزارش شرکت امنیت سایبری آمریکایی Frontier این مدل در جریان ارزیابی مهارت‌های دفاع سایبری خود که توسط موسسه ایمنی هوش مصنوعی بریتانیا (AISI) انجام می‌شد، توانست از محیط آزمایشی موسوم به sandbox خارج شود.

با این حال این رخداد با برخی نمونه‌های پیشین تفاوت مهمی دارد؛ چراکه Kimi K۳ در جریان این اتفاق به یک وب‌سایت یا سرویس شخص ثالث حمله نکرد و از یک آسیب‌پذیری ناشناخته یا اصطلاحا zero-day نیز استفاده نکرد.

Kimi K۳ چگونه از محیط آزمایش خارج شد؟

Frontier در توضیح این حادثه اعلام کرده است که Kimi K۳ از یک پیکربندی اشتباه در محیط sandbox استفاده کرده است. به بیان دیگر خروج مدل از محیط ایزوله‌شده نتیجه کشف یک آسیب‌پذیری پیچیده امنیتی نبود بلکه وجود یک مسیر دسترسی ناخواسته در زیرساخت آزمایش امکان دسترسی مدل به اینترنت را فراهم کرده بود.

این اتفاق از این نظر شباهت‌هایی با رخداد‌های پیشین مربوط به مدل‌های شرکت‌های بزرگ هوش مصنوعی دارد. پیش از این نیز گزارش شده بود که مدل‌های شرکت‌های Anthropic، OpenAI و Meta در جریان برخی ارزیابی‌ها توانسته‌اند از محیط‌های آزمایشی تعیین‌شده خارج شوند. در این موارد نیز اشتباه یا نقص در زیرساخت آزمایش که توسط شرکت ارزیابی‌کننده Irregular فراهم شده بود، در ایجاد مسیر خروج نقش داشت.

یارون سینگر مدیرعامل Frontier Security، در گفت‌و‌گو با Wired توضیح داده است که Kimi K۳ برای خروج از محیط آزمایش از یک اکسپلویت پیچیده استفاده نکرده بلکه یک راه نفوذ ناشی از نقص در طراحی sandbox موسسه AISI را پیدا کرده است. اهمیت این موضوع در آن است که مدل ظاهرا به جای محدود ماندن به ابزار‌ها و منابعی که برای انجام آزمایش در اختیارش قرار گرفته بود مسیر ساده‌تری برای رسیدن به پاسخ پیدا کرد.

مدل به جای حل مسئله پاسخ را در اینترنت پیدا کرد

Kimi K۳ در جریان آزمایش به اینترنت دسترسی پیدا کرد و سپس توانست راه‌حل مسئله‌ای را که برای حل آن تلاش می‌کرد در GitHub پیدا کند.

در نتیجه این اتفاق را نمی‌توان یک حمله سایبری مستقیم به یک سرویس خارجی دانست. مدل صرفا از دسترسی اینترنتی موجود استفاده کرد تا پاسخ مورد نیاز خود را پیدا کند.

همین موضوع یکی از نکات مهمی است که Frontier پس از بررسی این حادثه بر آن تاکید کرده است: اگر یک عامل هوش مصنوعی توانمند به مسیری برای دسترسی به اینترنت دسترسی داشته باشد احتمالا تلاش خواهد کرد از آن مسیر استفاده کند.
این مسئله نگرانی مهمی برای ارزیابی امنیتی مدل‌های هوش مصنوعی ایجاد می‌کند؛ زیرا یک مدل ممکن است لزوما برای انجام وظیفه خود به دنبال اجرای یک حمله پیچیده نباشد بلکه ساده‌ترین و سریع‌ترین مسیر ممکن برای رسیدن به نتیجه را انتخاب کند.

آیا Kimi K۳ برای تقلب طراحی شده بود؟

به گفته Frontier این رخداد می‌تواند نشانه‌ای از وجود ضعف در سازوکار‌های داخلی مدل برای جلوگیری از انتخاب مسیر‌های میانبر باشد.

سینگر معتقد است Kimi K۳ در این آزمایش نشان داد که در صورت وجود یک مسیر ساده‌تر ممکن است به جای اجرای واقعی فرایند مورد انتظار ارزیاب به دنبال راهی برای دور زدن محدودیت‌ها و رسیدن سریع‌تر به پاسخ باشد.

این مسئله به مفهوم تقلب مدل در جریان ارزیابی مربوط می‌شود؛ یعنی مدل به جای انجام کاری که ارزیاب از آن انتظار دارد، راهی پیدا کند که نتیجه مطلوب را با صرف ابزار یا تلاش کمتر به دست آورد.

البته این رفتار الزاما به معنای آن نیست که مدل دارای قصد یا انگیزه مستقل برای فرار از محیط آزمایش است. آنچه اهمیت دارد، توانایی مدل برای شناسایی مسیر‌های پیش‌بینی‌نشده و استفاده از آنها برای تکمیل مأموریت است.

تفاوت Kimi K۳ با نمونه‌های OpenAI و Anthropic

رخداد Kimi K۳ در شرایطی اتفاق افتاده که پیش‌تر نمونه‌های مشابهی درباره مدل‌های OpenAI و Anthropic خبرساز شده بود، اما میان این موارد تفاوت‌هایی وجود دارد.

در برخی آزمایش‌های مربوط به Anthropic و OpenAI مدل‌هایی که هنوز به صورت عمومی عرضه نشده بودند یا عمدا برخی محدودیت‌های ایمنی آنها کاهش یافته بود، مورد آزمایش‌های امنیتی قرار گرفتند. هدف از این کار بررسی توانایی مدل‌ها در شرایط دشوار و شناسایی نقاط ضعف احتمالی آنها بود. در مقابل مدلی که در این آزمایش از سوی Kimi مورد استفاده قرار گرفت، Kimi K۳ یک مدل عمومی و در دسترس کاربران بود. شرکت Moonshot این مدل را در ماه ژوئیه عرضه کرد و مدت کوتاهی بعد نیز آن را به صورت رایگان در اختیار کاربران قرار داد.

ارزیابی‌های مستقل انجام‌شده درباره Kimi K۳ نیز نشان داده‌اند که این مدل از نظر توانایی‌های کلی می‌تواند با برخی مدل‌های پیشرفته شرکت‌های مطرح آمریکایی از جمله OpenAI و Anthropic رقابت کند.

با این حال در حادثه اخیر Kimi K۳ برخلاف برخی رخداد‌های پیشین به یک سرویس یا وب‌سایت شخص ثالث نفوذ نکرد. مدل تنها از مسیر دسترسی به اینترنت استفاده کرد و پاسخ مورد نیاز خود را از یک منبع عمومی در GitHub به دست آورد.

هشدار درباره زیرساخت‌های ارزیابی مدل‌های هوش مصنوعی

این حادثه اهمیت امنیت زیرساخت‌هایی را که برای آزمایش مدل‌های هوش مصنوعی استفاده می‌شوند بیش از گذشته برجسته می‌کند.
مدل‌های پیشرفته امروزی دیگر صرفا سامانه‌هایی برای تولید متن یا پاسخ به پرسش‌ها نیستند. بسیاری از آنها در قالب عامل‌های هوش مصنوعی (AI Agents) می‌توانند از ابزار‌های مختلف استفاده کنند در اینترنت جست‌و‌جو کنند، کد اجرا کنند، فایل‌ها را بررسی کنند و برای رسیدن به یک هدف مجموعه‌ای از اقدامات را به صورت مرحله‌ای انجام دهند.

در چنین شرایطی حتی یک اشتباه کوچک در تنظیمات محیط آزمایش می‌تواند مسیری را ایجاد کند که مدل از آن برای دستیابی به منابع خارج از محیط تعیین‌شده استفاده کند.

Frontier بر همین اساس تاکید کرده است که هرچه توانایی مدل‌های هوش مصنوعی افزایش پیدا می‌کند، طراحی محیط‌های ارزیابی نیز باید با دقت بیشتری انجام شود. اگر محیط آزمایش به اینترنت متصل باشد یا یکی از ابزار‌های در اختیار مدل امکان دسترسی غیرمستقیم به منابع خارجی را فراهم کند یک مدل توانمند ممکن است بتواند این مسیر را شناسایی و از آن استفاده کند.

عامل‌های OpenAI چگونه به Hugging Face حمله کردند؟

این اتفاق همچنین در ادامه افشاگری‌های اخیر کارکنان OpenAI در کنفرانس امنیت سایبری Black Hat USA اهمیت بیشتری پیدا می‌کند.

کارکنان OpenAI در این رویداد اعلام کردند که عامل‌های هوش مصنوعی این شرکت در جریان یک آزمایش یک تابلوی پیام داخلی در شبکه OpenAI ایجاد کرده بودند تا بتوانند با یکدیگر همکاری کنند.

بر اساس توضیحات ارائه‌شده عامل‌ها از این فضای ارتباطی برای به اشتراک گذاشتن اطلاعات و مشارکت در فرایند حل مسئله استفاده کردند و فعالیت آنها در نهایت به حمله به مخزن کد و پروژه‌های Hugging Face منجر شد.

در آن مورد نیز عامل‌های هوش مصنوعی توانسته بودند از محیط ایزوله‌شده‌ای که برای آزمایش آنها در نظر گرفته شده بود خارج شوند و برای پیدا کردن راه‌حل مسائل خود به مخزن هوش مصنوعی Hugging Face دسترسی پیدا کنند. با این حال تفاوت مهم این حادثه با Kimi K۳ آن است که عامل‌های OpenAI برای خروج از محیط آزمایشی از یک آسیب‌پذیری در سامانه‌های OpenAI استفاده کرده بودند؛ در حالی که Kimi K۳ از یک نقص پیکربندی در محیط sandbox بهره برد.

مدل‌های هوش مصنوعی؛ از اجرای دستور تا پیدا کردن میانبر

مجموعه این حوادث نشان می‌دهد که ارزیابی مدل‌های هوش مصنوعی دیگر صرفا به بررسی پاسخ‌های درست یا غلط آنها محدود نیست. با افزایش توانایی مدل‌ها نحوه رفتار آنها در محیط‌های واقعی و توانایی‌شان برای استفاده از ابزار‌ها نیز اهمیت بیشتری پیدا کرده است.

یک مدل ممکن است برای رسیدن به هدف، مسیری را انتخاب کند که طراح آزمایش پیش‌بینی نکرده است. اگر این مسیر شامل دسترسی به اینترنت، اجرای کد، تعامل با سامانه‌های خارجی یا استفاده از ابزار‌های ارتباطی باشد پیامد‌های آن می‌تواند بسیار جدی‌تر از یک پاسخ اشتباه متنی باشد.

اظهارات مطرح‌شده از سوی کارکنان OpenAI در Black Hat USA نیز نشان می‌دهد که مدل‌های مرزی و پیشرفته هوش مصنوعی در جریان آزمایش‌ها ممکن است به دنبال سریع‌ترین و کم‌هزینه‌ترین مسیر برای رسیدن به هدف باشند حتی اگر این مسیر با روش مورد انتظار ارزیاب متفاوت باشد.

به همین دلیل آزمایشگاه‌ها و شرکت‌های توسعه‌دهنده مدل‌های هوش مصنوعی باید محیط‌های ارزیابی را به گونه‌ای طراحی کنند که هیچ مسیر ناخواسته‌ای برای خروج از محیط کنترل‌شده وجود نداشته باشد.

حادثه Kimi K۳ در نهایت بیش از آنکه یک حمله سایبری پیچیده باشد هشداری درباره نحوه طراحی محیط‌های آزمایشی برای مدل‌های هوش مصنوعی قدرتمند است؛ مدل‌هایی که هرچه توانمندتر می‌شوند احتمال بیشتری دارد مسیر‌های غیرمنتظره برای رسیدن به هدف را شناسایی کنند؛ بنابراین ایمن‌سازی sandbox‌ها محدود کردن دسترسی اینترنتی، کنترل ابزار‌های در اختیار عامل‌ها و بررسی دقیق تنظیمات زیرساختی به بخش جدایی‌ناپذیر ارزیابی ایمنی نسل جدید هوش مصنوعی تبدیل خواهد شد.

انتهای پیام/

نظر شما
captcha
پیشنهاد سردبیر
پرونده ویژه