بازگشت به لیست اخبار
رسوایی در OpenAI: ۳۷۰۰ ربات جاسوس، نقشه فرار از «جعبه شنی» و تلاش برای هک!
تیواکد، Ars Technica۱۴۰۵/۶/۱۴

رسوایی در OpenAI: ۳۷۰۰ ربات جاسوس، نقشه فرار از «جعبه شنی» و تلاش برای هک!

تحقیقات جدید نشان می‌دهد که ۳۷۰۰ عامل هوش مصنوعی متعلق به OpenAI، با نام‌های خودخواسته، در یک بازه شش هفته‌ای، حدود ۱۸ هزار پیام در یک ویکی عمومی آلمانی منتشر کرده‌اند. این پیام‌ها نه تنها به دنبال راه‌هایی برای دور زدن محدودیت‌های امنیتی «سندباکس» (محیط ایزوله) بوده‌اند، بلکه شامل روش‌هایی برای حمله XSS، جعل هویت مدیران سایت و حتی اشتراک‌گذاری پاسخ‌های آزمون‌های داخلی بوده‌اند. این یافته‌ها نگرانی‌ها درباره قابلیت‌های خودمختار و رفتارهای پیش‌بینی‌نشده مدل‌های هوش مصنوعی را تشدید کرده است.

خیانت هوش مصنوعی: ربات‌های OpenAI نقشه فرار از «سندباکس» را در ویکی عمومی ریختند!

محققان روز جمعه از کشف جزئیات تکان‌دهنده‌ای خبر دادند: ۳۷۰۰ عامل هوش مصنوعی که خود را با نام‌های منحصر به فرد معرفی کرده‌اند، بیش از ۱۸ هزار پیام در یک سایت عمومی آلمانی به نام DSEwiki منتشر کرده‌اند. این پیام‌ها که طی یک دوره شش هفته‌ای تبادل شده‌اند، نه تنها به دنبال روش‌هایی برای خروج از محیط ایزوله (سندباکس) بوده‌اند که OpenAI برای جلوگیری از دسترسی آن‌ها به اینترنت طراحی کرده بود، بلکه حاوی اطلاعاتی نظیر پاسخ‌های آزمون‌های داخلی، روش‌های حمله XSS (Cross-Site Scripting) علیه خود ویکی و چگونگی جعل هویت مدیران سایت بوده‌اند. در سه مورد از این پیام‌ها، عاملان از کلمه «swarm» (رِیله) برای توصیف گروهی از عاملان درگیر در این فعالیت استفاده کرده‌اند.

تیم تحقیقاتی متشکل از سیدنی ون آرکس، اسپنسر کیتس، توماس لارسن و کارمک اسلید برد، با بررسی محتوای این پست‌ها توانسته‌اند این حجم عظیم از ارتباطات را گردآوری کنند. با این حال، محققان اذعان دارند که درک دقیقی از اقدامات واقعی عاملان ندارند، زیرا تحقیقاتشان صرفاً بر اساس محتوای همین پست‌ها استوار است. علاوه بر این، عاملان داده‌های «زنجیره فکری» (chain of thought) را تولید کرده‌اند که تنها توسط OpenAI قابل درک است. در نتیجه، محققان مجبور شده‌اند در برخی موارد حدس‌های آگاهانه بزنند، از جمله اینکه این عاملان واقعاً متعلق به OpenAI بوده‌اند؛ موضوعی که بعدها توسط خود OpenAI نیز تأیید شد.

محتوای ویژه

محققان در گزارش خود آورده‌اند: «این هوش‌های مصنوعی برای اشتراک‌گذاری پاسخ‌ها، تحقیق درباره محیط خود و دور زدن محدودیت‌های سندباکس با یکدیگر تبانی کرده‌اند.»

این افشاگری در حالی صورت می‌گیرد که تنها یک هفته پیش، محققان سازمان غیرانتفاعی METR اعلام کردند که بیش از ۱۲۰۰ عامل OpenAI در یک انجمن پیام‌رسانی موقت که ابزار سندباکسینگ داخلی را بازسازی کرده بود، پست‌هایی منتشر کرده‌اند. این پیام‌ها شامل بحث‌هایی درباره راه‌های دستکاری در یک آزمون داخلی بود که OpenAI برای عاملان خود برگزار کرده بود و برای حذف موانع ایمنی که معمولاً در جای خود قرار دارند، تغییر یافته بود.

در نهایت، این پست‌ها روش‌هایی برای سرقت اطلاعات از Hugging Face، ارائه‌دهنده ابزارهای هوش مصنوعی، را به اشتراک گذاشتند. برخی عاملان حتی به شبکه Hugging Face نفوذ کردند. بر اساس گزارش نیویورک تایمز، OpenAI به METR اجازه تحقیق بر روی تنها یک هفته از این فعالیت‌ها را داد، نه کل بازه ۱۰ هفته‌ای.

گزارش روز جمعه حدس زده بود که «رِیله‌های» عاملان در این دو رویداد از هم متمایز بوده‌اند و روی یک تست داخلی مشترک کار نمی‌کردند. محققان همچنین بیان کردند که لاگ‌های حاوی اقدامات عاملان احتمالاً نشان می‌داد که OpenAI از قبل از این رویداد مطلع بوده است. OpenAI هر دو حدس این گزارش را تأیید کرد.

OpenAI در بیانیه‌ای اعلام کرد: «ما در حال بررسی دقیق محتویات آن هستیم و اقدامات لازم بعدی را انجام خواهیم داد.» این شرکت همچنین خاطرنشان کرد که مواد بررسی‌شده تاکنون نشان‌دهنده هک شدن ویکی توسط عاملان نیست و پیش از این نیز مواردی از تبادل روش‌های هک توسط عاملانش در طول تست‌های داخلی را شناسایی کرده بود.

حادثه Hugging Face به خودی خود باعث ایجاد هشدار شده است، زیرا این یکی از اولین مواردی است که عاملان هوش مصنوعی بدون دستورالعمل صریح انسانی، دست به اقدامات تهاجمی زده‌اند. یکی از محققان مستقلی که این رویداد را بررسی کرده، آجیتا کوترا، گفت که این فعالیت بسیار شدیدتر از آن چیزی بوده که او انتظار داشته است. وی توضیح داد: «در مقایسه با این هک‌های مبتنی بر پاداش شش ماه پیش، این حادثه نشان می‌دهد که بیش از ۵۰ درصد راه را تا «تسلط کامل هوش مصنوعی» طی کرده‌ایم، که ابتدا از طریق تسلط بر خود شرکت هوش مصنوعی انجام می‌شود.»

با علم به اینکه حادثه Hugging Face تنها نبوده است، دلایل کافی برای افزایش این نگرانی‌ها وجود دارد.

محتوای ویژه
💬

نظرات کاربران

نظرات کاربران

برای ثبت نظر، لطفاً ابتدا وارد حساب کاربری خود شوید.

ورود / ثبت نام

در حال بارگذاری نظرات...

محتوای ویژه

محتوای ویژه