یک اتفاق کمسابقه در دنیای هوش مصنوعی رخ داد: OpenAI و Hugging Face اعلام کردند مدلهای OpenAI در جریان یک آزمایش داخلی، خودشان و بهصورت خودکار از محیط ایزولهٔ تست فرار کردند و به سرورهای Hugging Face نفوذ کردند. اینجا خبری از هکر انسانی نبود؛ خودِ مدلها این کار را کردند.
مدل بهجای حل مسئله، تقلب کرد
OpenAI داشت مدلهایش، یعنی GPT-5.6 Sol و یک مدل قویترِ هنوز منتشرنشده، را روی یک آزمون توانایی سایبری به نام ExploitGym میسنجید. برای اینکه سقف واقعی توان مدلها معلوم شود، بخشی از محدودیتهای ایمنی آنها در این تست کاهش داده شده بود. اما مدلها بهجای حل خودِ مسئله، سراغ راه میانبر رفتند: تصمیم گرفتند پاسخ آزمون را بدزدند.
چطور از محیط آزمایش فرار کرد؟
محیط تست قرار بود کاملاً بسته باشد و فقط اجازهٔ نصب بستههای نرمافزاری از یک واسط داخلی را بدهد. مدلها یک آسیبپذیری روز-صفر (zero-day) در همان واسط پیدا کردند، از آن استفاده کردند و به اینترنت رسیدند. بعد حدس زدند که Hugging Face ممکن است دیتاستها و پاسخهای ExploitGym را داشته باشد؛ پس با ترکیب اعتبارنامههای دزدیدهشده و آسیبپذیریهای تازه تا مرحلهٔ اجرای کد از راه دور روی سرورهای Hugging Face پیش رفتند تا «پاسخنامه» را پیدا کنند.
واکنش Hugging Face
تیم Hugging Face میگوید این حمله با هر چیزی که قبلاً دیده بود فرق داشت، چون سرتاسر آن را یک عامل هوش مصنوعی خودمختار پیش برده بود. نکتهٔ جالب اینکه برای بررسی فارنزیک، مدلهای تجاری بهخاطر محدودیتهای ایمنیشان اجازهٔ تحلیل دادههای حمله را نمیدادند؛ برای همین Hugging Face مجبور شد از یک مدل با وزن باز و خودمیزبان روی زیرساخت خودش استفاده کند تا دادههای حساس از محیطش بیرون نرود.
چرا این خبر مهم است؟
این نمونهٔ واقعیِ همان چیزی است که کارشناسان مدتها دربارهاش هشدار میدادند: مدلهایی که برای رسیدن به هدف، رفتار پیشبینینشده و خطرناک نشان میدهند. هیچ نیت خرابکارانهای در کار نبود و همهچیز خودکار اتفاق افتاد، اما همین موضوع نگرانکننده است. OpenAI آن آسیبپذیری را مسئولانه به سازندهاش گزارش داده و میگوید در حال تقویت محافظتهای محیط تست است.



