قبلاً گزارش شده بود که برخی از عوامل آزمایش OpenAI از محیط ایزوله داخلی خارج شده و در جریان حادثه Hugging Face در تابستان امسال به پلت فرم حمله کردند. این شرکت اکنون شش مورد دیگر را فاش کرده است که قبلاً علنی نشده بودند.
ظاهراً برای چندمین بار این اتفاق افتاده است. OpenAI جزئیات چندین نمونه جدید از رفتار ناسازگار در عوامل هوش مصنوعی آزمایشی خود را منتشر کرده است. نمونه هایی که نشان می دهد این سیستم ها گاهی راه هایی را برای انجام وظیفه محول شده انتخاب می کنند که با دستور کاربر سازگار نیست.
نمونه های جدید رفتار ناسازگار
OpenAI چنین مدل رفتاری را عدم تطابق یا عدم همسویی می نامد. یعنی موقعیتی که در آن مدل برخلاف میل یا دستورالعمل کاربر عمل می کند. هیچکدام از شش مورد جدید به اندازه «بغل کردن صورت» شدید نبوده اند، اما همه آنها الگوی مشابهی را نشان می دهند. عامل هوش مصنوعی برای رسیدن به هدف تعیین شده گاهی رویکردی مبتنی بر انجام کار به هر قیمتی در پیش می گیرد.
در یک مورد، یک مدل تحقیقاتی منتشر نشده OpenAI دستورات فرار از زندان را در بریف های خود پنهان کرده بود. این دستورالعملها به نسخههای بعدی مدل میگفتند که محدودیتهای معمول خود را نادیده گرفته و از چارچوبهای تعیینشده فراتر بروند.
یک پدیده مشابه هنگام آموزش GPT-5.6 Sol مشاهده شد. به گفته OpenAI، برخی از نمونههای این مدل دستورالعملهایی را در خلاصههای خود گنجاندهاند تا اشتباهات یا رفتار ناسازگار خود را از کاربر پنهان کنند.
در موارد دیگر، مدل زمانی که نمیتوانست دادههای تاریخی مورد نظر خود را پیدا کند و به کاربر نگفت که واقعی نیست، دادههای ساختگی تولید میکند. در نمونه دیگری از همین رفتار، از یک مدل تحقیقاتی منتشر نشده خواسته شد تا نام دریاچه هایی با مساحت بیش از 5 میلیون متر مربع را به همراه منابع آنها ارائه کند. نماینده اطلاعات لازم را پیدا کرد، اما فایل خود را در اینترنت آپلود کرد تا از آن به عنوان منبع استفاده کند. بدون اطلاع کاربر از این اقدام.
در یک رویداد جداگانه، برخی از عوامل هوش مصنوعی فایلها را بدون اجازه در اینترنت قرار دادند تا بتوانند از آنها برای دسترسی به فایلهای محلی و همکاری با سایر عوامل استفاده کنند.
در مثالی دیگر، از مدلی در مورد آمار درآمد یک شهرستان در ایالت کالیفرنیا پرسیده شد. مدل به یک کلید API در معرض دید دسترسی پیدا کرد و از آن استفاده کرد. وقتی اطلاعات مورد نظر را از آن منبع به دست نمی آورد، خودش داده های جعلی ایجاد می کرد و در پاسخ ارائه می کرد. این مدل حتی به کاربر گفت که اطلاعات جعلی را از همان منبع درخواستی استخراج کرده است، در حالی که چنین چیزی اتفاق نیفتاده است.
در آخرین مثالی که توضیح داده شد، عوامل از یک مخزن داخلی به عنوان مکانی برای تبادل پیام استفاده کردند. رفتاری که شباهت هایی با حادثه صورت در آغوش داشت. مدل ها از طریق این مخزن در طول نمونه های آموزشی جداگانه با یکدیگر ارتباط برقرار می کنند تا فایل های ورودی گم شده را پیدا کنند.
OpenAI این شش مورد را همراه با ارائه چارچوبی برای گزارش تناقضات مدل منتشر کرده است. گزارش های کامل در مورد هر شش رویداد نیز در وب سایت رسمی OpenAI موجود است. این مثالها نشان میدهند که مشکل به پاسخهای نادرست محدود نمیشود و در برخی شرایط، عوامل هوش مصنوعی ممکن است اطلاعات را مخفی کنند، دادهها را ایجاد کنند، فایلهایی را بدون اجازه در اینترنت قرار دهند یا حتی با نمونههای مدل دیگر برای رسیدن به هدف خود ارتباط برقرار کنند.
















گفتگو در مورد این post