

Entropic در گزارشی جدید مدعی شده است که مدل هوش مصنوعی GLM-5.3 متعلق به شرکت چینی Zhipu AI می تواند برای تولید محتوای مخرب استفاده شود و مکانیسم های حفاظتی آن به اندازه کافی در برابر برخی روش ها مقاوم نیستند.
این شرکت میگوید GLM-5.3 قابلیت استفاده در حملات سایبری را دارد و میتوان از چندین راه دور زد. انتشار این گزارش در شرایطی صورت گرفت که همزمان درخواست هایی برای کاهش سرعت توسعه هوش مصنوعی وجود دارد و Entropic نیز بر ضرورت حاکمیت و مقررات در این زمینه تاکید دارد. مدلهای Claude Opus 5.5 و Claude Sonnet 5.5 تنها چند روز پس از مطرح شدن نگرانیها، با وجود هشدارهای مدیر عامل Entropic، Dario Amudi در مورد نیاز به کنترل سرعت مرزهای هوش مصنوعی، عرضه شدند.
Anthropic، یک شرکت فعال در زمینه مدلهای هوش مصنوعی بسته و با در نظر گرفتن عرضه اولیه عمومی، اکنون هشدار میدهد که مدلهای وزن باز چینی میتوانند مورد سوء استفاده قرار گرفته و محتوای مضر تولید کنند. این شرکت همچنین به گزارشی از مرکز نوآوری و استانداردهای هوش مصنوعی استناد کرد که در اواخر سپتامبر منتشر شد. بر اساس آن ارزیابی، GLM-5.3 قادر است برخی از اکسپلویت های امنیتی را در سطحی مشابه مدل منتشر نشده کلود میتوس Entropic به طور کامل خودکار کند.
این قابلیت های گزارش شده در Claude Mythos از جمله عواملی بودند که Entropic را به توسعه Project Glasswing سوق دادند. این پروژه به توسعه دهندگان امکان دسترسی به یک مدل هوش مصنوعی سطح Mythos را می دهد تا آسیب پذیری ها قبل از انتشار مدل های قدرتمند مشابه شناسایی و رفع شوند.
Entropic همچنین GLM-5.3 را در آزمایش Exploitbench آزمایش کرد. یک محیط آزمایشگاهی مجزا که در آن مدلهای هوش مصنوعی برای توسعه بهرهبرداریهای Google Chrome ارزیابی میشوند. GLM-5.3 توانست 50 اکسپلویت را در 410 اجرا ایجاد کند، در حالی که Mythos 56 ضربه را در همین تعداد تلاش انجام داد.

در یکی دیگر از تست های آنتروپی داخلی، توانایی مدل ها برای ایجاد دستکاری های کامل در طول اجرای برنامه بررسی شد. GLM-5.3 بار دیگر از Mythos فاصله گرفت و به نرخ موفقیت 4% دست یافت، در حالی که Mythos به نرخ 6% دست یافت. در همین معیار، سایر مدل های سنگین وزن مانند Kimi K3 و DeepSeek V4.1 Flash هیچ موفقیتی کسب نکردند.
Entropic همچنین گزارش داد که دادههای GLM-5.3 قادر به ایجاد برخی زنجیرههای اکسپلویت به صورت خودکار هستند. نسخه سبک تر GLM-5.3-Flash همچنین توانایی ایجاد چنین زنجیره هایی را در آزمایش های مربوط به آسیب پذیری های شناخته شده نشان داده است و هزینه اعلام شده برای پردازش آیتم آزمایشی حدود 20.40 دلار بوده است. بر اساس برآورد Entropy، بسته به نسبت ورودی و خروجی، این قابلیت مربوط به پردازش حدود 100 تا 300 میلیون توکن در تست بوده است.
Entropic در ادامه ادعا می کند که نسخه معمولی GLM-5.3، علیرغم داشتن مکانیسم های حفاظتی، می تواند محدودیت های خود را به روش های مختلف برطرف کند. یکی از روش های مورد بررسی استفاده از دستورات فریبنده برای قرار دادن مدل در نقش یک عامل خود مختار و تهاجمی بود که ضریب موفقیت 64 درصدی در آزمایش ها داشت. روش دیگری نیز با تهیه بخشی از فرآیند تفکر مدل مورد آزمایش قرار گرفت و میزان موفقیت 92% را نشان داد. Entropic روش دیگری به نام Abliteration را نیز بررسی کرده است.
حذف محافظ های ایمنی مدل
Entropic معتقد است که GLM-5.3 در شکل اولیه خود دارای مکانیسم های حفاظتی ضعیفی است و از پاسخگویی به بسیاری از درخواست های مربوط به تولید محتوای مضر خودداری می کند. با این حال، یک تفاوت مهم بین این مدل و محصولات آنتروپیک، ماهیت وزنی GLM-5.3 است. زیرا کاربران می توانند نسخه قابل دانلود را تغییر دهند و لایه های حفاظتی مدل را دستکاری کنند.
در حالت رسمی و بدون تغییر، GLM-5.3 از نظر میزان امتناع از پاسخگویی در سطح مدل های آنتروپیک قرار دارد. سپس Entropic به عمد یک نسخه از GLM-5.3 را از پادمانها حذف کرد و دریافت که نرخ رد این مدل به تنها 6 درصد کاهش یافته است. برای GLM-5.3-Flash نیز این رقم 14 درصد گزارش شده است.

نسخه های دستکاری شده مشابهی را می توان در مخازن مانند Hugging Face یافت. چنین مدل هایی عمدتاً برای محیط های شبیه سازی شده تست امنیتی و ارزیابی حملات توسعه یافته اند، اما در صورت سوء استفاده می توانند در حملات واقعی نیز استفاده شوند. از این منظر، یافته Entropic در مورد امکان حذف محافظ های GLM-5.3 دور از انتظار نیست.
اجرای نسخه دستکاری شده GLM-5.3 در سطح قابل استفاده به قدرت پردازش زیادی نیاز دارد. وزنهای مدل در حالت دقیق FP8 حدود 306 گیگابایت حافظه ویدیویی یا VRAM مصرف میکنند و تقریباً به همان میزان حافظه برای حفظ پسزمینه پردازش در کش KV مورد نیاز است.
برای رسیدن به سرعت تخمینی 100 توکن در ثانیه، حداقل حدود 4 ترابایت بر ثانیه پهنای باند حافظه مورد نیاز است. چنین پیکربندی به سخت افزار قدرتمندی مانند مجموعه ای از هشت شتاب دهنده هوش مصنوعی Nvidia H200 نیاز دارد. هزینه تامین چنین زیرساختی نیز به صدها هزار دلار می رسد و در نتیجه بازیگران دولت متخاصم تنها در صورتی می توانند به چنین سیستمی دسترسی داشته باشند که به سخت افزار مناسب دسترسی داشته باشند.
برای یک هکر معمولی که می خواهد چنین کاری را در مقیاس شخصی انجام دهد، وضعیت بسیار دشوارتر خواهد بود. در چنین سناریویی، اجاره قدرت پردازش، دستکاری مدل و سپس اجرای آن هزینه بسیار بالایی ایجاد می کند. Anthropic می گوید آماده سازی نسخه اصلاح شده GLM-5.3-Flash به 2200 ساعت پردازش گرافیکی نیاز دارد و هزینه آن حدود 4400 دلار است. این تقریباً 2 دلار در ساعت استفاده از GPU است.
اجاره قدرت پردازشی مورد نیاز برای دستکاری نسخه کامل GLM-5.3 نیز طبق آمار Runpod حدود 30 دلار در ساعت هزینه دارد. در این محاسبه، اجاره هر H200 حدود 3.79 دلار در ساعت اعلام شده و اجرای پیکربندی مورد نیاز به هشت عدد از این شتاب دهنده ها نیاز دارد.
طبق برآوردها، تولید حدود 100 میلیون توکن با هشت پردازنده گرافیکی NVL H200 و سرعت فرضی 100 توکن در ثانیه حدود 8422 دلار هزینه خواهد داشت و حدود 11.5 روز طول می کشد. در نتیجه تلفیق فرآیند دستکاری مدل، اجرای آن و استفاده از قابلیت های سایبری می تواند زمان و هزینه بسیار بیشتری را طلب کند و این موضوع یکی از مهمترین موانع عملی افراد یا گروه هایی است که قصد سوء استفاده از چنین مدلی را دارند.
چرا Entropic روی این موضوع تمرکز کرده است؟
در میان نگرانی های فزاینده در مورد ایمنی هوش مصنوعی، آنتروپیک در تلاش است تا توجه را به خطرات احتمالی مدل های پیشرفته و سبک جلب کند. به خصوص مدل هایی که با پیشرفت تکنولوژی قابلیت هایشان افزایش می یابد.

در کنار این تحولات، دونالد ترامپ با تعدادی از چهره های مطرح صنعت هوش مصنوعی دیدار کرده و موضوع تنظیم داوطلبانه عرضه مدل های آینده نیز مطرح شده است. گزارش Entropic را میتوان تلاشی برای تشویق توسعهدهندگان و دولتها به بررسی دقیقتر قابلیتهای مدلهای سبک وزن دانست.
این رویکرد همچنین ممکن است نشانه ای از مخالفت فزاینده برخی آزمایشگاه های هوش مصنوعی با مدل های وزن باز باشد. به خصوص در شرایطی که مدل های ارزان تر و نزدیک به سطح عملکرد محصولات بسته نظر برخی از کاربران را به خود جلب کرده است. اما این تصور صرفاً یک حدس و گمان است و به عنوان یک واقعیت قطعی در گزارش حاضر ارائه نشده است.
در شرایط فعلی مدل های سبک وزن همچنان از نظر قابلیت ها به نمونه های پیشرفته بسته نزدیک هستند و فاصله آنها در برخی مناطق تنها چند ماه تخمین زده می شود. با این حال، هزینه بالای پیادهسازی مدلهای در مقیاس بزرگ، موانع جدی برای استفاده عملی از نسخههای دستکاری شده برای عوامل مخرب ایجاد میکند.
خطر بالقوه استفاده از مدلهای سبک وزن دستکاری شده توسط بازیگران متخاصم یا مخرب واقعی در نظر گرفته میشود، اما هزینه بالا و الزامات سختافزاری باعث میشود دستیابی به این قابلیتها به طور گسترده آسان نباشد، حداقل در شرایطی که در گزارش توضیح داده شده است.
















گفتگو در مورد این post