0ارسال شده توسط: امیر جلالی19 مرداد 1405 ساعت 09:26

مسمومیت حافظه هوش مصنوعی می‌تواند مدل‌های پیشرفته را فریب دهد تا اطلاعات نادرست را برای ماه‌ها به خاطر بسپارند و از آن‌ها در تعاملات بعدی خود استفاده کنند.

اخیراً محققان شرکتفورس‌پوینت(Forcepoint) در بخشX-Labsخود،آسیب‌پذیری AIجدیدی را کشف کرده‌اند که نگرانی‌های جدی در مورد اعتمادپذیری دستیاران هوش مصنوعی ایجاد می‌کند. این کشف نشان می‌دهد چگونه عامل‌های هوش مصنوعی می‌توانند با داده‌های غلط مسموم شوند و آن‌ها را به عنوان حقایق معتبر ذخیره کنند. یافته‌هایفورس‌پوینتدر مورد چگونگی سوءاستفاده از حافظه بلندمدتهوش مصنوعی، تبعات گسترده‌ای برای امنیت و کاربرد سیستم‌های هوش مصنوعی دارد.

حمله‌ای ساده با نتایجی مخرب

یک عامل هوش مصنوعی (ایجنت) می‌تواند با خواندن متون مخفی در صفحات وب، اطلاعات نادرست را به عنوان یک واقعیت دائمی در حافظه بلندمدت خود ذخیره کند. این اطلاعات جعلی هفته‌ها بعد، در کارهای نامربوط دیگر، توسط هوش مصنوعی بازیابی و مورد اعتماد قرار می‌گیرد. این روش کهمسمومیت حافظه پایدارنام دارد، یک آسیب‌پذیری امنیتی جدی است.

MINJA(به‌طور کامل Memory INJection Attack) نام آکادمیک این حمله است که در کنفرانسNeurIPS 2025معرفی شد. این حمله بدون نیاز به دسترسی‌های ویژه یا امتیازات بالا، فقط با ارسال درخواست‌های عادی از طریق رابط کاربری استاندارد انجام می‌شود.MINJAنرخ موفقیت بالای ۹۵ درصد برای تزریق و بیش از ۷۰ درصد برای حمله را در مدل‌هایی نظیرGPT-4o-mini،جمنای ۲.۰ فلشولاما ۳.۱ ۸Bنشان داده است. اگرچه این ارقام ممکن است در شرایط واقعی کمتر باشند، اما این تهدید برای محصولات پرکاربردی همچونChatGPT،جمنای،کلودومایکروسافت ۳۶۵ کوپایلوتهمچنان قابل توجه است.

    باورنکردنی اما واقعی: هوش مصنوعی ویروس‌های جدید می‌سازد!ادعای رویترز: چین از مدل‌های هوش مصنوعی آمریکایی برای توسعه سامانه‌های نظامی خود استفاده کرده استکاخ سفید ورود ربات‌های انسان‌نمای خارجی به خاک آمریکا را ممنوع کرد

راهکار فورس‌پوینت: حافظه قابل بازرسی

فورس‌پوینتبرای مقابله با این پدیده، پیشنهاد می‌کند که به‌جای اینکه خاطرات استخراج شده را به عنوان حقایق مطلق در نظر بگیریم، آن‌ها را به عنوان اشیایی قابل بازرسی تلقی کنیم. این رویکرد شامل ذخیره هر حافظه به همراه فراداده‌هایی مانند منبع، نوع منبع، تایید کاربر و یک امتیاز ریسک است. استفاده از عباراتی که رفتار آینده را شکل می‌دهند (مانند «از این به بعد» یا «این را پیش‌فرض قرار بده») یا ظهور ناگهانی یک دامنه، تماس یا فروشنده جدید، به این امتیاز ریسک می‌افزاید.

تشخیص تناقض نیز در این طرح مهم است؛ اگر یک حافظه جدید با اطلاعات موجود در تضاد باشد، هر دو نمی‌توانند درست باشند. در این صورت، سیستم تعارض را علامت‌گذاری کرده و آیتم جدید را برای تایید کاربر نگه می‌دارد، به جای آنکه آن را به‌طور خودکار بازنویسی کند. اطلاعات حساس مانند دستورالعمل‌های پرداخت، جزئیات بانکی یا تنظیمات امنیتی نیز وزن بالاتری دریافت می‌کنند. با این حال، هیچ یک از این روش‌ها مشکل اساسی را حل نمی‌کند: عامل‌های هوش مصنوعی، حافظه بازیابی‌شده را به عنوان تجربه خود می‌دانند، نه صرفاً یک ورودی. امتیازدهی فقط هزینهمسمومیت حافظه هوش مصنوعیرا بالا می‌برد و اعتقاد عامل را تغییر نمی‌دهد.

#آسیب_پذیری #امنیت_سایبری #هوش_مصنوعی