امنیت مدل‌های هوش مصنوعی در برابر حمله فقط به ساختن یک رمز عبور قوی برای حساب کاربری خلاصه نمی‌شود. خود مدل، داده‌های آموزشی، فایل‌هایی که می‌خواند، ابزارهایی که به آن متصل است و حتی متن یک ایمیل می‌توانند به نقطه ورود مهاجم تبدیل شوند.

مهاجم ممکن است مدل را با یک پرامپت فریب دهد، داده آموزشی را آلوده کند، اطلاعات محرمانه را از پاسخ‌ها بیرون بکشد یا از اتصال مدل به ابزارهای دیگر سوءاستفاده کند. برای کاربران خانگی، نتیجه می‌تواند از یک پاسخ گمراه‌کننده تا افشای اطلاعات شخصی یا انجام یک اقدام ناخواسته به نام کاربر متغیر باشد.

امنیت مدل‌های هوش مصنوعی در برابر حمله چگونه تهدید می‌شود؟

مدل هوش مصنوعی مانند یک نرم‌افزار معمولی فقط با بستن یک حفره امن نمی‌شود. چون مدل بر اساس الگوهای آماری پاسخ می‌دهد، ممکن است در برابر ورودی‌هایی آسیب‌پذیر باشد که ظاهری عادی دارند اما هدفشان تغییر رفتار سامانه است.

تزریق پرامپت؛ وقتی متن، دستور پنهان دارد

در حمله تزریق پرامپت، مهاجم از متن برای دور زدن هدف یا قواعد اولیه مدل استفاده می‌کند. برای نمونه، کاربر ممکن است از مدل بخواهد دستورهای قبلی را کنار بگذارد و اطلاعاتی را نمایش دهد که نباید در اختیار او باشد.

نوع پیچیده‌تر، تزریق غیرمستقیم است. در این حالت، دستور مخرب مستقیماً در گفت‌وگو نوشته نمی‌شود؛ بلکه داخل یک فایل PDF، صفحه وب، ایمیل یا سندی قرار می‌گیرد که مدل برای خلاصه‌سازی یا تحلیل آن را می‌خواند. اگر مدل به ابزارهایی مانند ایمیل، فضای ابری یا سامانه مالی دسترسی داشته باشد، همین متن می‌تواند خطر عملی ایجاد کند.

داده‌مسموم‌سازی؛ دستکاری پیش از رسیدن اطلاعات به مدل

در داده‌مسموم‌سازی، مهاجم داده‌های آموزشی یا داده‌هایی را که برای تنظیم مدل استفاده می‌شوند دستکاری می‌کند. هدف می‌تواند ایجاد پاسخ‌های نادرست، جانبدارانه یا رفتار متفاوت در برابر یک عبارت خاص باشد.

این تهدید بیشتر متوجه شرکت‌ها، توسعه‌دهندگان و سامانه‌هایی است که داده را از منابع عمومی یا کاربران دریافت می‌کنند. هر فایل یا رکوردی که وارد چرخه آموزش می‌شود، نباید بدون بررسی کیفیت، منبع و سابقه تغییرات پذیرفته شود.

ورودی‌های فریبنده و افشای اطلاعات

برخی ورودی‌ها طوری طراحی می‌شوند که برای انسان عادی به نظر برسند اما مدل را به سمت طبقه‌بندی یا پاسخ اشتباه ببرند. تغییرات کوچک در تصویر، متن یا داده می‌تواند در بعضی سامانه‌ها نتیجه را عوض کند.

خطر دیگر، افشای اطلاعات است. مدل ممکن است بخشی از داده‌های حساس موجود در زمینه گفت‌وگو، حافظه سرویس یا سامانه متصل را بیش از حد لازم در پاسخ بازتاب دهد. این موضوع به‌ویژه زمانی جدی است که چند کاربر به یک مخزن داده دسترسی دارند.

اتصال مدل به ابزارها، سطح حمله را بزرگ‌تر می‌کند

یک چت‌بات که فقط متن تولید می‌کند، معمولاً دامنه آسیب محدودتری نسبت به عاملی دارد که می‌تواند ایمیل بخواند، فایل جابه‌جا کند، کد اجرا کند یا خرید انجام دهد. هر دسترسی تازه، توانایی تازه‌ای برای مدل ایجاد می‌کند و هم‌زمان مسیر احتمالی سوءاستفاده را افزایش می‌دهد.

اصل مهم این است که مدل فقط به ابزار و داده‌ای دسترسی داشته باشد که برای همان کار لازم است. اجازه خواندن ایمیل نباید خودبه‌خود به معنای امکان ارسال پاسخ باشد؛ دسترسی به فایل‌ها هم نباید با اختیار حذف یا اشتراک‌گذاری آن‌ها همراه شود.

برای کاهش ریسک، اقدام‌های زیر اهمیت بیشتری از یک فهرست طولانی از قابلیت‌های امنیتی دارند:

  • دسترسی مدل به اطلاعات و ابزارها را حداقلی و مرحله‌ای کنید.
  • برای ارسال پیام، حذف فایل، خرید یا تغییر تنظیمات، تأیید انسانی بگیرید.
  • داده‌های کاربران مختلف را از هم جدا نگه دارید.
  • فایل‌های واردشده را پیش از استفاده از نظر منبع و محتوای مشکوک بررسی کنید.
  • گزارش فعالیت‌ها را ثبت کنید تا رفتار غیرعادی قابل پیگیری باشد.
  • کلیدهای دسترسی و توکن‌ها را داخل پرامپت یا متن قابل مشاهده قرار ندهید.

کاربر خانگی برای محافظت از اطلاعات چه کاری انجام دهد؟

بخش مهمی از امنیت، پیش از رسیدن درخواست به مدل اتفاق می‌افتد. اعضای خانواده بهتر است اطلاعاتی را که در صورت انتشار می‌تواند دردسرساز شود، وارد ابزارهای هوش مصنوعی نکنند؛ حتی اگر درخواست ظاهراً ساده باشد.

  • رمز عبور، کد یک‌بارمصرف، شماره کارت و تصویر مدارک هویتی را ارسال نکنید.
  • برای خلاصه‌سازی قرارداد، پرونده یا نامه، نام‌ها و شماره‌های قابل شناسایی را حذف کنید.
  • به فایل یا لینکی که مدل پیشنهاد می‌کند اعتماد خودکار نداشته باشید.
  • پاسخ‌های پزشکی، مالی، حقوقی و آموزشی حساس را از یک منبع مستقل بررسی کنید.
  • برای کودکان توضیح دهید که چت‌بات دوست یا محرم اسرار واقعی نیست و نباید اطلاعات خصوصی را از آن پنهان نکنند.
  • ورود دومرحله‌ای حساب و اعلان ورودهای جدید را فعال کنید.

خاموش کردن گزینه استفاده از گفت‌وگوها برای بهبود سرویس، در صورت وجود چنین تنظیمی، می‌تواند یک لایه احتیاطی باشد؛ اما جایگزین نکردن اطلاعات حساس و مدیریت دسترسی نیست. تنظیمات هر سرویس با سرویس دیگر فرق دارد و باید متن سیاست حریم خصوصی همان ابزار بررسی شود.

یک سامانه امن چگونه حمله را تشخیص می‌دهد و محدود می‌کند؟

امنیت قابل اتکا با یک فیلتر ساده برای کلمات نامناسب ساخته نمی‌شود. سامانه باید ورودی، خروجی و اقدام‌های مدل را جداگانه کنترل کند و بین پاسخ معمولی و اقدامی که پیامد واقعی دارد تفاوت بگذارد.

  1. اعتبارسنجی ورودی: فایل‌ها، لینک‌ها و درخواست‌های غیرعادی پیش از ورود به جریان اصلی بررسی شوند.
  2. تفکیک دستور و داده: متنی که مدل باید خلاصه کند نباید بتواند به‌سادگی جای دستورهای اصلی را بگیرد.
  3. محدودسازی اقدام: مدل برای عملیات حساس، مجوز کوتاه‌مدت و محدود داشته باشد.
  4. بررسی خروجی: پاسخ پیش از نمایش یا اجرا از نظر افشای داده، دستور خطرناک و خطای آشکار ارزیابی شود.
  5. آزمون مداوم: تیم فنی باید با سناریوهای حمله و داده‌های ساختگی، رفتار مدل را مرتب آزمایش کند.

همچنین باید برای زمان وقوع حادثه، برنامه مشخصی وجود داشته باشد: قطع دسترسی مدل به ابزارها، لغو کلیدهای افشاشده، بررسی گزارش‌ها، اطلاع‌رسانی به افراد درگیر و اصلاح مسیر ورود داده. نداشتن برنامه واکنش، یک خطای کوچک را به حادثه‌ای گسترده‌تر تبدیل می‌کند.

چرا پاسخ درست همیشه به معنای سامانه امن نیست؟

یک مدل ممکن است در بیشتر گفت‌وگوها پاسخ دقیق بدهد، اما همچنان در برابر حمله آسیب‌پذیر باشد. امنیت فقط با کیفیت پاسخ سنجیده نمی‌شود؛ باید مشخص باشد مدل چه داده‌ای می‌بیند، چه کاری می‌تواند انجام دهد و هنگام خطا چه چیزی محدود می‌شود.

همچنین «هک شدن» همیشه به معنای کنترل کامل مدل نیست. گاهی مهاجم فقط کاری می‌کند مدل بخشی از اطلاعات محرمانه را بازگو کند، پاسخ خاصی را تغییر دهد یا کاربر را به کلیک روی یک لینک جعلی ترغیب کند. همین آسیب محدود نیز برای یک حساب خانوادگی، مدرسه یا کسب‌وکار کوچک می‌تواند مهم باشد.

جمع‌بندی: امنیت مدل‌های هوش مصنوعی در برابر حمله با یک ابزار یا تنظیم واحد به دست نمی‌آید. کاهش اطلاعات حساس، محدود کردن دسترسی‌ها، بررسی فایل و لینک، تأیید انسانی برای اقدام‌های مهم و آزمایش مداوم، چهار لایه عملی برای استفاده امن‌تر از هوش مصنوعی هستند.