حملات مسمومسازی داده در هوش مصنوعی به تلاش عمدی برای وارد کردن دادههای گمراهکننده، برچسبهای نادرست یا نمونههای دستکاریشده به مجموعهداده گفته میشود؛ دادههایی که مدل برای آموزش، تنظیم یا بازیابی اطلاعات از آنها استفاده میکند. هدف مهاجم این است که رفتار سامانه تغییر کند، بدون آنکه لزوماً خود مدل یا حساب کاربری قربانی مستقیماً هک شده باشد.
این تهدید برای کاربران عادی هم اهمیت دارد، چون ابزارهای هوش مصنوعی در جستوجو، آموزش، تولید تصویر، پیشنهاد محتوا و خدمات مشتری به دادههای گسترده تکیه میکنند. البته هر پاسخ اشتباه نشانهٔ حمله نیست؛ تفاوت اصلی در عمدی بودن دستکاری، تکرار الگوی خطا و وجود هدف مشخص است.
مسمومسازی داده در هوش مصنوعی چیست؟
مدل هوش مصنوعی از نمونههایی مانند متن، تصویر، صدا، کد یا دادههای رفتاری الگو میگیرد. اگر بخشی از این نمونهها عمداً تغییر داده شود، مدل ممکن است همان الگوهای نادرست را یاد بگیرد یا در شرایط خاص، خروجی مطلوب مهاجم را تولید کند.
این دستکاری میتواند در چند مرحله رخ دهد: هنگام جمعآوری داده از اینترنت، در زمان برچسبگذاری و آمادهسازی، هنگام تنظیم مدل با دادههای اختصاصی یا حتی در پایگاه دانشی که یک سامانه برای پاسخگویی به آن مراجعه میکند. بنابراین مسمومسازی فقط به مدلهای بسیار بزرگ محدود نیست و سامانههای کوچکتر، ابزارهای داخلی شرکتها و سیستمهای مبتنی بر جستوجوی اسناد نیز ممکن است درگیر شوند.
مهاجم با مسمومسازی داده چه هدفی دارد؟
همهٔ حملات نتیجهٔ یکسانی ندارند. برخی برای کاهش کیفیت کلی مدل طراحی میشوند و برخی فقط رفتار آن را در یک موضوع، عبارت یا موقعیت خاص تغییر میدهند.
- حملهٔ تخریب کیفیت: دادههای ناسازگار یا برچسبهای غلط وارد مجموعهداده میشوند تا دقت مدل در موضوعی خاص یا بهطور کلی کاهش پیدا کند.
- حملهٔ هدفدار: مدل در برابر یک ورودی مشخص، پاسخ یا تصمیمی خاص ارائه میدهد؛ درحالیکه در سایر موقعیتها ظاهراً عادی کار میکند.
- ایجاد رفتار پنهان: دادهها طوری تنظیم میشوند که مدل فقط با یک الگوی خاص، واکنش متفاوتی نشان دهد. این رفتار میتواند در آزمونهای معمول دیده نشود.
- آلوده کردن پایگاه دانش: اسناد نادرست یا دستکاریشده وارد منابعی میشوند که سامانههای پاسخگو برای بازیابی اطلاعات از آنها استفاده میکنند.
مهاجم ممکن است به جای نفوذ مستقیم به زیرساخت، محتوای عمومی یا منابعی را هدف بگیرد که احتمال جمعآوری آنها توسط سامانه وجود دارد. همین موضوع، کنترل منشأ داده و بررسی تغییرات را به بخش مهمی از امنیت هوش مصنوعی تبدیل میکند.
تفاوت مسمومسازی داده با خطای معمول هوش مصنوعی
هوش مصنوعی ممکن است به دلیل دادهٔ کم، ابهام در سؤال، آموزش ناکافی یا ناتوانی در تشخیص واقعیت، پاسخ نادرست تولید کند. این خطاها لزوماً حملهٔ امنیتی نیستند و معمولاً با پرسشهای متفاوت یا بررسی منابع تغییر میکنند.
در مسمومسازی، نشانهها بیشتر به شکل یک الگوی هدفدار ظاهر میشوند: مثلاً مدل دربارهٔ یک موضوع مشخص بارها ادعایی نادرست را تکرار میکند، با یک عبارت یا تصویر خاص رفتار غیرعادی نشان میدهد یا پس از ورود دادههای جدید، افت عملکرد ناگهانی پیدا میکند. بااینحال، مشاهدهٔ چنین نشانههایی بهتنهایی برای اثبات حمله کافی نیست و بررسی فنی لازم است.
مسمومسازی در کدام بخشهای سامانه رخ میدهد؟
دادههای آموزشی و تنظیم مدل
اگر دادههای آموزشی پیش از ورود به فرایند یادگیری بررسی نشوند، نمونههای جعلی میتوانند بر الگوهای آموختهشده اثر بگذارند. دادههای تنظیم مدل نیز حساساند، چون حجمشان کمتر است و گاهی برای تغییر رفتار در یک حوزهٔ مشخص استفاده میشوند.
منابع جستوجو و پایگاههای دانشی
در سامانههایی که پاسخ را از اسناد، فایلهای سازمانی یا محتوای آنلاین بازیابی میکنند، خطر فقط در آموزش مدل نیست. ورود یک سند نادرست، قدیمی یا دستکاریشده میتواند پاسخ همان سامانه را منحرف کند؛ حتی اگر مدل اصلی سالم مانده باشد.
برچسبها و بازخورد انسانی
برچسبگذاری نادرست یا بازخوردهای غیرقابل اعتماد ممکن است مدل را به سمت پاسخهای ضعیف سوق دهد. اگر این فرایند بدون ثبت هویت منبع، کنترل کیفیت و امکان بازبینی انجام شود، تشخیص خطا یا حمله دشوارتر خواهد بود.
چطور خطر حملات مسمومسازی داده کاهش پیدا میکند؟
مقابله با این تهدید یک راهحل منفرد ندارد و باید از زمان ورود داده تا مرحلهٔ پایش خروجی ادامه پیدا کند. مهمترین اقدامات دفاعی عبارتاند از:
- بررسی منشأ داده: مشخص باشد هر فایل یا رکورد از کجا آمده، چه زمانی تغییر کرده و چه کسی آن را تأیید کرده است.
- تفکیک منابع: دادهٔ ناشناس یا کماعتماد نباید بدون بررسی در کنار دادهٔ معتبر برای آموزش یا بازیابی قرار بگیرد.
- پاکسازی و نمونهبرداری: دادههای تکراری، ناسازگار، غیرعادی و دارای برچسب مشکوک باید پیش از استفاده بررسی شوند.
- آزمون با دادهٔ مستقل: عملکرد مدل فقط با همان دادههایی که برای آموزش استفاده شده سنجیده نشود؛ آزمون مستقل میتواند رفتار غیرعادی را آشکار کند.
- ثبت نسخه و امکان بازگشت: نگهداری نسخههای قبلی داده و مدل کمک میکند در صورت افت ناگهانی، منبع تغییر شناسایی و سامانه به نسخهٔ سالم برگردانده شود.
- پایش خروجیها: تکرار یک پاسخ غیرعادی، تغییر ناگهانی دقت یا حساسیت بیش از حد به یک ورودی باید بررسی شود.
هیچکدام از این روشها تضمین نمیکنند که حمله بهطور کامل غیرممکن شود. هدف، بالا بردن هزینهٔ حمله، کوتاه کردن زمان تشخیص و جلوگیری از گسترش اثر آن است.
کاربر هنگام استفاده از ابزارهای هوش مصنوعی چه کاری انجام دهد؟
کاربر معمولاً به دادههای آموزشی یا زیرساخت مدل دسترسی ندارد، اما میتواند اثر اطلاعات نادرست را محدود کند. برای پاسخهای مربوط به سلامت، پول، تحصیل، حقوق یا امنیت خانواده، به یک خروجی اکتفا نکنید و ادعاهای مهم را با منبع رسمی یا متخصص تطبیق دهید.
همچنین بهتر است اطلاعات شخصی، عکسهای خانوادگی و اسناد حساس را در سرویسهای ناشناخته بارگذاری نکنید. اگر یک ابزار ناگهان پاسخهای متناقض میدهد، به منابع نامعتبر استناد میکند یا در برابر یک عبارت خاص رفتار غیرعادی دارد، موضوع را گزارش کنید و تا روشن شدن وضعیت از آن برای تصمیمهای مهم استفاده نکنید.
جمعبندی؛ مسمومسازی داده در هوش مصنوعی را چطور جدی بگیریم؟
حملات مسمومسازی داده در هوش مصنوعی با آلوده کردن دادههای آموزشی، برچسبها یا منابع بازیابی، رفتار مدل را منحرف میکنند. این حملات با خطای معمول یا توهم هوش مصنوعی یکی نیستند و معمولاً به الگوی تکرارشونده، هدفدار و قابل بررسی نیاز دارند.
برای کاربران، راه عملی این است که پاسخهای حساس را راستیآزمایی کنند؛ برای سازندگان سامانه، کنترل منشأ داده، آزمون مستقل، پایش مداوم و امکان بازگشت به نسخهٔ سالم ضروری است.



