استخراج اطلاعات از مدلهای هوش مصنوعی به تلاشهایی گفته میشود که هدفشان بیرون کشیدن دادههای حساس، بخشهایی از دادههای آموزشی یا سرنخهایی دربارهٔ اطلاعاتی است که مدل در فرایند آموزش دیده است. این حمله الزاماً به معنای دسترسی مستقیم به فایلهای آموزشی نیست؛ گاهی مهاجم با پرسشهای حسابشده و تکرار درخواستها، مدل را به بازتولید یک عبارت خاص یا افشای جزئیات ناخواسته نزدیک میکند.
خطر برای کاربران خانگی بیشتر از جایی شروع میشود که اطلاعات خصوصی در یک سرویس نامطمئن وارد شود. مدل ممکن است آن داده را در پاسخ بعدی به فرد دیگری افشا نکند، اما کاربر معمولاً کنترل کاملی بر محل ذخیره، مدت نگهداری و شیوه استفاده از گفتگو ندارد. به همین دلیل، پیشگیری از ورود دادهٔ حساس مهمتر از امید بستن به محرمانه ماندن آن پس از ارسال است.
استخراج اطلاعات از مدلهای هوش مصنوعی چگونه انجام میشود؟
مدلهای زبانی از متنهای بسیار زیادی الگو یاد میگیرند. اگر عبارتی بارها در دادههای آموزشی تکرار شده باشد، ساختار آن ساده باشد یا اطلاعاتی منحصربهفرد در کنار الگوهای قابل پیشبینی قرار گرفته باشد، احتمال بازتولید ناخواستهٔ آن افزایش مییابد؛ البته این احتمال به مدل، دادهٔ آموزشی، تنظیمات سرویس و نوع حمله بستگی دارد.
در حملات واقعی، مهاجم معمولاً به یک پرسش منفرد اکتفا نمیکند. او پاسخهای متعدد را با تغییر لحن، زمینه و قالب مقایسه میکند تا نشانههایی از عبارتهای حفظشده، دادههای شخصی یا دستورهای داخلی سیستم پیدا کند. این روند میتواند خودکار شود و تعداد زیادی درخواست مشابه را در مدت کوتاه بررسی کند.
- استخراج مستقیم: تلاش برای وادار کردن مدل به تکمیل یا بازگویی یک متن، نام، شناسه یا قطعهکد مشخص.
- استنتاج عضویت: بررسی اینکه آیا یک نمونهٔ خاص احتمالاً در دادههای آموزشی مدل وجود داشته است یا نه؛ این روش ممکن است حضور داده را حدس بزند، بدون آنکه متن کامل را نشان دهد.
- وارونسازی مدل: ساختن تصویری احتمالی از ویژگیهای دادهٔ آموزشی یا الگوهای مورد استفادهٔ مدل از روی خروجیهای آن. نتیجه در بسیاری از موارد تقریبی است و نباید آن را معادل بازیابی اصل داده دانست.
چه نوع اطلاعاتی بیشتر در معرض افشا قرار دارد؟
دادهای که هم منحصربهفرد باشد و هم در چند نمونهٔ آموزشی تکرار شده باشد، برای حملات استخراج جذابتر است. نامهای کامل همراه با شماره تماس، نشانی، شناسههای کاربری، متنهای خصوصی، کلیدهای دسترسی و اطلاعاتی که بدون ویرایش در منابع عمومی یا مجموعههای آموزشی باقی ماندهاند، از نمونههای حساس هستند.
بااینحال، مدل هوش مصنوعی معمولاً مانند موتور جستوجو به یک فهرست دقیق از دادههای آموزشدیده دسترسی ندارد. پاسخ تولیدشده میتواند ترکیبی از الگوهای متعدد، ناقص یا حتی نادرست باشد؛ بنابراین هم افشای واقعی و هم نسبت دادن نادرست یک اطلاعات به دادهٔ آموزشی باید با دقت بررسی شود.
اطلاعات مربوط به کودکان، پروندههای پزشکی، اختلافات خانوادگی، تصاویر مدارک و جزئیات مالی بهدلیل پیامدهای مستقیم افشا، حساسیت بیشتری دارند. وارد کردن چنین دادههایی در یک ابزار رایگان یا ناشناس، حتی اگر حملهٔ استخراج رخ ندهد، میتواند ریسک ذخیرهسازی یا دسترسی غیرمجاز را بالا ببرد.
افشای اطلاعات از مدل با افشای گفتوگوی کاربر یکی نیست
دو نگرانی معمولاً با هم اشتباه گرفته میشوند. استخراج دادهٔ آموزشی به بیرون کشیدن اطلاعاتی مربوط است که پیشتر در فرایند آموزش مدل وجود داشته؛ اما نشت گفتوگو میتواند از ضعف حساب کاربری، تنظیمات اشتباه، افزونهٔ ناامن، اشتراکگذاری عمومی یا دسترسی غیرمجاز به تاریخچهٔ چت ناشی شود.
همچنین افشای «دستور سیستمی» یا قوانین داخلی یک چتبات با استخراج اطلاعات آموزشی یکی نیست. ممکن است کاربر با درخواستهای خاص بخشی از دستورهای داخلی را ببیند، اما این اتفاق بهتنهایی ثابت نمیکند که دادهٔ محرمانهٔ آموزش مدل بازیابی شده است.
پیامد حملات استخراج اطلاعات برای کاربران و سازمانها چیست؟
در سطح فردی، افشای یک شناسه، متن خصوصی یا قطعهای از اطلاعات خانوادگی میتواند به جعل هویت، اخاذی، فیشینگ یا آسیب اعتباری منجر شود. خطر زمانی بیشتر میشود که چند خروجی ظاهراً بیاهمیت کنار هم قرار بگیرند و تصویر کاملی از یک فرد یا خانواده بسازند.
برای سازمانها، موضوع فقط حریم خصوصی نیست. بازتولید کدهای داخلی، اسناد تجاری، دادههای مشتریان یا دستورهای محرمانه میتواند به نقض قرارداد، زیان مالی و دشواری در اثبات منبع افشا منجر شود. در سوی دیگر، ارسال انبوه درخواست برای تقلید رفتار مدل ممکن است هزینهٔ زیرساخت را بالا ببرد و کیفیت سرویس را کاهش دهد.
چطور خطر استخراج اطلاعات را کاهش دهیم؟
کارهایی که کاربران باید انجام دهند
- رمز عبور، کد یکبارمصرف، شماره کارت، کد ملی، نشانی دقیق و تصویر مدارک را در چتبات عمومی وارد نکنید.
- برای متنهای حساس، نام، شماره، نشانی و جزئیات قابلشناسایی را با نمونههای ساختگی جایگزین کنید؛ حذف بخشی از نام بهتنهایی همیشه کافی نیست.
- تنظیمات ذخیرهٔ تاریخچه، استفاده از گفتگو برای بهبود سرویس و امکان حذف داده را بررسی کنید؛ نام این گزینهها در سرویسهای مختلف یکسان نیست.
- دسترسی افزونهها و برنامههای متصل به چتبات را محدود کنید و برای حساب کاربری، رمز عبور قوی و احراز هویت دومرحلهای فعال کنید.
- اگر چتبات متنی حساس را بازتولید کرد، آن را در شبکههای اجتماعی منتشر نکنید؛ خروجی، زمان، تنظیمات و متن درخواست را برای گزارش به ارائهدهنده نگه دارید.
کنترلهایی که سازندگان مدل به کار میگیرند
سازندگان میتوانند دادههای شخصی را پیش از آموزش پالایش کنند، تکرار بیش از حد نمونهها را کاهش دهند و مدل را با دادههای آزمایشی برای سنجش بازتولید اطلاعات حساس بررسی کنند. محدود کردن نرخ درخواست، ثبت الگوهای غیرعادی، جداسازی دادههای آموزشی از دادههای عملیاتی و اعمال فیلتر خروجی نیز مانع قطعی نیست، اما سطح حمله را پایین میآورد.
آموزش ایمنسازی باید فقط روی خود مدل متمرکز نباشد. کنترل دسترسی، رمزنگاری، سیاست نگهداری داده، بازبینی انسانی و مسیر روشن برای گزارش افشا، بخشهای ضروری یک سامانهٔ قابل اعتماد هستند.
چند باور اشتباه دربارهٔ استخراج اطلاعات
- «مدل هر چیزی را که دیده، دقیقاً به خاطر دارد.» مدل معمولاً الگوهای آماری را یاد میگیرد و ممکن است اطلاعات را ناقص یا نادرست بازتولید کند؛ اما این موضوع دلیل امن بودن دادهٔ حساس نیست.
- «اگر اطلاعات در اینترنت عمومی بوده، افشای دوبارهٔ آن مهم نیست.» کنار هم قرار گرفتن اطلاعات عمومی میتواند به شناسایی فرد یا ایجاد یک نمایهٔ حساس منجر شود.
- «فقط شرکتهای بزرگ هدف حملهاند.» حسابهای شخصی هم بهدلیل رمزهای فاششده، اطلاعات مالی یا دادههای کودکان ارزشمند هستند؛ پیشگیری برای همهٔ کاربران لازم است.
جمعبندی: حملات استخراج اطلاعات از مدلهای هوش مصنوعی از ضعف احتمالی در دادههای آموزشی، طراحی سرویس یا شیوهٔ استفاده از آن بهره میبرند. مدل بهطور خودکار همهٔ اطلاعات را افشا نمیکند، اما هیچ کاربر یا سازمانی نباید چتبات عمومی را محل نگهداری اسرار بداند؛ ناشناسسازی داده، بررسی تنظیمات حریم خصوصی و محدود کردن دسترسیها، عملیترین لایههای دفاعی هستند.



