مصاحبه های هوش مصنوعی

«هفت‌خوان»؛ پلتفرم بومی تست نفوذ مدل‌های زبانی هوش مصنوعی ساخته شد

با گسترش استفاده از هوش مصنوعی در سازمان‌ها و زیرساخت‌های حساس، ارزیابی امنیت مدل‌های زبانی بزرگ (LLM) به یکی از نیازهای مهم این حوزه تبدیل شده است. در چنین شرایطی، گروهی از دانش‌آموزان پایه یازدهم دبیرستان علامه حلی با راه‌اندازی پلتفرم «هفت‌خوان» تلاش کرده‌اند آموزش و آزمون امنیت مدل‌های زبانی را از قالب‌های تئوریک خارج کنند و به تجربه‌ای تعاملی و مبتنی بر بازی تبدیل کنند.

به گزارش مهر این پلتفرم با الهام از هفت‌خوان رستم طراحی شده است و کاربران را در مسیری هفت‌مرحله‌ای با نمونه‌هایی از آسیب‌پذیری‌های واقعی مدل‌های زبانی مواجه می‌کند. هدف سازندگان هفت‌خوان، ایجاد محیطی امن برای تمرین تست نفوذ، آموزش مهارت‌های امنیتی و جمع‌آوری داده‌های بومی درباره روش‌های حمله به مدل‌های هوش مصنوعی است.

از هفت‌خوان رستم تا هفت آسیب‌پذیری هوش مصنوعی

طاها الهی‌بخش، دانش‌پژوه المپیاد هوش مصنوعی و عضو تیم هفت‌خوان، درباره این پروژه گفت: این پلتفرم به‌وسیله گروهی از دانش‌آموزان رشته نرم‌افزار دبیرستان علامه حلی توسعه پیدا کرده است. به گفته او، هفت‌خوان با ترکیب داستان‌پردازی مبتنی بر شاهنامه و سازوکارهای بازی‌سازی، تلاش می‌کند یادگیری امنیت هوش مصنوعی را از یک فرایند خشک و صرفاً نظری به تجربه‌ای عملی و ماندگار تبدیل کند.

هر مرحله از این مسیر به یک کلاس مشخص از آسیب‌پذیری‌های مدل‌های زبانی اختصاص دارد:

  1. تزریق دستور
  2. نقض محدودیت‌ها
  3. هالوسینیشن یا توهم مدل
  4. سوءاستفاده از قابلیت‌های عامل‌محور
  5. سوءاستفاده از مدل‌های چندرسانه‌ای
  6. تولید محتوای مخرب
  7. افشای اطلاعات حساس

کاربر در هر مرحله باید با شناسایی و عبور از چالش امنیتی، قفل آن خوان را باز کند. این فرایند علاوه‌بر آموزش مهارت‌های تست نفوذ، به تکمیل پایگاه داده‌ای از حملات و روش‌های نفوذ بومی نیز کمک می‌کند. هفت‌خوان همچنین از سیستم رتبه‌بندی، چالش‌های گروهی و دیگر عناصر بازی‌سازی برای افزایش مشارکت کاربران استفاده می‌کند.

از افشای اطلاعات بانکی تا مقابله با هالوسینیشن

الهی‌بخش معتقد است در سال‌های اخیر تمرکز اصلی کشور بر توسعه سرویس‌های هوش مصنوعی بوده، اما با افزایش استفاده از این سرویس‌ها، امنیت آن‌ها نیز باید به اولویتی جدی تبدیل شود. او هشدار داد مدل‌های تازه‌تنظیم‌شده یا Fine-tuned که بدون آزمون‌های امنیتی کافی و گاردریل‌های مناسب وارد چرخه استفاده می‌شوند، ممکن است به تهدیدی برای سازمان‌ها تبدیل شوند؛ تهدیدی که از افشای اطلاعات حساس بانکی تا تولید محتوای مخرب را شامل می‌شود.

به گفته او، یکی از چالش‌های اصلی این حوزه کمبود داده‌های معتبر، پویا و بومی برای آموزش و ارزیابی سامانه‌های حفاظتی است. هفت‌خوان می‌خواهد با ایجاد جامعه‌ای از آزمون‌گران امنیتی، از یک سو امکان تمرین در محیطی کنترل‌شده را فراهم کند و از سوی دیگر، به سازمان‌ها اجازه دهد مدل‌های زبانی خود را در برابر سناریوهای مختلف امنیتی آزمایش کنند.

این پلتفرم دو گروه اصلی را هدف قرار داده است: جوانان ۱۸ تا ۲۴ سال، از جمله دانشجویان و علاقه‌مندان امنیت سایبری که به دنبال یادگیری عملی هستند، و سازمان‌ها و تیم‌های فنی در شرکت‌های دانش‌بنیان و نهادهای دولتی که برای آزمون مدل‌های خود به داده و سناریوهای بومی نیاز دارند.

از جمله سناریوهای پیش‌بینی‌شده در هفت‌خوان می‌توان به بررسی حمله به مدل‌های عامل‌محور بانکی، سوءاستفاده از مدل‌های تولید تصویر، شناسایی شایعه‌پراکنی و مقابله با هالوسینیشن در پاسخ‌های حساس اشاره کرد. حفظ حریم خصوصی، فراهم‌کردن محیط ایمن برای کاربران و سازمان‌ها، شبیه‌سازی آسیب‌پذیری‌های واقعی مدل‌های زبانی و ایجاد محیطی برای آزمون حملات عامل‌محور، بانکی و محتوایی، از دیگر ویژگی‌های این محصول عنوان شده است.

هفت‌خوان در حال حاضر در مرحله آزمایشی قرار دارد و تیم سازنده آن در حال برنامه‌ریزی برای توسعه همکاری با سازمان‌ها و انعقاد قراردادهای تجاری است.

نمایش بیشتر

نوشته های مشابه

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *