
با گسترش استفاده از هوش مصنوعی در سازمانها و زیرساختهای حساس، ارزیابی امنیت مدلهای زبانی بزرگ (LLM) به یکی از نیازهای مهم این حوزه تبدیل شده است. در چنین شرایطی، گروهی از دانشآموزان پایه یازدهم دبیرستان علامه حلی با راهاندازی پلتفرم «هفتخوان» تلاش کردهاند آموزش و آزمون امنیت مدلهای زبانی را از قالبهای تئوریک خارج کنند و به تجربهای تعاملی و مبتنی بر بازی تبدیل کنند.
به گزارش مهر این پلتفرم با الهام از هفتخوان رستم طراحی شده است و کاربران را در مسیری هفتمرحلهای با نمونههایی از آسیبپذیریهای واقعی مدلهای زبانی مواجه میکند. هدف سازندگان هفتخوان، ایجاد محیطی امن برای تمرین تست نفوذ، آموزش مهارتهای امنیتی و جمعآوری دادههای بومی درباره روشهای حمله به مدلهای هوش مصنوعی است.
از هفتخوان رستم تا هفت آسیبپذیری هوش مصنوعی
طاها الهیبخش، دانشپژوه المپیاد هوش مصنوعی و عضو تیم هفتخوان، درباره این پروژه گفت: این پلتفرم بهوسیله گروهی از دانشآموزان رشته نرمافزار دبیرستان علامه حلی توسعه پیدا کرده است. به گفته او، هفتخوان با ترکیب داستانپردازی مبتنی بر شاهنامه و سازوکارهای بازیسازی، تلاش میکند یادگیری امنیت هوش مصنوعی را از یک فرایند خشک و صرفاً نظری به تجربهای عملی و ماندگار تبدیل کند.
هر مرحله از این مسیر به یک کلاس مشخص از آسیبپذیریهای مدلهای زبانی اختصاص دارد:
- تزریق دستور
- نقض محدودیتها
- هالوسینیشن یا توهم مدل
- سوءاستفاده از قابلیتهای عاملمحور
- سوءاستفاده از مدلهای چندرسانهای
- تولید محتوای مخرب
- افشای اطلاعات حساس
کاربر در هر مرحله باید با شناسایی و عبور از چالش امنیتی، قفل آن خوان را باز کند. این فرایند علاوهبر آموزش مهارتهای تست نفوذ، به تکمیل پایگاه دادهای از حملات و روشهای نفوذ بومی نیز کمک میکند. هفتخوان همچنین از سیستم رتبهبندی، چالشهای گروهی و دیگر عناصر بازیسازی برای افزایش مشارکت کاربران استفاده میکند.
از افشای اطلاعات بانکی تا مقابله با هالوسینیشن
الهیبخش معتقد است در سالهای اخیر تمرکز اصلی کشور بر توسعه سرویسهای هوش مصنوعی بوده، اما با افزایش استفاده از این سرویسها، امنیت آنها نیز باید به اولویتی جدی تبدیل شود. او هشدار داد مدلهای تازهتنظیمشده یا Fine-tuned که بدون آزمونهای امنیتی کافی و گاردریلهای مناسب وارد چرخه استفاده میشوند، ممکن است به تهدیدی برای سازمانها تبدیل شوند؛ تهدیدی که از افشای اطلاعات حساس بانکی تا تولید محتوای مخرب را شامل میشود.
به گفته او، یکی از چالشهای اصلی این حوزه کمبود دادههای معتبر، پویا و بومی برای آموزش و ارزیابی سامانههای حفاظتی است. هفتخوان میخواهد با ایجاد جامعهای از آزمونگران امنیتی، از یک سو امکان تمرین در محیطی کنترلشده را فراهم کند و از سوی دیگر، به سازمانها اجازه دهد مدلهای زبانی خود را در برابر سناریوهای مختلف امنیتی آزمایش کنند.
این پلتفرم دو گروه اصلی را هدف قرار داده است: جوانان ۱۸ تا ۲۴ سال، از جمله دانشجویان و علاقهمندان امنیت سایبری که به دنبال یادگیری عملی هستند، و سازمانها و تیمهای فنی در شرکتهای دانشبنیان و نهادهای دولتی که برای آزمون مدلهای خود به داده و سناریوهای بومی نیاز دارند.
از جمله سناریوهای پیشبینیشده در هفتخوان میتوان به بررسی حمله به مدلهای عاملمحور بانکی، سوءاستفاده از مدلهای تولید تصویر، شناسایی شایعهپراکنی و مقابله با هالوسینیشن در پاسخهای حساس اشاره کرد. حفظ حریم خصوصی، فراهمکردن محیط ایمن برای کاربران و سازمانها، شبیهسازی آسیبپذیریهای واقعی مدلهای زبانی و ایجاد محیطی برای آزمون حملات عاملمحور، بانکی و محتوایی، از دیگر ویژگیهای این محصول عنوان شده است.
هفتخوان در حال حاضر در مرحله آزمایشی قرار دارد و تیم سازنده آن در حال برنامهریزی برای توسعه همکاری با سازمانها و انعقاد قراردادهای تجاری است.



