با گسترش روزافزون زیرساختهای دیجیتال و افزایش پیچیدگی حملات سایبری، امنیت سایبری به یکی از مهمترین حوزههای فناوری اطلاعات تبدیل شده است. در این میان، آزمون نفوذ (Penetration Testing) به عنوان یکی از مؤثرترین روشهای ارزیابی امنیت سیستمها شناخته میشود. این فرآیند با شبیهسازی حملات واقعی، نقاط ضعف شبکهها، سامانهها و نرمافزارها را پیش از آنکه توسط مهاجمان مورد سوءاستفاده قرار گیرند، شناسایی میکند. با وجود اهمیت بالای آزمون نفوذ، اجرای آن نیازمند متخصصان باتجربه، صرف زمان قابل توجه و هزینههای زیاد است و ابزارهای خودکار موجود نیز عمدتاً به اسکن آسیبپذیری محدود شدهاند و توانایی تصمیمگیری پویا، تحلیل شرایط و انتخاب راهبرد مناسب مشابه کارشناسان انسانی را ندارند. در سالهای اخیر، ظهور مدلهای زبانی بزرگ (Large Language Models یا LLMs) مانند GPT و Claude، با توانایی چشمگیر در درک زبان طبیعی، استدلال، تولید کد و تصمیمگیری، چشمانداز جدیدی را برای خودکارسازی فعالیتهای پیچیده امنیت سایبری ایجاد کرده است. این پایاننامه با تمرکز بر همین تحول، تلاش میکند امکان استفاده از مدلهای زبانی بزرگ را به عنوان هسته اصلی عاملهای هوشمند در حوزه امنیت سایبری بررسی کند.
ریشه مسئلهای که این پژوهش به دنبال حل آن است، به محدودیت ابزارهای سنتی آزمون نفوذ بازمیگردد. ابزارهای رایج امنیتی معمولاً بر اساس قوانین از پیش تعریفشده یا پایگاه داده آسیبپذیریها عمل میکنند و در شرایط جدید یا پیچیده، انعطاف لازم برای تحلیل وضعیت و انتخاب مسیر مناسب را ندارند. در مقابل، کارشناسان انسانی میتوانند با ترکیب تجربه، استدلال و اطلاعات محیطی، تصمیمهای هوشمندانه اتخاذ کنند. پژوهش حاضر با این فرض آغاز میشود که مدلهای زبانی بزرگ میتوانند بخشی از این قابلیت شناختی را بازآفرینی کرده و به عنوان یک عامل هوشمند، فرآیند آزمون نفوذ را به صورت خودکار مدیریت کنند. نویسنده همچنین به این نکته اشاره میکند که پس از انتشار ChatGPT در سال ۲۰۲۲ و استقبال گسترده از آن، تواناییهای این مدلها در حل مسائل پیچیده، تولید کد و تحلیل اطلاعات، توجه پژوهشگران امنیت سایبری را به خود جلب کرد و همین موضوع انگیزه اصلی شکلگیری این تحقیق بوده است.
در بخش نخست پژوهش، مبانی نظری مدلهای زبانی بزرگ، روند تکامل آنها، معماری ترنسفورمر، کاربردهای امروزی و همچنین محدودیتهای اخلاقی و فنی آنها بررسی میشود. نویسنده نشان میدهد که این مدلها تنها ابزار تولید متن نیستند، بلکه قادرند اطلاعات را تحلیل کنند، کد تولید نمایند، درباره مسائل پیچیده استدلال کنند و حتی نقش یک عامل تصمیمگیرنده را بر عهده بگیرند. همچنین پیشینه استفاده از هوش مصنوعی در امنیت سایبری، پروژههای مرتبط، ابزارهای موجود و تحقیقات پیشین در زمینه آزمون نفوذ خودکار مورد بررسی قرار میگیرد تا جایگاه پژوهش حاضر نسبت به مطالعات گذشته مشخص شود.
بخش اصلی پایاننامه به طراحی یک عامل هوشمند مبتنی بر مدلهای زبانی بزرگ اختصاص دارد. نویسنده ابتدا چهار قابلیت اساسی مورد نیاز برای ساخت چنین عاملی را معرفی میکند که شامل تولید متن طبیعی، پردازش و خلاصهسازی اطلاعات، تولید کد و تصمیمگیری در جریان اجرای عملیات است. سپس با ترکیب این قابلیتها، یک معماری عمومی برای عامل هوشمند پیشنهاد میشود که قادر است محیط را مشاهده کند، دادهها را تحلیل نماید، ابزارهای مناسب را انتخاب کند، دستورات لازم را تولید و اجرا نماید و براساس نتایج به دست آمده، مسیر بعدی عملیات را تعیین کند. این عامل در یک محیط واقعی مبتنی بر Docker و سیستمعامل Kali Linux اجرا میشود و از ابزارهای متداول آزمون نفوذ برای تعامل با سامانههای هدف استفاده میکند.
یکی از مهمترین نوآوریهای این پژوهش، ارائه معماری سلسلهمراتبی موسوم به «زنجیره فرماندهی» برای مدیریت فرآیند تصمیمگیری عامل هوشمند است. نویسنده نشان میدهد که مدلهای زبانی در حل مسائل چندمرحلهای، به ویژه زمانی که نیاز به برنامهریزی بلندمدت، حفظ حافظه و بازگشت به تصمیمات قبلی وجود دارد، با محدودیت مواجه هستند. برای رفع این مشکل، ساختاری چندسطحی طراحی شده است که شامل برنامهریز راهبردی، برنامهریز عملیاتی و ماژولهای اجرایی است. این ساختار باعث میشود مسئولیتها میان اجزای مختلف تقسیم شود، حافظه عامل به شکل مؤثرتری مدیریت گردد و فرآیند تصمیمگیری از حالت خطی خارج شده و قابلیت برنامهریزی، بازنگری و مدیریت عملیات پیچیده را پیدا کند. این معماری همچنین امکان تولید گزارشهای قابل فهم برای انسان و مستندسازی فرآیند آزمون نفوذ را فراهم میکند.
بخش مهم دیگری از پایاننامه به ارزیابی عملکرد مدلهای زبانی بزرگ در حل چالشهای امنیت سایبری Capture The Flag یا CTF اختصاص دارد. نویسنده برای این منظور یک چارچوب ارزیابی جامع طراحی میکند که امکان مقایسه مدلهای مختلف، استراتژیهای متفاوت طراحی پرامپت، نحوه نمایش تاریخچه اقدامات و ساختار عاملهای هوشمند را فراهم میآورد. آزمایشها روی مجموعهدادههای معتبر از جمله Bandit، InterCode-CTF و FemtoCTF انجام شدهاند تا عملکرد مدلها در شرایط متنوع سنجیده شود. این چارچوب نه تنها میزان موفقیت مدلها در حل چالشها را اندازهگیری میکند، بلکه زمان اجرا، هزینه، رفتار مدل، نقاط قوت و محدودیتهای هر راهبرد را نیز تحلیل میکند.
نتایج به دست آمده نشان میدهد که نحوه طراحی عامل و روش تعامل با مدل زبانی تأثیر بسیار بیشتری نسبت به انتخاب صرف مدل دارد. استفاده از معماری پیشنهادی و راهبردهای مناسب طراحی پرامپت باعث شده میزان موفقیت عامل هوشمند در حل چالشهای PicoCTF نسبت به روش مرجع منتشرشده بیش از ۱۰۲ درصد افزایش یابد. علاوه بر این، پژوهش نشان میدهد که مدلهای زبانی در وظایف ساده عملکرد بسیار مطلوبی دارند، اما در مسائل پیچیده و چندمرحلهای همچنان با محدودیتهایی مانند فراموشی اطلاعات، ناتوانی در برنامهریزی بلندمدت و تمرکز بیش از حد روی یک مسیر مواجه هستند؛ محدودیتهایی که با استفاده از معماری سلسلهمراتبی تا حد زیادی کاهش یافتهاند.
از دیگر دستاوردهای مهم این پژوهش، ارائه یک چارچوب استاندارد برای ارزیابی عاملهای مبتنی بر مدلهای زبانی در حوزه امنیت سایبری است. این چارچوب امکان مقایسه مدلهای مختلف، بررسی استراتژیهای پرامپت، تحلیل هزینه و کارایی و همچنین ایجاد معیارهای قابل تکرار برای تحقیقات آینده را فراهم میکند. علاوه بر این، پژوهش حاضر نشان میدهد که عاملهای مبتنی بر مدلهای زبانی میتوانند شکاف میان ابزارهای سنتی خودکار و توانایی تحلیل کارشناسان انسانی را تا حد قابل توجهی کاهش دهند و در آینده نقش مهمی در خودکارسازی عملیات امنیت سایبری ایفا کنند.
در کنار نتایج فنی، نویسنده به ابعاد اخلاقی و امنیتی این فناوری نیز توجه ویژهای دارد. از آنجا که هر فناوری قابل استفاده برای مدافعان میتواند توسط مهاجمان نیز مورد سوءاستفاده قرار گیرد، توسعه چنین سامانههایی باید همراه با چارچوبهای مسئولانه، نظارت مناسب و اصول اخلاقی انجام شود. پایاننامه تأکید میکند که هدف اصلی این فناوری، کمک به افزایش امنیت سازمانها، کاهش هزینه آزمون نفوذ، افزایش دسترسی سازمانهای کوچک به خدمات امنیتی و ارتقای توان تحلیل متخصصان امنیت است، نه جایگزینی کامل انسان. همچنین با توجه به سرعت پیشرفت مدلهای زبانی، پژوهش حاضر یک نقطه آغاز برای تحقیقات آینده در زمینه عاملهای هوشمند امنیت سایبری محسوب میشود و مسیر توسعه سامانههای خودکار پیشرفتهتر را هموار میکند.
در مجموع، این پایاننامه با ترکیب مفاهیم مدلهای زبانی بزرگ، عاملهای هوشمند، آزمون نفوذ و چالشهای CTF، رویکردی نوین برای خودکارسازی عملیات امنیت سایبری ارائه میدهد. طراحی معماری چندسطحی عامل، ارائه چارچوب ارزیابی جامع، تحلیل عملکرد مدلهای مختلف و معرفی بهترین راهبردهای تعامل با مدلهای زبانی، از مهمترین دستاوردهای این پژوهش به شمار میروند. نتایج تحقیق نشان میدهد که اگرچه مدلهای زبانی بزرگ هنوز جایگزین کامل متخصصان امنیت نیستند، اما با بهرهگیری از معماریهای مناسب و راهبردهای تصمیمگیری پیشرفته، میتوانند به ابزارهایی قدرتمند برای انجام آزمون نفوذ، تحلیل آسیبپذیریها و پشتیبانی از تصمیمگیری در امنیت سایبری تبدیل شوند و آینده این حوزه را به شکل قابل توجهی متحول سازند.
| فهرست مطالب | شماره صفحه |
|---|---|
| چکیده | 2 |
| فصل ۱: مقدمه | 9 |
| 1-1. نمای کلی پایاننامه | 10 |
| 1-2. دستاوردها و نوآوریهای پژوهش | 10 |
| 1-3. انگیزه پژوهش | 11 |
| فصل ۲: مبانی نظری و پژوهشهای مرتبط | 13 |
| 2-1. مدلهای زبانی بزرگ (Large Language Models – LLMs) | 13 |
| 2-1-1. پیشینه تاریخی و روند تکامل | 13 |
| 2-1-2. قابلیتها و کاربردهای نوین | 14 |
| 2-1-3. مدلهای زبانی بزرگ بهعنوان عاملهای هوشمند (Agent Models) | 16 |
| 2-2. آزمون نفوذ و فضای سایبری (Penetration Testing & Cyberspace) | 16 |
| 2-2-1. راهکارهای موجود هوش مصنوعی در فضای سایبری | 17 |
| فصل ۳: عاملهای آزمون نفوذ مبتنی بر مدلهای زبانی بزرگ | 19 |
| 3-1. طراحی و ساخت یک عامل مبتنی بر مدل زبانی بزرگ | 19 |
| 3-1-1. قابلیتهای اصلی مدلهای زبانی بزرگ | 19 |
| 3-1-2. معماری عمومی عامل هوشمند | 21 |
| 3-1-3. راهبرد طراحی پرامپت (Prompting Strategy) | 22 |
| 3-1-4. محیط آزمایش | 24 |
| 3-1-5. پژوهش اولیه | 25 |
| 3-1-6. معماری برنامهریز زنجیره فرماندهی (Chain of Command Planner) | 26 |
| 3-2. ملاحظات ایمنی و اخلاقی | 29 |
| 3-3. ارزیابی و پژوهشهای آینده | 30 |
| فصل ۴: عاملهای مبتنی بر مدلهای زبانی بزرگ بهعنوان حلکننده چالشهای CTF | 33 |
| 4-1. مقدمه | 33 |
| 4-2. روششناسی پژوهش | 35 |
| 4-2-1. مدلها | 35 |
| 4-2-2. راهبردهای طراحی پرامپت | 36 |
| 4-2-3. چارچوب ارزیابی | 42 |
| 4-3. Bandit | 47 |
| 4-3-1. اهداف ارزیابی Bandit | 47 |
| 4-3-2. مجموعهداده Bandit | 48 |
| 4-3-3. تنظیمات و اجرای آزمایش | 48 |
| 4-3-4. ارزیابی | 49 |
| 4-3-5. بحث و تحلیل | 52 |
| 4-4. InterCode-CTF (PicoCTF) | 53 |
| 4-4-1. مجموعهداده InterCode-CTF | 53 |
| 4-4-2. محیط اجرا | 54 |
| 4-4-3. تنظیمات آزمایش | 55 |
| 4-4-4. نتایج مطالعه قابلیتها | 56 |
| 4-4-5. مطالعه حذف مؤلفهها (Ablation Study) | 58 |
| 4-4-6. تحلیل زمان و هزینه | 60 |
| 4-4-7. رفتار مدل | 62 |
| 4-4-8. مطالعات موردی | 64 |
| 4-4-9. بحث و تحلیل | 67 |
| 4-5. مجموعهداده FemtoCTF؛ ارزیابی متمرکزتر | 68 |
| 4-5-1. ساختار مجموعهداده | 68 |
| 4-5-2. تنظیمات آزمایش | 69 |
| 4-5-3. نتایج | 71 |
| 4-5-4. بحث و تحلیل | 74 |
| 4-6. جمعبندی: مدلهای زبانی بزرگ بهعنوان حلکننده چالشهای CTF | 74 |
| 4-6-1. خلاصه یافتهها | 74 |
| پیوست A: اجزای عامل آزمون نفوذ | 77 |
| A-1. نمونه مدل محیط | 77 |
| A-2. نمونه تولید گزارش | 78 |
| A-3. پرامپتهای عامل سلسلهمراتبی | 78 |
| A-4. فرایند تولید ماژول | 78 |
| پیوست B: چارچوب ارزیابی CTF | 82 |
| B-1. نمودارهای توزیع تجمعی InterCode-CTF | 82 |
| منابع | 85 |
هوش مصنوعی حالا میتواند هکر شود؟ نگاهی به پایاننامهای که آینده امنیت سایبری را تغییر میدهد
هوش مصنوعی دیگر فقط متن نمینویسد یا کد تولید نمیکند؛ حالا میتواند مانند یک متخصص امنیت فکر کند، تصمیم بگیرد و حتی مسیر یک حمله سایبری را مرحلهبهمرحله تحلیل کند. اما سؤال مهم اینجاست: آیا مدلهای زبانی بزرگ واقعاً میتوانند جای یک متخصص آزمون نفوذ را بگیرند؟
این دقیقاً همان پرسشی است که پژوهشگران MIT در این پایاننامه به دنبال پاسخ آن بودهاند. نتیجه، مجموعهای از ایدهها و یافتههایی است که میتواند آینده امنیت سایبری را متحول کند.
مدلهای زبانی فقط چتبات نیستند؛ آنها میتوانند عامل هوشمند باشند
بیشتر افراد مدلهای زبانی بزرگ مانند ChatGPT را ابزارهایی برای پاسخ به سؤال یا تولید متن میدانند. اما این پایاننامه نشان میدهد اگر این مدلها به ابزار مناسب، حافظه، محیط اجرا و قابلیت تصمیمگیری مجهز شوند، میتوانند به یک عامل هوشمند (AI Agent) تبدیل شوند.
در چنین شرایطی، مدل تنها پاسخ تولید نمیکند؛ بلکه محیط را مشاهده میکند، اطلاعات را تحلیل میکند، تصمیم میگیرد، دستورات لازم را مینویسد، آنها را اجرا میکند و بر اساس نتیجه، مسیر بعدی را انتخاب میکند.
این تغییر دیدگاه شاید مهمترین تحول سالهای اخیر در حوزه هوش مصنوعی باشد؛ جایی که مدل از یک «دستیار» به یک «مجری عملیات» تبدیل میشود.
مشکل اصلی آزمون نفوذ همیشه کمبود هوش بوده، نه ابزار
ابزارهای امنیتی فراوانی برای اسکن شبکهها وجود دارند؛ اما اغلب آنها فقط آسیبپذیریها را گزارش میکنند.
یک متخصص امنیت واقعی هنگام آزمون نفوذ دائماً از خودش سؤال میپرسد:
- حالا بهترین قدم بعدی چیست؟
- آیا مسیر قبلی اشتباه بود؟
- باید اطلاعات بیشتری جمعآوری کنم یا حمله را ادامه دهم؟
- اگر این روش جواب نداد، مسیر جایگزین چیست؟
دقیقاً همین توانایی تصمیمگیری چیزی است که ابزارهای سنتی فاقد آن هستند.
نویسنده پایاننامه تلاش کرده این شکاف را با استفاده از مدلهای زبانی بزرگ پر کند؛ یعنی عاملی طراحی کند که بتواند مانند یک کارشناس امنیت فکر کند، نه صرفاً چند دستور از پیش تعیینشده را اجرا کند.
حافظه مهمتر از هوش است
یکی از جالبترین نکات پژوهش این است که مشکل اصلی مدلهای زبانی، کمبود دانش نیست.
آنها تقریباً همه ابزارهای امنیتی را میشناسند.
مشکل اینجاست که در عملیات چندمرحلهای، اطلاعات قبلی را فراموش میکنند یا روی اولین مسیر انتخابشده گیر میکنند.
برای حل این مسئله، پژوهش یک معماری سلسلهمراتبی پیشنهاد میکند که در آن چند عامل با مسئولیتهای مختلف همکاری میکنند.
یکی مسئول برنامهریزی کلان است.
یکی عملیات را مدیریت میکند.
و دیگری دستورات اجرایی را تولید میکند.
در نتیجه عامل هوشمند میتواند مسیرهای مختلف را مدیریت کند، تصمیمهای قبلی را به خاطر بسپارد و در صورت نیاز حتی به عقب بازگردد.
این دقیقاً همان چیزی است که یک متخصص امنیت هنگام کار انجام میدهد.
طراحی پرامپت از انتخاب مدل مهمتر است
بسیاری تصور میکنند کافی است قدرتمندترین مدل هوش مصنوعی را انتخاب کنند تا بهترین نتیجه حاصل شود.
اما این پایاننامه نتیجه متفاوتی ارائه میدهد.
پژوهش نشان میدهد نحوه طراحی پرامپت، ساختار عامل و معماری تصمیمگیری، تأثیر بسیار بیشتری از انتخاب خود مدل دارد.
به بیان دیگر، یک مدل متوسط با معماری مناسب میتواند عملکردی بهتر از یک مدل بسیار قدرتمند اما بدون ساختار داشته باشد.
این یافته، یکی از ارزشمندترین پیامهای پژوهش برای توسعهدهندگان سیستمهای مبتنی بر هوش مصنوعی است.
بیش از ۱۰۰ درصد بهبود عملکرد
شاید شگفتانگیزترین نتیجه پایاننامه همین باشد.
عامل پیشنهادی پژوهش در حل چالشهای امنیتی PicoCTF توانسته نسبت به روش مرجع منتشرشده بیش از ۱۰۲ درصد بهبود عملکرد داشته باشد.
این موفقیت تنها با استفاده از مدل قویتر به دست نیامده است؛ بلکه نتیجه طراحی بهتر عامل، مدیریت حافظه، معماری سلسلهمراتبی و راهبردهای مناسب طراحی پرامپت بوده است.
این موضوع نشان میدهد آینده هوش مصنوعی صرفاً به مدلهای بزرگتر وابسته نیست؛ بلکه به نحوه استفاده از آنها نیز بستگی دارد.
CTF فقط یک بازی نیست
یکی دیگر از نکات جالب پایاننامه این است که چالشهای Capture The Flag یا CTF صرفاً مسابقات سرگرمکننده هک نیستند.
در این پژوهش، CTF به عنوان یک آزمایشگاه استاندارد برای سنجش توانایی مدلهای زبانی در حل مسائل واقعی امنیت سایبری استفاده شده است.
به همین دلیل نویسنده یک چارچوب جامع ارزیابی طراحی کرده که امکان مقایسه مدلها، روشهای مختلف طراحی پرامپت، هزینه اجرا، زمان پاسخ و کیفیت تصمیمگیری را فراهم میکند.
چنین چارچوبی میتواند مبنای تحقیقات آینده در حوزه عاملهای هوشمند امنیت سایبری باشد.
آیا هوش مصنوعی جای متخصص امنیت را میگیرد؟
شاید انتظار داشته باشید پاسخ این پایاننامه «بله» باشد.
اما نتیجه کاملاً متعادلتر است.
پژوهش نشان میدهد مدلهای زبانی هنوز در مدیریت مسائل بسیار پیچیده، برنامهریزی بلندمدت، حفظ حافظه و تصمیمگیریهای چندمرحلهای محدودیت دارند.
بنابراین هدف این فناوری حذف متخصصان امنیت نیست.
بلکه ساخت ابزارهایی است که سرعت، دقت و بهرهوری کارشناسان را افزایش دهند و انجام آزمون نفوذ را برای سازمانهای بیشتری امکانپذیر کنند.
آینده امنیت سایبری احتمالاً چندعاملی خواهد بود
شاید مهمترین پیام این پایاننامه اصلاً درباره امنیت نباشد.
بلکه درباره آینده هوش مصنوعی است.
ما در حال حرکت از چتباتهایی هستیم که فقط پاسخ میدهند، به سمت عاملهایی که مشاهده میکنند، برنامهریزی میکنند، تصمیم میگیرند، اجرا میکنند و از نتایج خود یاد میگیرند.
امنیت سایبری تنها اولین حوزهای است که این تحول را تجربه میکند.
احتمالاً در آینده نزدیک، همین معماری را در پزشکی، مهندسی، رباتیک، برنامهنویسی و بسیاری از صنایع دیگر نیز خواهیم دید.
جمعبندی
این پایاننامه نشان میدهد آینده امنیت سایبری صرفاً به ابزارهای جدید وابسته نیست؛ بلکه به نحوه همکاری هوش مصنوعی با انسان بستگی دارد. مدلهای زبانی بزرگ زمانی بیشترین ارزش را ایجاد میکنند که در قالب عاملهای هوشمند، با معماری مناسب، حافظه ساختاریافته و راهبردهای تصمیمگیری دقیق به کار گرفته شوند. شاید سؤال اصلی دیگر این نباشد که «آیا هوش مصنوعی میتواند آزمون نفوذ انجام دهد؟» بلکه این باشد که تا چند سال دیگر چه بخشهایی از امنیت سایبری را میتوان با چنین عاملهایی بهطور کامل خودکار کرد؟
بسیار سریع و ساده می توانید اصل این پایان نامه را به صورت فایل PDF در اختیار داشته باشید.