با گسترش روزافزون زیرساخت‌های دیجیتال و افزایش پیچیدگی حملات سایبری، امنیت سایبری به یکی از مهم‌ترین حوزه‌های فناوری اطلاعات تبدیل شده است. در این میان، آزمون نفوذ (Penetration Testing) به عنوان یکی از مؤثرترین روش‌های ارزیابی امنیت سیستم‌ها شناخته می‌شود. این فرآیند با شبیه‌سازی حملات واقعی، نقاط ضعف شبکه‌ها، سامانه‌ها و نرم‌افزارها را پیش از آنکه توسط مهاجمان مورد سوءاستفاده قرار گیرند، شناسایی می‌کند. با وجود اهمیت بالای آزمون نفوذ، اجرای آن نیازمند متخصصان باتجربه، صرف زمان قابل توجه و هزینه‌های زیاد است و ابزارهای خودکار موجود نیز عمدتاً به اسکن آسیب‌پذیری محدود شده‌اند و توانایی تصمیم‌گیری پویا، تحلیل شرایط و انتخاب راهبرد مناسب مشابه کارشناسان انسانی را ندارند. در سال‌های اخیر، ظهور مدل‌های زبانی بزرگ (Large Language Models یا LLMs) مانند GPT و Claude، با توانایی چشمگیر در درک زبان طبیعی، استدلال، تولید کد و تصمیم‌گیری، چشم‌انداز جدیدی را برای خودکارسازی فعالیت‌های پیچیده امنیت سایبری ایجاد کرده است. این پایان‌نامه با تمرکز بر همین تحول، تلاش می‌کند امکان استفاده از مدل‌های زبانی بزرگ را به عنوان هسته اصلی عامل‌های هوشمند در حوزه امنیت سایبری بررسی کند.

ریشه مسئله‌ای که این پژوهش به دنبال حل آن است، به محدودیت ابزارهای سنتی آزمون نفوذ بازمی‌گردد. ابزارهای رایج امنیتی معمولاً بر اساس قوانین از پیش تعریف‌شده یا پایگاه داده آسیب‌پذیری‌ها عمل می‌کنند و در شرایط جدید یا پیچیده، انعطاف لازم برای تحلیل وضعیت و انتخاب مسیر مناسب را ندارند. در مقابل، کارشناسان انسانی می‌توانند با ترکیب تجربه، استدلال و اطلاعات محیطی، تصمیم‌های هوشمندانه اتخاذ کنند. پژوهش حاضر با این فرض آغاز می‌شود که مدل‌های زبانی بزرگ می‌توانند بخشی از این قابلیت شناختی را بازآفرینی کرده و به عنوان یک عامل هوشمند، فرآیند آزمون نفوذ را به صورت خودکار مدیریت کنند. نویسنده همچنین به این نکته اشاره می‌کند که پس از انتشار ChatGPT در سال ۲۰۲۲ و استقبال گسترده از آن، توانایی‌های این مدل‌ها در حل مسائل پیچیده، تولید کد و تحلیل اطلاعات، توجه پژوهشگران امنیت سایبری را به خود جلب کرد و همین موضوع انگیزه اصلی شکل‌گیری این تحقیق بوده است.

در بخش نخست پژوهش، مبانی نظری مدل‌های زبانی بزرگ، روند تکامل آن‌ها، معماری ترنسفورمر، کاربردهای امروزی و همچنین محدودیت‌های اخلاقی و فنی آن‌ها بررسی می‌شود. نویسنده نشان می‌دهد که این مدل‌ها تنها ابزار تولید متن نیستند، بلکه قادرند اطلاعات را تحلیل کنند، کد تولید نمایند، درباره مسائل پیچیده استدلال کنند و حتی نقش یک عامل تصمیم‌گیرنده را بر عهده بگیرند. همچنین پیشینه استفاده از هوش مصنوعی در امنیت سایبری، پروژه‌های مرتبط، ابزارهای موجود و تحقیقات پیشین در زمینه آزمون نفوذ خودکار مورد بررسی قرار می‌گیرد تا جایگاه پژوهش حاضر نسبت به مطالعات گذشته مشخص شود.

بخش اصلی پایان‌نامه به طراحی یک عامل هوشمند مبتنی بر مدل‌های زبانی بزرگ اختصاص دارد. نویسنده ابتدا چهار قابلیت اساسی مورد نیاز برای ساخت چنین عاملی را معرفی می‌کند که شامل تولید متن طبیعی، پردازش و خلاصه‌سازی اطلاعات، تولید کد و تصمیم‌گیری در جریان اجرای عملیات است. سپس با ترکیب این قابلیت‌ها، یک معماری عمومی برای عامل هوشمند پیشنهاد می‌شود که قادر است محیط را مشاهده کند، داده‌ها را تحلیل نماید، ابزارهای مناسب را انتخاب کند، دستورات لازم را تولید و اجرا نماید و براساس نتایج به دست آمده، مسیر بعدی عملیات را تعیین کند. این عامل در یک محیط واقعی مبتنی بر Docker و سیستم‌عامل Kali Linux اجرا می‌شود و از ابزارهای متداول آزمون نفوذ برای تعامل با سامانه‌های هدف استفاده می‌کند.

یکی از مهم‌ترین نوآوری‌های این پژوهش، ارائه معماری سلسله‌مراتبی موسوم به «زنجیره فرماندهی» برای مدیریت فرآیند تصمیم‌گیری عامل هوشمند است. نویسنده نشان می‌دهد که مدل‌های زبانی در حل مسائل چندمرحله‌ای، به ویژه زمانی که نیاز به برنامه‌ریزی بلندمدت، حفظ حافظه و بازگشت به تصمیمات قبلی وجود دارد، با محدودیت مواجه هستند. برای رفع این مشکل، ساختاری چندسطحی طراحی شده است که شامل برنامه‌ریز راهبردی، برنامه‌ریز عملیاتی و ماژول‌های اجرایی است. این ساختار باعث می‌شود مسئولیت‌ها میان اجزای مختلف تقسیم شود، حافظه عامل به شکل مؤثرتری مدیریت گردد و فرآیند تصمیم‌گیری از حالت خطی خارج شده و قابلیت برنامه‌ریزی، بازنگری و مدیریت عملیات پیچیده را پیدا کند. این معماری همچنین امکان تولید گزارش‌های قابل فهم برای انسان و مستندسازی فرآیند آزمون نفوذ را فراهم می‌کند.

بخش مهم دیگری از پایان‌نامه به ارزیابی عملکرد مدل‌های زبانی بزرگ در حل چالش‌های امنیت سایبری Capture The Flag یا CTF اختصاص دارد. نویسنده برای این منظور یک چارچوب ارزیابی جامع طراحی می‌کند که امکان مقایسه مدل‌های مختلف، استراتژی‌های متفاوت طراحی پرامپت، نحوه نمایش تاریخچه اقدامات و ساختار عامل‌های هوشمند را فراهم می‌آورد. آزمایش‌ها روی مجموعه‌داده‌های معتبر از جمله Bandit، InterCode-CTF و FemtoCTF انجام شده‌اند تا عملکرد مدل‌ها در شرایط متنوع سنجیده شود. این چارچوب نه تنها میزان موفقیت مدل‌ها در حل چالش‌ها را اندازه‌گیری می‌کند، بلکه زمان اجرا، هزینه، رفتار مدل، نقاط قوت و محدودیت‌های هر راهبرد را نیز تحلیل می‌کند.

نتایج به دست آمده نشان می‌دهد که نحوه طراحی عامل و روش تعامل با مدل زبانی تأثیر بسیار بیشتری نسبت به انتخاب صرف مدل دارد. استفاده از معماری پیشنهادی و راهبردهای مناسب طراحی پرامپت باعث شده میزان موفقیت عامل هوشمند در حل چالش‌های PicoCTF نسبت به روش مرجع منتشرشده بیش از ۱۰۲ درصد افزایش یابد. علاوه بر این، پژوهش نشان می‌دهد که مدل‌های زبانی در وظایف ساده عملکرد بسیار مطلوبی دارند، اما در مسائل پیچیده و چندمرحله‌ای همچنان با محدودیت‌هایی مانند فراموشی اطلاعات، ناتوانی در برنامه‌ریزی بلندمدت و تمرکز بیش از حد روی یک مسیر مواجه هستند؛ محدودیت‌هایی که با استفاده از معماری سلسله‌مراتبی تا حد زیادی کاهش یافته‌اند.

از دیگر دستاوردهای مهم این پژوهش، ارائه یک چارچوب استاندارد برای ارزیابی عامل‌های مبتنی بر مدل‌های زبانی در حوزه امنیت سایبری است. این چارچوب امکان مقایسه مدل‌های مختلف، بررسی استراتژی‌های پرامپت، تحلیل هزینه و کارایی و همچنین ایجاد معیارهای قابل تکرار برای تحقیقات آینده را فراهم می‌کند. علاوه بر این، پژوهش حاضر نشان می‌دهد که عامل‌های مبتنی بر مدل‌های زبانی می‌توانند شکاف میان ابزارهای سنتی خودکار و توانایی تحلیل کارشناسان انسانی را تا حد قابل توجهی کاهش دهند و در آینده نقش مهمی در خودکارسازی عملیات امنیت سایبری ایفا کنند.

در کنار نتایج فنی، نویسنده به ابعاد اخلاقی و امنیتی این فناوری نیز توجه ویژه‌ای دارد. از آنجا که هر فناوری قابل استفاده برای مدافعان می‌تواند توسط مهاجمان نیز مورد سوءاستفاده قرار گیرد، توسعه چنین سامانه‌هایی باید همراه با چارچوب‌های مسئولانه، نظارت مناسب و اصول اخلاقی انجام شود. پایان‌نامه تأکید می‌کند که هدف اصلی این فناوری، کمک به افزایش امنیت سازمان‌ها، کاهش هزینه آزمون نفوذ، افزایش دسترسی سازمان‌های کوچک به خدمات امنیتی و ارتقای توان تحلیل متخصصان امنیت است، نه جایگزینی کامل انسان. همچنین با توجه به سرعت پیشرفت مدل‌های زبانی، پژوهش حاضر یک نقطه آغاز برای تحقیقات آینده در زمینه عامل‌های هوشمند امنیت سایبری محسوب می‌شود و مسیر توسعه سامانه‌های خودکار پیشرفته‌تر را هموار می‌کند.

در مجموع، این پایان‌نامه با ترکیب مفاهیم مدل‌های زبانی بزرگ، عامل‌های هوشمند، آزمون نفوذ و چالش‌های CTF، رویکردی نوین برای خودکارسازی عملیات امنیت سایبری ارائه می‌دهد. طراحی معماری چندسطحی عامل، ارائه چارچوب ارزیابی جامع، تحلیل عملکرد مدل‌های مختلف و معرفی بهترین راهبردهای تعامل با مدل‌های زبانی، از مهم‌ترین دستاوردهای این پژوهش به شمار می‌روند. نتایج تحقیق نشان می‌دهد که اگرچه مدل‌های زبانی بزرگ هنوز جایگزین کامل متخصصان امنیت نیستند، اما با بهره‌گیری از معماری‌های مناسب و راهبردهای تصمیم‌گیری پیشرفته، می‌توانند به ابزارهایی قدرتمند برای انجام آزمون نفوذ، تحلیل آسیب‌پذیری‌ها و پشتیبانی از تصمیم‌گیری در امنیت سایبری تبدیل شوند و آینده این حوزه را به شکل قابل توجهی متحول سازند.

فهرست مطالب شماره صفحه
چکیده 2
فصل ۱: مقدمه 9
1-1. نمای کلی پایان‌نامه 10
1-2. دستاوردها و نوآوری‌های پژوهش 10
1-3. انگیزه پژوهش 11
فصل ۲: مبانی نظری و پژوهش‌های مرتبط 13
2-1. مدل‌های زبانی بزرگ (Large Language Models – LLMs) 13
2-1-1. پیشینه تاریخی و روند تکامل 13
2-1-2. قابلیت‌ها و کاربردهای نوین 14
2-1-3. مدل‌های زبانی بزرگ به‌عنوان عامل‌های هوشمند (Agent Models) 16
2-2. آزمون نفوذ و فضای سایبری (Penetration Testing & Cyberspace) 16
2-2-1. راهکارهای موجود هوش مصنوعی در فضای سایبری 17
فصل ۳: عامل‌های آزمون نفوذ مبتنی بر مدل‌های زبانی بزرگ 19
3-1. طراحی و ساخت یک عامل مبتنی بر مدل زبانی بزرگ 19
3-1-1. قابلیت‌های اصلی مدل‌های زبانی بزرگ 19
3-1-2. معماری عمومی عامل هوشمند 21
3-1-3. راهبرد طراحی پرامپت (Prompting Strategy) 22
3-1-4. محیط آزمایش 24
3-1-5. پژوهش اولیه 25
3-1-6. معماری برنامه‌ریز زنجیره فرماندهی (Chain of Command Planner) 26
3-2. ملاحظات ایمنی و اخلاقی 29
3-3. ارزیابی و پژوهش‌های آینده 30
فصل ۴: عامل‌های مبتنی بر مدل‌های زبانی بزرگ به‌عنوان حل‌کننده چالش‌های CTF 33
4-1. مقدمه 33
4-2. روش‌شناسی پژوهش 35
4-2-1. مدل‌ها 35
4-2-2. راهبردهای طراحی پرامپت 36
4-2-3. چارچوب ارزیابی 42
4-3. Bandit 47
4-3-1. اهداف ارزیابی Bandit 47
4-3-2. مجموعه‌داده Bandit 48
4-3-3. تنظیمات و اجرای آزمایش 48
4-3-4. ارزیابی 49
4-3-5. بحث و تحلیل 52
4-4. InterCode-CTF (PicoCTF) 53
4-4-1. مجموعه‌داده InterCode-CTF 53
4-4-2. محیط اجرا 54
4-4-3. تنظیمات آزمایش 55
4-4-4. نتایج مطالعه قابلیت‌ها 56
4-4-5. مطالعه حذف مؤلفه‌ها (Ablation Study) 58
4-4-6. تحلیل زمان و هزینه 60
4-4-7. رفتار مدل 62
4-4-8. مطالعات موردی 64
4-4-9. بحث و تحلیل 67
4-5. مجموعه‌داده FemtoCTF؛ ارزیابی متمرکزتر 68
4-5-1. ساختار مجموعه‌داده 68
4-5-2. تنظیمات آزمایش 69
4-5-3. نتایج 71
4-5-4. بحث و تحلیل 74
4-6. جمع‌بندی: مدل‌های زبانی بزرگ به‌عنوان حل‌کننده چالش‌های CTF 74
4-6-1. خلاصه یافته‌ها 74
پیوست A: اجزای عامل آزمون نفوذ 77
A-1. نمونه مدل محیط 77
A-2. نمونه تولید گزارش 78
A-3. پرامپت‌های عامل سلسله‌مراتبی 78
A-4. فرایند تولید ماژول 78
پیوست B: چارچوب ارزیابی CTF 82
B-1. نمودارهای توزیع تجمعی InterCode-CTF 82
منابع 85

 

هوش مصنوعی حالا می‌تواند هکر شود؟ نگاهی به پایان‌نامه‌ای که آینده امنیت سایبری را تغییر می‌دهد

هوش مصنوعی دیگر فقط متن نمی‌نویسد یا کد تولید نمی‌کند؛ حالا می‌تواند مانند یک متخصص امنیت فکر کند، تصمیم بگیرد و حتی مسیر یک حمله سایبری را مرحله‌به‌مرحله تحلیل کند. اما سؤال مهم اینجاست: آیا مدل‌های زبانی بزرگ واقعاً می‌توانند جای یک متخصص آزمون نفوذ را بگیرند؟

این دقیقاً همان پرسشی است که پژوهشگران MIT در این پایان‌نامه به دنبال پاسخ آن بوده‌اند. نتیجه، مجموعه‌ای از ایده‌ها و یافته‌هایی است که می‌تواند آینده امنیت سایبری را متحول کند.


مدل‌های زبانی فقط چت‌بات نیستند؛ آن‌ها می‌توانند عامل هوشمند باشند

بیشتر افراد مدل‌های زبانی بزرگ مانند ChatGPT را ابزارهایی برای پاسخ به سؤال یا تولید متن می‌دانند. اما این پایان‌نامه نشان می‌دهد اگر این مدل‌ها به ابزار مناسب، حافظه، محیط اجرا و قابلیت تصمیم‌گیری مجهز شوند، می‌توانند به یک عامل هوشمند (AI Agent) تبدیل شوند.

در چنین شرایطی، مدل تنها پاسخ تولید نمی‌کند؛ بلکه محیط را مشاهده می‌کند، اطلاعات را تحلیل می‌کند، تصمیم می‌گیرد، دستورات لازم را می‌نویسد، آن‌ها را اجرا می‌کند و بر اساس نتیجه، مسیر بعدی را انتخاب می‌کند.

این تغییر دیدگاه شاید مهم‌ترین تحول سال‌های اخیر در حوزه هوش مصنوعی باشد؛ جایی که مدل از یک «دستیار» به یک «مجری عملیات» تبدیل می‌شود.


مشکل اصلی آزمون نفوذ همیشه کمبود هوش بوده، نه ابزار

ابزارهای امنیتی فراوانی برای اسکن شبکه‌ها وجود دارند؛ اما اغلب آن‌ها فقط آسیب‌پذیری‌ها را گزارش می‌کنند.

یک متخصص امنیت واقعی هنگام آزمون نفوذ دائماً از خودش سؤال می‌پرسد:

  • حالا بهترین قدم بعدی چیست؟
  • آیا مسیر قبلی اشتباه بود؟
  • باید اطلاعات بیشتری جمع‌آوری کنم یا حمله را ادامه دهم؟
  • اگر این روش جواب نداد، مسیر جایگزین چیست؟

دقیقاً همین توانایی تصمیم‌گیری چیزی است که ابزارهای سنتی فاقد آن هستند.

نویسنده پایان‌نامه تلاش کرده این شکاف را با استفاده از مدل‌های زبانی بزرگ پر کند؛ یعنی عاملی طراحی کند که بتواند مانند یک کارشناس امنیت فکر کند، نه صرفاً چند دستور از پیش تعیین‌شده را اجرا کند.


حافظه مهم‌تر از هوش است

یکی از جالب‌ترین نکات پژوهش این است که مشکل اصلی مدل‌های زبانی، کمبود دانش نیست.

آن‌ها تقریباً همه ابزارهای امنیتی را می‌شناسند.

مشکل اینجاست که در عملیات چندمرحله‌ای، اطلاعات قبلی را فراموش می‌کنند یا روی اولین مسیر انتخاب‌شده گیر می‌کنند.

برای حل این مسئله، پژوهش یک معماری سلسله‌مراتبی پیشنهاد می‌کند که در آن چند عامل با مسئولیت‌های مختلف همکاری می‌کنند.

یکی مسئول برنامه‌ریزی کلان است.

یکی عملیات را مدیریت می‌کند.

و دیگری دستورات اجرایی را تولید می‌کند.

در نتیجه عامل هوشمند می‌تواند مسیرهای مختلف را مدیریت کند، تصمیم‌های قبلی را به خاطر بسپارد و در صورت نیاز حتی به عقب بازگردد.

این دقیقاً همان چیزی است که یک متخصص امنیت هنگام کار انجام می‌دهد.


طراحی پرامپت از انتخاب مدل مهم‌تر است

بسیاری تصور می‌کنند کافی است قدرتمندترین مدل هوش مصنوعی را انتخاب کنند تا بهترین نتیجه حاصل شود.

اما این پایان‌نامه نتیجه متفاوتی ارائه می‌دهد.

پژوهش نشان می‌دهد نحوه طراحی پرامپت، ساختار عامل و معماری تصمیم‌گیری، تأثیر بسیار بیشتری از انتخاب خود مدل دارد.

به بیان دیگر، یک مدل متوسط با معماری مناسب می‌تواند عملکردی بهتر از یک مدل بسیار قدرتمند اما بدون ساختار داشته باشد.

این یافته، یکی از ارزشمندترین پیام‌های پژوهش برای توسعه‌دهندگان سیستم‌های مبتنی بر هوش مصنوعی است.


بیش از ۱۰۰ درصد بهبود عملکرد

شاید شگفت‌انگیزترین نتیجه پایان‌نامه همین باشد.

عامل پیشنهادی پژوهش در حل چالش‌های امنیتی PicoCTF توانسته نسبت به روش مرجع منتشرشده بیش از ۱۰۲ درصد بهبود عملکرد داشته باشد.

این موفقیت تنها با استفاده از مدل قوی‌تر به دست نیامده است؛ بلکه نتیجه طراحی بهتر عامل، مدیریت حافظه، معماری سلسله‌مراتبی و راهبردهای مناسب طراحی پرامپت بوده است.

این موضوع نشان می‌دهد آینده هوش مصنوعی صرفاً به مدل‌های بزرگ‌تر وابسته نیست؛ بلکه به نحوه استفاده از آن‌ها نیز بستگی دارد.


CTF فقط یک بازی نیست

یکی دیگر از نکات جالب پایان‌نامه این است که چالش‌های Capture The Flag یا CTF صرفاً مسابقات سرگرم‌کننده هک نیستند.

در این پژوهش، CTF به عنوان یک آزمایشگاه استاندارد برای سنجش توانایی مدل‌های زبانی در حل مسائل واقعی امنیت سایبری استفاده شده است.

به همین دلیل نویسنده یک چارچوب جامع ارزیابی طراحی کرده که امکان مقایسه مدل‌ها، روش‌های مختلف طراحی پرامپت، هزینه اجرا، زمان پاسخ و کیفیت تصمیم‌گیری را فراهم می‌کند.

چنین چارچوبی می‌تواند مبنای تحقیقات آینده در حوزه عامل‌های هوشمند امنیت سایبری باشد.


آیا هوش مصنوعی جای متخصص امنیت را می‌گیرد؟

شاید انتظار داشته باشید پاسخ این پایان‌نامه «بله» باشد.

اما نتیجه کاملاً متعادل‌تر است.

پژوهش نشان می‌دهد مدل‌های زبانی هنوز در مدیریت مسائل بسیار پیچیده، برنامه‌ریزی بلندمدت، حفظ حافظه و تصمیم‌گیری‌های چندمرحله‌ای محدودیت دارند.

بنابراین هدف این فناوری حذف متخصصان امنیت نیست.

بلکه ساخت ابزارهایی است که سرعت، دقت و بهره‌وری کارشناسان را افزایش دهند و انجام آزمون نفوذ را برای سازمان‌های بیشتری امکان‌پذیر کنند.


آینده امنیت سایبری احتمالاً چندعاملی خواهد بود

شاید مهم‌ترین پیام این پایان‌نامه اصلاً درباره امنیت نباشد.

بلکه درباره آینده هوش مصنوعی است.

ما در حال حرکت از چت‌بات‌هایی هستیم که فقط پاسخ می‌دهند، به سمت عامل‌هایی که مشاهده می‌کنند، برنامه‌ریزی می‌کنند، تصمیم می‌گیرند، اجرا می‌کنند و از نتایج خود یاد می‌گیرند.

امنیت سایبری تنها اولین حوزه‌ای است که این تحول را تجربه می‌کند.

احتمالاً در آینده نزدیک، همین معماری را در پزشکی، مهندسی، رباتیک، برنامه‌نویسی و بسیاری از صنایع دیگر نیز خواهیم دید.

جمع‌بندی

این پایان‌نامه نشان می‌دهد آینده امنیت سایبری صرفاً به ابزارهای جدید وابسته نیست؛ بلکه به نحوه همکاری هوش مصنوعی با انسان بستگی دارد. مدل‌های زبانی بزرگ زمانی بیشترین ارزش را ایجاد می‌کنند که در قالب عامل‌های هوشمند، با معماری مناسب، حافظه ساختاریافته و راهبردهای تصمیم‌گیری دقیق به کار گرفته شوند. شاید سؤال اصلی دیگر این نباشد که «آیا هوش مصنوعی می‌تواند آزمون نفوذ انجام دهد؟» بلکه این باشد که تا چند سال دیگر چه بخش‌هایی از امنیت سایبری را می‌توان با چنین عامل‌هایی به‌طور کامل خودکار کرد؟

 

 

 

بسیار سریع و ساده می توانید اصل این پایان نامه را به صورت فایل PDF در اختیار داشته باشید.

پس از دریافت پایان‌نامه، کلیه اطلاعات کتاب‌شناختی موردنیاز برای استناد علمی، از جمله نام دانشگاه، عنوان پایان‌نامه، نام پژوهشگر، سال دفاع و سایر مشخصات مرتبط، جهت ارجاع‌دهی صحیح مطابق با استانداردهای رایج، در اختیار شما قرار خواهد گرفت.