این پایان‌نامه به یکی از چالش‌های اساسی در حوزه هوش مصنوعی می‌پردازد: چگونه می‌توان به عوامل هوشمند آموخت که در محیط‌های اجتماعی پیچیده، نه تنها با یکدیگر همکاری کنند، بلکه بتوانند خود را با رفتارهای پیش‌بینی‌نشده و متنوع سایرین نیز سازگار کنند. مسئله مورد بحث، «معضلات اجتماعی ترتیبی» هستند؛ سناریوهایی که در آن‌ها هر فرد بین منفعت شخصی و منفعت جمعی گرفتار می‌شود و انتخاب همیشگی یکی از این دو، به نتیجه‌ای بهینه برای کل گروه نمی‌انجامد. مثال کلاسیک این معضلات، «معمای زندانی» است که در آن، همکاری متقابل بهترین نتیجه را برای هر دو طرف دارد، اما وسوسهٔ خیانت، همیشه وجود دارد.

روش‌های متداول در یادگیری تقویتی چندعاملی، معمولاً از «خودبازی» استفاده می‌کنند؛ یعنی عاملی در برابر کپی‌هایی از خودش آموزش می‌بیند. این روش اگرچه قدرتمند است، اما عاملی را پرورش می‌دهد که تنها در برابر یک استراتژی خاص، عملکرد مطلوب دارد. نتیجه این است که وقتی این عامل با استراتژی‌های رایج دیگری مانند «چشم‌درمقابل‌چشم» (که در آن عامل، رفتار طرف مقابل را تقلید می‌کند) روبه‌رو می‌شود، عملکرد ضعیفی از خود نشان می‌دهد و به سادگی قابل بهره‌کشی است. به عبارت دیگر، عامل یادگرفته است که چگونه با خودش بازی کند، نه اینکه چگونه با دیگران تعامل کند.

برای رفع این نقص، این پژوهش راهکاری نوین ارائه می‌دهد که ترکیبی از دو ایدهٔ کلیدی است. ایدهٔ نخست، «اشتراک پاداش تصادفی» نام دارد. در این روش، به جای آنکه هر عامل فقط پاداش خود را دریافت کند، سهمی از پاداش دیگران نیز به او داده می‌شود. این سهم‌بندی، به‌صورت تصادفی در طول آموزش تغییر می‌کند. این کار باعث می‌شود که عامل در طول خودبازی، با طیف گسترده‌ای از «انگیزه‌ها» و «رفتارها» مواجه شود و از افتادن در دام یک استراتژی خاص، رهایی یابد.

ایدهٔ دوم، استفاده از «شبکه‌های ارزش دوخطی» برای تخمین ارزش حالات مختلف بازی است. در معماری‌های سنتی، شبکهٔ ارزش، تمام اطلاعات را به‌صورت یکپارچه پردازش می‌کند. اما در این روش، شبکه به دو بخش مجزا تقسیم می‌شود: بخشی که به «شرایط فعلی بازی» می‌پردازد و بخشی که به «طرح اشتراک پاداش» (همان هدف و انگیزهٔ تعریف‌شده) توجه می‌کند. این تفکیک، به شبکه کمک می‌کند تا الگوهای کلی رفتار را بهتر درک کند و توانایی خود را برای تعمیم به موقعیت‌های دیده‌نشده، به طرز چشمگیری افزایش دهد.

برای ارزیابی روش پیشنهادی، آزمایش‌هایی بر روی نسخهٔ سه‌نفرهٔ بازی «معمای زندانی» انجام شده است. عامل آموزش‌دیده با روش جدید، در برابر طیف وسیعی از حریفان قرار گرفت؛ از حریفان ساده‌ای که همیشه یک حرکت تکراری انجام می‌دادند، تا حریفان استراتژیکی که بر اساس اعتماد، انتقام‌جویی یا تقلید عمل می‌کردند. نتایج نشان داد که عامل مجهز به شبکهٔ دوخطی، در مقایسه با روش‌های پایه، به‌طور قابل‌توجهی عملکرد بهتری داشت و توانست در اکثر موارد به تعادلی پایدار و بهینه دست یابد.

این موفقیت تنها به کسب امتیاز بالاتر محدود نمی‌شود. تحلیل رفتار عامل نشان می‌دهد که او توانسته است ویژگی‌های اجتماعی ظریفی را از خود بروز دهد؛ از جمله «خوش‌بینی» برای شروع همکاری، «انتقام‌گیری» در برابر خیانت، و مهم‌تر از همه، «بخشش» برای بازگشت به همکاری پس از پایان دورۀ تنبیه. این ویژگی‌ها که در انسان‌ها نشانهٔ بلوغ اجتماعی محسوب می‌شوند، در عامل هوشمند به‌صورت خودجوش و در نتیجهٔ بهینه‌سازی پاداش، ظهور یافته‌اند.

دستاورد این پژوهش، گامی مهم در جهت ساخت عامل‌های هوشمندی است که نه تنها در محیط‌های رقابتی و همکارانه، بلکه در تعاملات اجتماعی پیچیده و پویا نیز کارآمد باشند. این روش، چشم‌اندازی برای توسعهٔ سیستم‌های چندعاملی فراهم می‌کند که می‌توانند با طیف گسترده‌ای از استراتژی‌ها و رفتارهای انسانی، تعامل مؤثری داشته باشند و در نقش‌هایی مانند مذاکره، مدیریت منابع یا حتی همکاری در تیم‌های مجازی، به کار گرفته شوند. در واقع، این تحقیق نشان می‌دهد که می‌توان به ماشین‌ها «چگونگی معاشرت» را آموخت، نه صرفاً «چگونگی برنده شدن» را.

پیشگفتار ۵
فصل ۱: مقدمه ۱۳
فصل ۲: پیشینه و مبانی نظری ۱۷
۲-۱: معضلات اجتماعی (Social Dilemmas) ۱۷
۲-۲: یادگیری تقویتی (Reinforcement Learning) ۲۰
۲-۳: یادگیری تقویتی چندعاملی (Multi-Agent Reinforcement Learning) ۲۲
۲-۴: شکل‌دهی پاداش (Reward Shaping) ۲۴
۲-۵: یادگیری تقویتی چندهدفه (Multi-Goal Reinforcement Learning) ۲۵
فصل ۳: روش‌شناسی ۲۷
۳-۱: انگیزه و ایده‌های اصلی ۲۷
۳-۲: فرمول‌بندی ریاضی ۳۰
۳-۳: تنظیمات آزمایشگاهی ۳۳
فصل ۴: نتایج ۴۳
۴-۱: عملکرد خط پایه (Baseline Performance) ۴۳
۴-۲: ارزیابی در سناریوهای مختلف ۴۶
۴-۳: تحلیل حذفی (Ablation Studies) ۵۴
فصل ۵: نتیجه‌گیری و کارهای آینده ۶۱
منابع ۶۵

چطور می‌توان به ماشین‌ها «معاشرت» را یاد داد؟ این سوالی است که مرزهای هوش مصنوعی را جابه‌جا می‌کند. تصور کنید رباتی که نه تنها در یک بازی برنده می‌شود، بلکه می‌فهمد چه زمانی باید اعتماد کند، چه زمانی باید انتقام بگیرد، و مهم‌تر از همه، چه زمانی باید ببخشد.

این پایان‌نامه از دانشگاه MIT، دقیقاً به همین چالش پرداخته است: چگونه عواملی در یادگیری تقویتی چندعاملی بسازیم که در «معضلات اجتماعی ترتیبی»—سناریوهایی مثل معمای زندانی که در آن‌ها منفعت فردی در تضاد با منفعت جمعی است—رفتاری انعطاف‌پذیر و هوشمندانه داشته باشند.

روش‌های قدیمی، مثل «خودبازی»، به عامل یاد می‌دهند که فقط در برابر یک استراتژی خاص، عالی عمل کند. اما وقتی با حریفی تازه‌روبه‌رو می‌شود، شکست می‌خورد. راه‌حل محققان، ترکیب دو ایدهٔ شگفت‌انگیز است: اول، تغییر تصادفی نحوهٔ تقسیم پاداش بین عوامل در حین آموزش تا تنوع رفتاری ایجاد شود؛ دوم، استفاده از شبکه‌های عصبی دوخطی که مثل دو مغز متفکر، یکی به «وضعیت فعلی بازی» و دیگری به «هدف و انگیزهٔ تعریف‌شده» نگاه می‌کند.

نتیجه چیست؟ عاملی که نه تنها امتیاز بالایی می‌گیرد، بلکه رفتارهایی از خود نشان می‌دهد که برای ما انسان‌ها آشناست: خوش‌بینی برای شروع همکاری، انتقام برای پاسخ به خیانت، و بخشش برای بازگشت به صلح. محققان این ویژگی‌ها را در آزمایش‌های خود مشاهده کرده‌اند و نشان داده‌اند که این عامل در برابر طیف گسترده‌ای از حریفان—از ساده‌لوح تا حیله‌گر—عملکرد فوق‌العاده‌ای دارد.

به گفتهٔ نویسندگان، این پژوهش دریچه‌ای تازه به سوی ساخت سیستم‌هایی می‌گشاید که بتوانند در تعاملات اجتماعی پیچیده، مثل مذاکره یا مدیریت منابع مشترک، موفق عمل کنند. آن‌ها معتقدند: «می‌توان به ماشین‌ها چگونگی معاشرت را آموخت، نه صرفاً چگونگی برنده شدن را».

“`

بسیار سریع و ساده می توانید اصل این پایان نامه را به صورت فایل PDF در اختیار داشته باشید.

پس از دریافت پایان‌نامه، کلیه اطلاعات کتاب‌شناختی موردنیاز برای استناد علمی، از جمله نام دانشگاه، عنوان پایان‌نامه، نام پژوهشگر، سال دفاع و سایر مشخصات مرتبط، جهت ارجاع‌دهی صحیح مطابق با استانداردهای رایج، در اختیار شما قرار خواهد گرفت.