این پایاننامه به یکی از چالشهای اساسی در حوزه هوش مصنوعی میپردازد: چگونه میتوان به عوامل هوشمند آموخت که در محیطهای اجتماعی پیچیده، نه تنها با یکدیگر همکاری کنند، بلکه بتوانند خود را با رفتارهای پیشبینینشده و متنوع سایرین نیز سازگار کنند. مسئله مورد بحث، «معضلات اجتماعی ترتیبی» هستند؛ سناریوهایی که در آنها هر فرد بین منفعت شخصی و منفعت جمعی گرفتار میشود و انتخاب همیشگی یکی از این دو، به نتیجهای بهینه برای کل گروه نمیانجامد. مثال کلاسیک این معضلات، «معمای زندانی» است که در آن، همکاری متقابل بهترین نتیجه را برای هر دو طرف دارد، اما وسوسهٔ خیانت، همیشه وجود دارد.
روشهای متداول در یادگیری تقویتی چندعاملی، معمولاً از «خودبازی» استفاده میکنند؛ یعنی عاملی در برابر کپیهایی از خودش آموزش میبیند. این روش اگرچه قدرتمند است، اما عاملی را پرورش میدهد که تنها در برابر یک استراتژی خاص، عملکرد مطلوب دارد. نتیجه این است که وقتی این عامل با استراتژیهای رایج دیگری مانند «چشمدرمقابلچشم» (که در آن عامل، رفتار طرف مقابل را تقلید میکند) روبهرو میشود، عملکرد ضعیفی از خود نشان میدهد و به سادگی قابل بهرهکشی است. به عبارت دیگر، عامل یادگرفته است که چگونه با خودش بازی کند، نه اینکه چگونه با دیگران تعامل کند.
برای رفع این نقص، این پژوهش راهکاری نوین ارائه میدهد که ترکیبی از دو ایدهٔ کلیدی است. ایدهٔ نخست، «اشتراک پاداش تصادفی» نام دارد. در این روش، به جای آنکه هر عامل فقط پاداش خود را دریافت کند، سهمی از پاداش دیگران نیز به او داده میشود. این سهمبندی، بهصورت تصادفی در طول آموزش تغییر میکند. این کار باعث میشود که عامل در طول خودبازی، با طیف گستردهای از «انگیزهها» و «رفتارها» مواجه شود و از افتادن در دام یک استراتژی خاص، رهایی یابد.
ایدهٔ دوم، استفاده از «شبکههای ارزش دوخطی» برای تخمین ارزش حالات مختلف بازی است. در معماریهای سنتی، شبکهٔ ارزش، تمام اطلاعات را بهصورت یکپارچه پردازش میکند. اما در این روش، شبکه به دو بخش مجزا تقسیم میشود: بخشی که به «شرایط فعلی بازی» میپردازد و بخشی که به «طرح اشتراک پاداش» (همان هدف و انگیزهٔ تعریفشده) توجه میکند. این تفکیک، به شبکه کمک میکند تا الگوهای کلی رفتار را بهتر درک کند و توانایی خود را برای تعمیم به موقعیتهای دیدهنشده، به طرز چشمگیری افزایش دهد.
برای ارزیابی روش پیشنهادی، آزمایشهایی بر روی نسخهٔ سهنفرهٔ بازی «معمای زندانی» انجام شده است. عامل آموزشدیده با روش جدید، در برابر طیف وسیعی از حریفان قرار گرفت؛ از حریفان سادهای که همیشه یک حرکت تکراری انجام میدادند، تا حریفان استراتژیکی که بر اساس اعتماد، انتقامجویی یا تقلید عمل میکردند. نتایج نشان داد که عامل مجهز به شبکهٔ دوخطی، در مقایسه با روشهای پایه، بهطور قابلتوجهی عملکرد بهتری داشت و توانست در اکثر موارد به تعادلی پایدار و بهینه دست یابد.
این موفقیت تنها به کسب امتیاز بالاتر محدود نمیشود. تحلیل رفتار عامل نشان میدهد که او توانسته است ویژگیهای اجتماعی ظریفی را از خود بروز دهد؛ از جمله «خوشبینی» برای شروع همکاری، «انتقامگیری» در برابر خیانت، و مهمتر از همه، «بخشش» برای بازگشت به همکاری پس از پایان دورۀ تنبیه. این ویژگیها که در انسانها نشانهٔ بلوغ اجتماعی محسوب میشوند، در عامل هوشمند بهصورت خودجوش و در نتیجهٔ بهینهسازی پاداش، ظهور یافتهاند.
دستاورد این پژوهش، گامی مهم در جهت ساخت عاملهای هوشمندی است که نه تنها در محیطهای رقابتی و همکارانه، بلکه در تعاملات اجتماعی پیچیده و پویا نیز کارآمد باشند. این روش، چشماندازی برای توسعهٔ سیستمهای چندعاملی فراهم میکند که میتوانند با طیف گستردهای از استراتژیها و رفتارهای انسانی، تعامل مؤثری داشته باشند و در نقشهایی مانند مذاکره، مدیریت منابع یا حتی همکاری در تیمهای مجازی، به کار گرفته شوند. در واقع، این تحقیق نشان میدهد که میتوان به ماشینها «چگونگی معاشرت» را آموخت، نه صرفاً «چگونگی برنده شدن» را.
| پیشگفتار | ۵ |
| فصل ۱: مقدمه | ۱۳ |
| فصل ۲: پیشینه و مبانی نظری | ۱۷ |
| ۲-۱: معضلات اجتماعی (Social Dilemmas) | ۱۷ |
| ۲-۲: یادگیری تقویتی (Reinforcement Learning) | ۲۰ |
| ۲-۳: یادگیری تقویتی چندعاملی (Multi-Agent Reinforcement Learning) | ۲۲ |
| ۲-۴: شکلدهی پاداش (Reward Shaping) | ۲۴ |
| ۲-۵: یادگیری تقویتی چندهدفه (Multi-Goal Reinforcement Learning) | ۲۵ |
| فصل ۳: روششناسی | ۲۷ |
| ۳-۱: انگیزه و ایدههای اصلی | ۲۷ |
| ۳-۲: فرمولبندی ریاضی | ۳۰ |
| ۳-۳: تنظیمات آزمایشگاهی | ۳۳ |
| فصل ۴: نتایج | ۴۳ |
| ۴-۱: عملکرد خط پایه (Baseline Performance) | ۴۳ |
| ۴-۲: ارزیابی در سناریوهای مختلف | ۴۶ |
| ۴-۳: تحلیل حذفی (Ablation Studies) | ۵۴ |
| فصل ۵: نتیجهگیری و کارهای آینده | ۶۱ |
| منابع | ۶۵ |
چطور میتوان به ماشینها «معاشرت» را یاد داد؟ این سوالی است که مرزهای هوش مصنوعی را جابهجا میکند. تصور کنید رباتی که نه تنها در یک بازی برنده میشود، بلکه میفهمد چه زمانی باید اعتماد کند، چه زمانی باید انتقام بگیرد، و مهمتر از همه، چه زمانی باید ببخشد.
این پایاننامه از دانشگاه MIT، دقیقاً به همین چالش پرداخته است: چگونه عواملی در یادگیری تقویتی چندعاملی بسازیم که در «معضلات اجتماعی ترتیبی»—سناریوهایی مثل معمای زندانی که در آنها منفعت فردی در تضاد با منفعت جمعی است—رفتاری انعطافپذیر و هوشمندانه داشته باشند.
روشهای قدیمی، مثل «خودبازی»، به عامل یاد میدهند که فقط در برابر یک استراتژی خاص، عالی عمل کند. اما وقتی با حریفی تازهروبهرو میشود، شکست میخورد. راهحل محققان، ترکیب دو ایدهٔ شگفتانگیز است: اول، تغییر تصادفی نحوهٔ تقسیم پاداش بین عوامل در حین آموزش تا تنوع رفتاری ایجاد شود؛ دوم، استفاده از شبکههای عصبی دوخطی که مثل دو مغز متفکر، یکی به «وضعیت فعلی بازی» و دیگری به «هدف و انگیزهٔ تعریفشده» نگاه میکند.
نتیجه چیست؟ عاملی که نه تنها امتیاز بالایی میگیرد، بلکه رفتارهایی از خود نشان میدهد که برای ما انسانها آشناست: خوشبینی برای شروع همکاری، انتقام برای پاسخ به خیانت، و بخشش برای بازگشت به صلح. محققان این ویژگیها را در آزمایشهای خود مشاهده کردهاند و نشان دادهاند که این عامل در برابر طیف گستردهای از حریفان—از سادهلوح تا حیلهگر—عملکرد فوقالعادهای دارد.
به گفتهٔ نویسندگان، این پژوهش دریچهای تازه به سوی ساخت سیستمهایی میگشاید که بتوانند در تعاملات اجتماعی پیچیده، مثل مذاکره یا مدیریت منابع مشترک، موفق عمل کنند. آنها معتقدند: «میتوان به ماشینها چگونگی معاشرت را آموخت، نه صرفاً چگونگی برنده شدن را».
“`