این پایاننامه به بررسی یکی از بنیادیترین چالشهای سامانههای کنترل هوشمند، یعنی طراحی کنترلکنندههای پایدار برای سیستمهای دینامیکی پیچیده، ناشناخته و دارای ابعاد بالا میپردازد. با گسترش استفاده از سامانههای خودران، رباتهای هوشمند، هواپیماهای پیشرفته، شبکههای قدرت، ناوگان خودروهای خودران و سامانههای چندعاملی، تضمین پایداری و قابلیت اطمینان کنترلکنندهها به یکی از مهمترین نیازهای پژوهشی و صنعتی تبدیل شده است. بسیاری از روشهای کلاسیک کنترل بر این فرض استوار هستند که مدل ریاضی دقیقی از دینامیک سیستم در قالب معادلات دیفرانسیل در اختیار قرار دارد؛ در حالی که در بسیاری از کاربردهای واقعی، چنین مدلی یا در دسترس نیست یا به دلیل پیچیدگی بسیار زیاد سیستم، استخراج آن عملاً غیرممکن است. از سوی دیگر، افزایش ابعاد فضای حالت موجب میشود بسیاری از روشهای مرسوم با پدیده «نفرین ابعاد» مواجه شوند و هزینه محاسباتی آنها بهصورت نمایی افزایش یابد. این پایاننامه با هدف رفع این محدودیتها، دو چارچوب یادگیری جدید برای طراحی کنترلکنندههای پایدار ارائه میدهد که بدون نیاز به مدل دقیق سیستم، قادر به یادگیری کنترلکنندههایی با تضمین پایداری هستند.
ریشه اصلی مسئله مورد بررسی در این پژوهش به تاریخچه نظریه کنترل بازمیگردد. از زمان معرفی نظریه لیاپانوف، پژوهشگران تلاش کردهاند با استفاده از توابع لیاپانوف، پایداری سیستمهای غیرخطی را اثبات کنند. بعدها مفهوم «تابع کنترل لیاپانوف» (Control Lyapunov Function) معرفی شد که علاوه بر تحلیل پایداری، امکان طراحی کنترلکننده را نیز فراهم میکرد. با وجود موفقیت این رویکردها، روشهای کلاسیک عمدتاً بر پایه برنامهریزی نیمهمعین (SDP) و روش مجموع مربعات (SOS) توسعه یافتهاند که برای سیستمهای کوچک مناسب هستند اما با افزایش ابعاد سیستم، از نظر محاسباتی بسیار پرهزینه میشوند. همزمان با رشد یادگیری ماشین و شبکههای عصبی، پژوهشگران تلاش کردند از شبکههای عصبی برای تقریب توابع لیاپانوف و طراحی کنترلکننده استفاده کنند. هرچند این روشها نسبت به روشهای کلاسیک انعطاف بیشتری دارند، اما اغلب نیازمند نمونههای آموزشی بسیار زیاد، دانستن مدل دینامیکی سیستم یا نمونهبرداری از کل فضای حالت هستند که در مسائل واقعی امکانپذیر نیست. بنابراین همچنان شکاف بزرگی میان نظریه کنترل کلاسیک و کاربردهای عملی در سیستمهای پیچیده وجود دارد.
هدف نخست این پایاننامه، ارائه روشی برای یادگیری کنترلکننده پایدار در سیستمهای ناشناخته و دارای ابعاد بالا است؛ سیستمهایی که مدل دینامیکی آنها مشخص نیست و تنها امکان تعامل با محیط یا استفاده از نمونههای اولیه وجود دارد. نویسنده نشان میدهد که یادگیری کل فضای حالت نه ضروری است و نه عملی؛ زیرا تنها بخش کوچکی از فضای حالت در عمل توسط سیستم قابل دسترس است. بر همین اساس، چارچوبی با عنوان LYGE (Lyapunov-Guided Exploration) معرفی میشود که فرآیند یادگیری را تنها در زیرفضای قابل دسترس انجام میدهد. در این چارچوب ابتدا با استفاده از نمونههای اولیه، یک کنترلکننده ابتدایی ساخته میشود. سپس به کمک یک تابع کنترل لیاپانوف که بهصورت همزمان یاد گرفته میشود، فرآیند اکتشاف سیستم به سمت نواحی مفید فضای حالت هدایت میشود. در هر مرحله، مدل محلی دینامیک سیستم، کنترلکننده و تابع لیاپانوف بهطور مشترک بهبود یافته و محدوده قابل اعتماد سیستم به تدریج گسترش پیدا میکند تا در نهایت کنترلکنندهای پایدار برای کل فضای مورد نیاز حاصل شود.
ویژگی مهم این روش آن است که برخلاف بسیاری از الگوریتمهای یادگیری تقویتی، به جستجوی تصادفی در کل فضای حالت وابسته نیست. در روش پیشنهادی، تابع لیاپانوف همانند یک راهنما عمل میکند و تنها مسیرهایی را برای جمعآوری داده انتخاب میکند که احتمال نزدیک شدن به هدف و حفظ پایداری در آنها بیشتر است. در نتیجه تعداد نمونههای موردنیاز به میزان قابل توجهی کاهش پیدا میکند و فرآیند یادگیری نیز سریعتر همگرا میشود. این ویژگی بهویژه در سیستمهایی مانند هواپیمای F-16، رباتهای متحرک، سامانههای فرود خودکار و سایر سیستمهای پیچیده اهمیت فراوانی دارد؛ زیرا جمعآوری داده در این سامانهها هزینهبر و گاهی خطرناک است.
بخش دوم پایاننامه به یکی دیگر از چالشهای اساسی کنترل، یعنی کنترل سیستمهای دینامیکی شبکهای بزرگ اختصاص دارد. در این نوع سیستمها، تعداد زیادی زیرسامانه به یکدیگر متصل هستند و رفتار هر بخش بر سایر بخشها تأثیر میگذارد. شبکههای قدرت، دسته خودروهای خودران، گروه پهپادها، شبکههای حملونقل و سامانههای توزیع انرژی از جمله نمونههای مهم این دسته محسوب میشوند. در این سامانهها، افزایش تعداد گرهها باعث افزایش شدید ابعاد مسئله شده و روشهای متمرکز کلاسیک دیگر کارایی لازم را ندارند. علاوه بر این، آموزش یک شبکه عصبی واحد برای کل سیستم نیز از نظر حافظه، زمان آموزش و تعمیمپذیری با محدودیتهای جدی روبهرو است.
برای رفع این مشکل، نویسنده چارچوب دیگری با نام NeurISS (Neural Input-to-State Stability) ارائه میکند که بر پایه نظریه پایداری ورودی به حالت (Input-to-State Stability) توسعه یافته است. ایده اصلی این روش آن است که به جای ساخت یک تابع لیاپانوف واحد برای کل شبکه، برای هر زیرسامانه یک تابع لیاپانوف محلی و یک کنترلکننده غیرمتمرکز یاد گرفته میشود. سپس با استفاده از قوانین نظریه ISS، نشان داده میشود که مجموعه این توابع محلی میتوانند بهصورت ترکیبی، پایداری کل شبکه را تضمین کنند. این رویکرد علاوه بر کاهش پیچیدگی محاسباتی، امکان تعمیم نتایج آموزش به شبکههای بزرگتر را نیز فراهم میکند؛ به این معنا که مدلی که روی یک شبکه کوچک آموزش دیده است، با تغییرات اندک میتواند روی شبکههای بزرگتر نیز مورد استفاده قرار گیرد.
یکی از نوآوریهای مهم این پژوهش، توسعه گواهیهای عصبی ترکیبی برای سیستمهای شبکهای است. در این روش، شرایط ریاضی مربوط به نظریه ISS مستقیماً در تابع هزینه آموزش شبکه عصبی وارد میشود تا مدل یادگرفتهشده علاوه بر عملکرد مناسب، از نظر نظری نیز دارای تضمین پایداری باشد. همچنین مفهوم ISS مقاوم توسعه داده شده است تا زیرسامانههایی که دارای پارامترهای متفاوت یا عدم قطعیت هستند نیز بتوانند از یک تابع مشترک استفاده کنند. این ویژگی موجب افزایش مقاومت سیستم در برابر تغییرات مدل و کاهش تعداد توابع مورد نیاز برای آموزش میشود.
برای ارزیابی عملکرد روشهای پیشنهادی، آزمایشهای گستردهای روی مجموعهای از مسائل استاندارد انجام شده است. در بخش نخست، الگوریتم LYGE روی سیستمهایی مانند آونگ معکوس، CartPole، Cart-II Pole، Neural Lander و مدل واقعی جنگنده F-16 آزمایش شده و با روشهای یادگیری تقویتی، یادگیری تقلیدی و سایر الگوریتمهای مبتنی بر گواهی عصبی مقایسه شده است. نتایج نشان میدهد که روش پیشنهادی ضمن دستیابی به کنترلکنندههای پایدارتر، تعداد نمونههای موردنیاز برای آموزش را بین ۶۸ تا ۹۵ درصد کاهش میدهد و سرعت همگرایی بالاتری نسبت به روشهای موجود دارد. همچنین کنترلکنندههای حاصل قادرند سیستم را با اطمینان بیشتری به نقطه هدف هدایت کنند.
در بخش دوم نیز چارچوب NeurISS روی شبکههای قدرت، سیستمهای حرکت گروهی خودروها و کنترل آرایش پهپادها مورد آزمایش قرار گرفته است. نتایج تجربی نشان میدهد که این روش میتواند شبکههایی با بیش از صد زیرسامانه را با موفقیت کنترل کند؛ در حالی که بسیاری از روشهای متمرکز در چنین ابعادی عملاً قابل اجرا نیستند. همچنین عملکرد این روش نسبت به کنترلکنندههای کلاسیک مانند LQR و الگوریتمهای یادگیری تقویتی نظیر PPO و MAPPO در بسیاری از معیارها، بهویژه کاهش خطای ردیابی و حفظ پایداری، بهتر یا حداقل همتراز گزارش شده است.
در مجموع، این پایاننامه تلاشی برای نزدیک کردن نظریه کنترل پایدار و فناوریهای نوین یادگیری ماشین است. نویسنده نشان میدهد که میتوان بدون در اختیار داشتن مدل دقیق سیستم و تنها با استفاده از دادههای محدود، کنترلکنندههایی یاد گرفت که علاوه بر عملکرد مناسب، دارای تضمینهای نظری پایداری نیز باشند. دو چارچوب ارائهشده، یعنی LYGE و NeurISS، هر یک بخشی از محدودیتهای موجود در طراحی کنترلکننده برای سیستمهای واقعی را برطرف میکنند؛ اولی با هدایت هوشمند فرآیند یادگیری در سیستمهای ناشناخته و دارای ابعاد بالا، و دومی با ارائه گواهیهای عصبی ترکیبی برای کنترل غیرمتمرکز سیستمهای شبکهای بزرگ.
دستاوردهای این پژوهش میتوانند زمینهساز توسعه نسل جدیدی از سامانههای خودران، رباتهای هوشمند، شبکههای انرژی، سامانههای حملونقل و تجهیزات هوافضایی باشند؛ سامانههایی که علاوه بر بهرهگیری از قابلیتهای یادگیری ماشین، از نظر پایداری و قابلیت اطمینان نیز دارای پشتوانه نظری قوی هستند. این موضوع اهمیت ویژهای در کاربردهای حساس و ایمنیمحور دارد؛ زیرا کوچکترین ناپایداری در چنین سیستمهایی میتواند پیامدهای جدی به همراه داشته باشد. از این رو، پایاننامه حاضر گامی مؤثر در جهت توسعه روشهای مقیاسپذیر، قابل تعمیم و دارای تضمین پایداری برای نسل آینده سیستمهای کنترل هوشمند محسوب میشود.
“`html
| سرفصل | شماره صفحه |
|---|---|
| صفحه عنوان | 1 |
| چکیده | 3 |
| قدردانی | 5 |
| فصل ۱: مقدمه | 15 |
| 1-1 طراحی کنترلکننده پایدار برای سیستمهای واقعی | 15 |
| 1-1-1 سیستمهای ناشناخته با ابعاد بالا (High-dimensional Unknown Systems) | 16 |
| 1-1-2 سیستمهای شبکهای (Networked Systems) | 17 |
| 1-2 دستاوردها و نوآوریهای پژوهش | 19 |
| 1-3 ساختار پایاننامه | 21 |
| فصل ۲: پژوهشهای مرتبط | 22 |
| 2-1 سیستمهای ناشناخته با ابعاد بالا | 22 |
| 2-2 سیستمهای دینامیکی شبکهای (Networked Dynamical Systems) | 24 |
| فصل ۳: یادگیری پایدارسازی سیستمهای ناشناخته با ابعاد بالا | 25 |
| 3-1 تعریف مسئله و مقدمات | 25 |
| 3-2 الگوریتم LYGE (اکتشاف هدایتشده با لیاپانوف) | 27 |
| 3-3 تحلیل الگوریتم LYGE | 31 |
| 3-4 آزمایشها | 38 |
| 3-4-1 روشهای مبنا (Baselines) | 39 |
| 3-4-2 جزئیات پیادهسازی | 40 |
| 3-4-3 محیطهای آزمایشی | 41 |
| 3-4-4 تنظیم ابرپارامترها (Hyperparameters) | 45 |
| 3-4-5 نتایج و بحث | 45 |
| 3-5 بحث | 51 |
| 3-5-1 اعتبارسنجی توابع لیاپانوف (CLF) | 51 |
| 3-5-2 مسیرهای پیشنهادی برای پژوهشهای آینده | 52 |
| 3-6 جمعبندی | 52 |
| فصل ۴: گواهیهای عصبی ترکیبی برای سیستمهای دینامیکی شبکهای | 53 |
| 4-1 مقدمه | 53 |
| 4-2 روش پیشنهادی NeurISS (توابع لیاپانوف عصبی مبتنی بر ISS) | 55 |
| 4-3 تحلیل نظری | 63 |
| 4-4 آزمایشها و ارزیابی عملکرد | 67 |
| 4-5 جمعبندی | 79 |
| فصل ۵: نتیجهگیری و پژوهشهای آینده | 80 |
| منابع | 83 |
“`
چگونه هوش مصنوعی بالاخره توانست کنترل سیستمهای فوقپیچیده را یاد بگیرد؟
سالها یک سؤال بزرگ ذهن پژوهشگران کنترل و هوش مصنوعی را درگیر کرده بود: چگونه میتوان به یک سیستم اجازه داد خودش یاد بگیرد، بدون اینکه امنیت و پایداری آن به خطر بیفتد؟
این سؤال فقط یک مسئله دانشگاهی نیست. خودروهای خودران، پهپادها، رباتهای صنعتی، شبکههای برق و حتی جنگندههای مدرن همگی با همین چالش روبهرو هستند. اگر سیستم هنگام یادگیری دچار ناپایداری شود، نتیجه میتواند از یک خطای ساده تا یک فاجعه واقعی باشد.
پژوهشی که در این پایاننامه ارائه شده، دقیقاً به همین مسئله پرداخته و دو ایده نوآورانه معرفی میکند که میتوانند مسیر آینده کنترل هوشمند را تغییر دهند.
هوش مصنوعی همیشه هم نمیتواند آزادانه یاد بگیرد
یکی از باورهای رایج این است که اگر داده بیشتری به یک شبکه عصبی بدهیم، در نهایت همه چیز را یاد میگیرد. اما در سیستمهای کنترل این موضوع همیشه درست نیست.
یک ربات یا هواپیما نمیتواند برای یادگیری، هزاران بار اشتباه کند. هر اشتباه ممکن است هزینهبر یا حتی خطرناک باشد.
اینجاست که تفاوت میان یادگیری معمولی و یادگیری ایمن مشخص میشود. این پژوهش نشان میدهد که هدف فقط یادگیری نیست؛ بلکه یادگیری همراه با تضمین پایداری اهمیت دارد.
«یک کنترلکننده خوب تنها عملکرد مناسب ندارد؛ بلکه میتواند ثابت کند که سیستم از کنترل خارج نخواهد شد.»
لازم نیست تمام جهان را بشناسید
یکی از جذابترین ایدههای پایاننامه این است که سیستم مجبور نیست تمام فضای حالت را بررسی کند.
روشهای قدیمی معمولاً تلاش میکردند همه حالتهای ممکن سیستم را یاد بگیرند؛ کاری که در سیستمهای بزرگ تقریباً غیرممکن است.
ایده جدید بسیار ساده اما قدرتمند است:
فقط همان بخشهایی را یاد بگیر که واقعاً قابل دسترس و موردنیاز هستند.
به همین دلیل الگوریتم پیشنهادی به جای جستجوی کورکورانه، تنها در مسیرهایی حرکت میکند که احتمال رسیدن به کنترل پایدار در آنها بیشتر است.
نتیجه؟
- سرعت یادگیری بیشتر
- داده کمتر
- امنیت بالاتر
- هزینه محاسباتی بسیار پایینتر
لیاپانوف؛ ریاضیدانی که هنوز آینده را میسازد
بخش مهمی از این پژوهش بر نظریه معروف لیاپانوف استوار است؛ نظریهای که بیش از یک قرن پیش مطرح شد اما هنوز ستون اصلی تحلیل پایداری سیستمهای دینامیکی محسوب میشود.
نوآوری این پایاننامه آن است که به جای استفاده صرف از روابط ریاضی کلاسیک، شبکههای عصبی را برای یادگیری توابع لیاپانوف به کار میگیرد.
به بیان ساده، هوش مصنوعی فقط تصمیم نمیگیرد؛ بلکه یاد میگیرد چگونه ثابت کند تصمیمش ایمن است.
این ترکیب میان یادگیری عمیق و نظریه کنترل، یکی از مهمترین روندهای امروز پژوهشهای هوش مصنوعی محسوب میشود.
وقتی صدها سیستم باید همزمان کنترل شوند
فرض کنید صدها خودرو خودران در یک بزرگراه حرکت میکنند.
یا صدها پهپاد در یک مأموریت مشترک پرواز میکنند.
یا هزاران تجهیز در یک شبکه برق با یکدیگر در ارتباط هستند.
کنترل چنین شبکههایی با روشهای کلاسیک تقریباً غیرممکن میشود؛ زیرا با افزایش تعداد اجزا، حجم محاسبات به شکل انفجاری افزایش پیدا میکند.
راهکار ارائهشده در این پایاننامه متفاوت است.
به جای ساخت یک کنترلکننده بزرگ برای کل شبکه، برای هر بخش یک کنترلکننده محلی آموزش داده میشود و سپس همه آنها با قوانین ریاضی خاصی در کنار یکدیگر قرار میگیرند تا پایداری کل شبکه تضمین شود.
در واقع، سیستمهای کوچک یاد میگیرند چگونه به صورت گروهی رفتار کنند.
داده کمتر، نتیجه بهتر
شاید مهمترین نتیجه عملی این پژوهش، کاهش چشمگیر نیاز به داده باشد.
بر اساس آزمایشهای انجامشده، روش پیشنهادی توانسته در برخی مسائل بین ۶۸ تا ۹۵ درصد تعداد نمونههای آموزشی موردنیاز را کاهش دهد.
این موضوع اهمیت زیادی دارد؛ زیرا در بسیاری از سامانههای واقعی، جمعآوری داده پرهزینه، زمانبر و حتی خطرناک است.
هرچه سیستم با داده کمتر آموزش ببیند، سریعتر وارد مرحله بهرهبرداری خواهد شد.
از آزمایشگاه تا دنیای واقعی
برخلاف بسیاری از تحقیقات که تنها روی مثالهای ساده آزمایش میشوند، این پژوهش عملکرد روشهای پیشنهادی را روی مجموعهای از مسائل واقعی بررسی کرده است؛ از جمله:
- آونگ معکوس
- CartPole
- Cart-II Pole
- سامانه فرود عصبی (Neural Lander)
- مدل جنگنده F-16
- شبکههای قدرت
- ناوگان خودروهای خودران
- سیستمهای چندعاملی و شبکهای
همین تنوع آزمایشها نشان میدهد که ایدههای ارائهشده محدود به یک کاربرد خاص نیستند و قابلیت استفاده در طیف وسیعی از سامانههای مهندسی را دارند.
چرا این پژوهش اهمیت دارد؟
دنیای امروز به سمت سیستمهایی حرکت میکند که خودشان تصمیم میگیرند.
اما تصمیم گرفتن بدون تضمین پایداری، ریسک بزرگی است.
این پایاننامه نشان میدهد که میتوان هوش مصنوعی را به گونهای آموزش داد که هم عملکرد بالایی داشته باشد و هم از نظر ریاضی ثابت کند تصمیمهایش سیستم را ناپایدار نخواهد کرد.
همین ویژگی، فاصله میان پژوهشهای تئوری و کاربردهای صنعتی را کمتر میکند.
جمعبندی
آینده مهندسی کنترل تنها به ساخت الگوریتمهای هوشمندتر وابسته نیست؛ بلکه به طراحی الگوریتمهایی بستگی دارد که هم یاد بگیرند و هم قابل اعتماد باشند.
این پژوهش با ترکیب نظریه لیاپانوف، یادگیری ماشین و کنترل سیستمهای شبکهای، گامی مهم در همین مسیر برداشته است.
اکنون پرسش جالب اینجاست:
وقتی هوش مصنوعی بتواند یاد بگیرد و همزمان ثابت کند که تصمیمهایش همیشه پایدار هستند، آیا میتوان نسل بعدی خودروها، رباتها و سامانههای خودران را با اطمینان کامل به آن سپرد؟
بسیار سریع و ساده می توانید اصل این پایان نامه را به صورت فایل PDF در اختیار داشته باشید.