سیستمهای دینامیکی در دنیای واقعی همواره با عدمقطعیتهای پارامتری مواجهاند؛ جرم یک پهپاد ممکن است در اثر حمل بار تغییر کند، بازوی ربات ممکن است در اثر سایش فرسوده شود، یا یک موتور ممکن است ناگهان کارایی خود را از دست بدهد. کنترل چنین سیستمهایی در زمان واقعی، با حفظ پایداری و عملکرد بهینه، چالشی اساسی در مهندسی کنترل است. دو رویکرد اصلی برای مواجهه با این چالش وجود دارد: کنترل تطبیقی و یادگیری تقویتی.
کنترل تطبیقی، با تخمین لحظهبهلحظه پارامترهای نامعین، پایداری و همگرایی خطا را بهصورت تضمینشده فراهم میکند. اما این روش بهطور مستقیم قادر به بهینهسازی اهداف بلندمدت و توابع هزینه پیچیده نیست. در سوی دیگر، یادگیری تقویتی با آموزش گسترده در شبیهساز، سیاستهای کنترلی نزدیک به بهینه تولید میکند که میتوانند توابع هزینه غیرخطی و پیچیده را مدیریت کنند؛ اما این سیاستها هنگام مواجهه با عدمقطعیتهای پیشبینینشده در دنیای واقعی، عملکرد ضعیفی از خود نشان میدهند. این شکاف میان شبیهساز و دنیای واقعی، مهمترین مانع در کاربرد عملی یادگیری تقویتی است.
راهحل
این پایاننامه چارچوبی ترکیبی به نام AC-RL ارائه میدهد که نقاط قوت هر دو رویکرد را با هم تلفیق میکند. ایده اصلی، ساختار دوحلقای است: در **حلقه بیرونی**، یک سیاست یادگیری تقویتی در شبیهساز آموزش میبیند تا یک مسیر مرجع بهینه تولید کند. اما برخلاف روشهای معمول که این سیاست مستقیماً به سیستم واقعی اعمال میشود، در چارچوب AC-RL این سیاست به یک سیستم مرجع غیرخطی اعمال میشود. سپس در **حلقه داخلی**، یک کنترلکننده تطبیقی مرجع-مدل (MRAC) وظیفه دارد تا رفتار سیستم واقعی را به این سیستم مرجع همگرا کند. به عبارت دیگر، سیستم واقعی تحت تأثیر عدمقطعیتها، بهصورت تطبیقی به سمت رفتار بهینهای که در شبیهساز آموزش دیده هدایت میشود.
کنترلکننده تطبیقی داخلی از یک تنظیمکننده مرتبه بالا (High-Order Tuner) استفاده میکند که نسبت به روشهای مرتبه اول کلاسیک، همگرایی سریعتری دارد. این تنظیمکننده، ضرایب نامعین سیستم را بهصورت لحظهای تخمین میزند و سیگنال کنترلی را بهگونهای تصحیح میکند که خطای بین سیستم واقعی و سیستم مرجع به صفر میل کند. مهمتر اینکه، این چارچوب با افزودن یک مکانیزم تصحیح بر اساس خطای تغذیهشده از خطای ردیابی، پایداری سراسری را تضمین میکند.
نوآوریها
نخستین نوآوری این پایاننامه، ارائه اثبات پایداری برای این ساختار ترکیبی است. قضیه اصلی نشان میدهد که تحت فرضیات معقول، تمام سیگنالهای حلقه بسته محدود میمانند و خطای ردیابی به صفر همگرا میشود، بهگونهای که پشیمانی (Regret) از مرتبه O(1) خواهد بود.
دومین نوآوری، گسترش این چارچوب به سیستمهای با اشباع ورودی است. در دنیای واقعی، محرکها همواره محدودیت فیزیکی دارند و یک کنترلکننده خوب باید این محدودیت را لحاظ کند. پایاننامه با معرفی یک خطای کمکی و ساختار تطبیقی توسعهیافته، نسخهای از AC-RL ارائه میدهد که پایداری را حتی در حضور اشباع ورودی تضمین میکند.
سومین نوآوری، اثبات همگرایی پارامترها در شرایط تحریک پایدار (Persistent Excitation) است. در کنترل تطبیقی کلاسیک، تخمین پارامترها تنها زمانی به مقدار واقعی همگرا میشوند که سیگنال ورودی به اندازه کافی غنی باشد. این پایاننامه نشان میدهد که در چارچوب AC-RL، اگر این شرط برقرار باشد، پارامترهای تخمینزده شده به مقادیر واقعی خود همگرا میشوند که به معنای یادگیری کامل دینامیک سیستم است.
چهارمین نوآوری، گسترش روش به سیستمهای با نقاط تعادل متعدد و سیستمهای غیرخطی ناافاین (non-affine) است که دامنه کاربرد آن را به طیف گستردهتری از مسائل عملی میگستراند.
اعتبارسنجی
برای ارزیابی عملی، یک وظیفه فرود کوادروتور روی سکوی متحرک شبیهسازی شده است. کوادروتور با دینامیک غیرخطی کامل شبیهسازی میشود، در حالی که کنترلکننده بر اساس مدل خطیشده طراحی میشود. تابع هزینه سهحالته بهگونهای تعریف شده که تنها در صورت موفقیت در فرود، پاداش مثبت دریافت میکند و در غیر این صورت جریمه میشود.
سیاست یادگیری تقویتی با استفاده از الگوریتم PPO در شبیهساز مرجع آموزش داده شده است. سپس عملکرد چارچوب AC-RL در دو سناریوی نامعینی ارزیابی میشود: (۱) تغییرات پارامترهای فیزیکی کوادروتور (جرم، طول بازو و ممانهای اینرسی) تا ±۲۵ درصد و (۲) کاهش ناگهانی و شدید کارایی یکی از چهار پروانه.
نتایج نشان میدهد که در سناریوی تغییر پارامترها، AC-RL با نرخ موفقیت ۹۸٪ عملکردی تقریباً برابر با روشهای برتر مانند حوزهرندومسازی (DR-RL) و فراتعلمی (ME-RL) دارد. اما در سناریوی کاهش کارایی پروانه، تفاوت چشمگیر میشود: در کاهش ۵۰٪ کارایی، AC-RL با نرخ موفقیت ۵۰٪ عملکردی قابلقبول دارد، در حالی که روش ME-RL تنها به ۸٪ و روش RL خالص به ۱۴٪ میرسد. در کاهش ۷۵٪ کارایی، روشهای صرفاً مبتنی بر یادگیری تقویتی کاملاً شکست میخورند، در حالی که AC-RL همچنان در ۹٪ موارد موفق عمل میکند.
این نتایج نشان میدهند که افزودن کنترل تطبیقی بهعنوان یک “لایه ایمنی” پاییندست، نهتنها پایداری را تضمین میکند، بلکه انعطافپذیری چشمگیری در مواجهه با شرایط پیشبینینشده ایجاد میکند. آزمایشهای تکمیلی با افزودن نویز اندازهگیری نیز مزیت AC-RL را تأیید کرده است. در مجموع، این چارچوب گامی عملی برای پر کردن شکاف میان تئوری کنترل و کاربردهای یادگیری ماشین در سیستمهای دینامیکی واقعی محسوب میشود.
📖 فهرست مطالب
| عنوان فصل / بخش | صفحه |
|---|---|
| فصل ۱: مقدمه | ۱۳ |
| فصل ۲: پیشزمینه و مبانی | ۱۹ |
| ۲-۱: یادگیری تقویتی و یادگیری ماشین | ۱۹ |
| ۲-۱-۱: برنامهریزی پویا (Dynamic Programming) | ۲۱ |
| ۲-۱-۲: برنامهریزی پویای تقریبی (Approximate Dynamic Programming) | ۲۲ |
| ۲-۱-۳: روشهای شیب خطمشی (Policy Gradient Methods) | ۲۳ |
| ۲-۱-۴: یادگیری تقویتی مبتنی بر مدل (Model‑Based RL) | ۲۴ |
| ۲-۲: کنترل تطبیقی (Adaptive Control) | ۲۶ |
| ۲-۲-۱: رویکرد تطبیق‑یادگیری‑بهینهسازی | ۲۷ |
| ۲-۲-۲: کنترل تطبیقی مرجع‑مدل (MRAC) | ۲۹ |
| ۲-۲-۳: سامانههای خطی | ۳۰ |
| فصل ۳: روشها | ۳۵ |
| ۳-۱: یادگیری تقویتی عمیق (Deep RL) | ۳۵ |
| ۳-۱-۱: بهینهسازی ناحیه اطمینان و PPO | ۳۶ |
| ۳-۲: تصادفیسازی حوزه (Domain Randomization) | ۳۸ |
| ۳-۳: فراتعلمی (Meta‑Learning) | ۳۹ |
| ۳-۴: تنظیمکنندههای مرتبه بالا (High‑Order Tuners) | ۴۰ |
| فصل ۴: الگوریتم ترکیبی کنترل تطبیقی و یادگیری تقویتی (AC‑RL) | ۴۳ |
| ۴-۱: صورتبندی مسئله | ۴۳ |
| ۴-۲: ابزارهای زیرساختی | ۴۴ |
| ۴-۲-۱: رویکرد برونخط مبتنی بر یادگیری تقویتی | ۴۴ |
| ۴-۲-۲: رویکرد درونخط کلاسیک مبتنی بر روشهای تطبیقی | ۴۵ |
| ۴-۲-۳: تحریک پایدار و یادگیری پارامتر (Persistent Excitation) | ۴۶ |
| ۴-۳: الگوریتم AC‑RL | ۴۹ |
| ۴-۳-۱: کنترل تطبیقی مرجع‑مدل | ۴۹ |
| ۴-۳-۲: کنترلکننده AC‑RL | ۵۰ |
| ۴-۳-۳: اعتبارسنجی کنترلکننده AC‑RL | ۵۳ |
| ۴-۳-۴: AC‑RL با اشباع دامنه (Magnitude Saturation) | ۵۵ |
| ۴-۳-۵: گسترش به نقاط تعادل چندگانه | ۵۶ |
| ۴-۳-۶: گسترش به ردهای از سیستمهای ناافاین (Non‑affine) | ۵۷ |
| ۴-۳-۷: یادگیری در کنترلکنندههای AC‑RL با تحریک پایدار | ۵۹ |
| فصل ۵: اعتبارسنجی عددی | ۶۳ |
| ۵-۱: دینامیک کوادروتور | ۶۳ |
| ۵-۲: وظیفه فرود کوادروتور | ۶۵ |
| ۵-۳: حلقه بیرونی یادگیری تقویتی | ۶۶ |
| ۵-۴: نتایج (بدون نویز) | ۶۶ |
| ۵-۵: نتایج (همراه با نویز) | ۶۸ |
| فصل ۶: جمعبندی و کارهای آینده | ۷۱ |
| ضمیمه الف: اثباتها | ۷۳ |
وقتی کنترل تطبیقی با یادگیری تقویتی ازدواج میکند: سفری از شبیهساز تا دنیای واقعی
مسئلهای به نام «شکاف شبیهساز تا واقعیت»
تصور کنید یک پهپاد را در یک شبیهساز بینهایت دقیق آموزش دادهاید. میلیونها بار پرواز کرده، فرود آمده، و در هر شرایطی عملکردی بینقص نشان داده است. اما وقتی همان پهپاد را در دنیای واقعی روشن میکنید، ناگهان انگار همهچیز را فراموش کرده است. باد میوزد، موتورها اندکی متفاوت کار میکنند، وزن محموله تغییر کرده، و آن سیاست بینقصِ شبیهساز، در واقعیت به یک فاجعه تبدیل میشود.
این همان «شکاف شبیهساز تا واقعیت» (Sim‑to‑Real Gap) است؛ یکی از بزرگترین چالشهای پیش روی مهندسی کنترل و یادگیری ماشین در سالهای اخیر.
—
## 💡 راهحلی که در آن «همهچیز را یکجا داریم»
پایاننامهای که از دانشگاه MIT ارائه شده، چارچوبی به نام **AC‑RL** معرفی میکند که درست در همین نقطه، میان دو دنیا پل میزند. ایدهاش ساده اما عمیق است:
> **بهجای اینکه سیاست یادگیریشده را مستقیماً به سیستم واقعی تحمیل کنیم، آن را به یک «سیستم مرجع ایدهآل» اعمال میکنیم. سپس یک کنترلکننده تطبیقی در حلقه داخلی، سیستم واقعی را طوری تنظیم میکند که رفتاری دقیقاً مشابه آن سیستم مرجع از خود نشان دهد.**
به بیان دیگر، یادگیری تقویتی (RL) مسئول «چه چیزی خوب است» است، و کنترل تطبیقی (AC) مسئول «چطور به آن برسیم».
—
## 🧠 چرا این ترکیب هوشمندانه است؟
– **یادگیری تقویتی** در یافتن سیاستهای بهینه در فضای بزرگ و با توابع هزینهٔ پیچیده، بیرقیب است. اما در برابر عدمقطعیتهای پیشبینینشده، آسیبپذیر است.
– **کنترل تطبیقی** در مواجهه با عدمقطعیتهای پارامتری، پایداری تضمینشده و همگرایی خطا را ارائه میدهد، اما نمیتواند اهداف بلندمدت و غیرخطی را بهخوبی بهینه کند.
AC‑RL هر دو را کنار هم میگذارد: پایداری و انطباقپذیری از یک سو، و بهینهبودن از سوی دیگر.
—
## 📊 یک تست عملی: فرود کوادروتور روی سکوی متحرک
برای آزمودن این چارچوب، یک سناریوی دشوار انتخاب شده: یک کوادروتور باید روی سکوی در حال حرکت فرود بیاید. آن هم در حالی که:
– پارامترهای فیزیکی (جرم، اینرسی، طول بازو) تا ۲۵٪ تغییر داده شدهاند.
– یک پروانه ناگهان تا ۷۵٪ کارایی خود را از دست میدهد.
نتایج، گویا و قاطعاند:
| روش | نرخ موفقیت در کاهش ۵۰٪ کارایی پروانه | نرخ موفقیت در کاهش ۷۵٪ کارایی پروانه |
|——|————————————–|————————————–|
| **AC‑RL** | **۵۰٪** | **۹٪** |
| یادگیری تقویتی خالص | ۱۴٪ | ۰٪ |
| فراتعلمی (ME‑RL) | ۸٪ | ۰٪ |
> **«در حالی که روشهای صرفاً مبتنی بر یادگیری تقویتی در سناریوی کاهش ۷۵٪ کارایی کاملاً شکست میخورند، AC‑RL همچنان در ۹٪ موارد موفق عمل میکند.»**
> — برگرفته از نتایج تجربی پایاننامه
—
## 🎯 چرا این موضوع اهمیت دارد؟
این پژوهش فقط یک روش کنترلی دیگر نیست؛ بلکه تغییری در نگرش است. بهجای اینکه یادگیری ماشین و کنترل کلاسیک را رقیب یکدیگر ببینیم، میتوانیم از نقاط قوت هر دو، یک کل منسجم و توانمند بسازیم.
AC‑RL نشان میدهد که میتوان هم از «شهود» یادگیری تقویتی بهره برد و هم از «دقت ریاضی» کنترل تطبیقی. و این یعنی گامی بهسوی سیستمهایی که نهتنها هوشمند، بلکه قابلاطمینان هستند.
—
## 🔮 نگاهی به آینده
این پایاننامه مسیرهای تازهای را میگشاید: استفاده از شبکههای عمیق برای تخمین رگرسورهای غیرخطی، بهکارگیری در سیستمهای پیچیدهتر مانند رباتهای انساننما، و حتی ترکیب با روشهای مبتنی بر داده برای سیستمهایی که مدل تحلیلی دقیقی ندارند.
شاید روزی نهچندان دور، پهپادها، خودروهای خودران و رباتهای صنعتی، همه از چنین چارچوبی برای حرکت ایمن و هوشمند در دنیای واقعی استفاده کنند. دنیایی که در آن، شبیهساز و واقعیت، دیگر دو قطب متضاد نیستند، بلکه دو روی یک سکهاند.
بسیار سریع و ساده می توانید اصل این پایان نامه را به صورت فایل PDF در اختیار داشته باشید.