سیستم‌های دینامیکی در دنیای واقعی همواره با عدم‌قطعیت‌های پارامتری مواجه‌اند؛ جرم یک پهپاد ممکن است در اثر حمل بار تغییر کند، بازوی ربات ممکن است در اثر سایش فرسوده شود، یا یک موتور ممکن است ناگهان کارایی خود را از دست بدهد. کنترل چنین سیستم‌هایی در زمان واقعی، با حفظ پایداری و عملکرد بهینه، چالشی اساسی در مهندسی کنترل است. دو رویکرد اصلی برای مواجهه با این چالش وجود دارد: کنترل تطبیقی و یادگیری تقویتی.

کنترل تطبیقی، با تخمین لحظه‌به‌لحظه پارامترهای نامعین، پایداری و همگرایی خطا را به‌صورت تضمین‌شده فراهم می‌کند. اما این روش به‌طور مستقیم قادر به بهینه‌سازی اهداف بلندمدت و توابع هزینه پیچیده نیست. در سوی دیگر، یادگیری تقویتی با آموزش گسترده در شبیه‌ساز، سیاست‌های کنترلی نزدیک به بهینه تولید می‌کند که می‌توانند توابع هزینه غیرخطی و پیچیده را مدیریت کنند؛ اما این سیاست‌ها هنگام مواجهه با عدم‌قطعیت‌های پیش‌بینی‌نشده در دنیای واقعی، عملکرد ضعیفی از خود نشان می‌دهند. این شکاف میان شبیه‌ساز و دنیای واقعی، مهم‌ترین مانع در کاربرد عملی یادگیری تقویتی است.

راه‌حل

این پایان‌نامه چارچوبی ترکیبی به نام AC-RL ارائه می‌دهد که نقاط قوت هر دو رویکرد را با هم تلفیق می‌کند. ایده اصلی، ساختار دوحلق‌ای است: در **حلقه بیرونی**، یک سیاست یادگیری تقویتی در شبیه‌ساز آموزش می‌بیند تا یک مسیر مرجع بهینه تولید کند. اما برخلاف روش‌های معمول که این سیاست مستقیماً به سیستم واقعی اعمال می‌شود، در چارچوب AC-RL این سیاست به یک سیستم مرجع غیرخطی اعمال می‌شود. سپس در **حلقه داخلی**، یک کنترل‌کننده تطبیقی مرجع-مدل (MRAC) وظیفه دارد تا رفتار سیستم واقعی را به این سیستم مرجع همگرا کند. به عبارت دیگر، سیستم واقعی تحت تأثیر عدم‌قطعیت‌ها، به‌صورت تطبیقی به سمت رفتار بهینه‌ای که در شبیه‌ساز آموزش دیده هدایت می‌شود.

کنترل‌کننده تطبیقی داخلی از یک تنظیم‌کننده مرتبه بالا (High-Order Tuner) استفاده می‌کند که نسبت به روش‌های مرتبه اول کلاسیک، همگرایی سریع‌تری دارد. این تنظیم‌کننده، ضرایب نامعین سیستم را به‌صورت لحظه‌ای تخمین می‌زند و سیگنال کنترلی را به‌گونه‌ای تصحیح می‌کند که خطای بین سیستم واقعی و سیستم مرجع به صفر میل کند. مهم‌تر اینکه، این چارچوب با افزودن یک مکانیزم تصحیح بر اساس خطای تغذیه‌شده از خطای ردیابی، پایداری سراسری را تضمین می‌کند.

نوآوری‌ها

نخستین نوآوری این پایان‌نامه، ارائه اثبات پایداری برای این ساختار ترکیبی است. قضیه اصلی نشان می‌دهد که تحت فرضیات معقول، تمام سیگنال‌های حلقه بسته محدود می‌مانند و خطای ردیابی به صفر همگرا می‌شود، به‌گونه‌ای که پشیمانی (Regret) از مرتبه O(1) خواهد بود.

دومین نوآوری، گسترش این چارچوب به سیستم‌های با اشباع ورودی است. در دنیای واقعی، محرک‌ها همواره محدودیت فیزیکی دارند و یک کنترل‌کننده خوب باید این محدودیت را لحاظ کند. پایان‌نامه با معرفی یک خطای کمکی و ساختار تطبیقی توسعه‌یافته، نسخه‌ای از AC-RL ارائه می‌دهد که پایداری را حتی در حضور اشباع ورودی تضمین می‌کند.

سومین نوآوری، اثبات همگرایی پارامترها در شرایط تحریک پایدار (Persistent Excitation) است. در کنترل تطبیقی کلاسیک، تخمین پارامترها تنها زمانی به مقدار واقعی همگرا می‌شوند که سیگنال ورودی به اندازه کافی غنی باشد. این پایان‌نامه نشان می‌دهد که در چارچوب AC-RL، اگر این شرط برقرار باشد، پارامترهای تخمین‌زده شده به مقادیر واقعی خود همگرا می‌شوند که به معنای یادگیری کامل دینامیک سیستم است.

چهارمین نوآوری، گسترش روش به سیستم‌های با نقاط تعادل متعدد و سیستم‌های غیرخطی ناافاین (non-affine) است که دامنه کاربرد آن را به طیف گسترده‌تری از مسائل عملی می‌گستراند.

اعتبارسنجی

برای ارزیابی عملی، یک وظیفه فرود کوادروتور روی سکوی متحرک شبیه‌سازی شده است. کوادروتور با دینامیک غیرخطی کامل شبیه‌سازی می‌شود، در حالی که کنترل‌کننده بر اساس مدل خطی‌شده طراحی می‌شود. تابع هزینه سه‌حالته به‌گونه‌ای تعریف شده که تنها در صورت موفقیت در فرود، پاداش مثبت دریافت می‌کند و در غیر این صورت جریمه می‌شود.

سیاست یادگیری تقویتی با استفاده از الگوریتم PPO در شبیه‌ساز مرجع آموزش داده شده است. سپس عملکرد چارچوب AC-RL در دو سناریوی نامعینی ارزیابی می‌شود: (۱) تغییرات پارامترهای فیزیکی کوادروتور (جرم، طول بازو و ممان‌های اینرسی) تا ±۲۵ درصد و (۲) کاهش ناگهانی و شدید کارایی یکی از چهار پروانه.

نتایج نشان می‌دهد که در سناریوی تغییر پارامترها، AC-RL با نرخ موفقیت ۹۸٪ عملکردی تقریباً برابر با روش‌های برتر مانند حوزه‌رندوم‌سازی (DR-RL) و فراتعلمی (ME-RL) دارد. اما در سناریوی کاهش کارایی پروانه، تفاوت چشمگیر می‌شود: در کاهش ۵۰٪ کارایی، AC-RL با نرخ موفقیت ۵۰٪ عملکردی قابل‌قبول دارد، در حالی که روش ME-RL تنها به ۸٪ و روش RL خالص به ۱۴٪ می‌رسد. در کاهش ۷۵٪ کارایی، روش‌های صرفاً مبتنی بر یادگیری تقویتی کاملاً شکست می‌خورند، در حالی که AC-RL همچنان در ۹٪ موارد موفق عمل می‌کند.

این نتایج نشان می‌دهند که افزودن کنترل تطبیقی به‌عنوان یک “لایه ایمنی” پایین‌دست، نه‌تنها پایداری را تضمین می‌کند، بلکه انعطاف‌پذیری چشمگیری در مواجهه با شرایط پیش‌بینی‌نشده ایجاد می‌کند. آزمایش‌های تکمیلی با افزودن نویز اندازه‌گیری نیز مزیت AC-RL را تأیید کرده است. در مجموع، این چارچوب گامی عملی برای پر کردن شکاف میان تئوری کنترل و کاربردهای یادگیری ماشین در سیستم‌های دینامیکی واقعی محسوب می‌شود.

📖 فهرست مطالب

عنوان فصل / بخش صفحه
فصل ۱: مقدمه ۱۳
فصل ۲: پیش‌زمینه و مبانی ۱۹
۲-۱: یادگیری تقویتی و یادگیری ماشین ۱۹
۲-۱-۱: برنامه‌ریزی پویا (Dynamic Programming) ۲۱
۲-۱-۲: برنامه‌ریزی پویای تقریبی (Approximate Dynamic Programming) ۲۲
۲-۱-۳: روش‌های شیب خط‌مشی (Policy Gradient Methods) ۲۳
۲-۱-۴: یادگیری تقویتی مبتنی بر مدل (Model‑Based RL) ۲۴
۲-۲: کنترل تطبیقی (Adaptive Control) ۲۶
۲-۲-۱: رویکرد تطبیق‑یادگیری‑بهینه‌سازی ۲۷
۲-۲-۲: کنترل تطبیقی مرجع‑مدل (MRAC) ۲۹
۲-۲-۳: سامانه‌های خطی ۳۰
فصل ۳: روش‌ها ۳۵
۳-۱: یادگیری تقویتی عمیق (Deep RL) ۳۵
۳-۱-۱: بهینه‌سازی ناحیه اطمینان و PPO ۳۶
۳-۲: تصادفی‌سازی حوزه (Domain Randomization) ۳۸
۳-۳: فراتعلمی (Meta‑Learning) ۳۹
۳-۴: تنظیم‌کننده‌های مرتبه بالا (High‑Order Tuners) ۴۰
فصل ۴: الگوریتم ترکیبی کنترل تطبیقی و یادگیری تقویتی (AC‑RL) ۴۳
۴-۱: صورتبندی مسئله ۴۳
۴-۲: ابزارهای زیرساختی ۴۴
۴-۲-۱: رویکرد برون‌خط مبتنی بر یادگیری تقویتی ۴۴
۴-۲-۲: رویکرد درون‌خط کلاسیک مبتنی بر روش‌های تطبیقی ۴۵
۴-۲-۳: تحریک پایدار و یادگیری پارامتر (Persistent Excitation) ۴۶
۴-۳: الگوریتم AC‑RL ۴۹
۴-۳-۱: کنترل تطبیقی مرجع‑مدل ۴۹
۴-۳-۲: کنترل‌کننده AC‑RL ۵۰
۴-۳-۳: اعتبارسنجی کنترل‌کننده AC‑RL ۵۳
۴-۳-۴: AC‑RL با اشباع دامنه (Magnitude Saturation) ۵۵
۴-۳-۵: گسترش به نقاط تعادل چندگانه ۵۶
۴-۳-۶: گسترش به رده‌ای از سیستم‌های ناافاین (Non‑affine) ۵۷
۴-۳-۷: یادگیری در کنترل‌کننده‌های AC‑RL با تحریک پایدار ۵۹
فصل ۵: اعتبارسنجی عددی ۶۳
۵-۱: دینامیک کوادروتور ۶۳
۵-۲: وظیفه فرود کوادروتور ۶۵
۵-۳: حلقه بیرونی یادگیری تقویتی ۶۶
۵-۴: نتایج (بدون نویز) ۶۶
۵-۵: نتایج (همراه با نویز) ۶۸
فصل ۶: جمع‌بندی و کارهای آینده ۷۱
ضمیمه الف: اثبات‌ها ۷۳

 

وقتی کنترل تطبیقی با یادگیری تقویتی ازدواج میکند: سفری از شبیهساز تا دنیای واقعی

مسئلهای به نام «شکاف شبیهساز تا واقعیت»

تصور کنید یک پهپاد را در یک شبیهساز بینهایت دقیق آموزش دادهاید. میلیونها بار پرواز کرده، فرود آمده، و در هر شرایطی عملکردی بینقص نشان داده است. اما وقتی همان پهپاد را در دنیای واقعی روشن میکنید، ناگهان انگار همهچیز را فراموش کرده است. باد میوزد، موتورها اندکی متفاوت کار میکنند، وزن محموله تغییر کرده، و آن سیاست بینقصِ شبیهساز، در واقعیت به یک فاجعه تبدیل میشود.

این همان «شکاف شبیهساز تا واقعیت» (Sim‑to‑Real Gap) است؛ یکی از بزرگترین چالشهای پیش روی مهندسی کنترل و یادگیری ماشین در سالهای اخیر.

## 💡 راهحلی که در آن «همهچیز را یکجا داریم»

پایاننامهای که از دانشگاه MIT ارائه شده، چارچوبی به نام **AC‑RL** معرفی میکند که درست در همین نقطه، میان دو دنیا پل میزند. ایدهاش ساده اما عمیق است:

> **بهجای اینکه سیاست یادگیریشده را مستقیماً به سیستم واقعی تحمیل کنیم، آن را به یک «سیستم مرجع ایدهآل» اعمال میکنیم. سپس یک کنترلکننده تطبیقی در حلقه داخلی، سیستم واقعی را طوری تنظیم میکند که رفتاری دقیقاً مشابه آن سیستم مرجع از خود نشان دهد.**

به بیان دیگر، یادگیری تقویتی (RL) مسئول «چه چیزی خوب است» است، و کنترل تطبیقی (AC) مسئول «چطور به آن برسیم».

## 🧠 چرا این ترکیب هوشمندانه است؟

– **یادگیری تقویتی** در یافتن سیاستهای بهینه در فضای بزرگ و با توابع هزینهٔ پیچیده، بیرقیب است. اما در برابر عدمقطعیتهای پیشبینینشده، آسیبپذیر است.
– **کنترل تطبیقی** در مواجهه با عدمقطعیتهای پارامتری، پایداری تضمینشده و همگرایی خطا را ارائه میدهد، اما نمیتواند اهداف بلندمدت و غیرخطی را بهخوبی بهینه کند.

AC‑RL هر دو را کنار هم میگذارد: پایداری و انطباقپذیری از یک سو، و بهینهبودن از سوی دیگر.

## 📊 یک تست عملی: فرود کوادروتور روی سکوی متحرک

برای آزمودن این چارچوب، یک سناریوی دشوار انتخاب شده: یک کوادروتور باید روی سکوی در حال حرکت فرود بیاید. آن هم در حالی که:

– پارامترهای فیزیکی (جرم، اینرسی، طول بازو) تا ۲۵٪ تغییر داده شدهاند.
– یک پروانه ناگهان تا ۷۵٪ کارایی خود را از دست میدهد.

نتایج، گویا و قاطعاند:

| روش | نرخ موفقیت در کاهش ۵۰٪ کارایی پروانه | نرخ موفقیت در کاهش ۷۵٪ کارایی پروانه |
|——|————————————–|————————————–|
| **AC‑RL** | **۵۰٪** | **۹٪** |
| یادگیری تقویتی خالص | ۱۴٪ | ۰٪ |
| فراتعلمی (ME‑RL) | ۸٪ | ۰٪ |

> **«در حالی که روشهای صرفاً مبتنی بر یادگیری تقویتی در سناریوی کاهش ۷۵٪ کارایی کاملاً شکست میخورند، AC‑RL همچنان در ۹٪ موارد موفق عمل میکند.»**
> — برگرفته از نتایج تجربی پایاننامه

## 🎯 چرا این موضوع اهمیت دارد؟

این پژوهش فقط یک روش کنترلی دیگر نیست؛ بلکه تغییری در نگرش است. بهجای اینکه یادگیری ماشین و کنترل کلاسیک را رقیب یکدیگر ببینیم، میتوانیم از نقاط قوت هر دو، یک کل منسجم و توانمند بسازیم.

AC‑RL نشان میدهد که میتوان هم از «شهود» یادگیری تقویتی بهره برد و هم از «دقت ریاضی» کنترل تطبیقی. و این یعنی گامی بهسوی سیستمهایی که نهتنها هوشمند، بلکه قابلاطمینان هستند.

## 🔮 نگاهی به آینده

این پایاننامه مسیرهای تازهای را میگشاید: استفاده از شبکههای عمیق برای تخمین رگرسورهای غیرخطی، بهکارگیری در سیستمهای پیچیدهتر مانند رباتهای انساننما، و حتی ترکیب با روشهای مبتنی بر داده برای سیستمهایی که مدل تحلیلی دقیقی ندارند.

شاید روزی نهچندان دور، پهپادها، خودروهای خودران و رباتهای صنعتی، همه از چنین چارچوبی برای حرکت ایمن و هوشمند در دنیای واقعی استفاده کنند. دنیایی که در آن، شبیهساز و واقعیت، دیگر دو قطب متضاد نیستند، بلکه دو روی یک سکهاند.

 

 

بسیار سریع و ساده می توانید اصل این پایان نامه را به صورت فایل PDF در اختیار داشته باشید.

پس از دریافت پایان‌نامه، کلیه اطلاعات کتاب‌شناختی موردنیاز برای استناد علمی، از جمله نام دانشگاه، عنوان پایان‌نامه، نام پژوهشگر، سال دفاع و سایر مشخصات مرتبط، جهت ارجاع‌دهی صحیح مطابق با استانداردهای رایج، در اختیار شما قرار خواهد گرفت.