بازآرایی دروندستی اشیاء (In-Hand Object Reorientation) یکی از مهمترین و در عین حال پیچیدهترین مسائل در حوزه رباتیک و دستکاری ماهرانه اشیاء به شمار میرود. در این مسئله، یک دست رباتیکی چندانگشتی باید بتواند بدون رها کردن جسم، آن را از یک وضعیت اولیه به یک جهتگیری هدف منتقل کند. این فرآیند در ظاهر ساده به نظر میرسد، اما به دلیل فضای کنترلی با ابعاد بالا، تغییرات مداوم نقاط تماس میان انگشتان و جسم، تنوع بسیار زیاد شکل و ویژگیهای فیزیکی اشیاء و همچنین اثر نیروی گرانش، به یکی از چالشهای اساسی در رباتیک تبدیل شده است. اهمیت این موضوع از آنجا ناشی میشود که بسیاری از فعالیتهای روزمره انسان، از گرفتن یک ابزار گرفته تا استفاده از وسایل مختلف، نیازمند تغییر جهت دقیق اشیاء در داخل دست هستند؛ قابلیتی که هنوز دستیابی به آن برای سامانههای رباتیکی دشوار است.
در سالهای گذشته پژوهشگران راهکارهای مختلفی برای حل این مسئله ارائه کردهاند. بخش قابل توجهی از تحقیقات اولیه بر پایه مدلهای تحلیلی و بهینهسازی مسیر حرکت استوار بودند. این روشها اگرچه در محیطهای شبیهسازی عملکرد مطلوبی داشتند، اما وابستگی شدید آنها به مدل دقیق جسم، ویژگیهای دینامیکی و پارامترهای فیزیکی باعث شد استفاده از آنها در محیطهای واقعی و برای اشیاء ناشناخته با محدودیتهای جدی مواجه شود. پس از آن، استفاده از یادگیری تقویتی مدلمبنا و سپس یادگیری تقویتی بدون مدل، مسیر جدیدی را برای حل این مسئله ایجاد کرد. با این حال، بسیاری از این روشها تنها برای تعداد محدودی از اشیاء آموزش دیده بودند، به تجهیزات جانبی نظیر سیستمهای رهگیری حرکت وابسته بودند و معمولاً تنها در شرایطی که کف دست رو به بالا قرار داشت عملکرد مناسبی ارائه میکردند. علاوه بر این، توانایی تعمیم به اشیاء جدید و ناشناخته همچنان یکی از نقاط ضعف اصلی روشهای موجود محسوب میشد.
هدف اصلی این پایاننامه طراحی و توسعه یک سامانه عمومی برای بازآرایی دروندستی اشیاء است که بتواند بدون نیاز به مدل دقیق جسم، اشیاء بسیار متنوع را در شرایط مختلف جابهجا و بازجهتدهی کند. برخلاف بسیاری از پژوهشهای پیشین، این سامانه تنها به یک سناریوی خاص محدود نیست، بلکه قادر است هم در حالتی که دست رباتیکی رو به بالا قرار دارد و هم در شرایطی که دست رو به پایین است عملیات بازآرایی را انجام دهد. همچنین سیستم امکان استفاده از سطوح کمکی مانند میز را نیز در فرآیند دستکاری فراهم میکند و علاوه بر آن تلاش شده است تا سیاستهای کنترلی تنها با استفاده از دادههایی که در محیط واقعی بهسادگی قابل دستیابی هستند، مانند تصاویر RGBD و موقعیت مفاصل دست، قابل اجرا باشند.
برای دستیابی به این هدف، پژوهش حاضر یک چارچوب یادگیری تقویتی بدون مدل ارائه میدهد که سه ایده اصلی را با یکدیگر ترکیب میکند. نخست، از ساختار «معلم–دانشآموز» استفاده شده است؛ به این صورت که ابتدا یک سیاست کنترلی معلم با استفاده از اطلاعات کامل محیط در شبیهسازی آموزش داده میشود و سپس این دانش به یک سیاست دانشآموز منتقل میشود که تنها از اطلاعات قابل دسترس در دنیای واقعی استفاده میکند. این رویکرد امکان انتقال دانش از محیط شبیهسازی به محیط واقعی را تا حد زیادی افزایش میدهد. دومین بخش، استفاده از مقداردهی اولیه پایدار برای وضعیت جسم است که بهویژه در شرایطی که دست رو به پایین قرار دارد، از سقوط جسم در ابتدای فرآیند جلوگیری کرده و یادگیری را تسهیل میکند. سومین بخش نیز استفاده از برنامه آموزشی مبتنی بر گرانش است که طی آن شدت اثر گرانش بهصورت تدریجی افزایش مییابد تا عامل یادگیرنده بتواند ابتدا مهارت کنترل جسم را در شرایط سادهتر فرا گرفته و سپس به شرایط واقعی برسد.
در این پژوهش برای آموزش عامل از الگوریتم PPO استفاده شده و دو نوع سیاست کنترلی شامل شبکههای عصبی پیشخور (MLP) و شبکههای بازگشتی (RNN) مورد ارزیابی قرار گرفتهاند. علاوه بر این، برای نزدیکتر شدن شرایط شبیهسازی به محیط واقعی، از تکنیک تصادفیسازی پارامترهای دینامیکی (Domain Randomization) استفاده شده است؛ به گونهای که جرم، اصطکاک، میرایی مفاصل و نویزهای موجود در مشاهدات و فرمانهای کنترلی بهصورت تصادفی تغییر میکنند. این فرآیند موجب افزایش پایداری و قابلیت انتقال سیاستهای یادگرفتهشده به شرایط واقعی میشود.
در ادامه، برای حذف وابستگی به اطلاعات کامل محیط، دو نوع سیاست دانشآموز توسعه داده شده است. در حالت نخست، سیاست تنها از اطلاعات کمبعد شامل موقعیت مفاصل دست، موقعیت جسم و اختلاف جهت آن نسبت به هدف استفاده میکند. در حالت دوم، سامانه مستقیماً از تصاویر RGBD و ابرنقاط سهبعدی استخراجشده از دوربینها بهره میگیرد. برای پردازش این دادههای سهبعدی، معماری جدیدی مبتنی بر شبکههای کانولوشنی تنک سهبعدی ارائه شده است که ضمن کاهش هزینه محاسباتی، امکان استخراج ویژگیهای مناسب از ابرنقاط را فراهم میکند. همچنین برای مقابله با مشکل تقارن برخی اشیاء، معیار فاصله Chamfer به عنوان شاخص موفقیت عملیات بازآرایی مورد استفاده قرار گرفته است تا وابستگی صرف به زاویه چرخش کاهش یابد.
ارزیابیهای انجامشده در این پایاننامه بر روی دست رباتیکی Shadow Hand و در محیط شبیهسازی NVIDIA Isaac Gym انجام شده است. برای بررسی توانایی تعمیم، از دو مجموعهداده بزرگ EGAD و YCB شامل بیش از دو هزار شیء با اشکال بسیار متنوع استفاده شده است. نتایج نشان میدهد که سیاستهای آموزشدیده قادرند درصد موفقیت بسیار بالایی در بازآرایی اشیاء مختلف به دست آورند. در حالت قرارگیری دست رو به بالا، نرخ موفقیت برای بسیاری از اشیاء از ۹۰ درصد فراتر میرود و حتی در شرایطی که دست رو به پایین قرار دارد نیز با استفاده از راهکارهای پیشنهادی، عملکرد سیستم به شکل محسوسی بهبود پیدا میکند. همچنین آزمایشهای انتقال مستقیم سیاستها به مجموعهدادههای جدید نشان میدهد که سیستم توانایی قابل توجهی در تعمیم به اشیاء ناشناخته دارد و بدون نیاز به آموزش مجدد نیز عملکرد مناسبی ارائه میدهد.
یکی از مهمترین یافتههای این پژوهش، کشف این موضوع است که برخلاف تصور رایج، اطلاع دقیق از شکل هندسی جسم برای انجام بسیاری از عملیات بازآرایی دروندستی الزامی نیست. سیاستهای یادگرفتهشده حتی بدون دریافت اطلاعات صریح درباره شکل اشیاء نیز قادر به کنترل و تغییر جهت تعداد زیادی از اجسام ناشناخته هستند. این نتیجه نشان میدهد که راهبردهای کنترلی عمومی میتوانند نقش مهمتری نسبت به اطلاعات بینایی ایفا کنند و اطلاعات تصویری بیشتر به عنوان عاملی برای بهبود عملکرد نهایی عمل میکنند، نه شرط اصلی موفقیت.
در مجموع، این پایاننامه یک چارچوب جامع برای بازآرایی دروندستی اشیاء ارائه میکند که با ترکیب یادگیری تقویتی بدون مدل، یادگیری معلم–دانشآموز، برنامه آموزشی مبتنی بر گرانش، مقداردهی اولیه پایدار، پردازش دادههای RGBD و تصادفیسازی پارامترهای محیط، توانسته است بسیاری از محدودیتهای روشهای پیشین را برطرف کند. نتایج بهدستآمده نشان میدهد که سامانه پیشنهادی نهتنها قابلیت کنترل طیف گستردهای از اشیاء با اشکال مختلف را دارد، بلکه از پتانسیل بالایی برای انتقال به سامانههای رباتیکی واقعی نیز برخوردار است و میتواند مبنایی مناسب برای توسعه نسل آینده سامانههای دستکاری هوشمند و رباتهای ماهر در محیطهای واقعی باشد.
فهرست مطالب
| سرفصل | شماره صفحه |
|---|---|
| چکیده | 6 |
| فصل ۱: مقدمه | 11 |
| فصل ۲: روش پیشنهادی | 17 |
| ۲-۱. آموزش سیاست معلم | 18 |
| ۲-۲. آموزش سیاست دانشآموز | 19 |
| ۲-۲-۱. آموزش دانشآموز با استفاده از فضای حالت کاهشیافته | 19 |
| ۲-۲-۲. آموزش دانشآموز مبتنی بر بینایی (Vision) | 20 |
| شبکه Sparse3D-IMPALA (شبکه سهبعدی تنک IMPALA) | 20 |
| رفع مشکل تقارن اشیاء با فاصله چمفر (Chamfer Distance) | 21 |
| فصل ۳: تنظیمات آزمایشها | 23 |
| مجموعهدادههای اشیاء | 23 |
| تنظیمات مشاهدات بینایی | 23 |
| تنظیمات دست رو به بالا | 23 |
| تنظیمات دست رو به پایین | 24 |
| معیارهای ارزیابی | 24 |
| فصل ۴: نتایج | 25 |
| ۴-۱. بازآرایی اشیاء با دست رو به بالا | 25 |
| آموزش سیاست معلم با اطلاعات کامل حالت | 25 |
| آموزش سیاست دانشآموز با فضای حالت کاهشیافته | 26 |
| ۴-۲. بازآرایی اشیاء با دست رو به پایین | 27 |
| ۴-۲-۱. بازآرایی اشیاء روی میز | 28 |
| ۴-۲-۲. بازآرایی اشیاء در هوا با دست رو به پایین | 28 |
| مقداردهی اولیه مناسب وضعیت جسم | 28 |
| بهبود عملکرد با برنامه آموزشی گرانش (Gravity Curriculum) | 29 |
| ۴-۳. انتقال صفرنمونه (Zero-shot Transfer) بین مجموعهدادهها | 30 |
| ۴-۴. بازآرایی اشیاء با حسگرهای RGBD | 30 |
| فصل ۵: کارهای مرتبط | 33 |
| فصل ۶: بحث و نتیجهگیری | 35 |
| منابع | 37 |
| پیوست A | 43 |
| A-1. شواهد انتقال به دنیای واقعی | 43 |
| A-2. تنظیمات محیط | 44 |
| A-2-1. تعریف فضای حالت | 44 |
| A-2-2. مجموعهداده | 45 |
| A-3. جزئیات آموزش | 48 |
| A-3-1. تنظیمات آموزش | 48 |
| A-3-2. توابع پاداش | 48 |
| A-3-3. تصادفیسازی دینامیک (Domain Randomization) | 49 |
| A-3-4. برنامه آموزشی گرانش (Gravity Curriculum) | 50 |
| A-4. نتایج تکمیلی | 51 |
| A-4-1. نتایج آموزش و آزمون | 51 |
| A-4-2. انتقال بین مجموعهدادهها | 53 |
| A-4-3. تحلیل گشتاور | 54 |
| A-4-4. آزمایشهای بینایی همراه با نویز | 55 |
چطور یک دست رباتیک بدون رها کردن جسم، آن را مثل دست انسان میچرخاند؟ راز یکی از سختترین چالشهای رباتیک!
رباتها سالهاست که میتوانند اشیاء را بردارند، اما هنوز انجام کاری که انسان بدون فکر انجام میدهد، یعنی چرخاندن یک جسم داخل دست بدون رها کردن آن، یکی از پیچیدهترین مسائل رباتیک محسوب میشود. چرا این کار تا این اندازه دشوار است و پژوهشگران چگونه موفق شدهاند قدم بزرگی برای حل آن بردارند؟
دستکاری دروندستی؛ مهارتی که از انسان ساده اما برای ربات بسیار پیچیده است
وقتی یک خودکار را بین انگشتان خود میچرخانید یا پیچگوشتی را برای استفاده در دست تنظیم میکنید، مغز شما همزمان صدها تصمیم کوچک میگیرد. برای یک ربات، همین حرکت به معنای حل یک مسئله بسیار پیچیده با تعداد زیادی متغیر است.
نکته جالب اینجاست که کوچکترین تغییر در محل تماس انگشتان یا وزن جسم میتواند کل فرآیند را با شکست مواجه کند.
چرا روشهای قدیمی همیشه جواب نمیدادند؟
بخش زیادی از تحقیقات گذشته بر این فرض استوار بودند که ربات باید تقریباً همه چیز را درباره جسم بداند؛ از شکل دقیق گرفته تا جرم، اصطکاک و سایر ویژگیهای فیزیکی.
اما دنیای واقعی چنین نیست.
اگر جسم جدید باشد یا اطلاعات دقیقی از آن وجود نداشته باشد، بسیاری از این روشها دیگر عملکرد مناسبی نخواهند داشت. همین موضوع باعث شده بود استفاده از آنها در محیطهای واقعی با محدودیتهای فراوانی همراه باشد.
یادگیری تقویتی؛ وقتی ربات با آزمون و خطا مهارت پیدا میکند
ایده اصلی این پژوهش استفاده از یادگیری تقویتی است.
به جای اینکه همه قوانین حرکت برای ربات برنامهنویسی شوند، ربات بارها و بارها تلاش میکند، اشتباه میکند، پاداش میگیرد و در نهایت بهترین راهبرد را برای چرخاندن اجسام یاد میگیرد.
این دقیقاً شبیه روشی است که انسان بسیاری از مهارتهای حرکتی را در کودکی یاد میگیرد.
یک معلم مجازی، قبل از ورود به دنیای واقعی
یکی از هوشمندانهترین بخشهای این پژوهش استفاده از ساختار «معلم–دانشآموز» است.
ابتدا یک عامل هوشمند در محیط شبیهسازی، با دسترسی کامل به اطلاعات، مهارت لازم را یاد میگیرد. سپس این دانش به عامل دیگری منتقل میشود که تنها اطلاعاتی را در اختیار دارد که در یک ربات واقعی قابل اندازهگیری هستند.
این روش شکاف میان شبیهسازی و دنیای واقعی را تا حد زیادی کاهش میدهد.
گرانش هم بهصورت مرحلهای وارد بازی میشود
یکی از مشکلات اصلی این است که اگر از همان ابتدا شرایط واقعی شبیهسازی شود، جسم مرتب سقوط میکند و فرآیند یادگیری تقریباً غیرممکن میشود.
راهحل ارائهشده بسیار خلاقانه است؛ ابتدا اثر گرانش کمتر در نظر گرفته میشود و سپس بهتدریج تا مقدار واقعی افزایش پیدا میکند.
این آموزش مرحلهای باعث میشود ربات ابتدا اصول کنترل جسم را بیاموزد و سپس در شرایط واقعی عملکرد مناسبی داشته باشد.
ربات حتی با اشیایی که قبلاً ندیده هم کنار میآید
یکی از مهمترین دستاوردهای این پژوهش، توانایی تعمیم به اشیاء ناشناخته است.
سیستم تنها برای چند جسم خاص آموزش داده نشده، بلکه روی مجموعه بزرگی از هزاران شیء با شکلهای متفاوت آزمایش شده و توانسته بدون آموزش مجدد نیز عملکرد موفقی داشته باشد.
این ویژگی برای کاربردهای صنعتی و خدماتی اهمیت بسیار زیادی دارد؛ زیرا در محیط واقعی همیشه با اجسام جدید روبهرو خواهیم بود.
بینایی سهبعدی؛ وقتی ربات محیط را بهتر درک میکند
در بخش دیگری از پژوهش، از تصاویر RGBD و ابرنقاط سهبعدی استفاده شده تا ربات بتواند شکل و وضعیت اجسام را بهتر تشخیص دهد.
ترکیب این اطلاعات با یادگیری تقویتی باعث شده سیستم در شرایط واقعی پایداری بیشتری داشته باشد و تصمیمهای دقیقتری بگیرد.
مهمترین کشف؛ همیشه لازم نیست شکل دقیق جسم را بدانیم
شاید جالبترین نتیجه این پژوهش این باشد که ربات برای انجام بسیاری از عملیات، الزاماً نیازی به دانستن مدل دقیق جسم ندارد.
در بسیاری از آزمایشها، سیاستهای یادگرفتهشده تنها با استفاده از اطلاعات محدود نیز توانستند اجسام ناشناخته را با موفقیت جابهجا و بازجهتدهی کنند.
این نتیجه میتواند نگاه پژوهشگران به طراحی سامانههای دستکاری رباتیک را تغییر دهد.
آیندهای که رباتها ماهرتر از همیشه خواهند شد
پژوهش حاضر نشان میدهد ترکیب یادگیری تقویتی، آموزش معلم–دانشآموز، بینایی سهبعدی و آموزش مرحلهای میتواند یکی از مهمترین موانع رباتیک یعنی دستکاری ماهرانه اشیاء را تا حد زیادی برطرف کند.
با توسعه چنین فناوریهایی، رباتهای آینده نهتنها قادر خواهند بود اجسام را بردارند، بلکه میتوانند آنها را همانند انسان در دست بچرخانند، تنظیم کنند و برای انجام وظایف پیچیده آماده سازند.
در نهایت شاید پرسش مهم این باشد: اگر رباتها بتوانند مهارتهای ظریف حرکتی انسان را نیز بیاموزند، مرز میان تواناییهای انسان و ماشین تا کجا جابهجا خواهد شد؟
بسیار سریع و ساده می توانید اصل این پایان نامه را به صورت فایل PDF در اختیار داشته باشید.