بازآرایی درون‌دستی اشیاء (In-Hand Object Reorientation) یکی از مهم‌ترین و در عین حال پیچیده‌ترین مسائل در حوزه رباتیک و دست‌کاری ماهرانه اشیاء به شمار می‌رود. در این مسئله، یک دست رباتیکی چندانگشتی باید بتواند بدون رها کردن جسم، آن را از یک وضعیت اولیه به یک جهت‌گیری هدف منتقل کند. این فرآیند در ظاهر ساده به نظر می‌رسد، اما به دلیل فضای کنترلی با ابعاد بالا، تغییرات مداوم نقاط تماس میان انگشتان و جسم، تنوع بسیار زیاد شکل و ویژگی‌های فیزیکی اشیاء و همچنین اثر نیروی گرانش، به یکی از چالش‌های اساسی در رباتیک تبدیل شده است. اهمیت این موضوع از آنجا ناشی می‌شود که بسیاری از فعالیت‌های روزمره انسان، از گرفتن یک ابزار گرفته تا استفاده از وسایل مختلف، نیازمند تغییر جهت دقیق اشیاء در داخل دست هستند؛ قابلیتی که هنوز دستیابی به آن برای سامانه‌های رباتیکی دشوار است.

در سال‌های گذشته پژوهشگران راهکارهای مختلفی برای حل این مسئله ارائه کرده‌اند. بخش قابل توجهی از تحقیقات اولیه بر پایه مدل‌های تحلیلی و بهینه‌سازی مسیر حرکت استوار بودند. این روش‌ها اگرچه در محیط‌های شبیه‌سازی عملکرد مطلوبی داشتند، اما وابستگی شدید آن‌ها به مدل دقیق جسم، ویژگی‌های دینامیکی و پارامترهای فیزیکی باعث شد استفاده از آن‌ها در محیط‌های واقعی و برای اشیاء ناشناخته با محدودیت‌های جدی مواجه شود. پس از آن، استفاده از یادگیری تقویتی مدل‌مبنا و سپس یادگیری تقویتی بدون مدل، مسیر جدیدی را برای حل این مسئله ایجاد کرد. با این حال، بسیاری از این روش‌ها تنها برای تعداد محدودی از اشیاء آموزش دیده بودند، به تجهیزات جانبی نظیر سیستم‌های رهگیری حرکت وابسته بودند و معمولاً تنها در شرایطی که کف دست رو به بالا قرار داشت عملکرد مناسبی ارائه می‌کردند. علاوه بر این، توانایی تعمیم به اشیاء جدید و ناشناخته همچنان یکی از نقاط ضعف اصلی روش‌های موجود محسوب می‌شد.

هدف اصلی این پایان‌نامه طراحی و توسعه یک سامانه عمومی برای بازآرایی درون‌دستی اشیاء است که بتواند بدون نیاز به مدل دقیق جسم، اشیاء بسیار متنوع را در شرایط مختلف جابه‌جا و بازجهت‌دهی کند. برخلاف بسیاری از پژوهش‌های پیشین، این سامانه تنها به یک سناریوی خاص محدود نیست، بلکه قادر است هم در حالتی که دست رباتیکی رو به بالا قرار دارد و هم در شرایطی که دست رو به پایین است عملیات بازآرایی را انجام دهد. همچنین سیستم امکان استفاده از سطوح کمکی مانند میز را نیز در فرآیند دست‌کاری فراهم می‌کند و علاوه بر آن تلاش شده است تا سیاست‌های کنترلی تنها با استفاده از داده‌هایی که در محیط واقعی به‌سادگی قابل دستیابی هستند، مانند تصاویر RGBD و موقعیت مفاصل دست، قابل اجرا باشند.

برای دستیابی به این هدف، پژوهش حاضر یک چارچوب یادگیری تقویتی بدون مدل ارائه می‌دهد که سه ایده اصلی را با یکدیگر ترکیب می‌کند. نخست، از ساختار «معلم–دانش‌آموز» استفاده شده است؛ به این صورت که ابتدا یک سیاست کنترلی معلم با استفاده از اطلاعات کامل محیط در شبیه‌سازی آموزش داده می‌شود و سپس این دانش به یک سیاست دانش‌آموز منتقل می‌شود که تنها از اطلاعات قابل دسترس در دنیای واقعی استفاده می‌کند. این رویکرد امکان انتقال دانش از محیط شبیه‌سازی به محیط واقعی را تا حد زیادی افزایش می‌دهد. دومین بخش، استفاده از مقداردهی اولیه پایدار برای وضعیت جسم است که به‌ویژه در شرایطی که دست رو به پایین قرار دارد، از سقوط جسم در ابتدای فرآیند جلوگیری کرده و یادگیری را تسهیل می‌کند. سومین بخش نیز استفاده از برنامه آموزشی مبتنی بر گرانش است که طی آن شدت اثر گرانش به‌صورت تدریجی افزایش می‌یابد تا عامل یادگیرنده بتواند ابتدا مهارت کنترل جسم را در شرایط ساده‌تر فرا گرفته و سپس به شرایط واقعی برسد.

در این پژوهش برای آموزش عامل از الگوریتم PPO استفاده شده و دو نوع سیاست کنترلی شامل شبکه‌های عصبی پیشخور (MLP) و شبکه‌های بازگشتی (RNN) مورد ارزیابی قرار گرفته‌اند. علاوه بر این، برای نزدیک‌تر شدن شرایط شبیه‌سازی به محیط واقعی، از تکنیک تصادفی‌سازی پارامترهای دینامیکی (Domain Randomization) استفاده شده است؛ به گونه‌ای که جرم، اصطکاک، میرایی مفاصل و نویزهای موجود در مشاهدات و فرمان‌های کنترلی به‌صورت تصادفی تغییر می‌کنند. این فرآیند موجب افزایش پایداری و قابلیت انتقال سیاست‌های یادگرفته‌شده به شرایط واقعی می‌شود.

در ادامه، برای حذف وابستگی به اطلاعات کامل محیط، دو نوع سیاست دانش‌آموز توسعه داده شده است. در حالت نخست، سیاست تنها از اطلاعات کم‌بعد شامل موقعیت مفاصل دست، موقعیت جسم و اختلاف جهت آن نسبت به هدف استفاده می‌کند. در حالت دوم، سامانه مستقیماً از تصاویر RGBD و ابرنقاط سه‌بعدی استخراج‌شده از دوربین‌ها بهره می‌گیرد. برای پردازش این داده‌های سه‌بعدی، معماری جدیدی مبتنی بر شبکه‌های کانولوشنی تنک سه‌بعدی ارائه شده است که ضمن کاهش هزینه محاسباتی، امکان استخراج ویژگی‌های مناسب از ابرنقاط را فراهم می‌کند. همچنین برای مقابله با مشکل تقارن برخی اشیاء، معیار فاصله Chamfer به عنوان شاخص موفقیت عملیات بازآرایی مورد استفاده قرار گرفته است تا وابستگی صرف به زاویه چرخش کاهش یابد.

ارزیابی‌های انجام‌شده در این پایان‌نامه بر روی دست رباتیکی Shadow Hand و در محیط شبیه‌سازی NVIDIA Isaac Gym انجام شده است. برای بررسی توانایی تعمیم، از دو مجموعه‌داده بزرگ EGAD و YCB شامل بیش از دو هزار شیء با اشکال بسیار متنوع استفاده شده است. نتایج نشان می‌دهد که سیاست‌های آموزش‌دیده قادرند درصد موفقیت بسیار بالایی در بازآرایی اشیاء مختلف به دست آورند. در حالت قرارگیری دست رو به بالا، نرخ موفقیت برای بسیاری از اشیاء از ۹۰ درصد فراتر می‌رود و حتی در شرایطی که دست رو به پایین قرار دارد نیز با استفاده از راهکارهای پیشنهادی، عملکرد سیستم به شکل محسوسی بهبود پیدا می‌کند. همچنین آزمایش‌های انتقال مستقیم سیاست‌ها به مجموعه‌داده‌های جدید نشان می‌دهد که سیستم توانایی قابل توجهی در تعمیم به اشیاء ناشناخته دارد و بدون نیاز به آموزش مجدد نیز عملکرد مناسبی ارائه می‌دهد.

یکی از مهم‌ترین یافته‌های این پژوهش، کشف این موضوع است که برخلاف تصور رایج، اطلاع دقیق از شکل هندسی جسم برای انجام بسیاری از عملیات بازآرایی درون‌دستی الزامی نیست. سیاست‌های یادگرفته‌شده حتی بدون دریافت اطلاعات صریح درباره شکل اشیاء نیز قادر به کنترل و تغییر جهت تعداد زیادی از اجسام ناشناخته هستند. این نتیجه نشان می‌دهد که راهبردهای کنترلی عمومی می‌توانند نقش مهم‌تری نسبت به اطلاعات بینایی ایفا کنند و اطلاعات تصویری بیشتر به عنوان عاملی برای بهبود عملکرد نهایی عمل می‌کنند، نه شرط اصلی موفقیت.

در مجموع، این پایان‌نامه یک چارچوب جامع برای بازآرایی درون‌دستی اشیاء ارائه می‌کند که با ترکیب یادگیری تقویتی بدون مدل، یادگیری معلم–دانش‌آموز، برنامه آموزشی مبتنی بر گرانش، مقداردهی اولیه پایدار، پردازش داده‌های RGBD و تصادفی‌سازی پارامترهای محیط، توانسته است بسیاری از محدودیت‌های روش‌های پیشین را برطرف کند. نتایج به‌دست‌آمده نشان می‌دهد که سامانه پیشنهادی نه‌تنها قابلیت کنترل طیف گسترده‌ای از اشیاء با اشکال مختلف را دارد، بلکه از پتانسیل بالایی برای انتقال به سامانه‌های رباتیکی واقعی نیز برخوردار است و می‌تواند مبنایی مناسب برای توسعه نسل آینده سامانه‌های دست‌کاری هوشمند و ربات‌های ماهر در محیط‌های واقعی باشد.

 

فهرست مطالب

سرفصل شماره صفحه
چکیده 6
فصل ۱: مقدمه 11
فصل ۲: روش پیشنهادی 17
۲-۱. آموزش سیاست معلم 18
۲-۲. آموزش سیاست دانش‌آموز 19
۲-۲-۱. آموزش دانش‌آموز با استفاده از فضای حالت کاهش‌یافته 19
۲-۲-۲. آموزش دانش‌آموز مبتنی بر بینایی (Vision) 20
شبکه Sparse3D-IMPALA (شبکه سه‌بعدی تنک IMPALA) 20
رفع مشکل تقارن اشیاء با فاصله چمفر (Chamfer Distance) 21
فصل ۳: تنظیمات آزمایش‌ها 23
مجموعه‌داده‌های اشیاء 23
تنظیمات مشاهدات بینایی 23
تنظیمات دست رو به بالا 23
تنظیمات دست رو به پایین 24
معیارهای ارزیابی 24
فصل ۴: نتایج 25
۴-۱. بازآرایی اشیاء با دست رو به بالا 25
آموزش سیاست معلم با اطلاعات کامل حالت 25
آموزش سیاست دانش‌آموز با فضای حالت کاهش‌یافته 26
۴-۲. بازآرایی اشیاء با دست رو به پایین 27
۴-۲-۱. بازآرایی اشیاء روی میز 28
۴-۲-۲. بازآرایی اشیاء در هوا با دست رو به پایین 28
مقداردهی اولیه مناسب وضعیت جسم 28
بهبود عملکرد با برنامه آموزشی گرانش (Gravity Curriculum) 29
۴-۳. انتقال صفرنمونه (Zero-shot Transfer) بین مجموعه‌داده‌ها 30
۴-۴. بازآرایی اشیاء با حسگرهای RGBD 30
فصل ۵: کارهای مرتبط 33
فصل ۶: بحث و نتیجه‌گیری 35
منابع 37
پیوست A 43
A-1. شواهد انتقال به دنیای واقعی 43
A-2. تنظیمات محیط 44
A-2-1. تعریف فضای حالت 44
A-2-2. مجموعه‌داده 45
A-3. جزئیات آموزش 48
A-3-1. تنظیمات آموزش 48
A-3-2. توابع پاداش 48
A-3-3. تصادفی‌سازی دینامیک (Domain Randomization) 49
A-3-4. برنامه آموزشی گرانش (Gravity Curriculum) 50
A-4. نتایج تکمیلی 51
A-4-1. نتایج آموزش و آزمون 51
A-4-2. انتقال بین مجموعه‌داده‌ها 53
A-4-3. تحلیل گشتاور 54
A-4-4. آزمایش‌های بینایی همراه با نویز 55

 

چطور یک دست رباتیک بدون رها کردن جسم، آن را مثل دست انسان می‌چرخاند؟ راز یکی از سخت‌ترین چالش‌های رباتیک!

ربات‌ها سال‌هاست که می‌توانند اشیاء را بردارند، اما هنوز انجام کاری که انسان بدون فکر انجام می‌دهد، یعنی چرخاندن یک جسم داخل دست بدون رها کردن آن، یکی از پیچیده‌ترین مسائل رباتیک محسوب می‌شود. چرا این کار تا این اندازه دشوار است و پژوهشگران چگونه موفق شده‌اند قدم بزرگی برای حل آن بردارند؟


دستکاری درون‌دستی؛ مهارتی که از انسان ساده اما برای ربات بسیار پیچیده است

وقتی یک خودکار را بین انگشتان خود می‌چرخانید یا پیچ‌گوشتی را برای استفاده در دست تنظیم می‌کنید، مغز شما هم‌زمان صدها تصمیم کوچک می‌گیرد. برای یک ربات، همین حرکت به معنای حل یک مسئله بسیار پیچیده با تعداد زیادی متغیر است.

نکته جالب اینجاست که کوچک‌ترین تغییر در محل تماس انگشتان یا وزن جسم می‌تواند کل فرآیند را با شکست مواجه کند.


چرا روش‌های قدیمی همیشه جواب نمی‌دادند؟

بخش زیادی از تحقیقات گذشته بر این فرض استوار بودند که ربات باید تقریباً همه چیز را درباره جسم بداند؛ از شکل دقیق گرفته تا جرم، اصطکاک و سایر ویژگی‌های فیزیکی.

اما دنیای واقعی چنین نیست.

اگر جسم جدید باشد یا اطلاعات دقیقی از آن وجود نداشته باشد، بسیاری از این روش‌ها دیگر عملکرد مناسبی نخواهند داشت. همین موضوع باعث شده بود استفاده از آن‌ها در محیط‌های واقعی با محدودیت‌های فراوانی همراه باشد.


یادگیری تقویتی؛ وقتی ربات با آزمون و خطا مهارت پیدا می‌کند

ایده اصلی این پژوهش استفاده از یادگیری تقویتی است.

به جای اینکه همه قوانین حرکت برای ربات برنامه‌نویسی شوند، ربات بارها و بارها تلاش می‌کند، اشتباه می‌کند، پاداش می‌گیرد و در نهایت بهترین راهبرد را برای چرخاندن اجسام یاد می‌گیرد.

این دقیقاً شبیه روشی است که انسان بسیاری از مهارت‌های حرکتی را در کودکی یاد می‌گیرد.


یک معلم مجازی، قبل از ورود به دنیای واقعی

یکی از هوشمندانه‌ترین بخش‌های این پژوهش استفاده از ساختار «معلم–دانش‌آموز» است.

ابتدا یک عامل هوشمند در محیط شبیه‌سازی، با دسترسی کامل به اطلاعات، مهارت لازم را یاد می‌گیرد. سپس این دانش به عامل دیگری منتقل می‌شود که تنها اطلاعاتی را در اختیار دارد که در یک ربات واقعی قابل اندازه‌گیری هستند.

این روش شکاف میان شبیه‌سازی و دنیای واقعی را تا حد زیادی کاهش می‌دهد.


گرانش هم به‌صورت مرحله‌ای وارد بازی می‌شود

یکی از مشکلات اصلی این است که اگر از همان ابتدا شرایط واقعی شبیه‌سازی شود، جسم مرتب سقوط می‌کند و فرآیند یادگیری تقریباً غیرممکن می‌شود.

راه‌حل ارائه‌شده بسیار خلاقانه است؛ ابتدا اثر گرانش کمتر در نظر گرفته می‌شود و سپس به‌تدریج تا مقدار واقعی افزایش پیدا می‌کند.

این آموزش مرحله‌ای باعث می‌شود ربات ابتدا اصول کنترل جسم را بیاموزد و سپس در شرایط واقعی عملکرد مناسبی داشته باشد.


ربات حتی با اشیایی که قبلاً ندیده هم کنار می‌آید

یکی از مهم‌ترین دستاوردهای این پژوهش، توانایی تعمیم به اشیاء ناشناخته است.

سیستم تنها برای چند جسم خاص آموزش داده نشده، بلکه روی مجموعه بزرگی از هزاران شیء با شکل‌های متفاوت آزمایش شده و توانسته بدون آموزش مجدد نیز عملکرد موفقی داشته باشد.

این ویژگی برای کاربردهای صنعتی و خدماتی اهمیت بسیار زیادی دارد؛ زیرا در محیط واقعی همیشه با اجسام جدید روبه‌رو خواهیم بود.


بینایی سه‌بعدی؛ وقتی ربات محیط را بهتر درک می‌کند

در بخش دیگری از پژوهش، از تصاویر RGBD و ابرنقاط سه‌بعدی استفاده شده تا ربات بتواند شکل و وضعیت اجسام را بهتر تشخیص دهد.

ترکیب این اطلاعات با یادگیری تقویتی باعث شده سیستم در شرایط واقعی پایداری بیشتری داشته باشد و تصمیم‌های دقیق‌تری بگیرد.


مهم‌ترین کشف؛ همیشه لازم نیست شکل دقیق جسم را بدانیم

شاید جالب‌ترین نتیجه این پژوهش این باشد که ربات برای انجام بسیاری از عملیات، الزاماً نیازی به دانستن مدل دقیق جسم ندارد.

در بسیاری از آزمایش‌ها، سیاست‌های یادگرفته‌شده تنها با استفاده از اطلاعات محدود نیز توانستند اجسام ناشناخته را با موفقیت جابه‌جا و بازجهت‌دهی کنند.

این نتیجه می‌تواند نگاه پژوهشگران به طراحی سامانه‌های دستکاری رباتیک را تغییر دهد.


آینده‌ای که ربات‌ها ماهرتر از همیشه خواهند شد

پژوهش حاضر نشان می‌دهد ترکیب یادگیری تقویتی، آموزش معلم–دانش‌آموز، بینایی سه‌بعدی و آموزش مرحله‌ای می‌تواند یکی از مهم‌ترین موانع رباتیک یعنی دستکاری ماهرانه اشیاء را تا حد زیادی برطرف کند.

با توسعه چنین فناوری‌هایی، ربات‌های آینده نه‌تنها قادر خواهند بود اجسام را بردارند، بلکه می‌توانند آن‌ها را همانند انسان در دست بچرخانند، تنظیم کنند و برای انجام وظایف پیچیده آماده سازند.

در نهایت شاید پرسش مهم این باشد: اگر ربات‌ها بتوانند مهارت‌های ظریف حرکتی انسان را نیز بیاموزند، مرز میان توانایی‌های انسان و ماشین تا کجا جابه‌جا خواهد شد؟

بسیار سریع و ساده می توانید اصل این پایان نامه را به صورت فایل PDF در اختیار داشته باشید.

پس از دریافت پایان‌نامه، کلیه اطلاعات کتاب‌شناختی موردنیاز برای استناد علمی، از جمله نام دانشگاه، عنوان پایان‌نامه، نام پژوهشگر، سال دفاع و سایر مشخصات مرتبط، جهت ارجاع‌دهی صحیح مطابق با استانداردهای رایج، در اختیار شما قرار خواهد گرفت.