در دنیای رباتیک، برنامهریزی برای انجام کارهای پیچیده اغلب با چالشهایی روبرو است؛ زیرا رباتها باید در فضاهای پیوسته و با جزئیات بسیار زیاد حرکت کنند. یکی از راههای غلبه بر این مشکل، استفاده از برنامهریزی دومرحلهای است. در این روش، ربات ابتدا یک برنامهٔ انتزاعی و سطحبالا طراحی میکند و سپس آن را به اقدامات دقیق و پیوسته تبدیل میکند. اما کارایی این روش به شدت به این بستگی دارد که ربات از چه مفاهیم انتزاعی و سطحبالایی برای توصیف محیط خود استفاده کند.
نکتهٔ کلیدی اینجاست که طراحی دستی این مفاهیم انتزاعی توسط انسان، کاری طاقتفرسا و اغلب غیرعملی است. بنابراین، ربات باید خودش این مفاهیم را از طریق تعامل با محیط و با کمک یک معلم (که میتواند یک انسان باشد) یاد بگیرد. این پژوهش، چارچوبی نوین برای «یادگیری فعال» این مفاهیم انتزاعی ارائه میدهد. در این چارچوب، ربات فقط نام و آرگومانهای مفاهیم را میداند، اما باید طبقهبندی کنندهٔ آنها را بیاموزد؛ یعنی تعیین کند که در هر حالت، کدام مفاهیم صادق هستند و کدام نه.
آنچه این مسئله را از یادگیری فعال معمولی دشوارتر میکند، ماهیت ترتیبی آن است. ربات برای پرسیدن سوال از معلم دربارهٔ یک وضعیت خاص، ابتدا باید خود را به آن وضعیت برساند و این مستلزم انجام یک سری اقدامات پشت سر هم است. بنابراین، یادگیری شامل یک چرخهٔ دو مرحلهای میشود: «کاوش» در محیط برای رسیدن به حالات جدید، و سپس «پرسش» از معلم دربارهٔ صحت مفاهیم در آن حالات خاص. هدف این است که ربات با کمترین تعداد اقدام و پرسش، مفاهیم را به بهترین شکل ممکن بیاموزد.
این پایاننامه روشهای مختلفی را برای هدایت فرایند کاوش و پرسش بررسی میکند. برای کاوش، روشی به نام «نگاهبازپیشروی حریصانه» پیشنهاد شده است که در آن ربات با شبیهسازی چند قدم به جلو، مسیرهایی را انتخاب میکند که به حالات «جالبتری» منجر شوند. جالب بودن یک حالت بر اساس میزان عدماطمینان مدلهای یادگیری ربات دربارهٔ آن تعیین میشود. همچنین برای پرسش، از معیاری بر اساس «آنتروپی» استفاده میشود تا ربات فقط در مورد مفاهیمی سوال بپرسد که بیشترین ابهام را برای او دارند.
برای پیادهسازی این ایدهها، از مجموعهای از شبکههای عصبی استفاده شده است تا عدماطمینان مدل به درستی اندازهگیری شود. فرض اصلی این است که ربات از قبل میداند چه مفاهیمی وجود دارند و فقط طبقهبندی کنندهٔ آنها را نمیداند. همچنین، ربات به یک شبیهساز دقیق از محیط و مجموعهای از اقدامات از پیش تعریفشده دسترسی دارد. روش پیشنهادی بر روی یک محیط شبیهسازی شده به نام «انتخاب و قرار دادن یکبعدی» آزمایش شده است.
نتایج آزمایشها نشان میدهد که روش اصلی ارائهشده در این پژوهش، بسیار کارآمدتر از روشهای سادهتر مانند اقدامات تصادفی یا پرسشهای بیهدف عمل میکند. ربات با استفاده از این روش، با تعداد پرسشهای بسیار کمتری به معلم، مفاهیم را به سرعت و با دقت بالا یاد میگیرد و در نهایت میتواند تعداد بیشتری از وظایف محوله را با موفقیت به پایان برساند. این موفقیت نشان میدهد که انتخاب هوشمندانهٔ حالات برای کاوش و پرسش، تأثیر مستقیمی بر کارایی یادگیری دارد.
در نهایت، این پژوهش گامی مهم در جهت ساخت رباتهایی است که میتوانند به طور خودکار و کارآمد، درک خود را از دنیای اطراف شکل دهند. با کنار گذاشتن فرض وجود مفاهیم از پیش تعیینشده، راه برای ساخت عواملی باز میشود که در محیطهای پیچیده و ناشناخته، قادر به برنامهریزی و تصمیمگیری هوشمندانه هستند. این رویکرد، پلی است میان یادگیری ماشین و برنامهریزی خودکار که میتواند آیندهٔ رباتیک را متحول کند.
| سرفصل | شماره صفحه |
|---|---|
| چکیده | ۳ |
| سپاسگزاری | ۵ |
| ۱- مقدمه | ۱۱ |
| ۲- تعریف مسئله | ۱۳ |
| ۲-۱- محیطها | ۱۳ |
| ۲-۲- وظایف (تسکها) | ۱۵ |
| ۲-۳- مجموعهدادهٔ پایه | ۱۵ |
| ۳- پیشزمینه | ۱۷ |
| ۳-۱- نمایش NSRT | ۱۷ |
| ۳-۲- برنامهریزی با NSRT | ۱۸ |
| ۳-۳- یادگیری NSRT با محمولات دادهشده | ۱۹ |
| ۴- روشها | ۲۱ |
| ۴-۱- مثال جاری | ۲۲ |
| ۴-۲- مقداردهی اولیه | ۲۲ |
| ۴-۲-۱- مجموعهدادهٔ اولیه | ۲۳ |
| ۴-۲-۲- طبقهبندیکنندههای محمولات اولیه | ۲۴ |
| ۴-۲-۳- NSRTهای آموختهشده | ۲۴ |
| ۴-۳- یادگیری فعال | ۲۵ |
| ۴-۳-۱- کاوش (اکتشاف) | ۲۵ |
| ۴-۳-۲- پرسشها از معلم | ۳۰ |
| ۴-۴- رویکرد اصلی | ۳۲ |
| ۵- آزمایشها | ۳۳ |
| ۵-۱- تنظیمات آزمایشی | ۳۳ |
| ۵-۲- نتایج و بحث | ۳۵ |
| ۵-۲-۱- مقایسهٔ روشها | ۳۵ |
| ۵-۲-۲- طبقهبندی جمعی (ensemble) | ۳۶ |
| ۵-۲-۳- موارد آزمون طبقهبندی خارج از مجموعه | ۴۰ |
| ۶- کارهای مرتبط | ۴۵ |
| ۷- نتیجهگیری | ۴۷ |
| منابع | ۴۹ |
چرا رباتها باید «شک کنند»؟ داستان یادگیری فعال مفاهیم
تصور کنید از یک ربات میخواهید که یک مکعب قرمز را روی یک مکعب آبی قرار دهد. او این کار را به خوبی انجام میدهد، اما اگر بپرسید «آیا مکعب قرمز روی مکعب آبی قرار دارد؟»، مکث میکند و جوابی نمیدهد. مشکل از کجاست؟ ربات شما مفهوم «قرار گرفتن روی» را نمیداند!
در دنیای واقعی، ما به رباتها نمیگوییم که هر مفهوم انتزاعی دقیقاً به چه معناست؛ زیرا این کار برای هر موقعیت جدید، خستهکننده و غیرممکن است. در عوض، به آنها اجازه میدهیم تا خودشان این مفاهیم را کشف کنند. اما سوال اینجاست: یک ربات چگونه میتواند بهترین سوالات را برای یادگیری بپرسد، بدون اینکه معلم انسانی خود را خسته کند؟ پاسخ در یک چارچوب هوشمندانه به نام «یادگیری فعال» نهفته است.
🔍 چالش: قدم زدن برای پرسیدن یک سوال
برخلاف یادگیری ماشین معمولی که در آن دادهها به سادگی در اختیار الگوریتم قرار میگیرند، در یادگیری فعال رباتیک، مسئله بسیار پیچیدهتر است. ربات برای پرسیدن یک سوال دربارهٔ یک حالت خاص، اول باید خود را به آن حالت برساند. این یعنی او باید یک توالی از اقدامات را در محیط انجام دهد تا به نقطهای برسد که سوالش در آنجا معنا پیدا کند.
به عنوان مثال، اگر ربات بخواهد بداند که آیا «بلوک A کاملاً روی هدف B را پوشانده است»، ابتدا باید بلوک را بردارد و در جای مناسبی قرار دهد تا بتواند این وضعیت را مشاهده کند و سپس سوال خود را بپرسد. اینجاست که تمایز کلیدی این پژوهش نمایان میشود: «کاوش» صرفاً برای کشف محیط نیست، بلکه مقدمهای برای «پرسشهای هوشمندانه» است.
🎯 راهحل: کاوش با نگاه به آینده
محققان برای حل این مشکل، روشی به نام «نگاهبازپیشروی حریصانه» را پیشنهاد کردهاند. در این روش، ربات چند قدم به جلو در محیط خود را شبیهسازی میکند و مسیری را انتخاب میکند که به حالتی منجر شود که مدلهایش بیشترین عدماطمینان را دربارهٔ آن دارند.
به عبارت سادهتر، ربات به دنبال موقعیتهای مرزی و مبهم میگردد. جایی که شبکههای عصبی او نمیتوانند به راحتی تصمیم بگیرند که آیا یک مفهوم صادق است یا نه. این نقاط، طلاییترین مکانها برای یادگیری هستند، زیرا هر پاسخ معلم، بیشترین اطلاعات را به ربات میدهد.
⚡️ نتیجهای که دنیای رباتیک را تغییر میدهد
آزمایشها در محیط شبیهسازی «انتخاب و قرار دادن یکبعدی» نشان داد که این رویکرد، تعداد پرسشهای مورد نیاز از معلم را به طور چشمگیری کاهش میدهد. رباتی که از این روش استفاده میکند، با پرسیدن سوالات بسیار کمتر، مفاهیم را دقیقتر یاد میگیرد و در نهایت، تعداد وظایف حلشدهٔ او به طرز قابلتوجهی افزایش مییابد.
این پژوهش نشان میدهد که کلید ساخت رباتهای واقعاً مستقل، در طراحی مکانیسمهایی است که به آنها اجازه دهد «ندانستنهای خود را بشناسند» و دقیقاً به دنبال پر کردن همان شکافهای دانش بروند. آیندهای که در آن رباتها نه تنها دستورات را اجرا میکنند، بلکه میدانند چگونه و چه زمانی سوال بپرسند، دیگر دور از دسترس نیست.
“`