در سال‌های اخیر، هوش مصنوعی و به‌ویژه مدل‌های زبانی بزرگ، تحولی شگرف در بسیاری از حوزه‌ها ایجاد کرده‌اند. یکی از جذاب‌ترین و در عین حال چالش‌برانگیزترین کاربردهای این فناوری، ورود به دنیای رباتیک و توانمندسازی ربات‌ها برای درک و اجرای دستورات طبیعی انسان است. با این حال، یک مانع بزرگ بر سر راه این همکاری وجود دارد: ربات‌ها معمولاً برای هر کار جدید نیاز به آموزش مجدد و گسترده دارند و نمی‌توانند مانند انسان، از تجربیات گذشته خود برای رویارویی با موقعیت‌های تازه بهره ببرند. این پایان‌نامه به همین مسئله اساسی پاسخ می‌دهد و چارچوبی نوین برای «یادگیری مادام‌العمر» در ربات‌های دستکاری‌گر ارائه می‌کند؛ رویکردی که به ربات اجازه می‌دهد در طول زمان، مهارت‌های خود را به‌طور پیوسته افزایش دهد و در کارهای بعدی از آنها استفاده کند.

ایده اصلی این پژوهش، استفاده از مدل‌های زبانی بزرگ به عنوان «مغز» برنامه‌ریز ربات است. این مدل‌ها که با انبوهی از متون بشری آموزش دیده‌اند، درک عمیقی از مفاهیم، اشیا و توالی اقدامات دارند. در این سامانه، کاربر به زبان طبیعی به ربات می‌گوید که چه کاری انجام دهد؛ مثلاً «لطفاً ظرف‌های کثیف را در ماشین ظرفشویی بچین». مدل زبانی این درخواست را به چند گام ساده‌تر تجزیه می‌کند؛ مانند «ظرف را بردار»، «ماشین را باز کن»، «ظرف را داخل بگذار». اما تفاوت اساسی این سامانه با نمونه‌های قبلی در این است که اگر مدل متوجه شود برای انجام یکی از این گام‌ها، مهارت مناسبی در اختیار ندارد، می‌تواند از کاربر درخواست کمک کند و از او بخواهد که آن حرکت خاص را نشان دهد.

این فرایند درخواست و نمایش مهارت، هسته اصلی یادگیری مادام‌العمر را شکل می‌دهد. وقتی ربات متوجه می‌شود که مثلاً نمی‌تواند یک در کشویی را باز کند، از انسان می‌خواهد که این کار را یک بار به او نشان دهد. سپس با استفاده از روش‌های یادگیری تقلیدی و مدل‌های پیشرفته‌ای که مختص درک اشیا و روابط فضایی هستند، آن حرکت را فرا می‌گیرد و به‌عنوان یک مهارت جدید در کتابخانه خود ذخیره می‌کند. از آن پس، هر زمان که دوباره به چنین حرکتی نیاز پیدا کند، به‌جای درخواست دوباره، به‌سادگی از همان مهارت ذخیره‌شده استفاده می‌کند. به این ترتیب، ربات روزبه‌روز ماهرتر می‌شود، درست مانند یک انسان تازه‌کار که با تمرین و تکرار، کارهای روزمره را یاد می‌گیرد و هر بار سریع‌تر و بهتر انجامشان می‌دهد.

برای تبدیل این ایده به یک سامانه عملی، پژوهشی با نام «هالپ ۲.۰» طراحی و پیاده‌سازی شده است. این سامانه دارای معماری ماژولار است؛ یعنی هر بخش از آن، مانند شبیه‌ساز فیزیک، سیستم ادراک بصری، الگوریتم برنامه‌ریزی حرکت یا رابط با مدل زبانی، به‌گونه‌ای طراحی شده که بتوان آن را به‌راحتی با نسخه‌های دیگر جایگزین کرد. این ویژگی به پژوهشگران اجازه می‌دهد تا به‌سرعت تأثیر تغییرات مختلف را آزمایش کنند و بهترین ترکیب را بیابند. یکی از پیشرفت‌های مهم، جایگزینی شبیه‌ساز ساده قبلی با «آیزاک سیم» شرکت انویدیا است که تصاویر بسیار واقع‌گرایانه‌تری تولید می‌کند و عملکرد سیستم‌های ادراک بصری را بهبود می‌بخشد. همچنین از یک برنامه‌ریز حرکت بدون برخورد به نام «کیو-روبو» استفاده شده که مسیر حرکت ربات را با دقت بالا و بدون اصطکاک با اشیای اطراف محاسبه می‌کند.

یکی از نقاط قوت این سامانه، رابط کاربری وب‌محور آن است که به کاربران عادی اجازه می‌دهد به‌راحتی با ربات شبیه‌سازی‌شده تعامل کنند. این رابط، دستورهای متنی، بازخوردها و نمایش مهارت‌ها را به صورت فرم‌های ساده و راهنما در اختیار کاربر قرار می‌دهد و همزمان، تصویر زنده از محیط ربات را به نمایش می‌گذارد. برای انجام پژوهش در مقیاس بزرگ، این رابط به یک سرور مرکزی متصل است که چندین نمونه از سامانه را به‌طور همزمان مدیریت می‌کند و کاربران مختلف را به نمونه‌های آماده و از پیش بارگذاری‌شده اختصاص می‌دهد تا در زمان انتظار صرفه‌جویی شود. همچنین کلیه تعاملات و داده‌ها به صورت خودکار ضبط و ذخیره می‌شوند تا پژوهشگران بتوانند نتایج را بازبینی و تحلیل کنند.

برای ارزیابی عملکرد این رویکرد، مجموعه‌ای از آزمایش‌های گسترده طراحی شده است. نخست، محققان با استفاده از یک پلتفرم نظرسنجی آنلاین، از افراد عادی خواستند که تصاویری از محیط‌های واقعی مانند آشپزخانه، اتاق نشیمن یا اتاق لباس‌شویی ارسال کنند و برای هر تصویر، سه کار روزمره که دوست دارند ربات برایشان انجام دهد، پیشنهاد دهند. در نهایت، ۷۱ صحنه معتبر با ۲۱۳ کار گوناگون جمع‌آوری شد. سپس سامانه با مدل زبانی «جی‌پی‌تی-۴» این کارها را در دو مرحله اجرا کرد: یک بار با کتابخانه مهارت پایه و بار دیگر با مهارت‌هایی که خود در مرحله قبل یاد گرفته بود. نتایج نشان داد که مدل زبانی تا ۹۲ درصد مهارت‌های آموخته‌شده را در مرحله دوم به‌درستی به کار می‌گیرد و بیش از ۸۵ درصد کارها را بدون نیاز به مهارت جدید به پایان می‌رساند. همچنین مشاهده شد که با تنظیم دقیق دستورات متنی، می‌توان تعداد مهارت‌های زائد یا غیرضروری را به شدت کاهش داد و سامانه را کارآمدتر کرد.

با وجود این دستاوردها، پژوهش حاضر محدودیت‌ها و چالش‌هایی را نیز آشکار می‌کند. یکی از مهم‌ترین آنها، مسئله ارزیابی «درستی» برنامه‌های عملیاتی است؛ زیرا در بسیاری موارد، تشخیص اینکه یک توالی از اقدامات «درست» است یا نه، به شدت وابسته به بافت و حتی سلیقه شخصی است. همچنین بخش‌هایی مانند ادراک بصری و برنامه‌ریزی حرکت در محیط‌های شلوغ با اشیای بیشمار، هنوز با خطاهایی همراه است که می‌تواند کل زنجیره اقدامات را تحت تأثیر قرار دهد. به عنوان نمونه، برخی از اشیای شبیه‌سازی‌شده در مجموعه «شِیپ‌نت» آنقدر غیرواقعی طراحی شده‌اند که مدل‌های بینایی در تشخیص آنها دچار مشکل می‌شوند. با این حال، محققان تأکید می‌کنند که با بهبود تدریجی هر یک از این ماژول‌ها، سامانه می‌تواند روزبه‌روز قابل‌اعتمادتر شود.

در نهایت، این پایان‌نامه نشان می‌دهد که ترکیب مدل‌های زبانی بزرگ با یادگیری تقلیدی و ساختار ماژولار، مسیری بسیار امیدوارکننده برای ساخت ربات‌هایی با توانایی یادگیری مستمر است. تصور کنید رباتی که روز اول فقط می‌تواند یک شیء را بردارد و بگذارد، پس از یک هفته کار کردن در کنار شما، می‌تواند ماشین لباس‌شویی را راه بیندازد، ظرف‌ها را بشوید، قفسه‌ها را مرتب کند و حتی میز شام را بچیند. این دقیقاً همان افق روشنی است که این پژوهش به سوی آن گام برداشته است. با گسترش سامانه به محیط‌های واقعی و انجام آزمایش‌های بزرگ‌تر با کاربران بیشتر، می‌توان به آینده‌ای امید داشت که در آن ربات‌های خانگی نه فقط یک وسیله، بلکه دستیارانی هوشمند، آموزنده و همیشه در حال پیشرفت باشند.

شماره صفحه سرفصل
۱۳ ۱. مقدمه
۱۶ ۲. پیشینه پژوهش
۱۶ ۲.۱. مهارت‌های ابتدایی در رباتیک دستکاری
۱۷ ۲.۲. مدل‌های زبانی بزرگ برای برنامه‌ریزی بی‌نمونه (Zero-Shot)
۱۹ ۳. معماری سامانه هالپ ۲.۰
۲۰ ۳.۱. رباتیک دستکاری مبتنی بر مدل زبانی
۲۲ ۳.۱.۱. اتصال به موتور فیزیک
۲۴ ۳.۱.۲. ادراک صحنه و بخش‌بندی اشیا
۲۵ ۳.۱.۳. توصیف صحنه به زبان طبیعی
۲۵ ۳.۱.۴. ارتباط با مدل زبانی بزرگ
۲۶ ۳.۱.۵. کلاس‌های مهارت
۲۸ ۳.۱.۶. ذخیره‌سازی نمایش‌ها
۲۸ ۳.۱.۷. ضبط تعاملات برای تحلیل بعدی
۳۰ ۳.۱.۸. خط‌لوله کلی سامانه
۳۱ ۳.۲. رابط کاربری تعاملی مبتنی بر وب
۳۲ ۳.۲.۱. طراحی رابط کاربری
۳۵ ۳.۲.۲. رابط نمایش مهارت
۳۶ ۳.۲.۳. پروتکل پیام بین هماهنگ‌کننده و سامانه ربات
۳۸ ۳.۲.۴. مدیریت هم‌روندی (Concurrency)
۴۰ ۴. ارزیابی ماژول‌های سامانه
۴۰ ۴.۱. عملکرد بخش‌بندی معنایی (Semantic Segmentation)
۴۳ ۴.۲. برنامه‌ریزی حرکت بدون برخورد
۴۴ ۴.۳. مدل‌های زبانی بزرگ به‌عنوان یادگیرنده‌های مادام‌العمر
۴۵ ۴.۳.۱. طراحی آزمایش
۴۷ ۴.۳.۲. معیارهای سنجش عملکرد یادگیری مادام‌العمر
۴۹ ۴.۳.۳. توصیف رفتار مدل زبانی بزرگ
۵۳ ۵. محدودیت‌ها و کارهای آینده
۵۳ ۵.۱. ارزیابی درستی مهارت‌ها و برنامه‌ها
۵۴ ۵.۲. بسط اجزای سامانه
۵۵ ۵.۳. مطالعه‌های بزرگ‌مقیاس‌تر
۵۶ ۶. نتیجه‌گیری
۵۷ ضمیمه الف. نظرسنجی جمع‌سپاری صحنه‌ها و کارها
۵۷ الف.۱. محتوای نظرسنجی
۵۹ الف.۲. ویژگی‌های صحنه‌ها
۶۰ ضمیمه ب. مدل‌های زبانی بزرگ در توالی‌های طولانی کارها
۶۷ منابع

آیا ربات‌ها روزی مانند انسان یاد می‌گیرند؟ سفری به دنیای یادگیری مادام‌العمر در هوش مصنوعی

تا حالا شده از یک دستیار صوتی بخواهید کاری برایتان انجام دهد و بعد از چند بار تکرار، همچنان جواب اشتباهی بگیرید؟ یا اینکه رباتی را دیده‌اید که در یک محیط خاص عالی کار می‌کند، اما به محض ورود به یک آشپزخانه جدید، کاملاً سردرگم می‌شود؟ مشکل اصلی این است که بیشتر سیستم‌های هوشمند امروزی، «از صفر» یاد می‌گیرند و هر بار که با موقعیتی تازه روبرو می‌شوند، همه چیز را فراموش می‌کنند. اما اگر ربات‌ها می‌توانستند مثل ما انسان‌ها، مهارت‌های جدید را به خاطر بسپارند و در موقعیت‌های مختلف به کار بگیرند، دنیا چقدر متفاوت می‌شد؟

🔍 معمای یادگیری مستمر: چرا ربات‌ها از تجربه خود درس نمی‌گیرند؟

تصور کنید یک ربات برای اولین بار به شما کمک می‌کند تا یک فنجان را بردارید. روز بعد، از او می‌خواهید همان کار را با یک لیوان انجام دهد، اما او دوباره از اول یاد می‌گیرد که چگونه یک شیء را بگیرد! این یعنی هر بار که شیء تغییر می‌کند، ربات باید کل فرایند را از نو طی کند. این رویکرد نه‌تنها وقت‌گیر است، بلکه باعث می‌شود ربات‌ها هرگز نتوانند واقعاً «ماهر» شوند. پژوهشگران به این مشکل «یادگیری از صفر» می‌گویند و سال‌هاست به دنبال راهی برای شکستن این چرخه هستند.

اما یک سوال اساسی وجود دارد: آیا یک ربات می‌تواند مانند یک انسان، مهارت‌های قبلی خود را با مهارت‌های جدید ترکیب کند و به مرور زمان به یک دستیار کاربلد تبدیل شود؟ پاسخ در مفهوم «یادگیری مادام‌العمر» نهفته است؛ ایده‌ای که در این پژوهش به آن پرداخته شده و نتایج آن شگفت‌انگیز است.

💡 راه‌حل پیشنهادی: وقتی مدل‌های زبانی نقش مغز ربات را بازی می‌کنند

در این پژوهش، به جای اینکه به ربات بگوییم دقیقاً چه حرکتی انجام دهد، از یک مدل زبانی بزرگ مانند GPT-4 استفاده شده تا خودش بفهمد که برای انجام یک کار، چه مهارت‌هایی نیاز دارد. سپس اگر مهارتی را نداشت، از انسان می‌خواهد که آن را به او نشان دهد. این یعنی ربات نه‌تنها دستورات را اجرا می‌کند، بلکه «نقص» خود را تشخیص می‌دهد و درخواست آموزش می‌کند. این رویکرد کاملاً شبیه به رفتار یک انسان تازه‌کار است که از استاد خود سوال می‌پرسد.

نتیجه این می‌شود که با گذشت زمان، ربات یک کتابخانه غنی از مهارت‌ها ایجاد می‌کند و هر بار که با کار مشابهی روبرو می‌شود، به جای درخواست دوباره، از همان مهارت استفاده می‌کند. آزمایش‌ها نشان داده که در بیش از ۸۵٪ موارد، ربات مهارت‌های قبلی را به درستی به کار می‌گیرد و این یعنی قدمی بزرگ به سمت ربات‌هایی که واقعاً مستقل یاد می‌گیرند.

«مدل‌های زبانی بزرگ نه‌تنها می‌توانند برنامه‌ریزی کنند، بلکه قادرند از اشتباهات خود بیاموزند و مهارت‌های جدید را در بافت‌های تازه به کار گیرند. این ویژگی، آنها را به نامزدهای ایده‌آلی برای یادگیری مادام‌العمر تبدیل می‌کند.» — برگرفته از این پایان‌نامه

🛠️ یک سامانه کاربردی برای آزمایش این ایده

برای عملی کردن این رویکرد، یک سامانه کامل به نام «هالپ ۲.۰» طراحی شده است که از بخش‌های مختلفی مانند شبیه‌ساز فیزیک، سیستم بینایی کامپیوتر، و رابط کاربری وب‌محور تشکیل شده است. جالب‌ترین بخش این سامانه، رابط کاربری آن است که به افراد غیرمتخصص اجازه می‌دهد به‌راحتی با ربات ارتباط برقرار کنند و مهارت‌های جدید را به آن بیاموزند. این رابط، یک صفحه وب ساده است که کاربر می‌تواند از طریق آن به ربات دستور بدهد یا حرکت مورد نظر را به آن نشان دهد.

یکی از نکات جذاب این سامانه، قابلیت ضبط و بازپخش تمام تعاملات است. این یعنی پژوهشگران می‌توانند دقیقاً ببینند که ربات چگونه تصمیم گرفته، چه مهارت‌هایی را یاد گرفته و چگونه از آنها استفاده کرده است. این ویژگی، مطالعه و بهبود سیستم را بسیار آسان می‌کند.

📊 نتایج شگفت‌انگیز: ربات‌ها چقدر خوب یاد می‌گیرند؟

برای ارزیابی، پژوهشگران از ۷۱ صحنه مختلف در محیط‌های واقعی مانند آشپزخانه، اتاق نشیمن و لباس‌شویی استفاده کردند و ۲۱۳ کار روزمره را به ربات سپردند. نتایج نشان داد که ربات در بیش از ۹۰٪ موارد، مهارت‌های مفید و غیرتکراری را یاد می‌گیرد. همچنین در آزمایش‌های طولانی‌مدت، مشاهده شد که ربات با افزایش تعداد مهارت‌ها، کمتر و کمتر نیاز به یادگیری مهارت جدید پیدا می‌کند، درست مانند یک انسان که با تجربه‌تر شدن، سریع‌تر و بهتر کارها را انجام می‌دهد.

با این حال، همه چیز عالی نبود! گاهی ربات مهارت‌هایی را یاد می‌گرفت که کاملاً زائد بودند، مثلاً به جای «برداشتن» ساده، مهارت «برداشتن چاقو» را جداگانه یاد می‌گرفت. این رفتار نشان می‌دهد که مدل زبانی گاهی بیش از حد محتاط یا دقیق عمل می‌کند و نیاز به تنظیم دستورات اولیه دارد. پژوهشگران با بهینه‌سازی دستورات، توانستند این مشکل را تا حد زیادی برطرف کنند.

«زمانی که از مدل زبانی خواسته شد از یادگیری مهارت‌های غیرضروری خودداری کند، تعداد مهارت‌های زائد به طور چشمگیری کاهش یافت و کارایی سیستم به شدت افزایش پیدا کرد.» — برگرفته از این پایان‌نامه

🌍 چرا این پژوهش برای آینده ما مهم است؟

اگر این فناوری به بلوغ برسد، می‌تواند دنیای ربات‌های خانگی و صنعتی را متحول کند. تصور کنید رباتی که روز اول فقط می‌تواند یک لیوان را بردارد، پس از یک هفته، تمام کارهای آشپزخانه را بلد باشد و حتی بتواند محیط‌های جدید را بدون نیاز به برنامه‌ریزی مجدد مدیریت کند. این یعنی دیگر نیازی به خرید ربات‌های تخصصی برای هر کار نیست؛ یک ربات عمومی با توانایی یادگیری مداوم، می‌تواند جایگزین ده‌ها دستگاه مختلف شود.

علاوه بر این، این رویکرد می‌تواند به افراد مسن یا کم‌توان کمک کند تا استقلال بیشتری در زندگی روزمره داشته باشند. رباتی که با گذشت زمان، عادات و نیازهای فرد را یاد می‌گیرد، می‌تواند به مرور به یک همراه و دستیار واقعاً مفید تبدیل شود. این دقیقاً همان دیدگاه بلندمدتی است که پژوهشگران این پروژه دنبال می‌کنند.

🔮 چالش‌ها و افق‌های پیش رو

البته مسیر هموار نیست. یکی از بزرگترین چالش‌ها، ارزیابی «درستی» مهارت‌های یادگرفته‌شده است. گاهی تشخیص اینکه یک مهارت واقعاً مفید است یا نه، به شدت وابسته به بافت و سلیقه شخصی است. همچنین برخی از ماژول‌های سامانه، مانند بخش ادراک بصری، هنوز در محیط‌های شلوغ با خطاهایی همراه هستند که می‌تواند برنامه را مختل کند. با این حال، پژوهشگران معتقدند که با بهبود تدریجی هر یک از این بخش‌ها و انجام آزمایش‌های بزرگ‌تر، می‌توان بر این محدودیت‌ها غلبه کرد.

در آینده، این سامانه می‌تواند به پلتفرمی برای جمع‌آوری داده‌های عظیم از تعامل انسان و ربات تبدیل شود و به پژوهشگران کمک کند تا الگوریتم‌های یادگیری ماشین را برای کاربردهای واقعی بهبود بخشند. همچنین امکان ترکیب این روش با مدل‌های جدیدتر و قدرتمندتر، نویدبخش دستیابی به ربات‌هایی است که نه تنها مهارت‌ها را یاد می‌گیرند، بلکه خودشان خلاقانه از آنها استفاده می‌کنند.

بسیار سریع و ساده می توانید اصل این پایان نامه را به صورت فایل PDF در اختیار داشته باشید.

پس از دریافت پایان‌نامه، کلیه اطلاعات کتاب‌شناختی موردنیاز برای استناد علمی، از جمله نام دانشگاه، عنوان پایان‌نامه، نام پژوهشگر، سال دفاع و سایر مشخصات مرتبط، جهت ارجاع‌دهی صحیح مطابق با استانداردهای رایج، در اختیار شما قرار خواهد گرفت.