در سالهای اخیر، شبکههای عصبی عمیق به یکی از تأثیرگذارترین فناوریها در حوزه هوش مصنوعی تبدیل شدهاند و در زمینههای گوناگون از تشخیص تصویر و پردازش زبان طبیعی گرفته تا بازیهای رایانهای و خودروهای خودران، موفقیتهای چشمگیری به دست آوردهاند. یکی از ویژگیهای شگفتانگیز این مدلها، ظرفیت بالای یادگیری آنهاست؛ به گونهای که میتوانند دادههای آموزشی را با دقتی نزدیک به صد درصد بازآفرینی کنند. این پدیده که به «بیشبرازش» یا «برازش کامل» معروف است، در نگاه اول متناقض به نظر میرسد، زیرا در تئوریهای کلاسیک یادگیری ماشین، مدلهایی که دادههای آموزشی را کاملاً به خاطر میسپارند، معمولاً عملکرد ضعیفی در مواجهه با دادههای جدید دارند. با این حال، مشاهدات تجربی نشان داده است که بسیاری از این مدلهای بسیار بزرگ، نه تنها عملکرد ضعیفی ندارند، بلکه در بسیاری از موارد، تعمیمدهی فوقالعادهای از خود نشان میدهند. این تناقض آشکار، یکی از چالشبرانگیزترین پرسشهای پژوهش در حوزه یادگیری عمیق است.
پاسخ به این پرسش تا حد زیادی به الگوریتم بهینهسازی مورد استفاده برای آموزش مدل مربوط میشود. در سالهای اخیر، پژوهشگران دریافتهاند که روشهای بهینهسازی مبتنی بر گرادیان، مانند گرادیان کاهشی (Gradient Descent)، بهطور ناخودآگاه و ذاتی، مدلهایی با ویژگیهای خاصی را ترجیح میدهند. به این پدیده، «منظمسازی ضمنی» (Implicit Regularization) گفته میشود. به عبارت دیگر، حتی وقتی ما هیچ محدودیت یا جریمهای برای پیچیدگی مدل در نظر نمیگیریم، خود الگوریتم بهینهسازی، مسیر خود را به سمتی هدایت میکند که جوابهای نهایی دارای ویژگیهای مطلوبی مانند کوچک بودن نُرم وزنها یا داشتن حاشیهٔ امنیت بالا باشند. درک این منظمسازی ضمنی، کلید فهمیدن این موضوع است که چرا شبکههای عصبی عمیق با وجود تعداد بسیار زیاد پارامترها، همچنان میتوانند به خوبی تعمیم دهند.
برای سالها، بیشتر پژوهشها در زمینه منظمسازی ضمنی بر روی سادهترین حالت ممکن، یعنی مدلهای خطی متمرکز بود. در این مدلها، بهخوبی شناخته شده است که گرادیان کاهشی، در مسائل رگرسیون با تابع هزینهٔ مربعی، به سمت جوابی با کمترین نُرم اقلیدسی (ℓ₂) همگرا میشود و در مسائل طبقهبندی با تابع هزینهٔ لوجستیک، جهت وزنها به سمتی میرود که حاشیهٔ اقلیدسی را بیشینه کند (یعنی همان جواب ماشین بردار پشتیبان با هستهٔ خطی). با وجود این موفقیتها، همیشه این سؤال مطرح بود که آیا میتوان این منظمسازی ضمنی را به هندسههای دیگر تعمیم داد؟ مثلاً آیا میتوانیم الگوریتمی طراحی کنیم که بهطور ضمنی، مدلهایی با نُرم ℓ₁ (که منجر به پراکندگی یا اسپارسیتی میشود) یا نُرم ℓ∞ را ترجیح دهد؟ پاسخ به این سؤال، علاوه بر جنبهٔ نظری، کاربردهای عملی فراوانی دارد، زیرا هر نوع نُرم، ویژگی خاصی را به مدل تحمیل میکند که میتواند برای دادهها و مسائل خاص بسیار مفید باشد.
پاسخ به این پرسش، در قلب پژوهش حاضر قرار دارد. این پایاننامه با ارائهٔ رویکردی یکپارچه بر پایهٔ الگوریتم «میرور دسنت» (Mirror Descent) نشان میدهد که چگونه میتوان منظمسازی ضمنی را برای طیف وسیعی از هندسهها کنترل کرد. میرور دسنت، تعمیمی از گرادیان کاهشی است که در آن، بهجای حرکت مستقیم در جهت منفی گرادیان در فضای پارامترها، ابتدا پارامترها را به یک فضای دوگانه (که توسط یک تابع پتانسیل تعریف میشود) نگاشت میکنیم، در آن فضا حرکت میکنیم و سپس به فضای اصلی بازمیگردیم. انتخاب تابع پتانسیل، همانند انتخاب یک «آینه» عمل میکند و تعیین میکند که الگوریتم از چه هندسهای برای اندازهگیری فاصله و حرکت استفاده کند. این انعطافپذیری، کلید کنترل منظمسازی ضمنی است؛ زیرا نشان داده شده که انتخاب پتانسیل بهطور مستقیم بر نوع نُرمی که الگوریتم بهطور ضمنی بهینه میکند، تأثیر میگذارد.
نوآوری اصلی این پژوهش در دو جنبهٔ اساسی خلاصه میشود. نخست اینکه، برای اولین بار، منظمسازی ضمنی میرور دسنت در مسائل طبقهبندی با توابع هزینهٔ بهشدت کاهشیابنده (مانند تابع نمایی و لوجستیک) بهطور کامل تحلیل و اثبات شده است. پیش از این، میدانستیم که میرور دسنت در مسائل رگرسیون (با تابع مربعی) به سمت کمینهکنندهٔ تابع پتانسیل همگرا میشود، اما در مورد مسائل طبقهبندی، این موضوع یک سؤال باز بود. پژوهشگران با در نظر گرفتن دستهای از توابع پتانسیل به نام «همگن» (Homogeneous)، نشان دادند که جهت وزنهای تولید شده توسط میرور دسنت، در نهایت به سمت «حاشیهٔ بیشینهٔ تعمیمیافته» همگرا میشود. یعنی اگر تابع پتانسیل به گونهای باشد که نُرم ℓₚ را القا کند، الگوریتم به سمت طبقهبندیکنندهای با بیشینهٔ حاشیهٔ ℓₚ حرکت میکند. این نتیجه، بسیار کلیتر از نتایج پیشین است و نشان میدهد که میرور دسنت، یک چارچوب واحد برای کنترل منظمسازی ضمنی در هر دو دستهٔ مهم مسائل یادگیری (رگرسیون و طبقهبندی) فراهم میکند.
دومین جنبهٔ نوآورانه، بررسی سرعت همگرایی و ارائهٔ راهکارهایی برای افزایش آن است. یکی از چالشهای همیشگی الگوریتمهای مبتنی بر نُرمهای غیراقلیدسی، سرعت پایین همگرایی آنهاست. پژوهشگران نشان دادند که در حالت استفاده از گامهای ثابت (یعنی نرخ یادگیری ثابت)، میرور دسنت با نرخی فوقالعاده آهسته، یعنی به صورت چندلگاریتمی (Polylogarithmic)، به جواب نهایی همگرا میشود. برای رفع این مشکل، نسخهٔ «نرمالشده»ٔ الگوریتم معرفی شد که در آن، اندازهٔ گامها بهصورت تطبیقی و متناسب با نُرم گرادیان تنظیم میشود. این نسخهٔ بهبودیافته، نه تنها همگرایی را به میزان قابلتوجهی شتاب میبخشد (به صورت چندجملهای)، بلکه در عمل نیز پیادهسازی سادهای دارد و میتواند با هزینهٔ محاسباتی اندکی نسبت به گرادیان کاهشی استاندارد، به نتایج بسیار بهتری دست یابد. این دستاورد، جنبهٔ عملی میرور دسنت را به شدت تقویت میکند و آن را به ابزاری کارآمد برای مسائل واقعی تبدیل مینماید.
برای تأیید یافتههای نظری، مجموعهٔ وسیعی از آزمایشها بر روی دادههای مصنوعی و واقعی انجام شده است. در آزمایشهای خطی، با انتخاب توابع پتانسیل مختلف (مربوط به نُرمهای ℓ₁.₁، ℓ₂، ℓ₃ و ℓ₁₀)، مشاهده شد که الگوریتم دقیقاً به سمت طبقهبندیکنندهای با کمترین نُرم متناظر همگرا میشود و این همگرایی، با پیشبینیهای نظری مطابقت کامل دارد. در مرحلهٔ بعد، الگوریتم بر روی مجموعه دادهٔ MNIST و با استفاده از شبکههای عصبی ساده (پرسپترون چندلایه و شبکهٔ کانولوشنی) پیادهسازی شد. نتایج نشان داد که نسخهٔ نرمالشدهٔ میرور دسنت، علاوه بر سرعت همگرایی بالاتر، به دقت تستی بهتری نیز دست مییابد که حاکی از تعمیمدهی بهتر آن است.
گستردهترین آزمایشها، بر روی مجموعه دادهٔ استاندارد CIFAR-10 و با استفاده از معماریهای عمیق و شناختهشدهای مانند ResNet، VGG، MobileNet و RegNet انجام شد. در این آزمایشها، شبکهها با استفاده از میرور دسنت با مقادیر مختلف p (از ۱.۱ تا ۱۰) آموزش داده شدند. یکی از مشاهدات جالب، تأثیر مستقیم انتخاب p بر روی توزیع وزنهای شبکه بود. برای pهای کوچک (نزدیک به ۱)، توزیع وزنها پراکندهتر بود و تعداد بیشتری از وزنها حول صفر متمرکز شده بودند (ویژگی اسپارسیتی)، در حالی که برای pهای بزرگ، بیشینهٔ وزنها کوچکتر میشد. این مشاهدات، بهوضوح نشان میدهند که منظمسازی ضمنی میرور دسنت، حتی در شبکههای عصبی عمیق و غیرخطی نیز ساختار وزنها را تحت تأثیر قرار میدهد. از نظر عملکرد تعمیمدهی، بهطور شگفتانگیزی، در اکثر معماریها، مقدار p=۳ بهترین دقت تستی را به همراه داشت و در برخی موارد مانند MobileNet و RegNet، بیش از ۱٪ بهبود نسبت به حالت استاندارد (p=۲ یا همان گرادیان کاهشی) نشان داد. این یافته، برخلاف انتظار اولیه بود که شاید اسپارسیتی بیشتر (p نزدیک به ۱) تعمیم بهتری ایجاد کند، و نشان میدهد که رابطهٔ بین نوع نُرم و تعمیمدهی، پیچیدهتر از تصورات اولیه است و نیازمند پژوهشهای بیشتر است.
در مجموع، این پژوهش با ارائهٔ یک چارچوب نظری منسجم و تأیید تجربی آن، گام مهمی در جهت درک و کنترل منظمسازی ضمنی در الگوریتمهای بهینهسازی برداشته است. دستاورد اصلی، نشان دادن این موضوع است که میرور دسنت با توابع پتانسیل همگن، اولین الگوریتمی است که بهطور همزمان در مسائل رگرسیون و طبقهبندی، برای هندسههای متنوع، منظمسازی ضمنی قابلکنترلی ارائه میدهد. این ویژگی، میرور دسنت را به ابزاری قدرتمند و همهکاره برای پژوهشگران و مهندسان یادگیری ماشین تبدیل میکند که میخواهند بهطور هدفمند، ویژگیهای مطلوب را به مدلهای خود تزریق کنند. همچنین، معرفی نسخهٔ نرمالشده با همگرایی سریع، بر عملیاتیبودن این روش افزوده و راه را برای استفادهٔ گستردهتر از آن در مسائل بزرگمقیاس هموار میسازد. این پژوهش، چشماندازهای جدیدی را برای تحقیقات آتی میگشاید، از جمله مطالعهٔ تأثیر انتخاب پتانسیل بر تعمیمدهی در شرایط مختلف، و تعمیم این ایده به الگوریتمهای پیشرفتهتر مانند Adam و RMSprop که در عمل بسیار پرکاربرد هستند.
| عنوان | شماره صفحه |
|---|---|
| چکیده | ۳ |
| پیشگفتار و قدردانی | ۵ |
| فصل ۱: مقدمه | ۱۷ |
| ۱-۱ انگیزه | ۱۷ |
| ۱-۲ پیشینه | ۱۸ |
| ۱-۳ مشارکتهای علمی | ۲۰ |
| ۱-۴ پژوهشهای مرتبط | ۲۱ |
| فصل ۲: مفاهیم پایه و پیشنیازها | ۲۳ |
| ۲-۱ بهینهسازی محدب و گرادیان کاهشی | ۲۳ |
| ۲-۲ تنظیمات مسئله | ۲۴ |
| ۲-۳ مبانی میرور دسنت | ۲۶ |
| ۲-۴ مبانی منظمسازی ضمنی | ۲۷ |
| فصل ۳: میرور دسنت با پتانسیل همگن | ۳۱ |
| ۳-۱ نتایج اصلی نظری | ۳۳ |
| ۳-۲ نرخ همگرایی مجانبی | ۳۶ |
| ۳-۳ همگرایی شتابیافته با گامهای متغیر | ۳۷ |
| فصل ۴: آزمایشها | ۴۱ |
| ۴-۱ طبقهبندی خطی | ۴۱ |
| ۴-۲ آزمایشهای میرور دسنت نرمالشده | ۴۳ |
| ۴-۳ شبکههای عصبی عمیق | ۴۴ |
| فصل ۵: نتیجهگیری و کارهای آینده | ۴۷ |
| ضمیمهها (پیوستها) | |
| ضمیمه A: اثباتهای فصل ۲ | ۵۳ |
| ضمیمه B: ویژگیهای توابع پتانسیل تحت فرض ۱ | ۵۷ |
| ضمیمه C: بحث در مورد اندازه گامها | ۶۱ |
| ضمیمه D: اثباتهای بخش ۱-۳ | ۶۵ |
| ضمیمه E: اثباتهای بخش ۲-۳ | ۷۳ |
| ضمیمه F: اثباتهای بخش ۳-۳ | ۷۷ |
| ضمیمه G: کاربرد عملی p-GD | ۸۵ |
| ضمیمه H: جزئیات تجربی | ۸۷ |
| ضمیمه I: نتایج تجربی تکمیلی | ۹۱ |
| منابع | ۴۹ |
آیا میتوانیم به الگوریتمهای یادگیری ماشین یاد بدهیم که «هندسه» را ببینند؟
تا به حال به این فکر کردهاید که چرا یک شبکه عصبی عمیق با میلیونها پارامتر، با وجود اینکه میتواند دادههای آموزشی را کلمهبهکلمه حفظ کند، همچنان روی دادههای جدید عملکرد خوبی دارد؟ راز این موفقیت در «منظمسازی ضمنی» نهفته است؛ پدیدهای که در آن خودِ روش بهینهسازی، بدون دخالت ما، مدلهایی با ویژگیهای خاص را ترجیح میدهد. اما سؤال اینجاست: آیا میتوانیم به این الگوریتمها بگوییم که کدام ویژگی را ترجیح دهند؟ پژوهش اخیر پاسخ مثبتی به این سؤال داده و نشان داده که چگونه با استفاده از «میرور دسنت» میتوان منظمسازی ضمنی را برای هر نوع هندسهای که بخواهیم، کنترل کرد.
🔍 فراتر از قضیه فیثاغورس: وقتی فاصلهها فرق میکنند
در دنیای یادگیری ماشین، بیشتر الگوریتمها بر اساس «فاصلهٔ اقلیدسی» کار میکنند؛ یعنی همان فاصلهای که در هندسهٔ دبیرستانی با آن آشنا هستیم. اما آیا همیشه بهترین گزینه است؟ خیر! گاهی اوقات، استفاده از نُرمهای دیگر مثل ℓ₁ باعث میشود مدل پراکندهتر (اسپارس) شود و گاهی نُرم ℓ∞ وزنهای کوچکتری تولید میکند. پژوهشگران در این مطالعه نشان دادهاند که میرور دسنت، با انتخاب یک تابع پتانسیل مناسب، میتواند بهجای فاصلهٔ معمولی، از هر نوع فاصلهای که ما تعیین کنیم، برای بهینهسازی استفاده کند و در نتیجه، منظمسازی ضمنی را به سمتی که میخواهیم هدایت کند.
⚡ سرعت یا دقت؟ چرا نه هر دو!
یکی از چالشهای همیشگی روشهای غیراقلیدسی، سرعت پایین همگرایی آنهاست. این پژوهش نشان داده که اگر از گامهای ثابت استفاده کنیم، میرور دسنت با نرخی بسیار آهسته (چندلگاریتمی) به جواب میرسد. اما با ارائهٔ نسخهٔ «نرمالشده» که گامها را بهصورت تطبیقی تنظیم میکند، همگرایی بهطور چشمگیری شتاب میگیرد و به صورت چندجملهای میشود. به بیان دیگر، این روش نه تنها به جواب بهتری میرسد، بلکه سریعتر هم به آن میرسد؛ چیزی که در دنیای واقعی که زمان و منابع محدود است، یک مزیت بزرگ محسوب میشود.
🧪 از کاغذ تا واقعیت: آزمایش روی شبکههای عمیق
نکتهٔ شگفتانگیز این است که این تئوریها فقط روی کاغذ باقی نماندهاند. پژوهشگران میرور دسنت را روی شبکههای عصبی عمیق و واقعی مانند ResNet، VGG و MobileNet و روی مجموعهدادههای استانداردی مانند CIFAR-10 و ImageNet پیادهسازی کردند. نتیجه؟ انتخاب نُرم ℓ₃، در بسیاری از معماریها عملکرد بهتری نسبت به حالت استاندارد (ℓ₂) داشت؛ گاهی بیش از ۱٪ بهبود در دقت! همچنین مشاهده کردند که توزیع وزنهای شبکه با تغییر نُرم، کاملاً تغییر میکند و هر نُرم، ساختار متفاوتی را به مدل تحمیل میکند. این نشان میدهد که منظمسازی ضمنی، یک مفهوم انتزاعی نیست، بلکه تأثیری ملموس و قابلاندازهگیری بر روی مدلهای واقعی دارد.
💡 چرا باید به این موضوع اهمیت دهیم؟
توانایی کنترل منظمسازی ضمنی، مانند داشتن یک «فرمان هدایت» برای الگوریتمهای بهینهسازی است. دیگر مجبور نیستیم بهطور تصادفی امیدوار باشیم که الگوریتم، مدل خوبی پیدا کند؛ بلکه میتوانیم با انتخاب هوشمندانهٔ تابع پتانسیل، ویژگیهای مطلوب (مثل پراکندگی، کوچکی وزنها، یا حاشیهٔ امنیت بالا) را بهصورت هدفمند به مدل تزریق کنیم. این پژوهش، در واقع یک قدم بزرگ به سمت «مهندسی» کردن فرآیند یادگیری است، نه اینکه صرفاً آن را بهعنوان یک جعبهسیاه بپذیریم. همانطور که یکی از نویسندگان اشاره میکند: «میرور دسنت، اولین الگوریتمی است که هم در رگرسیون و هم در طبقهبندی، برای هندسههای مختلف، منظمسازی ضمنی قابلکنترلی ارائه میدهد.» این یعنی ما اکنون ابزاری داریم که میتواند در هر دو دستهٔ اصلی مسائل یادگیری ماشین (پیشبینی عددی و طبقهبندی) به کار رود و انعطافپذیری بینظیری را فراهم آورد.