در سال‌های اخیر، شبکه‌های عصبی عمیق به یکی از تأثیرگذارترین فناوری‌ها در حوزه هوش مصنوعی تبدیل شده‌اند و در زمینه‌های گوناگون از تشخیص تصویر و پردازش زبان طبیعی گرفته تا بازی‌های رایانه‌ای و خودروهای خودران، موفقیت‌های چشمگیری به دست آورده‌اند. یکی از ویژگی‌های شگفت‌انگیز این مدل‌ها، ظرفیت بالای یادگیری آن‌هاست؛ به گونه‌ای که می‌توانند داده‌های آموزشی را با دقتی نزدیک به صد درصد بازآفرینی کنند. این پدیده که به «بیش‌برازش» یا «برازش کامل» معروف است، در نگاه اول متناقض به نظر می‌رسد، زیرا در تئوری‌های کلاسیک یادگیری ماشین، مدل‌هایی که داده‌های آموزشی را کاملاً به خاطر می‌سپارند، معمولاً عملکرد ضعیفی در مواجهه با داده‌های جدید دارند. با این حال، مشاهدات تجربی نشان داده است که بسیاری از این مدل‌های بسیار بزرگ، نه تنها عملکرد ضعیفی ندارند، بلکه در بسیاری از موارد، تعمیم‌دهی فوق‌العاده‌ای از خود نشان می‌دهند. این تناقض آشکار، یکی از چالش‌برانگیزترین پرسش‌های پژوهش در حوزه یادگیری عمیق است.

پاسخ به این پرسش تا حد زیادی به الگوریتم بهینه‌سازی مورد استفاده برای آموزش مدل مربوط می‌شود. در سال‌های اخیر، پژوهشگران دریافته‌اند که روش‌های بهینه‌سازی مبتنی بر گرادیان، مانند گرادیان کاهشی (Gradient Descent)، به‌طور ناخودآگاه و ذاتی، مدل‌هایی با ویژگی‌های خاصی را ترجیح می‌دهند. به این پدیده، «منظم‌سازی ضمنی» (Implicit Regularization) گفته می‌شود. به عبارت دیگر، حتی وقتی ما هیچ محدودیت یا جریمه‌ای برای پیچیدگی مدل در نظر نمی‌گیریم، خود الگوریتم بهینه‌سازی، مسیر خود را به سمتی هدایت می‌کند که جواب‌های نهایی دارای ویژگی‌های مطلوبی مانند کوچک بودن نُرم وزن‌ها یا داشتن حاشیهٔ امنیت بالا باشند. درک این منظم‌سازی ضمنی، کلید فهمیدن این موضوع است که چرا شبکه‌های عصبی عمیق با وجود تعداد بسیار زیاد پارامترها، همچنان می‌توانند به خوبی تعمیم دهند.

برای سال‌ها، بیشتر پژوهش‌ها در زمینه منظم‌سازی ضمنی بر روی ساده‌ترین حالت ممکن، یعنی مدل‌های خطی متمرکز بود. در این مدل‌ها، به‌خوبی شناخته شده است که گرادیان کاهشی، در مسائل رگرسیون با تابع هزینهٔ مربعی، به سمت جوابی با کمترین نُرم اقلیدسی (ℓ₂) همگرا می‌شود و در مسائل طبقه‌بندی با تابع هزینهٔ لوجستیک، جهت وزن‌ها به سمتی می‌رود که حاشیهٔ اقلیدسی را بیشینه کند (یعنی همان جواب ماشین بردار پشتیبان با هستهٔ خطی). با وجود این موفقیت‌ها، همیشه این سؤال مطرح بود که آیا می‌توان این منظم‌سازی ضمنی را به هندسه‌های دیگر تعمیم داد؟ مثلاً آیا می‌توانیم الگوریتمی طراحی کنیم که به‌طور ضمنی، مدل‌هایی با نُرم ℓ₁ (که منجر به پراکندگی یا اسپارسیتی می‌شود) یا نُرم ℓ∞ را ترجیح دهد؟ پاسخ به این سؤال، علاوه بر جنبهٔ نظری، کاربردهای عملی فراوانی دارد، زیرا هر نوع نُرم، ویژگی خاصی را به مدل تحمیل می‌کند که می‌تواند برای داده‌ها و مسائل خاص بسیار مفید باشد.

پاسخ به این پرسش، در قلب پژوهش حاضر قرار دارد. این پایان‌نامه با ارائهٔ رویکردی یکپارچه بر پایهٔ الگوریتم «میرور دسنت» (Mirror Descent) نشان می‌دهد که چگونه می‌توان منظم‌سازی ضمنی را برای طیف وسیعی از هندسه‌ها کنترل کرد. میرور دسنت، تعمیمی از گرادیان کاهشی است که در آن، به‌جای حرکت مستقیم در جهت منفی گرادیان در فضای پارامترها، ابتدا پارامترها را به یک فضای دوگانه (که توسط یک تابع پتانسیل تعریف می‌شود) نگاشت می‌کنیم، در آن فضا حرکت می‌کنیم و سپس به فضای اصلی بازمی‌گردیم. انتخاب تابع پتانسیل، همانند انتخاب یک «آینه» عمل می‌کند و تعیین می‌کند که الگوریتم از چه هندسه‌ای برای اندازه‌گیری فاصله و حرکت استفاده کند. این انعطاف‌پذیری، کلید کنترل منظم‌سازی ضمنی است؛ زیرا نشان داده شده که انتخاب پتانسیل به‌طور مستقیم بر نوع نُرمی که الگوریتم به‌طور ضمنی بهینه می‌کند، تأثیر می‌گذارد.

نوآوری اصلی این پژوهش در دو جنبهٔ اساسی خلاصه می‌شود. نخست اینکه، برای اولین بار، منظم‌سازی ضمنی میرور دسنت در مسائل طبقه‌بندی با توابع هزینهٔ به‌شدت کاهش‌یابنده (مانند تابع نمایی و لوجستیک) به‌طور کامل تحلیل و اثبات شده است. پیش از این، می‌دانستیم که میرور دسنت در مسائل رگرسیون (با تابع مربعی) به سمت کمینه‌کنندهٔ تابع پتانسیل همگرا می‌شود، اما در مورد مسائل طبقه‌بندی، این موضوع یک سؤال باز بود. پژوهشگران با در نظر گرفتن دسته‌ای از توابع پتانسیل به نام «همگن» (Homogeneous)، نشان دادند که جهت وزن‌های تولید شده توسط میرور دسنت، در نهایت به سمت «حاشیهٔ بیشینهٔ تعمیم‌یافته» همگرا می‌شود. یعنی اگر تابع پتانسیل به گونه‌ای باشد که نُرم ℓₚ را القا کند، الگوریتم به سمت طبقه‌بندی‌کننده‌ای با بیشینهٔ حاشیهٔ ℓₚ حرکت می‌کند. این نتیجه، بسیار کلی‌تر از نتایج پیشین است و نشان می‌دهد که میرور دسنت، یک چارچوب واحد برای کنترل منظم‌سازی ضمنی در هر دو دستهٔ مهم مسائل یادگیری (رگرسیون و طبقه‌بندی) فراهم می‌کند.

دومین جنبهٔ نوآورانه، بررسی سرعت همگرایی و ارائهٔ راهکارهایی برای افزایش آن است. یکی از چالش‌های همیشگی الگوریتم‌های مبتنی بر نُرم‌های غیراقلیدسی، سرعت پایین همگرایی آن‌هاست. پژوهشگران نشان دادند که در حالت استفاده از گام‌های ثابت (یعنی نرخ یادگیری ثابت)، میرور دسنت با نرخی فوق‌العاده آهسته، یعنی به صورت چندلگاریتمی (Polylogarithmic)، به جواب نهایی همگرا می‌شود. برای رفع این مشکل، نسخهٔ «نرمال‌شده»ٔ الگوریتم معرفی شد که در آن، اندازهٔ گام‌ها به‌صورت تطبیقی و متناسب با نُرم گرادیان تنظیم می‌شود. این نسخهٔ بهبودیافته، نه تنها همگرایی را به میزان قابل‌توجهی شتاب می‌بخشد (به صورت چندجمله‌ای)، بلکه در عمل نیز پیاده‌سازی ساده‌ای دارد و می‌تواند با هزینهٔ محاسباتی اندکی نسبت به گرادیان کاهشی استاندارد، به نتایج بسیار بهتری دست یابد. این دستاورد، جنبهٔ عملی میرور دسنت را به شدت تقویت می‌کند و آن را به ابزاری کارآمد برای مسائل واقعی تبدیل می‌نماید.

برای تأیید یافته‌های نظری، مجموعهٔ وسیعی از آزمایش‌ها بر روی داده‌های مصنوعی و واقعی انجام شده است. در آزمایش‌های خطی، با انتخاب توابع پتانسیل مختلف (مربوط به نُرم‌های ℓ₁.₁، ℓ₂، ℓ₃ و ℓ₁₀)، مشاهده شد که الگوریتم دقیقاً به سمت طبقه‌بندی‌کننده‌ای با کمترین نُرم متناظر همگرا می‌شود و این همگرایی، با پیش‌بینی‌های نظری مطابقت کامل دارد. در مرحلهٔ بعد، الگوریتم بر روی مجموعه دادهٔ MNIST و با استفاده از شبکه‌های عصبی ساده (پرسپترون چندلایه و شبکهٔ کانولوشنی) پیاده‌سازی شد. نتایج نشان داد که نسخهٔ نرمال‌شدهٔ میرور دسنت، علاوه بر سرعت همگرایی بالاتر، به دقت تستی بهتری نیز دست می‌یابد که حاکی از تعمیم‌دهی بهتر آن است.

گسترده‌ترین آزمایش‌ها، بر روی مجموعه دادهٔ استاندارد CIFAR-10 و با استفاده از معماری‌های عمیق و شناخته‌شده‌ای مانند ResNet، VGG، MobileNet و RegNet انجام شد. در این آزمایش‌ها، شبکه‌ها با استفاده از میرور دسنت با مقادیر مختلف p (از ۱.۱ تا ۱۰) آموزش داده شدند. یکی از مشاهدات جالب، تأثیر مستقیم انتخاب p بر روی توزیع وزن‌های شبکه بود. برای pهای کوچک (نزدیک به ۱)، توزیع وزن‌ها پراکنده‌تر بود و تعداد بیشتری از وزن‌ها حول صفر متمرکز شده بودند (ویژگی اسپارسیتی)، در حالی که برای pهای بزرگ، بیشینهٔ وزن‌ها کوچک‌تر می‌شد. این مشاهدات، به‌وضوح نشان می‌دهند که منظم‌سازی ضمنی میرور دسنت، حتی در شبکه‌های عصبی عمیق و غیرخطی نیز ساختار وزن‌ها را تحت تأثیر قرار می‌دهد. از نظر عملکرد تعمیم‌دهی، به‌طور شگفت‌انگیزی، در اکثر معماری‌ها، مقدار p=۳ بهترین دقت تستی را به همراه داشت و در برخی موارد مانند MobileNet و RegNet، بیش از ۱٪ بهبود نسبت به حالت استاندارد (p=۲ یا همان گرادیان کاهشی) نشان داد. این یافته، برخلاف انتظار اولیه بود که شاید اسپارسیتی بیشتر (p نزدیک به ۱) تعمیم بهتری ایجاد کند، و نشان می‌دهد که رابطهٔ بین نوع نُرم و تعمیم‌دهی، پیچیده‌تر از تصورات اولیه است و نیازمند پژوهش‌های بیشتر است.

در مجموع، این پژوهش با ارائهٔ یک چارچوب نظری منسجم و تأیید تجربی آن، گام مهمی در جهت درک و کنترل منظم‌سازی ضمنی در الگوریتم‌های بهینه‌سازی برداشته است. دستاورد اصلی، نشان دادن این موضوع است که میرور دسنت با توابع پتانسیل همگن، اولین الگوریتمی است که به‌طور همزمان در مسائل رگرسیون و طبقه‌بندی، برای هندسه‌های متنوع، منظم‌سازی ضمنی قابل‌کنترلی ارائه می‌دهد. این ویژگی، میرور دسنت را به ابزاری قدرتمند و همه‌کاره برای پژوهشگران و مهندسان یادگیری ماشین تبدیل می‌کند که می‌خواهند به‌طور هدفمند، ویژگی‌های مطلوب را به مدل‌های خود تزریق کنند. همچنین، معرفی نسخهٔ نرمال‌شده با همگرایی سریع، بر عملیاتی‌بودن این روش افزوده و راه را برای استفادهٔ گسترده‌تر از آن در مسائل بزرگ‌مقیاس هموار می‌سازد. این پژوهش، چشم‌اندازهای جدیدی را برای تحقیقات آتی می‌گشاید، از جمله مطالعهٔ تأثیر انتخاب پتانسیل بر تعمیم‌دهی در شرایط مختلف، و تعمیم این ایده به الگوریتم‌های پیشرفته‌تر مانند Adam و RMSprop که در عمل بسیار پرکاربرد هستند.

عنوان شماره صفحه
چکیده ۳
پیشگفتار و قدردانی ۵
فصل ۱: مقدمه ۱۷
  ۱-۱ انگیزه ۱۷
  ۱-۲ پیشینه ۱۸
  ۱-۳ مشارکت‌های علمی ۲۰
  ۱-۴ پژوهش‌های مرتبط ۲۱
فصل ۲: مفاهیم پایه و پیش‌نیازها ۲۳
  ۲-۱ بهینه‌سازی محدب و گرادیان کاهشی ۲۳
  ۲-۲ تنظیمات مسئله ۲۴
  ۲-۳ مبانی میرور دسنت ۲۶
  ۲-۴ مبانی منظم‌سازی ضمنی ۲۷
فصل ۳: میرور دسنت با پتانسیل همگن ۳۱
  ۳-۱ نتایج اصلی نظری ۳۳
  ۳-۲ نرخ همگرایی مجانبی ۳۶
  ۳-۳ همگرایی شتاب‌یافته با گام‌های متغیر ۳۷
فصل ۴: آزمایش‌ها ۴۱
  ۴-۱ طبقه‌بندی خطی ۴۱
  ۴-۲ آزمایش‌های میرور دسنت نرمال‌شده ۴۳
  ۴-۳ شبکه‌های عصبی عمیق ۴۴
فصل ۵: نتیجه‌گیری و کارهای آینده ۴۷
ضمیمه‌ها (پیوست‌ها)
  ضمیمه A: اثبات‌های فصل ۲ ۵۳
  ضمیمه B: ویژگی‌های توابع پتانسیل تحت فرض ۱ ۵۷
  ضمیمه C: بحث در مورد اندازه گام‌ها ۶۱
  ضمیمه D: اثبات‌های بخش ۱-۳ ۶۵
  ضمیمه E: اثبات‌های بخش ۲-۳ ۷۳
  ضمیمه F: اثبات‌های بخش ۳-۳ ۷۷
  ضمیمه G: کاربرد عملی p-GD ۸۵
  ضمیمه H: جزئیات تجربی ۸۷
  ضمیمه I: نتایج تجربی تکمیلی ۹۱
منابع ۴۹

آیا میتوانیم به الگوریتمهای یادگیری ماشین یاد بدهیم که «هندسه» را ببینند؟

تا به حال به این فکر کردهاید که چرا یک شبکه عصبی عمیق با میلیونها پارامتر، با وجود اینکه میتواند دادههای آموزشی را کلمهبهکلمه حفظ کند، همچنان روی دادههای جدید عملکرد خوبی دارد؟ راز این موفقیت در «منظمسازی ضمنی» نهفته است؛ پدیدهای که در آن خودِ روش بهینهسازی، بدون دخالت ما، مدلهایی با ویژگیهای خاص را ترجیح میدهد. اما سؤال اینجاست: آیا میتوانیم به این الگوریتمها بگوییم که کدام ویژگی را ترجیح دهند؟ پژوهش اخیر پاسخ مثبتی به این سؤال داده و نشان داده که چگونه با استفاده از «میرور دسنت» میتوان منظمسازی ضمنی را برای هر نوع هندسهای که بخواهیم، کنترل کرد.

🔍 فراتر از قضیه فیثاغورس: وقتی فاصلهها فرق میکنند

در دنیای یادگیری ماشین، بیشتر الگوریتمها بر اساس «فاصلهٔ اقلیدسی» کار میکنند؛ یعنی همان فاصلهای که در هندسهٔ دبیرستانی با آن آشنا هستیم. اما آیا همیشه بهترین گزینه است؟ خیر! گاهی اوقات، استفاده از نُرمهای دیگر مثل ℓ₁ باعث میشود مدل پراکندهتر (اسپارس) شود و گاهی نُرم ℓ∞ وزنهای کوچکتری تولید میکند. پژوهشگران در این مطالعه نشان دادهاند که میرور دسنت، با انتخاب یک تابع پتانسیل مناسب، میتواند بهجای فاصلهٔ معمولی، از هر نوع فاصلهای که ما تعیین کنیم، برای بهینهسازی استفاده کند و در نتیجه، منظمسازی ضمنی را به سمتی که میخواهیم هدایت کند.

⚡ سرعت یا دقت؟ چرا نه هر دو!

یکی از چالشهای همیشگی روشهای غیراقلیدسی، سرعت پایین همگرایی آنهاست. این پژوهش نشان داده که اگر از گامهای ثابت استفاده کنیم، میرور دسنت با نرخی بسیار آهسته (چندلگاریتمی) به جواب میرسد. اما با ارائهٔ نسخهٔ «نرمالشده» که گامها را بهصورت تطبیقی تنظیم میکند، همگرایی بهطور چشمگیری شتاب میگیرد و به صورت چندجملهای میشود. به بیان دیگر، این روش نه تنها به جواب بهتری میرسد، بلکه سریعتر هم به آن میرسد؛ چیزی که در دنیای واقعی که زمان و منابع محدود است، یک مزیت بزرگ محسوب میشود.

🧪 از کاغذ تا واقعیت: آزمایش روی شبکههای عمیق

نکتهٔ شگفتانگیز این است که این تئوریها فقط روی کاغذ باقی نماندهاند. پژوهشگران میرور دسنت را روی شبکههای عصبی عمیق و واقعی مانند ResNet، VGG و MobileNet و روی مجموعهدادههای استانداردی مانند CIFAR-10 و ImageNet پیادهسازی کردند. نتیجه؟ انتخاب نُرم ℓ₃، در بسیاری از معماریها عملکرد بهتری نسبت به حالت استاندارد (ℓ₂) داشت؛ گاهی بیش از ۱٪ بهبود در دقت! همچنین مشاهده کردند که توزیع وزنهای شبکه با تغییر نُرم، کاملاً تغییر میکند و هر نُرم، ساختار متفاوتی را به مدل تحمیل میکند. این نشان میدهد که منظمسازی ضمنی، یک مفهوم انتزاعی نیست، بلکه تأثیری ملموس و قابلاندازهگیری بر روی مدلهای واقعی دارد.

💡 چرا باید به این موضوع اهمیت دهیم؟

توانایی کنترل منظمسازی ضمنی، مانند داشتن یک «فرمان هدایت» برای الگوریتمهای بهینهسازی است. دیگر مجبور نیستیم بهطور تصادفی امیدوار باشیم که الگوریتم، مدل خوبی پیدا کند؛ بلکه میتوانیم با انتخاب هوشمندانهٔ تابع پتانسیل، ویژگیهای مطلوب (مثل پراکندگی، کوچکی وزنها، یا حاشیهٔ امنیت بالا) را بهصورت هدفمند به مدل تزریق کنیم. این پژوهش، در واقع یک قدم بزرگ به سمت «مهندسی» کردن فرآیند یادگیری است، نه اینکه صرفاً آن را بهعنوان یک جعبهسیاه بپذیریم. همانطور که یکی از نویسندگان اشاره میکند: «میرور دسنت، اولین الگوریتمی است که هم در رگرسیون و هم در طبقهبندی، برای هندسههای مختلف، منظمسازی ضمنی قابلکنترلی ارائه میدهد.» این یعنی ما اکنون ابزاری داریم که میتواند در هر دو دستهٔ اصلی مسائل یادگیری ماشین (پیشبینی عددی و طبقهبندی) به کار رود و انعطافپذیری بینظیری را فراهم آورد.

بسیار سریع و ساده می توانید اصل این پایان نامه را به صورت فایل PDF در اختیار داشته باشید.

پس از دریافت پایان‌نامه، کلیه اطلاعات کتاب‌شناختی موردنیاز برای استناد علمی، از جمله نام دانشگاه، عنوان پایان‌نامه، نام پژوهشگر، سال دفاع و سایر مشخصات مرتبط، جهت ارجاع‌دهی صحیح مطابق با استانداردهای رایج، در اختیار شما قرار خواهد گرفت.