۱. مسئله و انگیزه
مدلهای بینایی رایانهای در برابر حملات رقابتی (مانند تغییرات ناچیز در پیکسلها که باعث گمراهی مدل میشود) بسیار آسیبپذیرند. روش «آموزش رقابتی» (Adversarial Training – AT) تا حد زیادی این آسیبپذیری را برطرف میکند، اما هزینهاش کاهش چشمگیر دقت روی تصاویر تمیز است. این یک ذاتِ تضاد بنیادین است که حتی با دادههای بینهایت هم از بین نمیرود. بنابراین، همواره نیاز به روشهایی بوده که این تعادل را بهخوبی مدیریت کنند.
۲. ایدهٔ اصلی: سوپ مدل و سوپ یادگیرنده
در سالهای اخیر، روش «سوپ مدل» نشان داده که اگر چند مدلِ تنظیمشده (Fine-tuned) را با هم میانگین بگیریم (وزنی یا ساده)، معمولاً عملکرد بهتری روی وظیفهٔ اصلی و توزیعهای جدید به دست میآید. نویسنده این ایده را به حوزۀ مقاومت رقابتی میبرد و سه نوع سوپ را بررسی میکند:
- سوپ با جستجوی شبکهای (Grid Search): برای ۲ یا ۳ مدل، ترکیبهای گسسته از ضرایب (مثلاً ۰، ۰٫۲، ۰٫۴، …) امتحان میشود.
- سوپ پیوسته (Continuous Soup): میانگین گیری از نقاط مختلف یک مسیر تنظیم (مثلاً checkpointهای اپوکهای ۱۰، ۲۰، ۳۰، ۴۰ و ۵۰).
- سوپ یادگیرنده (Learned Soup): بهجای جستجوی دستی، ضرایب میانگینگیریِ لایهبهلایه را خودِ شبکه با یک معماری wrapper و با استفاده از لایههای Softmax میآموزد. این روش برای تعداد زیاد مدلهای ورودی بسیار کارآمد است.
۳. نوآوریهای روش پیشنهادی
- تغییر مقداردهی اولیه: بهجای یکنواخت (Uniform)، از مقداردهی Xavier استفاده میکند تا شبکه از نقاط بهینهٔ محلی فرار کند.
- نرخ یادگیری بالا (تا ۱۰): با برنامهٔ کاهش کسینوسی، تا ضرایب بتوانند به صفر یا یک نزدیک شوند.
- قطعهافتادگی جداکننده (Detach Dropout): برخی لایههای میانگینگیری شده بهطور تصادفی از گرادیانگیری جدا میشوند تا مشکل محو شدن گرادیان در لایههای اولیه برطرف شود.
۴. آزمایشها و یافتههای اصلی
آزمایشها روی ResNet-9، ResNet-50 و دو WideResNet-28-10 از بنچمارک RobustBench انجام شده است. مدلها با حملات L∞، L₂ و L₁ با اپسیلونهای مختلف (۲/۲۵۵ تا ۱۶/۲۵۵) تنظیم شدهاند.
- جستجوی شبکهای: در ResNetها، دقت تمیز و مقاوم بهطور قابلپیشبینی با قدرت حمله تغییر میکند. اما در WideResNetها، رفتار غیرمحدب و پیچیدهتر است و بهترین نقطه معمولاً در میانهٔ ضرایب قرار دارد.
- سوپ یادگیرنده: در بسیاری از موارد، عملکردی هموارتر از جستجوی شبکهای ارائه میدهد و در برخی تنظیمات (مخصوصاً روی WideResNet گوال و همکاران) دقت مقاوم بالاتری نسبت به بهترین نقطهٔ جستجوی شبکهای به دست میآید.
- مقایسه با TRADES: وقتی بهجای AT از TRADES استفاده میشود، سوپ یادگیرنده همچنان تعادل را کنترل میکند، اما تأثیر تغییر پارامتر α (نسبت تعادل) بسیار کمتر از تغییر اپسیلون است.
- چشمانداز ضرر: ترسیم نقشهٔ ضرر در فضای وزن نشان میدهد که برخلاف مدلهای عادی، ناحیهٔ سوپ برای مدلهای مقاوم شدیداً غیرمحدب و ناهموار است و همین امر، نیاز به روشهای یادگیرنده مانند Learned Soup را توجیه میکند.
۵. محدودیتها و چالشها
- بیشبرازش (Overfitting): در حالت تکضریب (یک ضریب برای کل مدل)، سوپ یادگیرنده به نقطهای با عملکرد ضعیفتر از جستجوی شبکهای همگرا میشود که نشان از بیشبرازش دارد.
- نیاز به دادهٔ اعتبارسنجی: برای توقف زودهنگام (Early Stopping) باید یک split اعتبارسنجی از ابتدا در نظر گرفته شود تا آلودگی داده رخ ندهد – که در بسیاری از کاربردهای عملی ممکن نیست.
- هزینهٔ حافظه: برای آموزش سوپ یادگیرنده، باید تمام checkpointهای ورودی همزمان در حافظه باشند که برای مدلهای بسیار بزرگ محدودیت ایجاد میکند.
۶. جمعبندی و ارزش پژوهش
این پایاننامه نشان میدهد که روش «سوپ یادگیرنده» میتواند بهعنوان یک ابزار تکمیلی در کنار روشهای پیشرفتهٔ آموزش رقابتی (مانند استفاده از دادههای مصنوعی یا TRADES) به کار رود تا تعادل بین دقت تمیز و مقاومت را بهشکل مؤثرتری مدیریت کند. در حالی که جستجوی شبکهای برای تعداد کم مدل جوابگوست، برای سناریوهای با چندین مدل ورودی، روش پیشنهادی هم از نظر محاسباتی سبکتر است و هم اغلب به عملکرد بهتری میرسد. این پژوهش یکی از اولین گامهای جدی در بهکارگیری میانگینگیریِ وزنیِ آموختهشده برای مقاومت رقابتی است و افق جدیدی برای ترکیب مدلهای مقاوم میگشاید.
📖 فهرست مطالب
| عنوان فصل / بخش | صفحه |
|---|---|
| ۱. درآمد (Introduction) | ۱۱ |
| ۲. پیشنیازها و روشها (Preliminaries and Methods) | ۱۵ |
| ۳. روش: سوپهای یادگیرنده (Method: Learned Soups) | ۱۹ |
| ۴. آزمایشها و نتایج (Experiments and Results) | ۲۳ |
| ۴-۱. جستجوی شبکهای دستی (Manual grid search) | ۲۵ |
| ۴-۲. سوپهای یادگیرنده (Learned soups) | ۲۹ |
| ۴-۳. چشمانداز ضرر مقاوم در طول میانگینگیری مدل (Robust loss landscapes during model averaging) | ۳۳ |
| ۴-۴. بحث تکمیلی و محدودیتها (Additional Discussion & Limitations) | ۳۵ |
| ۵. پژوهشهای مرتبط (Related Works) | ۳۷ |
| ۶. نتیجهگیری (Conclusion) | ۴۱ |
| ضمیمهٔ الف – زاویه و فاصله بین نقاط بازبینی تنظیمشده (Angle and Distance between Finetuned Checkpoints) | ۴۷ |
| ضمیمهٔ ب – پویایی آموزش و تنظیم فراپارامتر (Training Dynamics and Hyperparameter Tuning) | ۴۹ |
🥣 سوپ دیجیتال؛ راز مدلهایی که هم دقیقاند، هم مقاوم
💡 تصور کنید یک مدل بینایی ماشین، هم تصاویر تمیز را با دقتِ فوقالعاده تشخیص بدهد و هم در برابر حملاتی که با تغییرِ چند پیکسل، قصد فریبش را دارند، مقاوم باشد. سالهاست میدانیم که این دو هدف با هم در تضادند — اما پژوهش تازهای از دانشگاه MIT نشان میدهد شاید کلیدِ حلِّ این معما، در یک «دستور پختِ» غیرمنتظره باشد: سوپِ مدلها.
🥄 ماجرا از چه قرار است؟
وقتی مدلی را برای مقاومت در برابر حملات رقابتی آموزش میدهیم، ناچاراً دقتِ آن روی تصاویر عادی افت میکند. این «مثلِ این است که برای محکمتر کردنِ در، کلید را کج کنید» — تا حدی امنیت بیشتر، یعنی دسترسیِ سختتر. پژوهشگران MIT بهجای انتخابِ یکی از این دو، راهِ سومی را امتحان کردهاند: چند مدلِ متفاوت (که هرکدام با قدرتِ حملهٔ مختلفی آموزش دیدهاند) را با هم «مخلوط» میکنند، اما نه بهصورتِ ساده، بلکه با ضرایبی که خودِ مدل یاد میگیرد چطور ترکیب شود.
⚙️ رازِ پختِ یک سوپِ هوشمند
برخلافِ روشهای قبلی که ضرایبِ ترکیب را با جستجویِ دستی پیدا میکردند (و برای بیش از سه مدل، طاقتفرسا میشد)، اینجا یک معماریِ wrapper طراحی شده که بهازایِ هر لایه، یک تابع Softmax دارد و خودش وزنِ هر مدل را با نرخِ یادگیریِ بالا (تا ۱۰) و مقداردهیِ ویژه تنظیم میکند. جالبترین بخش، ترفندِ «قطعهافتادگیِ جداکننده» (Detach Dropout) است: بعضی لایهها را تصادفاً از گرادیانگیری جدا میکند تا گرادیان در لایههای اولیه از بین نرود — درست مثلِ اینکه در حینِ پخت، یکبارِ دیگر مواد را هم بزنید تا ته نگیرد.
🔬 چه چیزهایی در آزمایشگاه کشف شد؟
- سوپ یادگیرنده در WideResNetهای بزرگ، از جستجویِ دستی بهتر عمل کرد — بهویژه در مدلهایی که از دادهٔ مصنوعیِ تولیدشده با دیفیوژن استفاده کرده بودند، دقتِ مقاوم را بالاتر برد.
- نقشهٔ ضرر در فضای وزن، بسیار ناهموار و غیرمحدب بود — یعنی راهحلِ بهینه با میانگینگیریِ ساده پیدا نمیشد و همین جایی است که «یادگیریِ ضرایب» میدرخشد.
- با روش TRADES هم جواب میدهد — اگر بهجای آموزشِ رقابتیِ استاندارد، از TRADES استفاده کنیم، سوپِ یادگیرنده همچنان تعادل را کنترل میکند، هرچند تأثیرِ تغییرِ پارامترِ تعادلِ TRADES بسیار کمتر از تغییرِ اپسیلون است.
🧩 چرا این یافته برای دنیای فناوری مهم است؟
در کاربردهای واقعی — از خودروهای خودران تا سیستمهای تشخیصِ پزشکی — ما به مدلهایی نیاز داریم که هم قابلاعتماد باشند (تصاویرِ عادی را درست بخوانند) و هم امن (در برابرِ حملاتِ عمدی از کار نیفتند). روشِ سوپِ یادگیرنده، یک «کلیدِ تنظیم» در اختیارِ مهندسان قرار میدهد: با تغییرِ اپسیلونِ حمله در حینِ آموزشِ خودِ سوپ، میتوانند منحنیِ تعادلِ دقت-مقاومت را بهسمتِ دلخواه هدایت کنند، بدونِ اینکه نیاز به آموزشِ دوبارهٔ مدلِ اصلی باشد.
⚠️ اما همهاش آسان نیست
- بیشبرازش یک تهدیدِ جدی است — اگر از یک ضریب برای کلِ مدل استفاده کنیم، سوپ به نقطهای ضعیفتر از جستجویِ دستی میرسد.
- نیاز به حافظهٔ بالا برای نگهداریِ همزمانِ چند مدل، میتواند برای مدلهای غولپیکر محدودیت ایجاد کند.
- توقفِ زودهنگام نیاز به دقت دارد، چون نمیتوانیم بدونِ آلودگیِ داده، یک مجموعهٔ اعتبارسنجی جداگانه در نظر بگیریم.
🥣 بریم سرِ اصلِ مطلب
این پژوهش، یکی از اولین گامهای جدی برای مهندسیِ دقیقِ ترکیبِ مدلهای مقاوم است. بهجایِ اینکه بین دقت و امنیت، یکی را انتخاب کنیم، حالا میتوانیم دستورِ پختِ خودمان را تنظیم کنیم — با موادی که خودِ مدل، بهترین نسبتِ آنها را یاد میگیرد. شاید روزی، هر مدلِ هوشمصنوعیِ جدی، کنارِ خودش یک «کتابِ آشپزی» داشته باشد که بگوید چطور باید موادِ مختلفِ آموزش را با هم ترکیب کرد تا هم خوشمزه باشد، هم مقوی.
بسیار سریع و ساده می توانید اصل این پایان نامه را به صورت فایل PDF در اختیار داشته باشید.