🎯 چکیدهٔ کلیدی: این پژوهش روشی نوین برای ترکیب مدل‌های عصبیِ آموزش‌دیدهٔ مقاوم (Adversarially Trained) ارائه می‌دهد تا بتوان هم‌زمان دقت روی تصاویر تمیز و مقاومت در برابر حملات رقابتی را بهینه کرد. رویکرد اصلی، توسعۀ «سوپ مدل» (Model Soups) و معرفی «سوپ یادگیرنده» (Learned Soup) است که ضرایب میانگین‌گیری وزنیِ لایه‌به‌لایه را خودش می‌آموزد.

۱. مسئله و انگیزه

مدل‌های بینایی رایانه‌ای در برابر حملات رقابتی (مانند تغییرات ناچیز در پیکسل‌ها که باعث گمراهی مدل می‌شود) بسیار آسیب‌پذیرند. روش «آموزش رقابتی» (Adversarial Training – AT) تا حد زیادی این آسیب‌پذیری را برطرف می‌کند، اما هزینه‌اش کاهش چشمگیر دقت روی تصاویر تمیز است. این یک ذاتِ تضاد بنیادین است که حتی با داده‌های بی‌نهایت هم از بین نمی‌رود. بنابراین، همواره نیاز به روش‌هایی بوده که این تعادل را به‌خوبی مدیریت کنند.

۲. ایدهٔ اصلی: سوپ مدل و سوپ یادگیرنده

در سال‌های اخیر، روش «سوپ مدل» نشان داده که اگر چند مدلِ تنظیم‌شده (Fine-tuned) را با هم میانگین بگیریم (وزنی یا ساده)، معمولاً عملکرد بهتری روی وظیفهٔ اصلی و توزیع‌های جدید به دست می‌آید. نویسنده این ایده را به حوزۀ مقاومت رقابتی می‌برد و سه نوع سوپ را بررسی می‌کند:

  • سوپ با جستجوی شبکه‌ای (Grid Search): برای ۲ یا ۳ مدل، ترکیب‌های گسسته از ضرایب (مثلاً ۰، ۰٫۲، ۰٫۴، …) امتحان می‌شود.
  • سوپ پیوسته (Continuous Soup): میانگین گیری از نقاط مختلف یک مسیر تنظیم (مثلاً checkpointهای اپوک‌های ۱۰، ۲۰، ۳۰، ۴۰ و ۵۰).
  • سوپ یادگیرنده (Learned Soup): به‌جای جستجوی دستی، ضرایب میانگین‌گیریِ لایه‌به‌لایه را خودِ شبکه با یک معماری wrapper و با استفاده از لایه‌های Softmax می‌آموزد. این روش برای تعداد زیاد مدل‌های ورودی بسیار کارآمد است.

۳. نوآوری‌های روش پیشنهادی

  • تغییر مقداردهی اولیه: به‌جای یکنواخت (Uniform)، از مقداردهی Xavier استفاده می‌کند تا شبکه از نقاط بهینهٔ محلی فرار کند.
  • نرخ یادگیری بالا (تا ۱۰): با برنامهٔ کاهش کسینوسی، تا ضرایب بتوانند به صفر یا یک نزدیک شوند.
  • قطعه‌افتادگی جداکننده (Detach Dropout): برخی لایه‌های میانگین‌گیری شده به‌طور تصادفی از گرادیان‌گیری جدا می‌شوند تا مشکل محو شدن گرادیان در لایه‌های اولیه برطرف شود.

۴. آزمایش‌ها و یافته‌های اصلی

آزمایش‌ها روی ResNet-9، ResNet-50 و دو WideResNet-28-10 از بنچمارک RobustBench انجام شده است. مدل‌ها با حملات L∞، L₂ و L₁ با اپسیلون‌های مختلف (۲/۲۵۵ تا ۱۶/۲۵۵) تنظیم شده‌اند.

  • جستجوی شبکه‌ای: در ResNetها، دقت تمیز و مقاوم به‌طور قابل‌پیش‌بینی با قدرت حمله تغییر می‌کند. اما در WideResNetها، رفتار غیرمحدب و پیچیده‌تر است و بهترین نقطه معمولاً در میانهٔ ضرایب قرار دارد.
  • سوپ یادگیرنده: در بسیاری از موارد، عملکردی هموارتر از جستجوی شبکه‌ای ارائه می‌دهد و در برخی تنظیمات (مخصوصاً روی WideResNet گوال و همکاران) دقت مقاوم بالاتری نسبت به بهترین نقطهٔ جستجوی شبکه‌ای به دست می‌آید.
  • مقایسه با TRADES: وقتی به‌جای AT از TRADES استفاده می‌شود، سوپ یادگیرنده همچنان تعادل را کنترل می‌کند، اما تأثیر تغییر پارامتر α (نسبت تعادل) بسیار کمتر از تغییر اپسیلون است.
  • چشم‌انداز ضرر: ترسیم نقشهٔ ضرر در فضای وزن نشان می‌دهد که برخلاف مدل‌های عادی، ناحیهٔ سوپ برای مدل‌های مقاوم شدیداً غیرمحدب و ناهموار است و همین امر، نیاز به روش‌های یادگیرنده مانند Learned Soup را توجیه می‌کند.

۵. محدودیت‌ها و چالش‌ها

  • بیش‌برازش (Overfitting): در حالت تک‌ضریب (یک ضریب برای کل مدل)، سوپ یادگیرنده به نقطه‌ای با عملکرد ضعیف‌تر از جستجوی شبکه‌ای همگرا می‌شود که نشان از بیش‌برازش دارد.
  • نیاز به دادهٔ اعتبارسنجی: برای توقف زودهنگام (Early Stopping) باید یک split اعتبارسنجی از ابتدا در نظر گرفته شود تا آلودگی داده رخ ندهد – که در بسیاری از کاربردهای عملی ممکن نیست.
  • هزینهٔ حافظه: برای آموزش سوپ یادگیرنده، باید تمام checkpointهای ورودی هم‌زمان در حافظه باشند که برای مدل‌های بسیار بزرگ محدودیت ایجاد می‌کند.

۶. جمع‌بندی و ارزش پژوهش

این پایان‌نامه نشان می‌دهد که روش «سوپ یادگیرنده» می‌تواند به‌عنوان یک ابزار تکمیلی در کنار روش‌های پیشرفتهٔ آموزش رقابتی (مانند استفاده از داده‌های مصنوعی یا TRADES) به کار رود تا تعادل بین دقت تمیز و مقاومت را به‌شکل مؤثرتری مدیریت کند. در حالی که جستجوی شبکه‌ای برای تعداد کم مدل جواب‌گوست، برای سناریوهای با چندین مدل ورودی، روش پیشنهادی هم از نظر محاسباتی سبک‌تر است و هم اغلب به عملکرد بهتری می‌رسد. این پژوهش یکی از اولین گام‌های جدی در به‌کارگیری میانگین‌گیریِ وزنیِ آموخته‌شده برای مقاومت رقابتی است و افق جدیدی برای ترکیب مدل‌های مقاوم می‌گشاید.

📌 پیام کلیدی پایان‌نامه: «سوپ‌های یادگیرنده» با آموختنِ ضرایب میانگین‌گیریِ لایه‌به‌لایه، می‌توانند منحنیِ تعادلِ دقت-مقاومت را هموارتر کنند و در بسیاری از موارد، حتی از بهترین مدلِ منفرد یا جستجوی دستیِ ضرایب بهتر عمل کنند – به‌شرطِ استفاده از مقداردهی مناسب، نرخ یادگیری بالا و مکانیزم قطعه‌افتادگی جداکننده.

📖 فهرست مطالب

عنوان فصل / بخش صفحه
۱. درآمد (Introduction) ۱۱
۲. پیش‌نیازها و روش‌ها (Preliminaries and Methods) ۱۵
۳. روش: سوپ‌های یادگیرنده (Method: Learned Soups) ۱۹
۴. آزمایش‌ها و نتایج (Experiments and Results) ۲۳
۴-۱. جستجوی شبکه‌ای دستی (Manual grid search) ۲۵
۴-۲. سوپ‌های یادگیرنده (Learned soups) ۲۹
۴-۳. چشم‌انداز ضرر مقاوم در طول میانگین‌گیری مدل (Robust loss landscapes during model averaging) ۳۳
۴-۴. بحث تکمیلی و محدودیت‌ها (Additional Discussion & Limitations) ۳۵
۵. پژوهش‌های مرتبط (Related Works) ۳۷
۶. نتیجه‌گیری (Conclusion) ۴۱
ضمیمهٔ الف – زاویه و فاصله بین نقاط بازبینی تنظیم‌شده (Angle and Distance between Finetuned Checkpoints) ۴۷
ضمیمهٔ ب – پویایی آموزش و تنظیم فراپارامتر (Training Dynamics and Hyperparameter Tuning) ۴۹

🥣 سوپ دیجیتال؛ راز مدل‌هایی که هم دقیق‌اند، هم مقاوم

چطور «سوپ یادگیرنده» تعادلِ دقت و امنیت را در هوش مصنوعی بر هم نمی‌زند

💡 تصور کنید یک مدل بینایی ماشین، هم تصاویر تمیز را با دقتِ فوق‌العاده تشخیص بدهد و هم در برابر حملاتی که با تغییرِ چند پیکسل، قصد فریبش را دارند، مقاوم باشد. سال‌هاست می‌دانیم که این دو هدف با هم در تضادند — اما پژوهش تازه‌ای از دانشگاه MIT نشان می‌دهد شاید کلیدِ حلِّ این معما، در یک «دستور پختِ» غیرمنتظره باشد: سوپِ مدل‌ها.

🥄 ماجرا از چه قرار است؟

وقتی مدلی را برای مقاومت در برابر حملات رقابتی آموزش می‌دهیم، ناچاراً دقتِ آن روی تصاویر عادی افت می‌کند. این «مثلِ این است که برای محکم‌تر کردنِ در، کلید را کج کنید» — تا حدی امنیت بیشتر، یعنی دست‌رسیِ سخت‌تر. پژوهشگران MIT به‌جای انتخابِ یکی از این دو، راهِ سومی را امتحان کرده‌اند: چند مدلِ متفاوت (که هرکدام با قدرتِ حملهٔ مختلفی آموزش دیده‌اند) را با هم «مخلوط» می‌کنند، اما نه به‌صورتِ ساده، بلکه با ضرایبی که خودِ مدل یاد می‌گیرد چطور ترکیب شود.

«سوپ یادگیرنده» (Learned Soup) می‌آموزد که از هر لایهٔ کدام مدل، چقدر وزن بگیرد تا هم دقتِ تمیز بالا بماند و هم مقاومتِ رقابتی، بدونِ اینکه یکی فدای دیگری شود.

⚙️ رازِ پختِ یک سوپِ هوشمند

برخلافِ روش‌های قبلی که ضرایبِ ترکیب را با جستجویِ دستی پیدا می‌کردند (و برای بیش از سه مدل، طاقت‌فرسا می‌شد)، اینجا یک معماریِ wrapper طراحی شده که به‌ازایِ هر لایه، یک تابع Softmax دارد و خودش وزنِ هر مدل را با نرخِ یادگیریِ بالا (تا ۱۰) و مقداردهیِ ویژه تنظیم می‌کند. جالب‌ترین بخش، ترفندِ «قطعه‌افتادگیِ جداکننده» (Detach Dropout) است: بعضی لایه‌ها را تصادفاً از گرادیان‌گیری جدا می‌کند تا گرادیان در لایه‌های اولیه از بین نرود — درست مثلِ اینکه در حینِ پخت، یک‌بارِ دیگر مواد را هم بزنید تا ته نگیرد.

🔬 چه چیزهایی در آزمایشگاه کشف شد؟

  • سوپ یادگیرنده در WideResNetهای بزرگ، از جستجویِ دستی بهتر عمل کرد — به‌ویژه در مدل‌هایی که از دادهٔ مصنوعیِ تولیدشده با دیفیوژن استفاده کرده بودند، دقتِ مقاوم را بالاتر برد.
  • نقشهٔ ضرر در فضای وزن، بسیار ناهموار و غیرمحدب بود — یعنی راه‌حلِ بهینه با میانگین‌گیریِ ساده پیدا نمی‌شد و همین جایی است که «یادگیریِ ضرایب» می‌درخشد.
  • با روش TRADES هم جواب می‌دهد — اگر به‌جای آموزشِ رقابتیِ استاندارد، از TRADES استفاده کنیم، سوپِ یادگیرنده همچنان تعادل را کنترل می‌کند، هرچند تأثیرِ تغییرِ پارامترِ تعادلِ TRADES بسیار کمتر از تغییرِ اپسیلون است.

🧩 چرا این یافته برای دنیای فناوری مهم است؟

در کاربردهای واقعی — از خودروهای خودران تا سیستم‌های تشخیصِ پزشکی — ما به مدل‌هایی نیاز داریم که هم قابل‌اعتماد باشند (تصاویرِ عادی را درست بخوانند) و هم امن (در برابرِ حملاتِ عمدی از کار نیفتند). روشِ سوپِ یادگیرنده، یک «کلیدِ تنظیم» در اختیارِ مهندسان قرار می‌دهد: با تغییرِ اپسیلونِ حمله در حینِ آموزشِ خودِ سوپ، می‌توانند منحنیِ تعادلِ دقت-مقاومت را به‌سمتِ دلخواه هدایت کنند، بدونِ اینکه نیاز به آموزشِ دوبارهٔ مدلِ اصلی باشد.

📌 به‌قولِ خودِ مقاله: «سوپ‌های یادگیرنده می‌توانند به‌عنوانِ یک ابزارِ تکمیلی، در کنارِ پیشرفته‌ترین روش‌های آموزشِ رقابتی (حتی با داده‌های مصنوعیِ میلیونی) به کار روند و عملکردی بهتر از هر مدلِ منفرد یا جستجویِ دستی ارائه دهند.»

⚠️ اما همه‌اش آسان نیست

  • بیش‌برازش یک تهدیدِ جدی است — اگر از یک ضریب برای کلِ مدل استفاده کنیم، سوپ به نقطه‌ای ضعیف‌تر از جستجویِ دستی می‌رسد.
  • نیاز به حافظهٔ بالا برای نگه‌داریِ هم‌زمانِ چند مدل، می‌تواند برای مدل‌های غول‌پیکر محدودیت ایجاد کند.
  • توقفِ زودهنگام نیاز به دقت دارد، چون نمی‌توانیم بدونِ آلودگیِ داده، یک مجموعهٔ اعتبارسنجی جداگانه در نظر بگیریم.

🥣 بریم سرِ اصلِ مطلب

این پژوهش، یکی از اولین گام‌های جدی برای مهندسیِ دقیقِ ترکیبِ مدل‌های مقاوم است. به‌جایِ اینکه بین دقت و امنیت، یکی را انتخاب کنیم، حالا می‌توانیم دستورِ پختِ خودمان را تنظیم کنیم — با موادی که خودِ مدل، بهترین نسبتِ آنها را یاد می‌گیرد. شاید روزی، هر مدلِ هوش‌مصنوعیِ جدی، کنارِ خودش یک «کتابِ آشپزی» داشته باشد که بگوید چطور باید موادِ مختلفِ آموزش را با هم ترکیب کرد تا هم خوش‌مزه باشد، هم مقوی.

✍️ نکتهٔ پایانی: آنچه این سوپ را از سایرِ روش‌ها متمایز می‌کند، «یادگیریِ لایه‌به‌لایه» است — یعنی مدل می‌داند که در هر عمقِ شبکه، به کدامِ یک از مدل‌هایِ اولیه بیشتر اعتماد کند. این یعنی هوشمندیِ ظریف، نه یک میانگینِ ساده.

بسیار سریع و ساده می توانید اصل این پایان نامه را به صورت فایل PDF در اختیار داشته باشید.

پس از دریافت پایان‌نامه، کلیه اطلاعات کتاب‌شناختی موردنیاز برای استناد علمی، از جمله نام دانشگاه، عنوان پایان‌نامه، نام پژوهشگر، سال دفاع و سایر مشخصات مرتبط، جهت ارجاع‌دهی صحیح مطابق با استانداردهای رایج، در اختیار شما قرار خواهد گرفت.