پایاننامه حاضر به بررسی یکی از مهمترین چالشهای موجود در حوزه یادگیری ماشین، یعنی برآورد میزان اطمینان (Uncertainty Quantification) در پیشبینیهای مدلهای هوش مصنوعی میپردازد. اگرچه مدلهای یادگیری عمیق در سالهای اخیر توانستهاند دقت بسیار بالایی در مسائل طبقهبندی تصاویر، تشخیص پزشکی، بینایی ماشین و سایر کاربردهای هوش مصنوعی به دست آورند، اما همچنان یک مشکل اساسی در این مدلها وجود دارد؛ آنها معمولاً با اطمینان بسیار زیاد پیشبینیهایی ارائه میکنند که در بسیاری از موارد اشتباه هستند. این موضوع در کاربردهای حساس مانند تشخیص بیماری، خودروهای خودران، سیستمهای مالی و سامانههای امنیتی میتواند پیامدهای جبرانناپذیری به همراه داشته باشد. به همین دلیل، پژوهشگران در سالهای اخیر به دنبال روشهایی بودهاند که علاوه بر تولید پاسخ، میزان اطمینان مدل نسبت به همان پاسخ را نیز مشخص کنند.
یکی از موفقترین رویکردها برای حل این مسئله، روش پیشبینی تطابقی (Conformal Prediction) است. این روش به جای ارائه تنها یک برچسب نهایی، مجموعهای از پاسخهای محتمل را همراه با تضمین آماری ارائه میدهد. به بیان دیگر، این روش تضمین میکند که با احتمال مشخصی (برای مثال ۹۰ درصد)، پاسخ صحیح در میان مجموعه پاسخهای ارائه شده قرار دارد. مزیت بزرگ این روش آن است که به توزیع دادهها وابسته نیست و تقریباً برای هر مدل یادگیری ماشین قابل استفاده است. همچنین برخلاف بسیاری از روشهای برآورد عدم قطعیت، نیازمند ایجاد تغییر در ساختار مدل نیست و میتواند به عنوان یک لایه تکمیلی روی مدلهای از پیش آموزشدیده مورد استفاده قرار گیرد.
با وجود این مزایا، پیشبینی تطابقی دارای یک ضعف مهم است. زمانی که مدل در تشخیص نمونهای دچار تردید باشد، برای حفظ تضمین آماری مجبور میشود مجموعهای بسیار بزرگ از پاسخها را ارائه کند. هرچه این مجموعه بزرگتر باشد، ارزش عملی آن کاهش پیدا میکند؛ زیرا کاربر به جای دریافت چند گزینه محدود، با تعداد زیادی پاسخ مواجه میشود که انتخاب صحیح را دشوار میکند. برای نمونه، در مجموعهدادهای مانند ImageNet که دارای هزار کلاس مختلف است، ممکن است مجموعه پیشبینی شامل صدها کلاس باشد که عملاً استفاده از آن را در کاربردهای واقعی دشوار میکند. بنابراین یکی از مهمترین چالشهای پژوهشهای اخیر، کاهش اندازه مجموعه پیشبینی بدون از بین بردن تضمین آماری آن است.
هدف اصلی این پایاننامه ارائه راهکاری برای رفع همین مشکل است. نویسنده تلاش کرده است بررسی کند که آیا استفاده از تکنیکی بسیار رایج در بینایی ماشین با نام دادهافزایی (Data Augmentation) میتواند باعث کوچکتر شدن مجموعههای پیشبینی و در نتیجه افزایش کاربرد عملی پیشبینی تطابقی شود یا خیر. دادهافزایی معمولاً در مرحله آموزش شبکههای عصبی مورد استفاده قرار میگیرد و با ایجاد نسخههای تغییر یافته از تصاویر، مانند چرخش، برش، وارونگی افقی یا تغییرات رنگ، باعث افزایش تنوع دادهها و بهبود قدرت تعمیم مدل میشود. اما در این پژوهش، دادهافزایی نه در مرحله آموزش، بلکه در مرحله پیشبینی و همچنین مرحله کالیبراسیون مورد استفاده قرار گرفته است تا تأثیر آن بر عملکرد پیشبینی تطابقی بررسی شود.
برای تحقق این هدف، پنج روش جدید تحت عنوان Test-Time Augmentation Enhanced Conformal Prediction (TTA-CP) معرفی شدهاند. هر یک از این روشها از دادهافزایی در یکی از مراحل فرآیند پیشبینی تطابقی یا در هر دو مرحله کالیبراسیون و تولید مجموعه پیشبینی استفاده میکنند. سپس خروجی تصاویر مختلف ایجادشده با استفاده از توابع مختلفی مانند اشتراک مجموعهها یا رأی اکثریت با یکدیگر ترکیب میشوند تا در نهایت یک مجموعه پیشبینی نهایی تولید شود. هدف از طراحی این روشها بررسی این موضوع است که کدام شیوه استفاده از دادهافزایی میتواند بدون کاهش میزان پوشش آماری، اندازه مجموعه پیشبینی را کاهش دهد.
برای ارزیابی این روشها، آزمایشها روی دو مجموعهداده کاملاً متفاوت انجام شده است. نخست مجموعهداده مشهور ImageNet که یکی از استانداردترین پایگاههای داده در حوزه بینایی ماشین محسوب میشود و دارای بیش از هزار کلاس مختلف است. دوم مجموعهداده Fitzpatrick17k که شامل تصاویر بیماریهای پوستی بوده و از نظر تعداد نمونه، عدم تعادل کلاسها و دشواری مسئله با ImageNet تفاوت قابل توجهی دارد. استفاده همزمان از این دو مجموعهداده باعث شده است نتایج پژوهش تنها محدود به یک نوع داده نباشد و بتوان رفتار روشهای پیشنهادی را در شرایط مختلف ارزیابی کرد.
در بخش آزمایشها، عملکرد روشهای پیشنهادی از چندین جنبه مورد ارزیابی قرار گرفته است. نخست میزان پوشش واقعی (Achieved Coverage) بررسی شده است؛ یعنی اینکه آیا تضمین آماری ارائهشده توسط پیشبینی تطابقی همچنان حفظ میشود یا خیر. سپس اندازه متوسط مجموعه پیشبینی اندازهگیری شده تا مشخص شود آیا دادهافزایی واقعاً باعث کاهش تعداد پاسخهای پیشنهادی میشود یا خیر. همچنین رابطه میان میزان پوشش و اندازه مجموعه پیشبینی مورد تحلیل قرار گرفته است تا مشخص شود هر روش چه تعادلی میان دقت و کاربردپذیری ایجاد میکند.
نتایج پژوهش نشان میدهد که استفاده از دادهافزایی در مرحله کالیبراسیون (TTA-Cal) تقریباً بدون ایجاد تغییر در تضمین آماری، میتواند عملکرد پیشبینی تطابقی را حفظ کند و در برخی شرایط حتی باعث ایجاد تعادل مناسبتری میان اندازه مجموعه پیشبینی و میزان پوشش شود. از سوی دیگر، روشهایی که از اشتراک مجموعههای پیشبینی استفاده میکنند، اگرچه در بسیاری از موارد اندازه مجموعه پیشبینی را کاهش میدهند، اما ممکن است در برخی شرایط باعث کاهش میزان پوشش شوند؛ بهویژه زمانی که از تبدیلاتی استفاده شود که مدل در زمان آموزش آنها را مشاهده نکرده است. در مقابل، روش مبتنی بر رأی اکثریت عملکرد پایدارتری از خود نشان داده و توانسته است پوشش آماری را تا حد زیادی حفظ کند.
یکی دیگر از بخشهای مهم پایاننامه بررسی تأثیر کیفیت مدل پایه بر عملکرد پیشبینی تطابقی است. نتایج نشان میدهد که استفاده از تکنیک تصادفیسازی (Randomization) در مدلهایی که دقت نسبتاً پایینی دارند، نه تنها باعث بهبود عملکرد نمیشود بلکه ممکن است میزان پوشش واقعی را نیز کاهش دهد. همچنین نویسنده نشان داده است که اجازه دادن به تولید مجموعههای پیشبینی خالی نیز در بسیاری از شرایط باعث کاهش کیفیت عملکرد سیستم میشود. این یافتهها نشان میدهد انتخاب تنظیمات مناسب برای الگوریتمهای پیشبینی تطابقی به ویژگیهای مدل پایه وابسته است و نمیتوان یک راهکار ثابت را برای همه مسائل پیشنهاد کرد.
در ادامه، پایاننامه عملکرد روشهای پیشنهادی را در سطح کلاسهای مختلف نیز مورد بررسی قرار داده است. این تحلیل بهویژه روی مجموعهداده Fitzpatrick17k انجام شده تا مشخص شود آیا دادهافزایی میتواند عملکرد مدل را برای کلاسهایی که نمونههای آموزشی کمتری دارند نیز بهبود دهد یا خیر. نتایج نشان داد اگرچه روند کلی عملکرد روشها در کلاسهای مختلف مشابه نتایج کلی مجموعهداده است، اما برخی روشها توانستهاند اندازه مجموعه پیشبینی را برای کلاسهای کمنمونه نیز کاهش دهند که میتواند در کاربردهای پزشکی اهمیت زیادی داشته باشد.
بخش دیگری از پژوهش به بررسی شرایطی اختصاص یافته که دادههای کالیبراسیون محدود هستند. در بسیاری از کاربردهای واقعی، تهیه دادههای برچسبخورده هزینهبر است و امکان استفاده از مجموعههای بزرگ کالیبراسیون وجود ندارد. نویسنده نشان داده است که استفاده از دادهافزایی در این مرحله میتواند نوسانات عملکرد پیشبینی تطابقی را کاهش دهد و پایداری بیشتری در نتایج ایجاد کند. این موضوع به ویژه در کاربردهای پزشکی و صنعتی که دادههای برچسبخورده محدود هستند، اهمیت فراوانی دارد.
از منظر علمی، این پایاننامه پلی میان دو حوزه مهم یادگیری ماشین یعنی پیشبینی تطابقی و دادهافزایی در زمان آزمون ایجاد کرده است؛ دو حوزهای که پیش از این کمتر به صورت همزمان مورد مطالعه قرار گرفته بودند. نویسنده نشان داده است که نحوه ترکیب این دو تکنیک میتواند تأثیر قابل توجهی بر کیفیت خروجی سیستمهای هوش مصنوعی داشته باشد و انتخاب صحیح سیاست دادهافزایی و روش تجمیع نتایج، عامل اصلی موفقیت این رویکرد است.
در مجموع، این پایاننامه با ارائه پنج روش جدید، انجام آزمایشهای گسترده روی دو مجموعهداده معتبر، تحلیل دقیق نتایج و بررسی شرایط مختلف، تلاش میکند راهکاری عملی برای افزایش کارایی پیشبینی تطابقی ارائه دهد. مهمترین دستاورد پژوهش این است که نشان میدهد استفاده هدفمند از دادهافزایی در زمان آزمون میتواند بدون از بین بردن تضمینهای آماری، مجموعههای پیشبینی کوچکتر، پایدارتر و کاربردیتری تولید کند. این دستاورد میتواند زمینه را برای استفاده گستردهتر از پیشبینی تطابقی در سامانههای حساس مانند تشخیص پزشکی، خودروهای خودران، سامانههای تصمیمیار، رباتیک و سایر کاربردهای هوش مصنوعی فراهم سازد و مسیر تازهای برای تحقیقات آینده در زمینه افزایش قابلیت اعتماد مدلهای یادگیری ماشین ایجاد کند.
فهرست مطالب
| سرفصل | شماره صفحه |
|---|---|
| فصل اول: مقدمه | 15 |
| فصل دوم: پژوهشهای مرتبط | 21 |
| پیشبینی تطابقی (Conformal Prediction) | 21 |
| دادهافزایی (Data Augmentation) | 23 |
| فصل سوم: تنظیمات و طراحی آزمایشها | 25 |
| الگوریتمهای پیشبینی تطابقی و نمادگذاری | 25 |
| دادهافزایی در زمان آزمون (Test-Time Data Augmentation) | 28 |
| تنظیمات آزمایش | 30 |
| مجموعهدادهها (Datasets) | 30 |
| معماری مدل و عملکرد آن | 31 |
| فصل چهارم: تأثیر TTA-CP بر میزان پوشش و اندازه مجموعه پیشبینی | 35 |
| مقایسه پوشش واقعی با پوشش نظری | 35 |
| رابطه اندازه مجموعه پیشبینی با میزان پوشش واقعی | 42 |
| جمعبندی | 43 |
| فصل پنجم: اثرات TTA-CP در سطح کلاس بر پوشش و اندازه مجموعه پیشبینی | 47 |
| تحلیل سطح کلاس در مجموعهداده Fitzpatrick 17k-8 | 47 |
| جمعبندی | 49 |
| فصل ششم: کاربردهای TTA-Cal در کاهش واریانس میزان پوشش واقعی | 51 |
| جمعبندی | 54 |
| فصل هفتم: بحث و پیشنهادهایی برای پژوهشهای آینده | 57 |
“`
چگونه «دادهافزایی» میتواند هوش مصنوعی را قابلاعتمادتر کند؟ نگاهی به راهکاری که یکی از بزرگترین ضعفهای مدلهای یادگیری ماشین را هدف گرفته است
هوش مصنوعی هر روز دقیقتر میشود، اما یک سؤال مهم همچنان پابرجاست: اگر مدل اشتباه کند، خودش از این اشتباه خبر دارد؟
بسیاری از مدلهای یادگیری ماشین حتی زمانی که پاسخ نادرستی ارائه میکنند، با اطمینان بسیار بالا همان پاسخ را اعلام میکنند. این موضوع در کاربردهایی مانند تشخیص بیماری، خودروهای خودران و سیستمهای تصمیمیار میتواند خطرناک باشد. پایاننامه حاضر دقیقاً روی همین مسئله تمرکز کرده و تلاش کرده است روشی ارائه دهد که علاوه بر حفظ دقت، میزان اعتمادپذیری خروجی مدل را نیز افزایش دهد. در ادامه مهمترین یافتههای این پژوهش را مرور میکنیم.
پیشبینی تطابقی؛ وقتی هوش مصنوعی به جای یک پاسخ، چند گزینه مطمئن ارائه میدهد
یکی از جذابترین ایدههای این پژوهش استفاده از «پیشبینی تطابقی» (Conformal Prediction) است. برخلاف مدلهای معمول که تنها یک پاسخ نهایی تولید میکنند، این روش مجموعهای از پاسخهای محتمل را همراه با یک تضمین آماری ارائه میدهد.
برای مثال اگر سیستم اعلام کند پوشش ۹۰ درصدی دارد، یعنی در ۹۰ درصد مواقع پاسخ صحیح داخل مجموعه پیشنهادهای آن قرار خواهد گرفت. این ویژگی باعث میشود خروجی مدل برای کاربردهای حساس بسیار قابل اعتمادتر باشد.
مشکل بزرگ؛ چرا مجموعه پاسخها بیش از حد بزرگ میشوند؟
اگرچه پیشبینی تطابقی اطمینان بیشتری ایجاد میکند، اما یک نقطه ضعف جدی دارد.
هرچه مدل نسبت به یک نمونه مطمئن نباشد، تعداد پاسخهای پیشنهادی بیشتر میشود. گاهی این مجموعه آنقدر بزرگ میشود که دیگر ارزش عملی خود را از دست میدهد؛ زیرا کاربر به جای چند گزینه محدود، با دهها یا حتی صدها پاسخ روبهرو میشود.
در عمل چنین خروجیای تصمیمگیری را سادهتر نمیکند، بلکه پیچیدهتر نیز خواهد کرد.
راهحل خلاقانه؛ استفاده از دادهافزایی در زمان آزمون
نوآوری اصلی این پایاننامه استفاده از تکنیک محبوب دادهافزایی (Data Augmentation) در مرحله پیشبینی است.
در این روش از تصویر اصلی نسخههای مختلفی مانند برش، وارونگی افقی یا سایر تغییرات استاندارد ساخته میشود. سپس مدل تمام این نسخهها را بررسی کرده و نتایج آنها با یکدیگر ترکیب میشوند.
ایده اصلی بسیار ساده اما هوشمندانه است:
اگر مدل روی نسخههای مختلف یک تصویر تقریباً به نتیجه مشابهی برسد، میتوان با اطمینان بیشتری پاسخهای غیرضروری را حذف کرد و مجموعه پیشبینی کوچکتری ساخت.
پنج روش جدید برای ترکیب دادهافزایی و پیشبینی تطابقی
یکی از ارزشمندترین بخشهای این پژوهش معرفی پنج روش جدید تحت عنوان TTA-CP است.
این روشها بررسی میکنند که دادهافزایی در چه مرحلهای بیشترین تأثیر را دارد:
- هنگام کالیبراسیون مدل
- هنگام تولید مجموعه پیشبینی
- یا در هر دو مرحله به صورت همزمان
همچنین چندین روش برای ترکیب نتایج تصاویر مختلف مورد ارزیابی قرار گرفته است؛ از جمله رأی اکثریت و اشتراک مجموعهها.
آزمایش روی دو مجموعهداده کاملاً متفاوت
برای اینکه نتایج فقط محدود به یک نوع داده نباشد، آزمایشها روی دو مجموعهداده معتبر انجام شدهاند:
- ImageNet به عنوان یکی از مشهورترین مجموعهدادههای بینایی ماشین
- Fitzpatrick17k شامل تصاویر بیماریهای پوستی
این انتخاب باعث شده عملکرد روش پیشنهادی هم در مسائل عمومی بینایی ماشین و هم در کاربردهای پزشکی بررسی شود.
همه روشها عملکرد یکسانی ندارند
یکی از نتایج جالب پژوهش این است که همه روشهای دادهافزایی الزاماً باعث بهبود عملکرد نمیشوند.
برخی روشها اگرچه اندازه مجموعه پیشبینی را کاهش میدهند، اما ممکن است تضمین آماری مدل را نیز تضعیف کنند.
در مقابل، برخی روشها مانند استفاده از رأی اکثریت توانستهاند تعادل مناسبی میان کوچک شدن مجموعه پیشبینی و حفظ میزان پوشش آماری برقرار کنند.
این موضوع نشان میدهد نحوه ترکیب نتایج اهمیت بسیار بیشتری از خود دادهافزایی دارد.
کیفیت مدل پایه همچنان تعیینکننده است
پژوهش نشان میدهد حتی بهترین الگوریتمهای پیشبینی تطابقی نیز نمیتوانند ضعف یک مدل ضعیف را کاملاً جبران کنند.
اگر مدل اولیه دقت کافی نداشته باشد، استفاده از برخی تکنیکها مانند تصادفیسازی ممکن است حتی باعث کاهش کیفیت خروجی شود.
بنابراین انتخاب مدل مناسب همچنان یکی از مهمترین مراحل طراحی سیستمهای هوش مصنوعی باقی میماند.
کاربردهای پزشکی؛ جایی که این ایده بیشترین ارزش را پیدا میکند
یکی از جذابترین بخشهای این پایاننامه، بررسی عملکرد روش پیشنهادی روی تصاویر بیماریهای پوستی است.
در کاربردهای پزشکی، دانستن میزان اطمینان سیستم تقریباً به اندازه خود پاسخ اهمیت دارد. اگر پزشک بداند سیستم میان چند تشخیص محدود مردد است، میتواند آزمایشهای تکمیلی مناسبتری درخواست کند و تصمیم دقیقتری بگیرد.
به همین دلیل چنین روشهایی میتوانند در آینده نقش مهمی در توسعه سامانههای هوشمند تشخیص بیماری ایفا کنند.
چرا این پژوهش اهمیت دارد؟
ارزش اصلی این پایاننامه صرفاً معرفی چند الگوریتم جدید نیست؛ بلکه نشان میدهد دو حوزه مهم یادگیری ماشین یعنی دادهافزایی و پیشبینی تطابقی میتوانند در کنار یکدیگر عملکرد بسیار بهتری ایجاد کنند.
این پژوهش ثابت میکند که با طراحی صحیح فرآیند کالیبراسیون و استفاده هوشمندانه از دادهافزایی، میتوان مدلهایی ساخت که هم قابل اعتمادتر باشند و هم خروجیهای کاربردیتری تولید کنند.
جمعبندی
هوش مصنوعی آینده تنها به مدلهایی با دقت بالاتر نیاز ندارد؛ بلکه به مدلهایی نیاز دارد که بدانند چه زمانی مطمئن هستند و چه زمانی نیستند.
این پایاننامه گام مهمی در همین مسیر برداشته و نشان داده است که استفاده هدفمند از دادهافزایی در زمان آزمون میتواند بدون از بین بردن تضمینهای آماری، خروجیهایی کوچکتر، پایدارتر و قابل اعتمادتر تولید کند.
شاید سؤال مهم آینده این باشد: آیا نسل بعدی سیستمهای هوش مصنوعی نه تنها پاسخ صحیح را خواهند دانست، بلکه خواهند دانست چه زمانی نباید بیش از حد به خودشان اطمینان کنند؟
بسیار سریع و ساده می توانید اصل این پایان نامه را به صورت فایل PDF در اختیار داشته باشید.