درخت تصمیم دودویی یکی از قابل‌فهم‌ترین مدل‌های یادگیری ماشین است، زیرا انسان می‌تواند به‌راحتی درک کند که یک پیش‌بینی چگونه با پاسخ دادن به مجموعه‌ای از پرسش‌های دودویی انجام می‌شود. هر پرسش دودویی به این صورت است که آیا یک ویژگی خاص مقدارش کمتر از یک حد آستانه است یا خیر. اگر پاسخ مثبت باشد، کاربر به زیردرخت چپ هدایت می‌شود و به پرسش دودویی دیگری در گره شاخه‌ای بعدی می‌رسد. اگر پاسخ منفی باشد، مسیر حرکت به زیردرخت راست خواهد بود. این ساختار ساده و شهودی باعث شده است که درخت‌های تصمیم در حوزه‌هایی که نیاز به شفافیت و قابلیت توضیح‌پذیری دارند، بسیار مورد توجه قرار گیرند. با این حال، ساخت درخت تصمیمی که بهترین عملکرد را داشته باشد، به دلیل ماهیت پیچیده و غیرخطی مسئله، یک چالش اساسی در یادگیری ماشین محسوب می‌شود. روش‌های سنتی مانند درخت‌های طبقه‌بندی و رگرسیون از یک رویکرد حریصانه استفاده می‌کنند که در آن هر گره بر اساس بهترین تقسیم ممکن در همان لحظه ساخته می‌شود. این رویکرد اگرچه سریع و ساده است، اما تضمینی برای رسیدن به بهترین درخت ممکن در کل فضای جستجو ارائه نمی‌دهد، زیرا یک تقسیم ضعیف در مراحل اولیه می‌تواند منجر به تقسیم‌های بهتر در عمق‌های پایین‌تر شود که توسط روش حریصانه نادیده گرفته می‌شود. به عبارت دیگر، رویکرد حریصانه ممکن است در دام کمینه‌های محلی گرفتار شود و نتواند به راه‌حل بهینه جهانی دست یابد. برای رفع این محدودیت، چارچوبی تحت عنوان درخت‌های تصمیم بهینه معرفی شده است که با استفاده از چندین نقطه شروع تصادفی و جستجوی محلی، درخت را به‌صورت تکراری بهبود می‌دهد تا به یک درخت بهینه محلی دست یابد.

در چارچوب درخت‌های تصمیم بهینه، ابتدا چندین درخت اولیه به‌صورت تصادفی ساخته می‌شود و سپس هر یک از این درخت‌ها با استفاده از جستجوی محلی به‌صورت تکراری بهبود می‌یابد تا زمانی که هیچ بهبود بیشتری امکان‌پذیر نباشد. در هر تکرار جستجوی محلی، تمام گره‌های درخت به ترتیب تصادفی بررسی می‌شوند و برای هر گره سه گزینه وجود دارد: به‌روزرسانی تقسیم با جستجو در میان همه ویژگی‌ها و مقادیر آستانه ممکن، جایگزینی گره با زیردرخت چپ، و جایگزینی گره با زیردرخت راست. گزینه‌ای که بهترین مقدار تابع هدف را ارائه دهد انتخاب می‌شود. این فرآیند تا زمانی ادامه می‌یابد که هیچ بهبود بیشتری در تابع هدف حاصل نشود یا دو تکرار متوالی مقدار تابع هدف یکسانی داشته باشند. در نهایت، درختی که بهترین مقدار تابع هدف را در میان همه نقاط شروع تصادفی داشته باشد، به‌عنوان درخت بهینه نهایی انتخاب می‌شود. با این وجود، جستجوی محلی نیز تضمینی برای رسیدن به بهینه جهانی ارائه نمی‌دهد، مگر آنکه تعداد نقاط شروع تصادفی از تعداد کمینه‌های محلی بیشتر باشد؛ در حالی که در عمل تعداد کمینه‌های محلی یک مسئله بهینه‌سازی معمولاً نامشخص است و نمی‌توان با اطمینان گفت که تعداد نقاط شروع تصادفی کافی است. این محدودیت انگیزه اصلی پژوهشی است که در این پایان‌نامه دنبال می‌شود.

در این پایان‌نامه، رویکردی مبتنی بر شبیه‌سازی بازپخت به‌عنوان جایگزینی برای جستجوی محلی در ساخت درخت‌های تصمیم بهینه پیشنهاد شده است. شبیه‌سازی بازپخت یک تکنیک بهینه‌سازی الهام‌گرفته از فرآیند فیزیکی بازپخت فلزات است که در آن ماده ابتدا تا دمای بالا گرم می‌شود تا ساختار اولیه آن شکسته شود و سپس با سرد شدن تدریجی، به ساختاری منظم و پایدار دست می‌یابد. در این فرآیند، احتمال پذیرش راه‌حل‌های بدتر در دماهای بالا بیشتر است و با کاهش دما، این احتمال به‌تدریج کم می‌شود. به‌کارگیری این ایده در ساخت درخت تصمیم به این معناست که برخلاف جستجوی محلی که همیشه درخت را به سمت حالتی با مقدار تابع هدف بهتر هدایت می‌کند، در شبیه‌سازی بازپخت به‌صورت احتمالی اجازه داده می‌شود که درخت به حالتی با مقدار تابع هدف بدتر منتقل شود. این مکانیزم به ظاهر متناقض، اما کلید اصلی خروج از کمینه‌های محلی و رسیدن به راه‌حل‌های بهتر در ادامه فرآیند است، زیرا برخی تبدیل‌های به‌ظاهر نامطلوب می‌توانند مسیر را برای یافتن مدل نهایی بهتر هموار کنند. چالش اصلی در طراحی این چارچوب، تعریف یک برنامه سردسازی مناسب است که بتواند در زمان عملیاتی معقول، به یک راه‌حل بهینه جهانی یا نزدیک به آن دست یابد. برنامه سردسازی تعیین می‌کند که دما با چه سرعتی کاهش یابد و در هر دما چند گره بهینه شوند.

این پژوهش بر سه حوزه مسئله متمرکز است: طبقه‌بندی، تجویز و تحلیل بقا. برای هر یک از این حوزه‌ها، نسخه‌ای از درخت تصمیم بهینه با شبیه‌سازی بازپخت توسعه یافته است. در حوزه طبقه‌بندی، درخت طبقه‌بندی بهینه با شبیه‌سازی بازپخت معرفی می‌شود که هدف آن پیش‌بینی کلاس یا برچسب داده‌ها است و معیار ارزیابی آن ناخالصی جینی است که هرچه پایین‌تر باشد، عملکرد مدل بهتر است. در این حوزه، هر برگ درخت یک کلاس را پیش‌بینی می‌کند و درخت سعی می‌کند داده‌ها را به‌گونه‌ای تقسیم کند که نمونه‌های هر برگ تا حد ممکن به یک کلاس خاص تعلق داشته باشند. در حوزه تجویز، درخت سیاست بهینه با شبیه‌سازی بازپخت ارائه می‌شود که هدف آن انتخاب بهترین درمان یا اقدام برای هر زیرگروه از افراد است تا مقدار پاداش میانگین بیشینه شود. در این حوزه، برخلاف طبقه‌بندی که در آن پیش‌بینی یک کلاس انجام می‌شود، مدل یک توصیه یا تجویز ارائه می‌دهد و ممکن است هدف بیشینه‌سازی یا کمینه‌سازی یک پیامد خاص باشد. برای مثال، در یک مسئله پزشکی ممکن است هدف انتخاب دوز بهینه دارو برای بیشینه‌سازی احتمال بهبود بیمار باشد، یا در یک مسئله اقتصادی هدف انتخاب قیمت بهینه برای کمینه‌سازی قیمت مسکن باشد. در حوزه تحلیل بقا، درخت بقای بهینه با شبیه‌سازی بازپخت توسعه یافته است که هدف آن پیش‌بینی زمان بقا یا زمان رخداد یک رویداد مورد علاقه برای هر زیرگروه از داده‌ها است و معیار ارزیابی آن امتیاز درست‌نمایی کامل محلی است که هرچه پایین‌تر باشد، تطابق پیش‌بینی با منحنی کاپلان-مایر بهتر است. در این حوزه، داده‌ها اغلب شامل سانسور شدگی هستند، یعنی برای برخی نمونه‌ها زمان دقیق رخداد رویداد مشخص نیست و تنها می‌دانیم که تا یک زمان معین رخ نداده است. این نوع داده‌ها در مطالعات پزشکی، قابلیت اطمینان و علوم اجتماعی بسیار رایج هستند.

چارچوب پیشنهادی از چندین مؤلفه کلیدی تشکیل شده است که آن را از روش‌های پیشین متمایز می‌کند. نخست، ساخت نقاط شروع تصادفی به‌گونه‌ای متفاوت انجام می‌شود؛ به‌جای آنکه تقسیم ریشه همیشه از میان زیرمجموعه کوچکی از بهترین ویژگی‌ها انتخاب شود، هر ویژگی به‌طور مساوی برای تقسیم ریشه در میان نقاط شروع توزیع می‌شود تا تنوع کافی در ساختار اولیه درخت‌ها ایجاد شود. این تنوع برای الگوریتم شبیه‌سازی بازپخت حیاتی است، زیرا اگر همه نقاط شروع ساختار مشابهی داشته باشند، الگوریتم ممکن است نتواند بخش‌های مختلف فضای جستجو را به‌درستی کاوش کند. دوم، برنامه سردسازی هندسی به‌عنوان مناسب‌ترین گزینه انتخاب شده است، زیرا دما در ابتدا به‌سرعت کاهش می‌یابد و سپس با آهنگی کندتر ادامه می‌یابد؛ این الگو با نیاز الگوریتم به بازسازی ساختار درخت در دماهای بالا و سپس بهبود دقیق و گزینشی آن در دماهای پایین هماهنگ است. در برنامه سردسازی لگاریتمی، زمان اجرا بسیار طولانی‌تر می‌شود و در برنامه خطی، الگوریتم بیش از حد در دماهای بالا باقی می‌ماند که منجر به تصادفی شدن بیش‌ازحد درخت می‌شود. سوم، تبدیل درخت به حالت همسایه بر اساس یک مکانیزم رتبه‌بندی انجام می‌شود که در آن به‌جای انتخاب تصادفی از میان همسایه‌ها، در هر نوار دمایی یکی از رتبه‌های مشخص انتخاب می‌شود؛ در دماهای بالا رتبه‌های پایین‌تر و در دماهای پایین رتبه‌های بالاتر. این مکانیزم سرعت همگرایی را افزایش می‌دهد و از انحراف بیش‌ازحد جلوگیری می‌کند. چهارم، تنظیم فراپارامترها شامل طول زنجیره مارکوف، شعاع جستجوی همسایگی و جریمه پیچیدگی است که برای هر مجموعه داده به‌صورت جداگانه تنظیم می‌شود. پنجم، شرط خاتمه الگوریتم ترکیبی از رسیدن به پایان برنامه سردسازی و عدم امکان بهبود هیچ گره در دمای جاری است، و در تمام مراحل بهترین درخت مشاهده‌شده نگهداری می‌شود تا حتی اگر در دماهای پایین درخت از مسیر بهینه منحرف شد، مدل نهایی بهترین درخت یافت‌شده در طول فرآیند باشد.

ارزیابی چارچوب پیشنهادی بر روی مجموعه داده‌های واقعی و پرکاربرد انجام شده است تا عملکرد آن در مقایسه با روش‌های موجود سنجیده شود. در حوزه طبقه‌بندی، مدل بر روی ۶۱ مجموعه داده از مخزن یادگیری ماشین دانشگاه کالیفرنیا ایروین آزمایش شده و نتایج نشان می‌دهد که درخت طبقه‌بندی بهینه با شبیه‌سازی بازپخت در تمام عمق‌های بیشینه از درخت طبقه‌بندی بهینه با جستجوی محلی عملکرد بهتری دارد. این بهبود در عمق‌های سه، چهار و هفت از نظر آماری معنادار است. همچنین در مقایسه با درخت‌های طبقه‌بندی و رگرسیون، بهبود قابل‌توجهی در تمام عمق‌ها مشاهده می‌شود. در حوزه تجویز، مدل بر روی ۱۰ مجموعه داده واقعی آزمایش شده و در سه مجموعه داده از درخت سیاست بهینه با جستجوی محلی و در چهار مجموعه داده از درخت‌های طبقه‌بندی و رگرسیون عملکرد بهتری داشته است. اگرچه بهبود در همه مجموعه داده‌ها مشاهده نشده، اما نتایج نشان می‌دهد که انواع خاصی از مسائل ممکن است از این چارچوب بهره بیشتری ببرند. در حوزه تحلیل بقا، مدل بر روی ۱۰ مجموعه داده از مخزن داده‌های زمان تا رخداد آزمایش شده و در تمام عمق‌های بیشینه از درخت بقای بهینه با جستجوی محلی عملکرد بهتری داشته است؛ این بهبود در عمق‌های بالاتر از دو از نظر آماری معنادار است. در مقایسه با الگوریتم‌های موجود تحلیل بقا، نتایج رقابتی و در برخی موارد برتر بوده است.

علاوه بر ارزیابی‌های گسترده بر روی مجموعه داده‌های عمومی، این چارچوب در مطالعات موردی بر روی داده‌های واقعی پزشکی نیز به‌کار گرفته شده است تا کاربرد عملی آن در حوزه سلامت نشان داده شود. در حوزه طبقه‌بندی، مدل برای پیش‌بینی مرگ‌ومیر بیماران مبتلا به سارکوم در بازه پنج سال پس از جراحی استفاده شده و توانسته است دقت پیش‌بینی را در مقایسه با روش‌های موجود بهبود دهد. در حوزه تجویز، مدل برای انتخاب زیرگروهی از بیماران مبتلا به تومور گوارشی استرومال که از دریافت شیمی‌درمانی پس از جراحی سود می‌برند، به‌کار رفته و توانسته است گزینه درمانی بهتری را در مقایسه با روش‌های پیشین تجویز کند. در حوزه تحلیل بقا، مدل برای پیش‌بینی زمان بقای بیماران مبتلا به سارکوم در طول کامل دوره پیگیری استفاده شده و دقت پیش‌بینی بهتری نسبت به روش‌های موجود ارائه داده است. این نتایج نشان می‌دهد که رویکرد پیشنهادی نه‌تنها در محیط‌های آزمایشی، بلکه در کاربردهای واقعی و حساس پزشکی نیز می‌تواند به تصمیم‌گیری بهتر کمک کند و ابزاری مفید برای متخصصان حوزه سلامت فراهم آورد.

در مجموع، این پژوهش نشان می‌دهد که جایگزینی جستجوی محلی با شبیه‌سازی بازپخت در ساخت درخت‌های تصمیم بهینه، یک رویکرد مؤثر و تعمیم‌پذیر است که می‌تواند در سه حوزه طبقه‌بندی، تجویز و تحلیل بقا به بهبود عملکرد پیش‌بینی و تصمیم‌گیری منجر شود. این چارچوب با بهره‌گیری از مکانیزم احتمالی پذیرش راه‌حل‌های بدتر، امکان خروج از کمینه‌های محلی را فراهم می‌کند و در بسیاری از موارد به مدل‌هایی با عملکرد بهتر از روش‌های مبتنی بر جستجوی محلی و روش‌های حریصانه دست می‌یابد. با این حال، محدودیت‌هایی نیز وجود دارد؛ از جمله آنکه بهبود در همه مجموعه داده‌ها مشاهده نشده است و زمان اجرای الگوریتم به‌دلیل تعداد بیشتر تکرارها و نقاط شروع متعدد، نسبت به روش‌های سریع‌تر مانند درخت‌های طبقه‌بندی و رگرسیون طولانی‌تر است. برای پژوهش‌های آینده، می‌توان این چارچوب را به تحلیل رگرسیون نیز تعمیم داد و با ترکیب بهینه‌سازی مقاوم، مدل‌هایی ساخت که در برابر داده‌های نویزی و شرایط غیرقطعی مقاوم‌تر باشند. همچنین بهبود روش‌های تنظیم فراپارامترها و انتخاب اعتبارسنجی مناسب‌تر می‌تواند به انتخاب مدل‌های دقیق‌تر و تعمیم‌پذیرتر کمک کند. به‌طور کلی، این پژوهش گامی مهم در جهت توسعه مدل‌های یادگیری ماشین تفسیرپذیر با عملکرد بالا برداشته و نشان می‌دهد که ترکیب ایده‌های بهینه‌سازی پیشرفته با ساختارهای ساده و قابل‌فهم می‌تواند به نتایج ارزشمندی منجر شود.

سرفصل شماره صفحه
صفحه عنوان 1
چکیده 3
تقدیر و تشکر 5
فهرست شکل‌ها 19
فهرست جدول‌ها 23
۱. مقدمه 25
۱.۱. درخت‌های تصمیم بهینه با جستجوی محلی 25
۱.۱.۱. درخت‌های طبقه‌بندی بهینه (OCT) 26
۱.۱.۲. درخت‌های سیاست بهینه (OPT) 28
۱.۱.۳. درخت‌های بقای بهینه (OST) 29
۱.۲. درخت‌های تصمیم بهینه با شبیه‌سازی بازپخت 31
۱.۲.۱. درخت‌های طبقه‌بندی بهینه با شبیه‌سازی بازپخت (OCT-SA) 32
۱.۲.۲. درخت‌های سیاست بهینه با شبیه‌سازی بازپخت (OPT-SA) 32
۱.۲.۳. درخت‌های بقای بهینه با شبیه‌سازی بازپخت (OST-SA) 33
۱.۳. مشارکت‌های اصلی 34
۱.۳.۱. درخت‌های تصمیم بهینه با شبیه‌سازی بازپخت 34
۱.۳.۲. ارزیابی بر روی مجموعه داده‌های واقعی و پرکاربرد 34
۱.۳.۳. مطالعات موردی بر روی مجموعه داده‌های پزشکی واقعی 35
۱.۴. ساختار پایان‌نامه 35
۲. درخت‌های تصمیم بهینه با شبیه‌سازی بازپخت 37
۲.۱. ساخت نقطه شروع تصادفی 37
۲.۲. برنامه سردسازی هندسی 38
۲.۳. تبدیل درخت به حالت همسایه 40
۲.۴. تنظیم فراپارامترها 40
۲.۵. شرط خاتمه 42
۳. درخت‌های طبقه‌بندی بهینه با شبیه‌سازی بازپخت (OCT-SA) 43
۳.۱. مقدمه 44
۳.۲. الگوریتم‌ها 46
۳.۲.۱. معماری کلی OCT-SA در الگوریتم ۱: شبیه‌سازی بازپخت 48
۳.۲.۲. الگوریتم ۲: رتبه‌بندی تقسیم موازی 48
۳.۲.۳. الگوریتم ۳: زیردرخت همسایه 51
۳.۲.۴. الگوریتم ۴: بهینه‌سازی تقسیم موازی 52
۳.۲.۵. الگوریتم ۵: محاسبه احتمال 54
۳.۳. نتایج بر روی مجموعه داده‌های واقعی و بحث 55
۳.۳.۱. تنظیمات آزمایش 55
۳.۳.۲. OCT-SA در مقابل OCT و CART 56
۳.۴. نتیجه‌گیری 62
۴. درخت‌های سیاست بهینه با شبیه‌سازی بازپخت (OPT-SA) 63
۴.۱. مقدمه 63
۴.۲. الگوریتم‌ها 66
۴.۲.۱. معماری کلی OPT-SA در الگوریتم ۶: شبیه‌سازی بازپخت 69
۴.۲.۲. الگوریتم ۷: رتبه‌بندی تقسیم موازی 71
۴.۲.۳. الگوریتم ۸: زیردرخت همسایه 73
۴.۲.۴. الگوریتم ۹: بهینه‌سازی تقسیم موازی 73
۴.۲.۵. الگوریتم ۱۰: محاسبه احتمال 76
۴.۳. نتایج بر روی مجموعه داده‌های واقعی و بحث 77
۴.۳.۱. تنظیمات آزمایش 77
۴.۳.۲. OPT-SA در مقابل OPT و CART 79
۴.۴. نتیجه‌گیری 84
۵. درخت‌های بقای بهینه با شبیه‌سازی بازپخت (OST-SA) 85
۵.۱. مقدمه 86
۵.۲. الگوریتم‌ها 88
۵.۲.۱. معماری کلی OST-SA در الگوریتم ۱۱: شبیه‌سازی بازپخت 91
۵.۲.۲. الگوریتم ۱۲: رتبه‌بندی تقسیم موازی 93
۵.۲.۳. الگوریتم ۱۳: زیردرخت همسایه 94
۵.۲.۴. الگوریتم ۱۴: بهینه‌سازی تقسیم موازی 96
۵.۲.۵. الگوریتم ۱۵: محاسبه احتمال 96
۵.۳. نتایج بر روی مجموعه داده‌های واقعی و بحث 99
۵.۳.۱. تنظیمات آزمایش 99
۵.۳.۲. OST-SA در مقابل OST و sksurv 100
۵.۴. نتیجه‌گیری 104
۶. مطالعات موردی 105
۶.۱. تحلیل طبقه‌بندی برای سارکوم 105
۶.۱.۱. تنظیمات آزمایش 105
۶.۱.۲. OCT-SA در مقابل OCT و CART 106
۶.۲. تحلیل تجویزی برای تومور گوارشی استرومال (GIST) 110
۶.۲.۱. تنظیمات آزمایش 110
۶.۲.۲. OPT-SA در مقابل OPT و CART 112
۶.۳. تحلیل بقا برای سارکوم 116
۶.۳.۱. تنظیمات آزمایش 116
۶.۳.۲. OST-SA در مقابل OST و sksurv 117
۷. نتیجه‌گیری 121
مراجع 134

وقتی ماشین یاد می‌گیرد اشتباه کند: راز درخت‌هایی که هوشمندانه‌تر تصمیم می‌گیرند

تصور کنید در حال بازی شطرنج هستید و هر حرکت را طوری انتخاب می‌کنید که در همان لحظه بهترین به نظر برسد. اما بعد از چند حرکت، متوجه می‌شوید که در دام افتاده‌اید. این دقیقاً همان مشکلی است که بسیاری از الگوریتم‌های یادگیری ماشین با آن دست‌وپنجه نرم می‌کنند. آن‌ها همیشه بهترین انتخاب لحظه‌ای را انجام می‌دهند، غافل از اینکه گاهی یک انتخاب به‌ظاهر ضعیف می‌تواند در نهایت به یک نتیجه درخشان منجر شود. اینجاست که ایده‌ای جسورانه و الهام‌گرفته از علم مواد وارد می‌شود: شبیه‌سازی بازپخت. رویکردی که به ماشین یاد می‌دهد گاهی اشتباه کند تا در نهایت درست‌ترین تصمیم را بگیرد.

چرا درخت‌های تصمیم این‌قدر مهم شده‌اند؟

درخت تصمیم یکی از معدود مدل‌های یادگیری ماشین است که انسان می‌تواند به‌راحتی آن را درک کند. هر گره یک پرسش ساده است: «آیا این مقدار کمتر از فلان حد است؟» و بر اساس پاسخ، مسیر ادامه می‌یابد تا در نهایت به یک پیش‌بینی برسیم. این شفافیت باعث شده که در حوزه‌های حساس مانند پزشکی، بانکداری و قضاوت، درخت‌های تصمیم جایگاه ویژه‌ای داشته باشند. اما مشکل اصلی اینجاست که ساختن بهترین درخت تصمیم ممکن، یک مسئله بسیار پیچیده است. روش‌های سنتی مانند CART با یک رویکرد حریصانه درخت را می‌سازند: در هر مرحله بهترین تقسیم را انتخاب می‌کنند. این روش سریع است، اما تضمینی برای رسیدن به بهترین درخت ممکن وجود ندارد.

برای رفع این مشکل، محققان چارچوبی به نام درخت‌های تصمیم بهینه را معرفی کردند که از چندین نقطه شروع تصادفی و جستجوی محلی استفاده می‌کند. ایده این است که به‌جای یک بار ساختن درخت، صدها درخت اولیه ساخته شود و هر کدام به‌صورت تکراری بهبود یابند. در نهایت، بهترین درخت از میان همه آن‌ها انتخاب می‌شود. این روش عملکرد بهتری نسبت به CART دارد، اما هنوز یک ایراد اساسی دارد: جستجوی محلی همیشه درخت را به سمت بهبود هدایت می‌کند و اگر در یک دره محلی گرفتار شود، نمی‌تواند از آن خارج شود. تعداد این دره‌های محلی در مسائل واقعی معمولاً نامشخص است و نمی‌توان با اطمینان گفت که تعداد نقاط شروع تصادفی کافی بوده است.

شبیه‌سازی بازپخت: هنر اشتباه کردن هوشمندانه

ایده شبیه‌سازی بازپخت از فرآیند ساخت فلزات گرفته شده است. وقتی فلز را تا دمای بالا گرم می‌کنند، اتم‌ها آزادانه حرکت می‌کنند و ساختار اولیه شکسته می‌شود. سپس با سرد شدن تدریجی، اتم‌ها به آرامی در جای خود قرار می‌گیرند و ساختاری منظم و پایدار شکل می‌گیرد. نکته کلیدی اینجاست که در دماهای بالا، اتم‌ها اجازه دارند به مکان‌های نامناسب نیز بروند، اما با کاهش دما، این آزادی کمتر و کمتر می‌شود تا در نهایت به یک ساختار بهینه برسند.

حالا این ایده را به دنیای درخت‌های تصمیم می‌آوریم. در روش جدید، به‌جای آنکه همیشه بهترین تغییر ممکن را انتخاب کنیم، با احتمالی اجازه می‌دهیم درخت به حالتی با عملکرد بدتر منتقل شود. این کار در دماهای بالا با احتمال بیشتری انجام می‌شود و در دماهای پایین، این احتمال به‌تدریج کاهش می‌یابد. چرا این کار مفید است؟ زیرا برخی تغییرات به‌ظاهر نامطلوب می‌توانند درخت را از یک دره محلی خارج کنند و مسیر را برای یافتن یک مدل بسیار بهتر هموار کنند. به عبارت دیگر، درخت یاد می‌گیرد که گاهی اشتباه کند تا در نهایت درست‌ترین تصمیم را بگیرد.

«برخلاف جستجوی محلی که همیشه درخت را به سمت حالتی با مقدار تابع هدف بهتر هدایت می‌کند، در شبیه‌سازی بازپخت به‌صورت احتمالی اجازه داده می‌شود که درخت به حالتی با مقدار تابع هدف بدتر منتقل شود. این مکانیزم به ظاهر متناقض، اما کلید اصلی خروج از کمینه‌های محلی و رسیدن به راه‌حل‌های بهتر در ادامه فرآیند است.»

سه دنیای متفاوت، یک راه‌حل هوشمند

این پژوهش فقط به یک حوزه محدود نمی‌شود. محققان این چارچوب را در سه حوزه کاملاً متفاوت به کار گرفته‌اند و در هر سه حوزه به نتایج چشمگیری دست یافته‌اند. در حوزه طبقه‌بندی، هدف پیش‌بینی یک برچسب یا کلاس است. مثلاً آیا یک ایمیل اسپم است یا خیر؟ در اینجا، مدل جدید بر روی ۶۱ مجموعه داده واقعی آزمایش شده و در تمام عمق‌ها از روش‌های قبلی بهتر عمل کرده است. جالب اینکه در برخی مجموعه داده‌ها، بهبود عملکرد بسیار قابل توجه بوده است.

در حوزه تجویز، ماجرا کمی پیچیده‌تر است. اینجا هدف فقط پیش‌بینی نیست، بلکه انتخاب بهترین اقدام یا درمان برای هر فرد یا گروه است. مثلاً برای یک بیمار خاص، کدام دوز دارو بهترین نتیجه را می‌دهد؟ مدل جدید در این حوزه نیز توانسته در چندین مجموعه داده از روش‌های موجود پیشی بگیرد. اگرچه بهبود در همه موارد مشاهده نشده، اما نتایج نشان می‌دهد که برای انواع خاصی از مسائل، این رویکرد می‌تواند بسیار مؤثر باشد.

در حوزه تحلیل بقا، هدف پیش‌بینی زمان رخداد یک رویداد است. مثلاً یک بیمار چقدر زنده می‌ماند؟ این حوزه با چالش داده‌های سانسور شده مواجه است، یعنی برای برخی نمونه‌ها زمان دقیق رخداد مشخص نیست. مدل جدید در این حوزه نیز بر روی ۱۰ مجموعه داده آزمایش شده و در تمام عمق‌ها از روش‌های قبلی بهتر عمل کرده است. این نتایج نشان می‌دهد که ایده شبیه‌سازی بازپخت یک راه‌حل عمومی و قدرتمند است که می‌تواند در حوزه‌های بسیار متنوعی به کار رود.

از آزمایشگاه تا بالین بیمار

شاید جذاب‌ترین بخش این پژوهش، کاربردهای واقعی آن در حوزه پزشکی باشد. محققان این چارچوب را بر روی داده‌های واقعی بیماران مبتلا به سارکوم و تومور گوارشی استرومال آزمایش کرده‌اند. در یک مطالعه موردی، مدل توانسته است با دقت بالاتری پیش‌بینی کند که کدام بیماران مبتلا به سارکوم احتمالاً در پنج سال پس از جراحی جان خود را از دست می‌دهند. این پیش‌بینی می‌تواند به پزشکان کمک کند تا منابع درمانی را بهتر تخصیص دهند و بر بیماران پرخطر تمرکز کنند.

در مطالعه موردی دیگر، مدل برای انتخاب زیرگروهی از بیماران مبتلا به تومور گوارشی استرومال که از شیمی‌درمانی پس از جراحی سود می‌برند، به کار رفته است. این یعنی به‌جای آنکه همه بیماران شیمی‌درمانی دریافت کنند، فقط آن‌هایی که واقعاً نیاز دارند این درمان را دریافت می‌کنند. این رویکرد نه‌تنها هزینه‌های درمانی را کاهش می‌دهد، بلکه عوارض جانبی غیرضروری را نیز کم می‌کند. در حوزه تحلیل بقا نیز مدل توانسته است زمان بقای بیماران مبتلا به سارکوم را با دقت بهتری پیش‌بینی کند.

چرا این یافته‌ها مهم هستند؟

اهمیت این پژوهش را می‌توان از چند زاویه بررسی کرد. نخست، این روش نشان می‌دهد که ترکیب ایده‌های بهینه‌سازی پیشرفته با ساختارهای ساده و قابل‌فهم می‌تواند به نتایج ارزشمندی منجر شود. در دنیایی که مدل‌های پیچیده و غیرقابل‌تفسیر مانند شبکه‌های عصبی عمیق روزبه‌روز محبوب‌تر می‌شوند، این پژوهش ثابت می‌کند که هنوز می‌توان با مدل‌های ساده و شفاف به عملکرد بالا دست یافت.

دوم، این پژوهش یک راه‌حل عمومی ارائه می‌دهد که در سه حوزه کاملاً متفاوت قابل استفاده است. این یعنی محققان و متخصصان حوزه‌های مختلف می‌توانند از این چارچوب برای مسائل خود استفاده کنند، بدون آنکه نیاز باشد از صفر شروع کنند. سوم، کاربردهای واقعی این پژوهش در پزشکی نشان می‌دهد که این روش فقط یک تمرین آکادمیک نیست، بلکه می‌تواند به بهبود واقعی در زندگی بیماران منجر شود.

«این نتایج نشان می‌دهد که رویکرد پیشنهادی نه‌تنها در محیط‌های آزمایشی، بلکه در کاربردهای واقعی و حساس پزشکی نیز می‌تواند به تصمیم‌گیری بهتر کمک کند و ابزاری مفید برای متخصصان حوزه سلامت فراهم آورد.»

نگاهی به آینده

مانند هر پژوهش دیگری، این کار نیز محدودیت‌های خود را دارد. زمان اجرای الگوریتم به‌دلیل تعداد بیشتر تکرارها و نقاط شروع متعدد، نسبت به روش‌های سریع‌تر مانند CART طولانی‌تر است. همچنین بهبود در همه مجموعه داده‌ها مشاهده نشده است. اما این محدودیت‌ها خود نشان‌دهنده مسیرهای جدیدی برای پژوهش‌های آینده هستند. محققان پیشنهاد می‌کنند که این چارچوب می‌تواند به تحلیل رگرسیون نیز تعمیم یابد و با ترکیب بهینه‌سازی مقاوم، مدل‌هایی ساخت که در برابر داده‌های نویزی و شرایط غیرقطعی مقاوم‌تر باشند.

شاید بزرگ‌ترین درس این پژوهش این باشد که گاهی برای رسیدن به بهترین نتیجه، باید جسور باشیم و اجازه دهیم مسیرمان مستقیم نباشد. همان‌طور که در شبیه‌سازی بازپخت، پذیرش موقت اشتباهات می‌تواند به یافتن راه‌حل‌های بهتر منجر شود، در پژوهش نیز پذیرش ایده‌های غیرمتعارف می‌تواند به پیشرفت‌های بزرگ منجر شود. این دقیقاً همان چیزی است که این پایان‌نامه با زیبایی تمام آن را به تصویر می‌کشد.

بسیار سریع و ساده می توانید اصل این پایان نامه را به صورت فایل PDF در اختیار داشته باشید.

پس از دریافت پایان‌نامه، کلیه اطلاعات کتاب‌شناختی موردنیاز برای استناد علمی، از جمله نام دانشگاه، عنوان پایان‌نامه، نام پژوهشگر، سال دفاع و سایر مشخصات مرتبط، جهت ارجاع‌دهی صحیح مطابق با استانداردهای رایج، در اختیار شما قرار خواهد گرفت.