این پایان‌نامه به ارائه یک چارچوب نوین برای پیش‌بینی وضعیت بیماران مبتلا به اختلالات خواب می‌پردازد. در حالی که تشخیص بیماری‌هایی مانند نارکولپسی و خواب‌زدگی بیش از حد (ایدیوپاتیک هیپرسومنیا) اغلب سال‌ها به طول می‌انجامد و با خطاهای فراوانی همراه است، پژوهش حاضر می‌کوشد با بهره‌گیری از روش‌های نوین یادگیری ماشین، فرآیندی قابل اعتماد برای کمک به پزشکان و بیماران ارائه دهد. هدف اصلی، پیش‌بینی مجموعه‌ای از تشخیص‌های محتمل یا درمان‌های مناسب با سطح اطمینانی مشخص است تا از این طریق، ابهام موجود در مسیر بالینی کاهش یابد.

رویکرد اصلی این پژوهش بر پایه «پیش‌بینی تطبیقی» (Conformal Prediction) استوار است. این روش به جای ارائه یک پاسخ قطعی و اغلب نادقیق، مجموعه‌ای از گزینه‌های تشخیصی یا درمانی را پیشنهاد می‌کند که با سطح اطمینان تعیین‌شده‌ای (مثلاً ۹۵٪) شامل پاسخ صحیح هستند. به عبارت دیگر، به جای گفتن «این بیماری مشخص است»، سیستم می‌گوید: «با اطمینان بالا، تشخیص بیمار یکی از این سه مورد است». این ویژگی در حوزه پزشکی که خطر خطا بالاست، بسیار ارزشمند محسوب می‌شود.

برای عملیاتی‌سازی این چارچوب، از داده‌های واقعی بیمه‌های سلامت آمریکا (شامل سوابق دارویی، تشخیص‌های قبلی و اطلاعات جمعیتی) استفاده شده است. مدل پایه با الگوریتم‌هایی مانند درخت تصمیم و نزدیک‌ترین همسایه‌ها آموزش دیده و سپس مرحله «کالیبراسیون» با استفاده از داده‌های جداگانه، سطح اطمینان نهایی را تنظیم می‌کند. نتیجه این فرآیند، تولید مجموعه‌ای از تشخیص‌هاست که نه تنها از دقت آماری بالایی برخوردار است، بلکه میزان نااطمینانی آن به روشنی قابل محاسبه و گزارش است.

یکی از بخش‌های جذاب این پژوهش، به کارگیری «طبقه‌بندی انتخابی» (Selective Classification) است. در این روش، مدل این اختیار را دارد که در مواقعی که سطح اطمینان کافی برای پیش‌بینی وجود ندارد، از ارائه هرگونه تشخیص خودداری کند و پاسخ «مردد» یا «نیاز به بررسی بیشتر» بدهد. این ویژگی از ارائه پیش‌بینی‌های پرریسک و نادرست جلوگیری کرده و به افزایش اعتمادپذیری کلی سیستم کمک شایانی می‌کند. یافته‌ها نشان می‌دهد که در زیرمجموعه‌هایی از بیماران که مدل با اطمینان بالا پاسخ می‌دهد، دقت پیش‌بینی به بیش از ۹۸٪ می‌رسد که در مقایسه با روش‌های سنتی، پیشرفتی قابل توجه است.

علاوه بر کارایی بالینی، این پژوهش به مقوله «عدالت الگوریتمی» نیز توجه ویژه‌ای داشته است. بررسی‌ها نشان داد که نرخ خودداری از پاسخ (ابتناء) و دقت پیش‌بینی در گروه‌های مختلف جنسی و نژادی تفاوت‌هایی دارد؛ به عنوان مثال، زنان در این مطالعه نرخ ابتناء بالاتری داشتند اما دقت پاسخ‌های پذیرفته‌شده در آن‌ها به ۱۰۰٪ می‌رسید. پژوهشگران با آگاهی از این نابرابری‌ها، راهکارهایی مانند تعدیل آستانه اطمینان برای گروه‌های مختلف را پیشنهاد می‌دهند تا همه بیماران به طور عادلانه‌تری از مزایای این فناوری بهره‌مند شوند.

در مجموع، این پایان‌نامه نشان می‌دهد که حتی در شرایطی که داده‌های پزشکی نویزدار و مرزهای تشخیصی میان بیماری‌ها مبهم است، می‌توان با ترکیب روش‌های آماری نوین، ابزاری کارآمد و قابل اعتماد برای محیط‌های بالینی ساخت. مهم‌ترین دستاورد، نه پیش‌بینی صددرصد دقیق، بلکه مدیریت هوشمندانه عدم‌اطمینان است؛ به طوری که پزشک و بیمار بدانند دقیقاً چقدر به پاسخ تولیدشده توسط الگوریتم می‌توان اعتماد کرد و در موارد عدم اطمینان، چه مسیرهای جایگزینی وجود دارد.

چارچوب ارائه‌شده در این پژوهش، قابلیت تعمیم به سایر خانواده‌های بیماری‌های با تشخیص دشوار را دارد و می‌تواند به عنوان استانداردی جدید برای سیستم‌های پشتیبان تصمیم‌گیری پزشکی در نظر گرفته شود. با گسترش استفاده از چنین رویکردهایی، انتظار می‌رود که فرآیند تشخیص و درمان برای بیماری‌های پیچیده عصبی، سریع‌تر، دقیق‌تر و عادلانه‌تر از گذشته انجام شود و بار روانی و مالی تحمیل‌شده بر بیماران و نظام سلامت به میزان قابل‌توجهی کاهش یابد.

یکی از نقاط قوت این پژوهش، استفاده از روش «یادگیری بدون پشیمانی» (No-Regret Learning) در کنار پیش‌بینی تطبیقی است. این روش به مدل کمک می‌کند تا در شرایط پیچیده بالینی، بهترین تصمیم ممکن را با در نظر گرفتن تمام گزینه‌های جایگزین اتخاذ کند. به عبارت دیگر، مدل نه تنها به دنبال پاسخ درست است، بلکه سعی می‌کند از انتخاب گزینه‌هایی که ممکن است بعداً پشیمانی به همراه داشته باشند، اجتناب کند. این ویژگی به ویژه در شرایطی که پزشک با چندین گزینه درمانی مشابه روبرو است، بسیار حیاتی به نظر می‌رسد.

نکته قابل تأمل دیگر، کاربرد بالینی این چارچوب در کاهش زمان تشخیص است. همانطور که در پژوهش اشاره شده، زنان مبتلا به نارکولپسی به طور متوسط ۱۲ سال دیرتر از مردان تشخیص داده می‌شوند. استفاده از این سیستم می‌تواند با ارائه مجموعه‌ای از تشخیص‌های محتمل در مراحل اولیه بیماری، این شکاف زمانی را به میزان قابل توجهی کاهش دهد. همچنین در مورد بیماری‌هایی که تشخیص آن‌ها از طریق طرد (Rule-out) انجام می‌شود، مانند ایدیوپاتیک هیپرسومنیا، این چارچوب می‌تواند با حذف سیستماتیک سایر تشخیص‌ها، فرآیند تشخیص را تسریع بخشد.

از منظر فنی، پژوهشگران با چالش‌های متعددی در پردازش داده‌های بیمه مواجه بوده‌اند. داده‌های بیمه‌ای آمریکا به دلیل ساختار پیچیده و حجم بسیار بالا (بیش از ۲۷۳ میلیون بیمار)، نیازمند تکنیک‌های پیشرفته پایگاه داده و پردازش موازی بوده است. با وجود این چالش‌ها، تیم پژوهش موفق شده است با استفاده از ابزارهایی مانند DuckDB و PostgreSQL، داده‌های مورد نیاز را استخراج و پردازش کند. همچنین، انتخاب ویژگی‌های مناسب مانند سابقه دارویی، تشخیص‌های قبلی و اطلاعات جمعیتی، نقش کلیدی در موفقیت نهایی مدل داشته است.

در زمینه کاربردهای عملی، این چارچوب می‌تواند در سیستم‌های پشتیبانی تصمیم‌گیری بالینی (CDSS) ادغام شود. پزشکان با وارد کردن سوابق بیمار، مجموعه‌ای از تشخیص‌های محتمل را با سطح اطمینان مشخص دریافت می‌کنند. این امر نه تنها به تشخیص سریع‌تر کمک می‌کند، بلکه از تشخیص‌های اشتباه که می‌توانند منجر به درمان‌های نادرست و هزینه‌های اضافی شوند، جلوگیری می‌نماید. همچنین، بیماران می‌توانند با آگاهی از سطح اطمینان تشخیص، تصمیمات بهتری در مورد پیگیری درمان خود بگیرند.

در پایان، این پژوهش نشان می‌دهد که ترکیب روش‌های آماری نوین با داده‌های واقعی بالینی می‌تواند تحولی اساسی در فرآیند تشخیص و درمان بیماری‌های پیچیده ایجاد کند. رویکرد پیشنهادی نه تنها دقت تشخیص را افزایش می‌دهد، بلکه با مدیریت هوشمندانه عدم‌اطمینان و توجه به عدالت الگوریتمی، گامی مهم در جهت پزشکی دقیق و عادلانه‌تر برداشته است. انتظار می‌رود با توسعه بیشتر این چارچوب و اعمال آن بر روی سایر بیماری‌ها، شاهد کاهش چشمگیر خطاهای تشخیصی و بهبود کیفیت زندگی بیماران باشیم.

توسعه این نوع سیستم‌ها در آینده می‌تواند به سمت استفاده از داده‌های چندوجهی مانند گزارشات ملاقات بیمار و تصاویر پزشکی پیش رود. همچنین، استفاده از مدل‌های زبانی بزرگ (LLM) برای درک بهتر متن گزارشات پزشکی، می‌تواند دقت پیش‌بینی‌ها را به میزان قابل توجهی افزایش دهد. علاوه بر این، اعمال این چارچوب در سیستم‌های بهداشتی سایر کشورها با پوشش همگانی درمان، می‌تواند دیدگاه جامع‌تری در مورد عملکرد الگوریتم در جمعیت‌های مختلف ارائه دهد.

عنوان شماره صفحه
چکیده ۳
قدردانی ۵
فصل ۱: مقدمه ۱۱
   ۱-۱ اختلالات خواب ۱۲
   ۱-۲ پیش‌بینی تطبیقی و طبقه‌بندی انتخابی ۱۳
   ۱-۳ مروری بر پژوهش ۱۴
فصل ۲: پیشینه پژوهش ۱۵
   ۲-۱ پژوهش‌های پیشین در الگوریتم‌های بالینی پیش‌بینی‌کننده ۱۵
   ۲-۲ پژوهش‌های پیشین در پیش‌بینی تطبیقی ۱۶
   ۲-۳ پژوهش‌های پیشین در طبقه‌بندی انتخابی ۱۷
فصل ۳: اکتشاف و تحلیل داده ۱۹
   ۳-۱ پیش‌پردازش داده ۱۹
   ۳-۲ ساخت گروه نمونه ۲۱
   ۳-۳ مقایسه مدل‌های پایه یادگیری ماشین ۲۳
فصل ۴: وظایف پیش‌بینی ۲۴
   ۴-۱ پیش‌بینی تشخیص نهایی ۲۴
   ۴-۲ پیش‌بینی برنامه درمانی ۲۶
فصل ۵: پیش‌بینی تطبیقی ۲۸
   ۵-۱ بنیان پیش‌بینی تطبیقی ۲۸
   ۵-۲ یادگیری بدون پشیمانی ۳۱
   ۵-۳ مدل‌های پایه ۳۳
   ۵-۴ معماری مدل ۳۸
   ۵-۵ ویژگی‌های مدل ۳۹
   ۵-۶ نتایج ۴۰
فصل ۶: طبقه‌بندی انتخابی ۴۴
   ۶-۱ انتخاب آستانه و پیامدهای افتراقی ۴۵
   ۶-۲ عدالت الگوریتمی و تفاوت‌های جمعیتی در نرخ خودداری از پاسخ ۴۶
فصل ۷: نتیجه‌گیری ۴۹
   ۷-۱ محدودیت‌ها ۴۹
   ۷-۲ یافته‌ها ۵۰
   ۷-۳ کارهای آینده ۵۱
فصل ۸: کتابنامه ۵۳

🔮 وقتی الگوریتم می‌گوید «نمی‌دانم»: چطور پیش‌بینی تطبیقی، تشخیص پزشکی را متحول می‌کند؟

تصور کنید به پزشک مراجعه می‌کنید و او پس از بررسی، به جای یک تشخیص قاطع، می‌گوید: «با اطمینان ۹۵٪، بیماری شما یکی از این سه چیز است.» شاید در نگاه اول این پاسخ ناقص به نظر برسد، اما دقیقاً همین «ابهام هوشمندانه» است که می‌تواند جان انسان‌ها را نجات دهد. در دنیای تشخیص بیماری‌های عصبی مثل نارکولپسی، جایی که اشتباه گرفتن دو بیماری مشابه می‌تواند سال‌ها درمان را به تأخیر بیندازد، دانستن مرزهای نادانسته‌هایمان ارزشمندتر از هر پیش‌بینی قطعی است.

🎯 چالش: وقتی داده‌ها مبهم هستند

تشخیص افتراقی بین نارکولپسی نوع ۱، نوع ۲ و خواب‌زدگی بیش از حد (ایدیوپاتیک هیپرسومنیا) یکی از دشوارترین کارهای پزشکی است. این سه اختلال علائم تقریباً یکسانی دارند و حتی پزشکان متخصص هم گاهی سال‌ها در تشخیص مردد می‌مانند. آمارها نشان می‌دهد زنان به طور متوسط ۱۲ سال دیرتر از مردان تشخیص درست دریافت می‌کنند. در چنین شرایطی، یک الگوریتم معمولی که فقط یک پاسخ قطعی می‌دهد، نه تنها کمکی نیست، بلکه می‌تواند خطرناک باشد.

💡 راه‌حل: پیش‌بینی تطبیقی و هنر «نمی‌دانم» گفتن

پژوهشگران مؤسسه فناوری ماساچوست (MIT) با الهام از روشی به نام «پیش‌بینی تطبیقی» (Conformal Prediction)، چارچوبی طراحی کرده‌اند که به جای پاسخ قطعی، مجموعه‌ای از گزینه‌های محتمل را با سطح اطمینان مشخص ارائه می‌دهد. به عبارت دیگر، مدل می‌گوید: «با اطمینان ۹۵٪، تشخیص صحیح یکی از این سه مورد است.» این روش که در آمار به «پوشش حاشیه‌ای» معروف است، تضمین می‌کند که در بلندمدت، حداقل ۹۵٪ از مجموعه‌پاسخ‌ها شامل پاسخ درست باشند.

نکته جذاب‌تر، توانایی «خودداری هوشمندانه» (Selective Classification) است. اگر داده‌های بیمار به قدری مبهم باشد که مدل نتواند به آستانه اطمینان تعیین‌شده برسد، به جای حدس زدن، می‌گوید: «برای این بیمار اطلاعات کافی ندارم، نیاز به بررسی بیشتر است.» این ویژگی از ارائه پیش‌بینی‌های پرریسک جلوگیری می‌کند و اعتمادپذیری سیستم را به شدت افزایش می‌دهد.

«در حوزه‌های پرخطر مانند پزشکی، مدیریت عدم‌اطمینان از خود پیش‌بینی مهم‌تر است.» — آنجلولوپولوس و بیتس، مقاله «آشنایی ملایم با پیش‌بینی تطبیقی» (۲۰۲۱)

📊 داده‌ها و پیاده‌سازی

برای آزمایش این چارچوب، از داده‌های واقعی بیمه‌های سلامت آمریکا شامل سوابق دارویی، تشخیص‌های قبلی، اطلاعات جمعیتی و حتی آزمایش‌های انجام‌شده برای بیش از ۲۷۳ میلیون بیمار استفاده شده است. نکته شگفت‌انگیز این است که با وجود نویز بالا در داده‌های بیمه‌ای (مثلاً پزشکان گاهی برای تأمین پوشش بیمه، تشخیص را تغییر می‌دهند)، مدل توانسته در زیرمجموعه‌ای از بیماران که با اطمینان بالا پاسخ داده، به دقت بیش از ۹۸٪ دست یابد.

جالب‌تر این که مدل برای تشخیص نارکولپسی نوع ۲ که از همه شایع‌تر است، بالاترین سطح اطمینان را نشان می‌دهد و برای نوع ۱ که نادرتر است، معمولاً مجموعه‌پاسخ بزرگ‌تری تولید می‌کند. این رفتار دقیقاً نشان‌دهنده منطق بالینی است: هرچه بیماری نادرتر باشد، به بررسی بیشتری نیاز دارد.

⚖️ عدالت الگوریتمی: وقتی مدل به بعضی گروه‌ها بیشتر کمک می‌کند

یکی از یافته‌های مهم این پژوهش، تفاوت عملکرد مدل در گروه‌های مختلف جمعیتی است. بررسی نرخ «خودداری از پاسخ» نشان داد که زنان نرخ خودداری بالاتری دارند (۵۴٪ در مقابل ۴۴٪ برای مردان)، اما در عوض، وقتی مدل برای زنان پاسخ می‌دهد، دقت آن به ۱۰۰٪ می‌رسد. این یعنی زنان در شرایطی که مدل اطمینان کافی دارد، از دقیق‌ترین پیش‌بینی‌ها بهره‌مند می‌شوند. پژوهشگران پیشنهاد می‌دهند که با تنظیم آستانه اطمینان برای هر گروه، می‌توان عدالت را افزایش داد و به همه بیماران خدمت بهتری ارائه کرد.

🔭 افق‌های پیش رو

این پژوهش نشان می‌دهد که در پیچیده‌ترین مسائل تشخیصی، بهترین راه حل، وانمود نکردن به دانستن همه چیز است. چارچوب پیشنهادی قابلیت تعمیم به سایر بیماری‌های با تشخیص دشوار مانند بیماری‌های خودایمنی و انواع سرطان را دارد. در آینده، ترکیب این روش با مدل‌های زبانی بزرگ برای تحلیل گزارشات پزشکی، می‌تواند دقت را به سطح جدیدی برساند. اما مهم‌تر از همه، این رویکرد به پزشکان و بیماران یادآوری می‌کند که در دنیای پر از ابهام پزشکی، دانستن مرزهای دانسته‌هایمان، اولین قدم به سوی درمان درست است.

بسیار سریع و ساده می توانید اصل این پایان نامه را به صورت فایل PDF در اختیار داشته باشید.

پس از دریافت پایان‌نامه، کلیه اطلاعات کتاب‌شناختی موردنیاز برای استناد علمی، از جمله نام دانشگاه، عنوان پایان‌نامه، نام پژوهشگر، سال دفاع و سایر مشخصات مرتبط، جهت ارجاع‌دهی صحیح مطابق با استانداردهای رایج، در اختیار شما قرار خواهد گرفت.