شناسایی ساختار دقیق مولکول‌های کوچک از میان مخلوط‌های پیچیده، یکی از دشوارترین و در عین حال حیاتی‌ترین مسائل در علوم دارویی، محیط‌زیستی و متابولومیکس به شمار می‌رود. روش اصلی برای این کار، استفاده از طیف‌سنجی جرمی پشت‌سرهم (LC-MS/MS) است که الگوی قطعه‌قطعه‌شدن یک مولکول ناشناخته را ثبت می‌کند. در سال‌های اخیر، تلاش‌های گسترده‌ای برای به‌کارگیری الگوریتم‌های یادگیری ماشین در این حوزه صورت گرفته است، اما نتایج به‌دست‌آمده چندان امیدوارکننده نبوده و حتی مدل‌های پیشرفته نیز عملکردی پایین‌تر از روش‌های سادهٔ سنتی دارند. این پژوهش با هدف ریشه‌یابی این ناکارآمدی، از رویکردی نظام‌مند و خودکار برای کشف نقاط کور مدل‌های فعلی استفاده کرده است.

رویکرد غالب در این حوزه، تبدیل طیف جرمی ورودی به یک «اثرانگشت مولکولی» (بردار دودویی از ویژگی‌های ساختاری) است. سپس این اثرانگشت پیش‌بینی‌شده، به‌عنوان کلید جستجو در پایگاه‌های دادهٔ شیمیایی مانند پاب‌کم استفاده می‌شود تا مشابه‌ترین ساختار پیدا شود. با وجود منطق ساده و کارآمد این روش، مدل‌های یادگیری ماشین موجود از عهدهٔ این کار برنمی‌آیند. یکی از مشاهدات کلیدی این پژوهش این است که یک روش بسیار ابتدایی به نام «همسایگی نزدیک» که صرفاً نزدیک‌ترین طیف موجود در کتابخانه را برمی‌گرداند، به‌طور میانگین عملکردی بهتر از تمام مدل‌های هوشمند دارد. این واقعیت تلخ، نشان‌دهندهٔ وجود نقص‌های بنیادین در طراحی و آموزش این مدل‌هاست که با افزایش حجم داده یا تنظیم سادهٔ پارامترها قابل رفع نیست.

برای کشف این نقص‌ها، پژوهشگران از دو ابزار تحلیلی قدرتمند از خانوادهٔ «انتساب داده» بهره گرفته‌اند. ابزار نخست، الگوریتم «تقسیم‌بندی برای یادگیری» نام دارد. این الگوریتم به‌جای تقسیم تصادفی داده‌ها، یک تقسیم‌بندی هوشمندانه ارائه می‌دهد که در آن مدل، ضعیف‌ترین عملکرد ممکن را روی مجموعهٔ آزمون داشته باشد. با بررسی ویژگی‌های این تقسیم‌بندی‌های دشوار، مشخص شد که مدل‌ها در برابر تغییرات «شرایط آزمایشگاهی» به‌شدت شکننده هستند. عواملی مانند انرژی برخورد یون‌ها، نوع مادهٔ افزوده‌شده به یون (آدوکت) و نوع دستگاه طیف‌سنجی، تأثیر چشمگیری بر الگوی طیف دارند، به‌گونه‌ای که طیف یک مولکول یکسان در دو شرایط مختلف، کاملاً متفاوت به نظر می‌رسد. مدل‌های فعلی نمی‌توانند این تغییرات را درک کنند و هر مولکول را در هر شرایطی، موجودی کاملاً جدید می‌پندارند. این یافته نشان می‌دهد که یکی از بزرگ‌ترین موانع، ناتوانی در تعمیم‌دهی به شرایط آزمایشگاهی گوناگون است.

ابزار دوم، «تابع تأثیر» نام دارد که نقش هر نمونهٔ آموزشی را در پیش‌بینی هر نمونهٔ آزمونی به‌صورت عددی اندازه‌گیری می‌کند. این روش مشخص می‌کند کدام نمونه‌های آموزشی به پیش‌بینی یک نمونه کمک می‌کنند و کدام‌یک آن را گمراه می‌سازند. بررسی‌های دقیق نشان داد که پیش‌بینی‌های ضعیف، عمدتاً ناشی از حضور نمونه‌های «مضر» در مجموعهٔ آموزش هستند، نه صرفاً کمبود نمونه‌های مفید. یکی از شگفت‌انگیزترین یافته‌ها این است که طیف‌های مربوط به یک مولکول یکسان، اگر در شرایط آزمایشگاهی متفاوت ثبت شده باشند، نه‌تنها کمکی به یادگیری نمی‌کنند، بلکه می‌توانند به‌عنوان نمونهٔ مضر عمل کنند و مدل را به خطا بیندازند. این یعنی مدل‌ها نمی‌توانند رابطهٔ میان شرایط آزمایش و فرایند قطعه‌قطعه‌شدن را درک کنند و در نتیجه، داده‌های ارزشمندی را که می‌توانستند تنوع شرایط را به مدل بیاموزند، به‌عنوان عامل مزاحم تلقی می‌کنند.

نقص مهم دیگری که با استفاده از تابع تأثیر آشکار شد، ناتوانی مدل‌ها در به‌کارگیری اطلاعات «شدت پیک‌ها»ست. هر طیف از پیک‌هایی تشکیل شده که هرکدام دارای دو مشخصهٔ اصلی هستند: نسبت جرم به بار (m/z) و شدت (نشان‌دهندهٔ فراوانی آن قطعه). بسیاری از مدل‌های پیشرفته، ابتدا هر پیک را به یک فرمول شیمیایی نسبت می‌دهند و سپس مجموعهٔ این فرمول‌ها را پردازش می‌کنند. این روش در ظاهر کارآمد است، زیرا نویز را حذف و تغییرات کوچک m/z را تصحیح می‌کند. اما مشکل زمانی رخ می‌دهد که دو مولکول متفاوت، مجموعهٔ فرمول‌های شیمیایی یکسانی در پیک‌های خود داشته باشند. در این حالت، تنها عاملی که آن‌ها را از هم متمایز می‌کند، الگوی شدت پیک‌هاست؛ اما مدل‌ها این اطلاعات را نادیده می‌گیرند و دو مولکول کاملاً متفاوت را در فضای پنهان خود، مشابه در نظر می‌گیرند. این اشتباه، به‌ویژه زمانی خطرناک می‌شود که یک طیف آزمایشی با یک طیف آموزشی اشتباه گرفته شود که از نظر مجموعهٔ فرمول‌ها یکسان ولی از نظر ساختار مولکولی و الگوی شدت، کاملاً متفاوت است. در برخی مجموعه‌داده‌ها، نزدیک به یک‌سوم از این موارد یک‌به‌چند وجود دارد که نشان‌دهندهٔ شیوع بالای این مشکل است.

نقص سوم، مربوط به «پیک‌های خارج از واژگان» است. در دنیای واقعی، همواره با مولکول‌هایی روبه‌رو هستیم که فرمول‌های شیمیایی قطعات آن‌ها در داده‌های آموزش دیده نشده است. مدل‌های فعلی، حتی آن‌هایی که ادعای مدیریت این پیک‌های ناشناخته را دارند، در عمل عملکرد بسیار ضعیفی از خود نشان می‌دهند. بررسی‌ها نشان داد که نمونه‌های آزمونی با تعداد پیک‌های خارج از واژگان بیشتر، به‌طور معناداری پیش‌بینی‌های ضعیف‌تری دارند. این ضعف در تقسیم‌بندی‌های دشوار که عمدتاً نمونه‌های آزمون را با پیک‌های ناشناختهٔ بیشتر انتخاب می‌کنند، به‌وضوح دیده می‌شود و سهم بزرگی در افت عملکرد مدل دارد. جالب اینجاست که مدل‌ها با وجود طراحی‌هایی که برای مقابله با این مشکل در نظر گرفته شده (مثلاً نمایش فرمول‌ها بر اساس ترکیب اتمی)، باز هم از عهدهٔ این کار برنمی‌آیند و این نشان می‌دهد که راه‌حل‌های فعلی ناکافی هستند.

برای تأیید صحت فرضیه‌های خود، پژوهشگران آزمایشی جالب انجام دادند: داده‌ها را در شرایطی «ایده‌آل» بازپردازش کردند. در این حالت، شرایط آزمایشگاهی یکسان‌سازی شد، طیف‌های تکراری از یک مولکول حذف گردید و نمونه‌هایی که بیش از نود درصد پیک‌های آن‌ها خارج از واژگان بود، از مجموعهٔ آزمون کنار گذاشته شدند. نتیجهٔ این تغییرات، بهبود چشمگیر عملکرد تمام مدل‌ها بود. در این شرایطِ ایده‌آل، برای نخستین بار مدل‌های یادگیری ماشین توانستند از روش سنتی همسایگی نزدیک پیشی بگیرند. این آزمایش به‌خوبی نشان می‌دهد که موانع شناسایی‌شده، دقیقاً همان عواملی هستند که مانع پیشرفت این حوزه شده‌اند و اگر برطرف شوند، پتانسیل بالای یادگیری ماشین در این کاربرد آشکار می‌شود.

در پایان، این پژوهش سه مسیر روشن را برای آینده ترسیم می‌کند: نخست، طراحی مدل‌هایی که فرایند فیزیکی قطعه‌قطعه‌شدن را به‌درستی شبیه‌سازی کنند و بتوانند تأثیر شرایط آزمایشگاهی را در ساختار خود بگنجانند. دوم، توسعهٔ نمایش‌های هوشمندانه‌تر برای پیک‌های طیف که هم از شدت آن‌ها استفاده کنند و هم در برابر پیک‌های ناشناخته مقاوم باشند؛ به‌گونه‌ای که فرمول‌های شیمیایی جدید را در فضایی با معنی شیمیایی قرار دهند. سوم، طراحی روش‌هایی برای انتخاب هوشمندانهٔ نمونه‌های آموزشی که بتوانند از میان داده‌های با شرایط مختلف، تنها نمونه‌های مفید را تشخیص دهند و از نمونه‌های مضر پرهیز کنند. با توجه به کاربردهای گستردهٔ این فناوری در کشف داروهای جدید، شناسایی آلاینده‌های محیطی و درک بهتر متابولیسم بدن، بهبود این مدل‌ها می‌تواند تأثیری عمیق و ماندگار بر سلامت و محیط‌زیست بگذارد. یافته‌های این پژوهش، گامی اساسی در جهت تحقق این هدف محسوب می‌شود.

 

سرفصل شماره صفحه
۱. مقدمه ۱۵
  ۱.۱. پیشینه ۱۶
    ۱.۱.۱. مروری بر مدل‌های کنونی مبتنی بر یادگیری ماشین برای LC-MS/MS ۱۶
    ۱.۱.۲. پژوهش‌های موجود در زمینهٔ شناخت محدودیت‌های رویکردهای کنونی مبتنی بر یادگیری ماشین برای مدل‌سازی LC-MS/MS ۱۹
    ۱.۱.۳. ابزارهای خودکار برای شناخت محدودیت‌های رویکردهای کنونی مبتنی بر یادگیری ماشین برای مدل‌سازی LC-MS/MS ۲۰
۲. پیش‌نیازها ۲۳
  ۲.۱. تعریف مسئلهٔ پیش‌بینی اثرانگشت مولکولی (Molecular Fingerprint) ۲۳
  ۲.۲. مجموعه‌داده‌ها و مدل‌ها ۲۴
    ۲.۲.۱. مجموعه‌داده‌ها ۲۴
    ۲.۲.۲. مدل‌ها ۲۵
  ۲.۳. نتایج معیارگذاری (Benchmarking) ۲۶
  ۲.۴. انگیزهٔ پژوهش ۲۷
۳. روش‌ها و آزمایش‌ها ۲۹
  ۳.۱. مرور کلی ۲۹
    ۳.۱.۱. مروری بر الگوریتم تقسیم‌بندی برای یادگیری (Learning to Split) ۲۹
    ۳.۱.۲. مروری بر تابع تأثیر (Influence Function) ۳۰
  ۳.۲. استفاده از روش‌های انتساب داده برای تشخیص مدل ۳۱
    ۳.۲.۱. استفاده از تقسیم‌بندی برای یادگیری جهت کشف محدودیت‌های مدل‌سازی ۳۲
    ۳.۲.۲. استفاده از تابع تأثیر برای ردیابی پیش‌بینی‌های مدل تا داده‌های آموزشی ۳۲
۴. نتایج و تحلیل‌ها ۳۵
  ۴.۱. فرضیه‌هایی دربارهٔ محدودیت‌های مدل‌های کنونی که توسط تقسیم‌بندی برای یادگیری آشکار شد ۳۵
    ۴.۱.۱. تعمیم‌پذیری در شرایط آزمایشگاهی گوناگون دشوار است ۳۵
    ۴.۱.۲. محدودیت‌های مدل‌سازی مدل‌های کنونی که توسط تقسیم‌بندی برای یادگیری آشکار شد ۳۶
  ۴.۲. فرضیه‌هایی دربارهٔ محدودیت‌های مدل‌های کنونی که توسط تابع تأثیر آشکار شد ۴۰
    ۴.۲.۱. مدل‌ها نمی‌توانند تأثیر شرایط آزمایشگاهی را بر فرایند قطعه‌قطعه‌شدن بیاموزند ۴۰
    ۴.۲.۲. مدل‌ها نمی‌توانند از اطلاعات شدت پیک‌ها استفاده کنند ۴۲
    ۴.۲.۳. مدل‌ها بازنمایی‌های نهان نمونه‌های غیرمشابه را به‌اشتباه هم‌تراز می‌کنند ۴۳
  ۴.۳. تلفیق یافته‌های حاصل از تحلیل‌های تقسیم‌بندی برای یادگیری و تابع تأثیر ۴۴
  ۴.۴. شواهد تجربی پشتیبان فرضیه‌های ما ۴۵
۵. بحث ۴۷
پیوست الف) راه‌اندازی آزمایش‌ها ۴۹
  الف.۱. ابرپارامترهای مدل‌های پیش‌بینی اثرانگشت (Hyper-parameters) ۴۹
پیوست ب) تحلیل‌های تکمیلی برای آزمایش‌های معیارگذاری ۵۱
  ب.۱. همبستگی پیرسون و اسپیرمن بین مدل‌ها ۵۱
  ب.۲. محاسبهٔ همپوشانی مورد انتظار بین دو مجموعهٔ آموزشی ۵۳
پیوست ج) تحلیل تکمیلی برای تقسیم‌بندی‌های حاصل از الگوریتم تقسیم‌بندی برای یادگیری ۵۵
  ج.۱. تفاوت‌های توزیعی شرایط آزمایشگاهی در مجموعه‌های آموزش و آزمون تحت تقسیم‌بندی حاصل از الگوریتم تقسیم‌بندی برای یادگیری ۵۵
پیوست د) تحلیل تکمیلی برای نمرات انتساب داده به‌دست‌آمده با توابع تأثیر ۵۹
  د.۱. توزیع نمرات تأثیر در مجموعه‌داده‌ها، مدل‌ها و تقسیم‌بندی‌ها ۵۹
مراجع ۶۳

 

🔬 رازهایی که طیف‌های جرمی فاش نمی‌کنند

چرا هوش مصنوعی در شناسایی مولکول‌ها از یک روش ساده جا می‌ماند؟

اگر به یک شیمیدان بگویید که الگوریتم‌های پیشرفتهٔ یادگیری ماشین در تشخیص ساختار مولکول‌ها از یک «کتابخانهٔ ساده» شکست می‌خورند، شاید باور نکند. اما تازه‌ترین پژوهش‌ها نشان داده‌اند که مدل‌های پیچیدهٔ امروزی، در برابر یک روش کلاسیک «همسایگی نزدیک» – که فقط نزدیک‌ترین طیف موجود را برمی‌گرداند – عملکرد ضعیف‌تری دارند. این یعنی ماشین‌ها با وجود میلیون‌ها پارامتر، هنوز قوانین سادهٔ قطعه‌قطعه شدن مولکول‌ها را درک نکرده‌اند. اما سوال اینجاست: چرا؟

⚡ معمای پیک‌های گمشده

طیف جرمی مثل اثرانگشت یک مولکول است؛ اما این اثرانگشت با هر دستگاهی که آن را بگیرید، فرق می‌کند. مدل‌های یادگیری ماشین معمولاً هر پیک را به یک «فرمول شیمیایی» نسبت می‌دهند. این کار نویز را حذف می‌کند، اما یک نقطه کور بزرگ دارد: شدت پیک‌ها را نادیده می‌گیرد. در بسیاری از موارد، دو مولکول کاملاً متفاوت، مجموعه‌فرمول‌های یکسانی دارند؛ تنها چیزی که آن‌ها را جدا می‌کند، شدت هر پیک است. اما ماشین این اطلاعات ظریف را نمی‌بیند و دو ساختار متفاوت را با هم قاطی می‌کند. پژوهشگران دریافته‌اند که نزدیک به یک‌سوم این موارد در مجموعه‌داده‌های واقعی رخ می‌دهد – یعنی سهم بزرگی از خطاها، ریشه در نادیده‌گرفتن شدت‌ها دارد.

📌 نقل قول از مقاله: «مدل‌ها خروجی‌های تقریباً یکسانی برای ورودی‌هایی با فرمول‌های شیمیایی مشابه تولید می‌کنند، حتی اگر شدت پیک‌ها کاملاً متفاوت باشد. این یعنی آن‌ها شدت را به‌عنوان یک ویژگی افتراقی در نظر نمی‌گیرند.»

🎯 شرایط آزمایشگاهی؛ دشمن خاموش

تصور کنید یک مولکول را در دو انرژی برخورد مختلف (مثلاً ۲۰ و ۴۰ الکترون‌ولت) در دستگاه طیف‌جرمی قرار دهید. نتیجه؟ دو طیف کاملاً ناهماهنگ که حتی چشم انسان هم به سختی آن‌ها را به هم مرتبط می‌کند. مدل‌های فعلی از این تغییرات بی‌خبرند؛ آن‌ها هر طیف را مستقل از شرایط ثبت آن تحلیل می‌کنند. اما یک روش هوشمند به نام «تقسیم‌بندی برای یادگیری» نشان داد که اگر داده‌ها را طوری تقسیم کنیم که شرایط آزمایش در مجموعهٔ آزمون با آموزش تفاوت فاحشی داشته باشد، عملکرد مدل تا ۵۰٪ سقوط می‌کند. این یعنی مهم‌ترین مانع، ناتوانی در تعمیم به شرایط گوناگون است – نه پیچیدگی ساختار مولکول‌ها.

🧩 پیک‌های ناشناخته، کابوس همیشگی

در دنیای واقعی، همواره با مولکول‌هایی روبه‌رو می‌شوید که اتم‌ها یا قطعاتی تازه دارند – چیزی که در داده‌های آموزشی دیده نشده. مدل‌های امروزی برای چنین پیک‌هایی «برچسب خارج از واژگان» می‌خورند و عملاً آن‌ها را نادیده می‌گیرند. بررسی‌ها نشان می‌دهد که نمونه‌های آزمونی با بیش از ۹۰٪ پیک ناشناخته، بدترین پیش‌بینی‌ها را دریافت می‌کنند. اما نکتهٔ جالب اینجاست که حتی مدل‌هایی که ادعای مدیریت این پیک‌ها را دارند، در عمل از عهدهٔ آن برنمی‌آیند. این یعنی یک خلأ اساسی در نحوهٔ بازنمایی پیک‌ها وجود دارد: بازنمایی‌های فعلی به‌قدری به داده‌های دیده‌شده وابسته‌اند که در برابر تازگی، درمانده می‌شوند.

🌐 چرا این موضوع برای شما اهمیت دارد؟

از کشف داروهای جدید گرفته تا شناسایی آلاینده‌های محیطی و درک متابولیسم بدن، همه به ابزاری نیاز دارند که بتواند مولکول‌های ناشناخته را سریع و دقیق شناسایی کند. اما اگر هوش مصنوعی در تشخیص حتی مولکول‌های شناخته‌شده هم درمانده باشد، چگونه می‌توان به آن در کشف مولکول‌های کاملاً جدید اعتماد کرد؟ پژوهش حاضر نشان می‌دهد که راه حل، نه در افزایش حجم داده، بلکه در طراحی مجدد معماری مدل‌ها نهفته است: مدل‌هایی که فیزیک قطعه‌قطعه شدن را درک کنند، شدت پیک‌ها را به‌کار گیرند، و در برابر پیک‌های ناشناخته مقاوم باشند. به‌قول یکی از پژوهشگران:

«اگر مدل‌ها نتوانند تأثیر شرایط آزمایشگاهی را بر طیف بیاموزند، هر مولکول را در هر شرایطی، موجودی کاملاً جدید خواهند پنداشت. این یعنی داده‌های گران‌بهایی که می‌توانستند تنوع را به مدل بیاموزند، تبدیل به عامل مزاحم می‌شوند.»

در آزمایشی جالب، وقتی شرایط ایده‌آل شد (یعنی شرایط آزمایشگاهی یکسان، حذف طیف‌های تکراری و حذف پیک‌های ناشناخته)، مدل‌ها برای نخستین بار از روش سنتی پیشی گرفتند. این یعنی پتانسیل یادگیری ماشین در این حوزه بسیار بالاست، اما قفل آن در گرو رفع همین چند نقص کلیدی است.

⏳ زمان مطالعه: حدود ۴ دقیقه | نوشته‌شده برای علاقه‌مندان به علم داده و شیمی

 

بسیار سریع و ساده می توانید اصل این پایان نامه را به صورت فایل PDF در اختیار داشته باشید.

پس از دریافت پایان‌نامه، کلیه اطلاعات کتاب‌شناختی موردنیاز برای استناد علمی، از جمله نام دانشگاه، عنوان پایان‌نامه، نام پژوهشگر، سال دفاع و سایر مشخصات مرتبط، جهت ارجاع‌دهی صحیح مطابق با استانداردهای رایج، در اختیار شما قرار خواهد گرفت.