شناسایی ساختار دقیق مولکولهای کوچک از میان مخلوطهای پیچیده، یکی از دشوارترین و در عین حال حیاتیترین مسائل در علوم دارویی، محیطزیستی و متابولومیکس به شمار میرود. روش اصلی برای این کار، استفاده از طیفسنجی جرمی پشتسرهم (LC-MS/MS) است که الگوی قطعهقطعهشدن یک مولکول ناشناخته را ثبت میکند. در سالهای اخیر، تلاشهای گستردهای برای بهکارگیری الگوریتمهای یادگیری ماشین در این حوزه صورت گرفته است، اما نتایج بهدستآمده چندان امیدوارکننده نبوده و حتی مدلهای پیشرفته نیز عملکردی پایینتر از روشهای سادهٔ سنتی دارند. این پژوهش با هدف ریشهیابی این ناکارآمدی، از رویکردی نظاممند و خودکار برای کشف نقاط کور مدلهای فعلی استفاده کرده است.
رویکرد غالب در این حوزه، تبدیل طیف جرمی ورودی به یک «اثرانگشت مولکولی» (بردار دودویی از ویژگیهای ساختاری) است. سپس این اثرانگشت پیشبینیشده، بهعنوان کلید جستجو در پایگاههای دادهٔ شیمیایی مانند پابکم استفاده میشود تا مشابهترین ساختار پیدا شود. با وجود منطق ساده و کارآمد این روش، مدلهای یادگیری ماشین موجود از عهدهٔ این کار برنمیآیند. یکی از مشاهدات کلیدی این پژوهش این است که یک روش بسیار ابتدایی به نام «همسایگی نزدیک» که صرفاً نزدیکترین طیف موجود در کتابخانه را برمیگرداند، بهطور میانگین عملکردی بهتر از تمام مدلهای هوشمند دارد. این واقعیت تلخ، نشاندهندهٔ وجود نقصهای بنیادین در طراحی و آموزش این مدلهاست که با افزایش حجم داده یا تنظیم سادهٔ پارامترها قابل رفع نیست.
برای کشف این نقصها، پژوهشگران از دو ابزار تحلیلی قدرتمند از خانوادهٔ «انتساب داده» بهره گرفتهاند. ابزار نخست، الگوریتم «تقسیمبندی برای یادگیری» نام دارد. این الگوریتم بهجای تقسیم تصادفی دادهها، یک تقسیمبندی هوشمندانه ارائه میدهد که در آن مدل، ضعیفترین عملکرد ممکن را روی مجموعهٔ آزمون داشته باشد. با بررسی ویژگیهای این تقسیمبندیهای دشوار، مشخص شد که مدلها در برابر تغییرات «شرایط آزمایشگاهی» بهشدت شکننده هستند. عواملی مانند انرژی برخورد یونها، نوع مادهٔ افزودهشده به یون (آدوکت) و نوع دستگاه طیفسنجی، تأثیر چشمگیری بر الگوی طیف دارند، بهگونهای که طیف یک مولکول یکسان در دو شرایط مختلف، کاملاً متفاوت به نظر میرسد. مدلهای فعلی نمیتوانند این تغییرات را درک کنند و هر مولکول را در هر شرایطی، موجودی کاملاً جدید میپندارند. این یافته نشان میدهد که یکی از بزرگترین موانع، ناتوانی در تعمیمدهی به شرایط آزمایشگاهی گوناگون است.
ابزار دوم، «تابع تأثیر» نام دارد که نقش هر نمونهٔ آموزشی را در پیشبینی هر نمونهٔ آزمونی بهصورت عددی اندازهگیری میکند. این روش مشخص میکند کدام نمونههای آموزشی به پیشبینی یک نمونه کمک میکنند و کدامیک آن را گمراه میسازند. بررسیهای دقیق نشان داد که پیشبینیهای ضعیف، عمدتاً ناشی از حضور نمونههای «مضر» در مجموعهٔ آموزش هستند، نه صرفاً کمبود نمونههای مفید. یکی از شگفتانگیزترین یافتهها این است که طیفهای مربوط به یک مولکول یکسان، اگر در شرایط آزمایشگاهی متفاوت ثبت شده باشند، نهتنها کمکی به یادگیری نمیکنند، بلکه میتوانند بهعنوان نمونهٔ مضر عمل کنند و مدل را به خطا بیندازند. این یعنی مدلها نمیتوانند رابطهٔ میان شرایط آزمایش و فرایند قطعهقطعهشدن را درک کنند و در نتیجه، دادههای ارزشمندی را که میتوانستند تنوع شرایط را به مدل بیاموزند، بهعنوان عامل مزاحم تلقی میکنند.
نقص مهم دیگری که با استفاده از تابع تأثیر آشکار شد، ناتوانی مدلها در بهکارگیری اطلاعات «شدت پیکها»ست. هر طیف از پیکهایی تشکیل شده که هرکدام دارای دو مشخصهٔ اصلی هستند: نسبت جرم به بار (m/z) و شدت (نشاندهندهٔ فراوانی آن قطعه). بسیاری از مدلهای پیشرفته، ابتدا هر پیک را به یک فرمول شیمیایی نسبت میدهند و سپس مجموعهٔ این فرمولها را پردازش میکنند. این روش در ظاهر کارآمد است، زیرا نویز را حذف و تغییرات کوچک m/z را تصحیح میکند. اما مشکل زمانی رخ میدهد که دو مولکول متفاوت، مجموعهٔ فرمولهای شیمیایی یکسانی در پیکهای خود داشته باشند. در این حالت، تنها عاملی که آنها را از هم متمایز میکند، الگوی شدت پیکهاست؛ اما مدلها این اطلاعات را نادیده میگیرند و دو مولکول کاملاً متفاوت را در فضای پنهان خود، مشابه در نظر میگیرند. این اشتباه، بهویژه زمانی خطرناک میشود که یک طیف آزمایشی با یک طیف آموزشی اشتباه گرفته شود که از نظر مجموعهٔ فرمولها یکسان ولی از نظر ساختار مولکولی و الگوی شدت، کاملاً متفاوت است. در برخی مجموعهدادهها، نزدیک به یکسوم از این موارد یکبهچند وجود دارد که نشاندهندهٔ شیوع بالای این مشکل است.
نقص سوم، مربوط به «پیکهای خارج از واژگان» است. در دنیای واقعی، همواره با مولکولهایی روبهرو هستیم که فرمولهای شیمیایی قطعات آنها در دادههای آموزش دیده نشده است. مدلهای فعلی، حتی آنهایی که ادعای مدیریت این پیکهای ناشناخته را دارند، در عمل عملکرد بسیار ضعیفی از خود نشان میدهند. بررسیها نشان داد که نمونههای آزمونی با تعداد پیکهای خارج از واژگان بیشتر، بهطور معناداری پیشبینیهای ضعیفتری دارند. این ضعف در تقسیمبندیهای دشوار که عمدتاً نمونههای آزمون را با پیکهای ناشناختهٔ بیشتر انتخاب میکنند، بهوضوح دیده میشود و سهم بزرگی در افت عملکرد مدل دارد. جالب اینجاست که مدلها با وجود طراحیهایی که برای مقابله با این مشکل در نظر گرفته شده (مثلاً نمایش فرمولها بر اساس ترکیب اتمی)، باز هم از عهدهٔ این کار برنمیآیند و این نشان میدهد که راهحلهای فعلی ناکافی هستند.
برای تأیید صحت فرضیههای خود، پژوهشگران آزمایشی جالب انجام دادند: دادهها را در شرایطی «ایدهآل» بازپردازش کردند. در این حالت، شرایط آزمایشگاهی یکسانسازی شد، طیفهای تکراری از یک مولکول حذف گردید و نمونههایی که بیش از نود درصد پیکهای آنها خارج از واژگان بود، از مجموعهٔ آزمون کنار گذاشته شدند. نتیجهٔ این تغییرات، بهبود چشمگیر عملکرد تمام مدلها بود. در این شرایطِ ایدهآل، برای نخستین بار مدلهای یادگیری ماشین توانستند از روش سنتی همسایگی نزدیک پیشی بگیرند. این آزمایش بهخوبی نشان میدهد که موانع شناساییشده، دقیقاً همان عواملی هستند که مانع پیشرفت این حوزه شدهاند و اگر برطرف شوند، پتانسیل بالای یادگیری ماشین در این کاربرد آشکار میشود.
در پایان، این پژوهش سه مسیر روشن را برای آینده ترسیم میکند: نخست، طراحی مدلهایی که فرایند فیزیکی قطعهقطعهشدن را بهدرستی شبیهسازی کنند و بتوانند تأثیر شرایط آزمایشگاهی را در ساختار خود بگنجانند. دوم، توسعهٔ نمایشهای هوشمندانهتر برای پیکهای طیف که هم از شدت آنها استفاده کنند و هم در برابر پیکهای ناشناخته مقاوم باشند؛ بهگونهای که فرمولهای شیمیایی جدید را در فضایی با معنی شیمیایی قرار دهند. سوم، طراحی روشهایی برای انتخاب هوشمندانهٔ نمونههای آموزشی که بتوانند از میان دادههای با شرایط مختلف، تنها نمونههای مفید را تشخیص دهند و از نمونههای مضر پرهیز کنند. با توجه به کاربردهای گستردهٔ این فناوری در کشف داروهای جدید، شناسایی آلایندههای محیطی و درک بهتر متابولیسم بدن، بهبود این مدلها میتواند تأثیری عمیق و ماندگار بر سلامت و محیطزیست بگذارد. یافتههای این پژوهش، گامی اساسی در جهت تحقق این هدف محسوب میشود.
| سرفصل | شماره صفحه |
|---|---|
| ۱. مقدمه | ۱۵ |
| ۱.۱. پیشینه | ۱۶ |
| ۱.۱.۱. مروری بر مدلهای کنونی مبتنی بر یادگیری ماشین برای LC-MS/MS | ۱۶ |
| ۱.۱.۲. پژوهشهای موجود در زمینهٔ شناخت محدودیتهای رویکردهای کنونی مبتنی بر یادگیری ماشین برای مدلسازی LC-MS/MS | ۱۹ |
| ۱.۱.۳. ابزارهای خودکار برای شناخت محدودیتهای رویکردهای کنونی مبتنی بر یادگیری ماشین برای مدلسازی LC-MS/MS | ۲۰ |
| ۲. پیشنیازها | ۲۳ |
| ۲.۱. تعریف مسئلهٔ پیشبینی اثرانگشت مولکولی (Molecular Fingerprint) | ۲۳ |
| ۲.۲. مجموعهدادهها و مدلها | ۲۴ |
| ۲.۲.۱. مجموعهدادهها | ۲۴ |
| ۲.۲.۲. مدلها | ۲۵ |
| ۲.۳. نتایج معیارگذاری (Benchmarking) | ۲۶ |
| ۲.۴. انگیزهٔ پژوهش | ۲۷ |
| ۳. روشها و آزمایشها | ۲۹ |
| ۳.۱. مرور کلی | ۲۹ |
| ۳.۱.۱. مروری بر الگوریتم تقسیمبندی برای یادگیری (Learning to Split) | ۲۹ |
| ۳.۱.۲. مروری بر تابع تأثیر (Influence Function) | ۳۰ |
| ۳.۲. استفاده از روشهای انتساب داده برای تشخیص مدل | ۳۱ |
| ۳.۲.۱. استفاده از تقسیمبندی برای یادگیری جهت کشف محدودیتهای مدلسازی | ۳۲ |
| ۳.۲.۲. استفاده از تابع تأثیر برای ردیابی پیشبینیهای مدل تا دادههای آموزشی | ۳۲ |
| ۴. نتایج و تحلیلها | ۳۵ |
| ۴.۱. فرضیههایی دربارهٔ محدودیتهای مدلهای کنونی که توسط تقسیمبندی برای یادگیری آشکار شد | ۳۵ |
| ۴.۱.۱. تعمیمپذیری در شرایط آزمایشگاهی گوناگون دشوار است | ۳۵ |
| ۴.۱.۲. محدودیتهای مدلسازی مدلهای کنونی که توسط تقسیمبندی برای یادگیری آشکار شد | ۳۶ |
| ۴.۲. فرضیههایی دربارهٔ محدودیتهای مدلهای کنونی که توسط تابع تأثیر آشکار شد | ۴۰ |
| ۴.۲.۱. مدلها نمیتوانند تأثیر شرایط آزمایشگاهی را بر فرایند قطعهقطعهشدن بیاموزند | ۴۰ |
| ۴.۲.۲. مدلها نمیتوانند از اطلاعات شدت پیکها استفاده کنند | ۴۲ |
| ۴.۲.۳. مدلها بازنماییهای نهان نمونههای غیرمشابه را بهاشتباه همتراز میکنند | ۴۳ |
| ۴.۳. تلفیق یافتههای حاصل از تحلیلهای تقسیمبندی برای یادگیری و تابع تأثیر | ۴۴ |
| ۴.۴. شواهد تجربی پشتیبان فرضیههای ما | ۴۵ |
| ۵. بحث | ۴۷ |
| پیوست الف) راهاندازی آزمایشها | ۴۹ |
| الف.۱. ابرپارامترهای مدلهای پیشبینی اثرانگشت (Hyper-parameters) | ۴۹ |
| پیوست ب) تحلیلهای تکمیلی برای آزمایشهای معیارگذاری | ۵۱ |
| ب.۱. همبستگی پیرسون و اسپیرمن بین مدلها | ۵۱ |
| ب.۲. محاسبهٔ همپوشانی مورد انتظار بین دو مجموعهٔ آموزشی | ۵۳ |
| پیوست ج) تحلیل تکمیلی برای تقسیمبندیهای حاصل از الگوریتم تقسیمبندی برای یادگیری | ۵۵ |
| ج.۱. تفاوتهای توزیعی شرایط آزمایشگاهی در مجموعههای آموزش و آزمون تحت تقسیمبندی حاصل از الگوریتم تقسیمبندی برای یادگیری | ۵۵ |
| پیوست د) تحلیل تکمیلی برای نمرات انتساب داده بهدستآمده با توابع تأثیر | ۵۹ |
| د.۱. توزیع نمرات تأثیر در مجموعهدادهها، مدلها و تقسیمبندیها | ۵۹ |
| مراجع | ۶۳ |
🔬 رازهایی که طیفهای جرمی فاش نمیکنند
اگر به یک شیمیدان بگویید که الگوریتمهای پیشرفتهٔ یادگیری ماشین در تشخیص ساختار مولکولها از یک «کتابخانهٔ ساده» شکست میخورند، شاید باور نکند. اما تازهترین پژوهشها نشان دادهاند که مدلهای پیچیدهٔ امروزی، در برابر یک روش کلاسیک «همسایگی نزدیک» – که فقط نزدیکترین طیف موجود را برمیگرداند – عملکرد ضعیفتری دارند. این یعنی ماشینها با وجود میلیونها پارامتر، هنوز قوانین سادهٔ قطعهقطعه شدن مولکولها را درک نکردهاند. اما سوال اینجاست: چرا؟
⚡ معمای پیکهای گمشده
طیف جرمی مثل اثرانگشت یک مولکول است؛ اما این اثرانگشت با هر دستگاهی که آن را بگیرید، فرق میکند. مدلهای یادگیری ماشین معمولاً هر پیک را به یک «فرمول شیمیایی» نسبت میدهند. این کار نویز را حذف میکند، اما یک نقطه کور بزرگ دارد: شدت پیکها را نادیده میگیرد. در بسیاری از موارد، دو مولکول کاملاً متفاوت، مجموعهفرمولهای یکسانی دارند؛ تنها چیزی که آنها را جدا میکند، شدت هر پیک است. اما ماشین این اطلاعات ظریف را نمیبیند و دو ساختار متفاوت را با هم قاطی میکند. پژوهشگران دریافتهاند که نزدیک به یکسوم این موارد در مجموعهدادههای واقعی رخ میدهد – یعنی سهم بزرگی از خطاها، ریشه در نادیدهگرفتن شدتها دارد.
🎯 شرایط آزمایشگاهی؛ دشمن خاموش
تصور کنید یک مولکول را در دو انرژی برخورد مختلف (مثلاً ۲۰ و ۴۰ الکترونولت) در دستگاه طیفجرمی قرار دهید. نتیجه؟ دو طیف کاملاً ناهماهنگ که حتی چشم انسان هم به سختی آنها را به هم مرتبط میکند. مدلهای فعلی از این تغییرات بیخبرند؛ آنها هر طیف را مستقل از شرایط ثبت آن تحلیل میکنند. اما یک روش هوشمند به نام «تقسیمبندی برای یادگیری» نشان داد که اگر دادهها را طوری تقسیم کنیم که شرایط آزمایش در مجموعهٔ آزمون با آموزش تفاوت فاحشی داشته باشد، عملکرد مدل تا ۵۰٪ سقوط میکند. این یعنی مهمترین مانع، ناتوانی در تعمیم به شرایط گوناگون است – نه پیچیدگی ساختار مولکولها.
🧩 پیکهای ناشناخته، کابوس همیشگی
در دنیای واقعی، همواره با مولکولهایی روبهرو میشوید که اتمها یا قطعاتی تازه دارند – چیزی که در دادههای آموزشی دیده نشده. مدلهای امروزی برای چنین پیکهایی «برچسب خارج از واژگان» میخورند و عملاً آنها را نادیده میگیرند. بررسیها نشان میدهد که نمونههای آزمونی با بیش از ۹۰٪ پیک ناشناخته، بدترین پیشبینیها را دریافت میکنند. اما نکتهٔ جالب اینجاست که حتی مدلهایی که ادعای مدیریت این پیکها را دارند، در عمل از عهدهٔ آن برنمیآیند. این یعنی یک خلأ اساسی در نحوهٔ بازنمایی پیکها وجود دارد: بازنماییهای فعلی بهقدری به دادههای دیدهشده وابستهاند که در برابر تازگی، درمانده میشوند.
🌐 چرا این موضوع برای شما اهمیت دارد؟
از کشف داروهای جدید گرفته تا شناسایی آلایندههای محیطی و درک متابولیسم بدن، همه به ابزاری نیاز دارند که بتواند مولکولهای ناشناخته را سریع و دقیق شناسایی کند. اما اگر هوش مصنوعی در تشخیص حتی مولکولهای شناختهشده هم درمانده باشد، چگونه میتوان به آن در کشف مولکولهای کاملاً جدید اعتماد کرد؟ پژوهش حاضر نشان میدهد که راه حل، نه در افزایش حجم داده، بلکه در طراحی مجدد معماری مدلها نهفته است: مدلهایی که فیزیک قطعهقطعه شدن را درک کنند، شدت پیکها را بهکار گیرند، و در برابر پیکهای ناشناخته مقاوم باشند. بهقول یکی از پژوهشگران:
در آزمایشی جالب، وقتی شرایط ایدهآل شد (یعنی شرایط آزمایشگاهی یکسان، حذف طیفهای تکراری و حذف پیکهای ناشناخته)، مدلها برای نخستین بار از روش سنتی پیشی گرفتند. این یعنی پتانسیل یادگیری ماشین در این حوزه بسیار بالاست، اما قفل آن در گرو رفع همین چند نقص کلیدی است.