خلاصهٔ پایاننامه
در سالهای اخیر، فنآوریهای توالییابی تکسلولی انقلابی در زیستشناسی ایجاد کردهاند. دو روش مهم در این حوزه،
scRNA‑seq (اندازهگیری میزان بیان ژنها) و scATAC‑seq (اندازهگیری میزان دسترسی به بخشهای تنظیمی دیانای) هستند.
هرکدام از این روشها تصویری متفاوت از وضعیت درونی یک سلول ارائه میدهند و ترکیب این دو، میتواند درک ما از سازوکارهای تنظیم ژن را عمیقتر کند.
با این حال، دادههای حاصل از scATAC‑seq بسیار پرابعاد، پراکنده و نویزی هستند. بهعنوان مثال، هر سلول ممکن است بیش از صد هزار جایگاه ژنومی را پوشش دهد،
اما تنها چند هزار تای آنها فعالیت غیرصفر دارند. این ویژگی، مدلسازی رایانهای را با چالش جدی مواجه میکند و پژوهشگران را به سمت یافتن روشهای
کارآمدتر برای نمایش و تحلیل این دادهها سوق داده است.
پایاننامهٔ حاضر، رویکردی نوین برای ترجمهٔ دادههای scATAC به scRNA پیشنهاد میکند.
ایدهٔ اصلی، استفاده از معماری ترنسفورمر (Transformer) است که در حوزههایی مانند پردازش زبان طبیعی و بینایی ماشین موفقیتهای چشمگیری داشته است.
اما چالش اصلی، تبدیل دادههای بسیار پراکندهٔ ATAC به قالبی است که ترنسفورمر بتواند آن را بهخوبی پردازش کند.
راهحل ارائهشده در این پژوهش، «درونسازی فشرده» یا Squish Embedding نام دارد.
در این روش، بهجای اینکه کل بردار ۱۱۶هزارتایی برای هر سلول به مدل داده شود، تنها جایگاههایی که مقدار غیرصفر دارند،
بههمراه یک بردار جاسازیشده برای هر جایگاه، به صورت دنبالهای از بردارها در اختیار ترنسفورمر قرار میگیرند.
این کار، طول ورودی را از بیش از صد هزار به حدود سه تا چهار هزار کاهش میدهد و امکان استفاده از ترنسفورمر را فراهم میکند.
دادههای مورد استفاده از مسابقهٔ NeurIPS 2021 گرفته شده و شامل بیش از ۴۲ هزار سلول است.
مدلهای پیادهسازیشده شامل نسخههای سبکوزن DistilBERT و نسخهٔ کارآمد از نظر حافظه یعنی LongT5 هستند.
هرچند نتایج عددی نشان میدهد که این روشها عملکرد بهتری نسبت به یک شبکهٔ سادهٔ چندلایه (MLP) ندارند،
اما مزیت اصلی آن، فراهم کردن امکان استفاده از خانوادهٔ بزرگ مدلهای ترنسفورمر برای دادههای زیستیِ پراکنده است.
بخش مهم دیگری از پژوهش، به مسیرهای آینده اختصاص دارد. از جملهٔ آنها میتوان به استفاده از آموزش بدون نظارت
با رویکرد CycleGAN برای بهرهگیری از دادههای جفتنشده، رمزگشایی خودبازگشتی برای محاسبهٔ میزان تأثیر هر جایگاه ATAC بر بیان هر ژن،
و افزودن آگاهی زیستی مانند ساختار سهبعدی کروماتین یا اطلاعات نوع سلول اشاره کرد.
این جهتها میتوانند در آینده به درک عمیقتری از روابط تنظیمی بین ژنوم و ترنسکریپتوم منجر شوند.
در نهایت، اگرچه روش پیشنهادی از نظر دقت عددی بر روشهای سادهتر برتری ندارد، اما به دلیل ساختار انعطافپذیر و قابلیت تفسیرپذیری بالا،
پنجرهٔ جدیدی به روی پژوهشگران باز میکند تا بتوانند دادههای پیچیدهٔ اپیژنتیکی را با ابزارهای پیشرفتهٔ یادگیری ماشین مدل کنند.
کدهای این پروژه نیز بهصورت عمومی در دسترس قرار گرفته است تا سایر محققان بتوانند از آن الهام بگیرند و آن را گسترش دهند.
فهرست مطالب
| عنوان | شمارهٔ صفحه |
|---|---|
| چکیده | ۳ |
| سپاسگزاری | ۵ |
| فصل ۱: مقدمه | ۱۳ |
| فصل ۲: داده | ۱۹ |
| فصل ۳: روشها | ۲۳ |
| فصل ۴: آزمایشها | ۲۷ |
| فصل ۵: کارهای آینده | ۳۱ |
| فصل ۶: نتیجهگیری | ۳۵ |
| پیوست الف: جزئیات مدلها | ۳۷ |
| پیوست ب: جزئیات آموزش | ۳۹ |
| پیوست ج: جزئیات پیادهسازی | ۴۱ |
| منابع | ۴۳ |
🔬 وقتی ترنسفورمر به آزمایشگاه میرود
تصور کنید یک جعبهٔ سیاه دارید که در آن، برای هر سلول، بیش از صد هزار نقطهٔ روشن و خاموش ثبت شده است.
این نقاط، جایگاههای ژنومیاند که هرکدام داستانی از دسترسیِ دیانای روایت میکنند.
حالا فرض کنید میخواهید از روی همین نقاط، پیشبینی کنید که کدام ژنها در آن سلول فعال هستند.
این دقیقاً همان چالشی است که زیستشناسیِ محاسباتی امروز با آن دستوپنجه نرم میکند.
⚡ چالش بزرگ: اقیانوسی از صفرها
دادهٔ scATAC‑seq ذاتاً اسپارس (پراکنده) است. در هر سلول، از میان بیش از ۱۱۶ هزار جایگاه ممکن،
بهطور میانگین تنها حدود ۳۴۰۰ جایگاه فعالیت غیرصفر دارند. این یعنی ۹۷٪ ماتریس ورودی خالی است.
مدلهای کلاسیک یادگیری ماشین با این حجم از صفرها بهسختی کنار میآیند، مگر اینکه آنها را فشرده یا کاهشبعد کنیم.
این ترفند ساده اما هوشمندانه، طول ورودی را تا یکسیام کاهش میدهد.
🧠 چرا ترنسفورمر، نه شبکههای ساده؟
ترنسفورمرها در زبان، تصویر و حتی بازیهای رایانهای، توانستهاند الگوهای دوربرد را بیاموزند.
در زیستشناسی نیز احتمالاً تعاملات بین جایگاههای دوردستِ ژنومی نقشی کلیدی در تنظیم بیان ژن دارند.
اما معماری استاندارد ترنسفورمر برای دنبالههایی با طول ۳۴۰۰ توکن (که در اینجا معادل تعداد جایگاههای غیرصفر است) طراحی نشده بود.
پژوهشگر این پایاننامه با بهرهگیری از مدلهای کارآمدی مانند LongT5 و DistilBERT،
سعی کرده است این شکاف را پر کند.
📊 نتیجهٔ کوتاه: نه آنقدرها هم که انتظار داشتیم!
جالب اینجاست که با وجود تمام ظرافتهای معماری، مدلهای ترنسفورمر در این آزمایش نتوانستند از یک شبکهٔ سادهٔ دو-لایه پیشی بگیرند.
کمترین خطای میانگین مربعات (MSE) برای ترنسفورمرها حدود ۰٫۰۹۶ و برای MLP ساده حدود ۰٫۰۹۰ ثبت شد.
اما آیا این شکست است؟ شاید نه. بلکه این اولین گام برای فهمیدن این است که «چه چیزی در این داده است که با این روشها قابل مدلسازی نیست».
«اگرچه روش پیشنهادی از نظر عددی برنده نیست، اما پنجرهای به سوی استفاده از صدها مدل ترنسفورمر متنباز در زیستشناسی تکسلولی میگشاید.»
— برگرفته از متن پایاننامه
🔮 مسیرهای بکر پیش رو
بخش هیجانانگیز ماجرا، راههای آیندهای است که نویسنده ترسیم کرده:
آموزش بدون نظارت با CycleGAN برای استفاده از دادههای جفتنشدهٔ عظیم،
رمزگشایی خودبازگشتی برای محاسبهٔ میزان تأثیر هر جایگاه ATAC بر هر ژن (که میتواند به کشف شبکههای تنظیم ژن کمک کند)،
و آگاهی از ساختار سهبعدی کروماتین با استفاده از نقشههای تماس Hi-C.
این جهتها نشان میدهند که داستان تازه شروع شده است.
“`