خلاصهٔ پایان‌نامه

در سال‌های اخیر، فن‌آوری‌های توالی‌یابی تک‌سلولی انقلابی در زیست‌شناسی ایجاد کرده‌اند. دو روش مهم در این حوزه،
scRNA‑seq (اندازه‌گیری میزان بیان ژن‌ها) و scATAC‑seq (اندازه‌گیری میزان دسترسی به بخش‌های تنظیمی دی‌ان‌ای) هستند.
هرکدام از این روش‌ها تصویری متفاوت از وضعیت درونی یک سلول ارائه می‌دهند و ترکیب این دو، می‌تواند درک ما از سازوکارهای تنظیم ژن را عمیق‌تر کند.

با این حال، داده‌های حاصل از scATAC‑seq بسیار پرابعاد، پراکنده و نویزی هستند. به‌عنوان مثال، هر سلول ممکن است بیش از صد هزار جایگاه ژنومی را پوشش دهد،
اما تنها چند هزار تای آنها فعالیت غیرصفر دارند. این ویژگی، مدل‌سازی رایانه‌ای را با چالش جدی مواجه می‌کند و پژوهشگران را به سمت یافتن روش‌های
کارآمدتر برای نمایش و تحلیل این داده‌ها سوق داده است.

پایان‌نامهٔ حاضر، رویکردی نوین برای ترجمهٔ داده‌های scATAC به scRNA پیشنهاد می‌کند.
ایدهٔ اصلی، استفاده از معماری ترنسفورمر (Transformer) است که در حوزه‌هایی مانند پردازش زبان طبیعی و بینایی ماشین موفقیت‌های چشمگیری داشته است.
اما چالش اصلی، تبدیل داده‌های بسیار پراکندهٔ ATAC به قالبی است که ترنسفورمر بتواند آن را به‌خوبی پردازش کند.

راه‌حل ارائه‌شده در این پژوهش، «درون‌سازی فشرده» یا Squish Embedding نام دارد.
در این روش، به‌جای اینکه کل بردار ۱۱۶‌هزارتایی برای هر سلول به مدل داده شود، تنها جایگاه‌هایی که مقدار غیرصفر دارند،
به‌همراه یک بردار جاسازی‌شده برای هر جایگاه، به صورت دنباله‌ای از بردارها در اختیار ترنسفورمر قرار می‌گیرند.
این کار، طول ورودی را از بیش از صد هزار به حدود سه تا چهار هزار کاهش می‌دهد و امکان استفاده از ترنسفورمر را فراهم می‌کند.

داده‌های مورد استفاده از مسابقهٔ NeurIPS 2021 گرفته شده و شامل بیش از ۴۲ هزار سلول است.
مدل‌های پیاده‌سازی‌شده شامل نسخه‌های سبک‌وزن DistilBERT و نسخهٔ کارآمد از نظر حافظه یعنی LongT5 هستند.
هرچند نتایج عددی نشان می‌دهد که این روش‌ها عملکرد بهتری نسبت به یک شبکهٔ سادهٔ چندلایه (MLP) ندارند،
اما مزیت اصلی آن، فراهم کردن امکان استفاده از خانوادهٔ بزرگ مدل‌های ترنسفورمر برای داده‌های زیستیِ پراکنده است.

بخش مهم دیگری از پژوهش، به مسیرهای آینده اختصاص دارد. از جملهٔ آنها می‌توان به استفاده از آموزش بدون نظارت
با رویکرد CycleGAN برای بهره‌گیری از داده‌های جفت‌نشده، رمزگشایی خودبازگشتی برای محاسبهٔ میزان تأثیر هر جایگاه ATAC بر بیان هر ژن،
و افزودن آگاهی زیستی مانند ساختار سه‌بعدی کروماتین یا اطلاعات نوع سلول اشاره کرد.
این جهت‌ها می‌توانند در آینده به درک عمیق‌تری از روابط تنظیمی بین ژنوم و ترنسکریپتوم منجر شوند.

در نهایت، اگرچه روش پیشنهادی از نظر دقت عددی بر روش‌های ساده‌تر برتری ندارد، اما به دلیل ساختار انعطاف‌پذیر و قابلیت تفسیرپذیری بالا،
پنجرهٔ جدیدی به روی پژوهشگران باز می‌کند تا بتوانند داده‌های پیچیدهٔ اپی‌ژنتیکی را با ابزارهای پیشرفتهٔ یادگیری ماشین مدل کنند.
کدهای این پروژه نیز به‌صورت عمومی در دسترس قرار گرفته است تا سایر محققان بتوانند از آن الهام بگیرند و آن را گسترش دهند.

فهرست مطالب

عنوان شمارهٔ صفحه
چکیده ۳
سپاس‌گزاری ۵
فصل ۱: مقدمه ۱۳
فصل ۲: داده ۱۹
فصل ۳: روش‌ها ۲۳
فصل ۴: آزمایش‌ها ۲۷
فصل ۵: کارهای آینده ۳۱
فصل ۶: نتیجه‌گیری ۳۵
پیوست الف: جزئیات مدل‌ها ۳۷
پیوست ب: جزئیات آموزش ۳۹
پیوست ج: جزئیات پیاده‌سازی ۴۱
منابع ۴۳

 

🔬 وقتی ترنسفورمر به آزمایشگاه می‌رود

رویای ترجمهٔ دادهٔ اَتَک به آران‌ای؛ سفری از اسپارسیتی تا هوش مصنوعی

تصور کنید یک جعبهٔ سیاه دارید که در آن، برای هر سلول، بیش از صد هزار نقطهٔ روشن و خاموش ثبت شده است.
این نقاط، جایگاه‌های ژنومی‌اند که هرکدام داستانی از دسترسیِ دی‌ان‌ای روایت می‌کنند.
حالا فرض کنید می‌خواهید از روی همین نقاط، پیش‌بینی کنید که کدام ژن‌ها در آن سلول فعال هستند.
این دقیقاً همان چالشی است که زیست‌شناسیِ محاسباتی امروز با آن دست‌وپنجه نرم می‌کند.

⚡ چالش بزرگ: اقیانوسی از صفرها

دادهٔ scATAC‑seq ذاتاً اسپارس (پراکنده) است. در هر سلول، از میان بیش از ۱۱۶ هزار جایگاه ممکن،
به‌طور میانگین تنها حدود ۳۴۰۰ جایگاه فعالیت غیرصفر دارند. این یعنی ۹۷٪ ماتریس ورودی خالی است.
مدل‌های کلاسیک یادگیری ماشین با این حجم از صفرها به‌سختی کنار می‌آیند، مگر اینکه آنها را فشرده یا کاهش‌بعد کنیم.

نکتهٔ کلیدی: روش «درون‌سازی فشرده» یا Squish Embedding، فقط جایگاه‌های غیرصفر را به‌همراه بردارهای آموخته‌شده برای هر جایگاه، به صورت دنباله‌ای از بردارها به ترنسفورمر تحویل می‌دهد.
این ترفند ساده اما هوشمندانه، طول ورودی را تا یک‌سی‌ام کاهش می‌دهد.

🧠 چرا ترنسفورمر، نه شبکه‌های ساده؟

ترنسفورمرها در زبان، تصویر و حتی بازی‌های رایانه‌ای، توانسته‌اند الگوهای دوربرد را بیاموزند.
در زیست‌شناسی نیز احتمالاً تعاملات بین جایگاه‌های دوردستِ ژنومی نقشی کلیدی در تنظیم بیان ژن دارند.
اما معماری استاندارد ترنسفورمر برای دنباله‌هایی با طول ۳۴۰۰ توکن (که در اینجا معادل تعداد جایگاه‌های غیرصفر است) طراحی نشده بود.
پژوهشگر این پایان‌نامه با بهره‌گیری از مدل‌های کارآمدی مانند LongT5 و DistilBERT،
سعی کرده است این شکاف را پر کند.

📊 نتیجهٔ کوتاه: نه آنقدرها هم که انتظار داشتیم!

جالب اینجاست که با وجود تمام ظرافت‌های معماری، مدل‌های ترنسفورمر در این آزمایش نتوانستند از یک شبکهٔ سادهٔ دو-لایه پیشی بگیرند.
کمترین خطای میانگین مربعات (MSE) برای ترنسفورمرها حدود ۰٫۰۹۶ و برای MLP ساده حدود ۰٫۰۹۰ ثبت شد.
اما آیا این شکست است؟ شاید نه. بلکه این اولین گام برای فهمیدن این است که «چه چیزی در این داده است که با این روش‌ها قابل مدل‌سازی نیست».

«اگرچه روش پیشنهادی از نظر عددی برنده نیست، اما پنجره‌ای به سوی استفاده از صدها مدل ترنسفورمر متن‌باز در زیست‌شناسی تک‌سلولی می‌گشاید.»
— برگرفته از متن پایان‌نامه

🔮 مسیرهای بکر پیش رو

بخش هیجان‌انگیز ماجرا، راه‌های آینده‌ای است که نویسنده ترسیم کرده:
آموزش بدون نظارت با CycleGAN برای استفاده از داده‌های جفت‌نشدهٔ عظیم،
رمزگشایی خودبازگشتی برای محاسبهٔ میزان تأثیر هر جایگاه ATAC بر هر ژن (که می‌تواند به کشف شبکه‌های تنظیم ژن کمک کند)،
و آگاهی از ساختار سه‌بعدی کروماتین با استفاده از نقشه‌های تماس Hi-C.
این جهت‌ها نشان می‌دهند که داستان تازه شروع شده است.

“`

بسیار سریع و ساده می توانید اصل این پایان نامه را به صورت فایل PDF در اختیار داشته باشید.

پس از دریافت پایان‌نامه، کلیه اطلاعات کتاب‌شناختی موردنیاز برای استناد علمی، از جمله نام دانشگاه، عنوان پایان‌نامه، نام پژوهشگر، سال دفاع و سایر مشخصات مرتبط، جهت ارجاع‌دهی صحیح مطابق با استانداردهای رایج، در اختیار شما قرار خواهد گرفت.