خطرات پنهان در اشتراکگذاری دادههای بیان ژن: نگاهی جامع به یک پژوهش
در سالهای اخیر، حجم دادههای زیستی و پزشکی بهطور بیسابقهای رشد کرده است. پایگاههای داده بزرگ مانند NCBI GEO و ArrayExpress میزبان میلیونها پروفایل بیان ژن هستند که پژوهشگران از سراسر جهان آنها را به اشتراک میگذارند. این دادهها که نشان میدهند کدام ژنها در یک بافت یا شرایط خاص فعال هستند، نقش کلیدی در درک بیماریها، کشف دارو و پزشکی شخصیسازیشده ایفا میکنند. با این حال، در کنار این منافع علمی، پرسشی بنیادین مطرح میشود: آیا انتشار عمومی این دادهها میتواند هویت افراد شرکتکننده در مطالعه را فاش کند؟ قوانین و مقرراتی مانند HIPAA و GDPR برای حفاظت از اطلاعات شخصی وضع شدهاند، اما بسیاری از انواع دادههای زیستپزشکی، از جمله دادههای ژنومی و بیان ژن، در چارچوب این قوانین بهروشنی تعریف نشدهاند. همین ابهام باعث شده است که خطرات واقعی حریم خصوصی این دادهها بهطور کامل شناخته نشود و پژوهشگران نتوانند با اطمینان درباره سطح مناسب حفاظت تصمیم بگیرند. این پژوهش با هدف روشنکردن یکی از مهمترین ابعاد این خطر، یعنی امکان تطبیق دادن پروفایل بیان ژن یک فرد با پروفایل ژنتیکی او، انجام شده است. پرسش بنیادینی که این کار به آن میپردازد این است که آیا دادههایی که در نگاه اول فقط نشاندهنده فعالیت ژنها هستند، میتوانند بهعنوان یک «اثر انگشت» ژنتیکی عمل کنند و هویت صاحب خود را در میان هزاران یا حتی دهها هزار نفر دیگر آشکار سازند.
برای درک ماهیت این تهدید، باید به رابطه میان ژنوم و بیان ژن توجه کرد. ژنوم هر انسان مجموعهای از دستورالعملهای وراثتی است که در هر سلول ذخیره شده است، اما همه ژنها در همه سلولها فعال نیستند. میزان فعالیت یا «بیان» هر ژن میتواند تحت تأثیر تفاوتهای کوچکی در توالی DNA باشد که به آنها «واریانت» یا «چندشکلی تکنوکلئوتیدی» میگویند. برخی از این واریانتها با سطح بیان ژنهای خاصی ارتباط دارند و به آنها «جایگاههای صفت کمی بیان» یا eQTL گفته میشود. به بیان ساده، اگر فردی واریانت خاصی در یک جایگاه ژنومی داشته باشد، احتمالاً ژن مرتبط با آن جایگاه در بدن او به میزان مشخصی فعالتر یا غیرفعالتر است. این ارتباط، کلید اصلی حملهای است که در این پژوهش بررسی میشود: اگر یک مهاجم به پروفایل بیان ژن فردی دسترسی داشته باشد و بداند کدام واریانتها با کدام ژنها مرتبطاند، میتواند با احتمال قابلتوجهی ژنوتیپ آن فرد را در آن جایگاهها پیشبینی کند. این فرایند که «حمله پیوندی» نامیده میشود، میتواند پروفایل بیان ژن یک فرد را به پروفایل ژنتیکی او در یک مجموعهداده دیگر متصل کند و به این ترتیب هویت او را حتی بدون داشتن نام و مشخصات آشکار، آشکار سازد. نکته مهم این است که حملهکننده نیازی به دسترسی به نمونه خون یا بزاق فرد ندارد؛ همان پروفایل بیانی که پژوهشگران با حسن نیت به اشتراک گذاشتهاند، میتواند بهعنوان سرنخی برای یافتن ژنوم او در پایگاههای دیگر کافی باشد.
پژوهشهای پیشین نشان داده بودند که چنین حملهای تا حدی امکانپذیر است، اما این پژوهشها محدودیتهای جدی داشتند. مدلهای آماری قبلی برای سادگی، هر واریانت را مستقل از دیگران در نظر میگرفتند و ناچار بودند فقط زیرمجموعه کوچکی از eQTLها را که با یکدیگر همبستگی نداشتند، برای پیشبینی استفاده کنند. این کار باعث میشد بخش بزرگی از اطلاعات موجود در دادههای بیان ژن نادیده گرفته شود. در واقع، واریانتهای مجاور در ژنوم اغلب با هم به ارث میرسند و همبستگی بالایی دارند؛ پدیدهای که «عدم تعادل پیوندی» نامیده میشود. اگر مدلی این همبستگیها را در نظر نگیرد و همه eQTLها را با هم ترکیب کند، امتیازهای تطبیق آن بهشدت بدتنظیم میشود و دقت پیشبینی افت میکند. همچنین، برخی eQTLها با چند ژن مختلف مرتبطاند و مدلهای قبلی فقط یکی از این ژنها را در نظر میگرفتند. این محدودیتها باعث میشد برآورد خطر واقعی حریم خصوصی بسیار کمتر از آنچه هست، به نظر برسد. پرسش اصلی این پژوهش آن بود که اگر مدلی طراحی شود که تمام این اطلاعات را بهطور همزمان و بهشکل صحیح ترکیب کند، میزان خطر واقعی چقدر خواهد بود. به عبارت دیگر، آیا آن سادهسازیها فقط باعث کاهش دقت میشدند، یا اینکه تصویری کاملاً نادرست از امنیت دادههای بیان ژن ارائه میدادند؟
برای پاسخ به این پرسش، پژوهشگران مدل جدیدی به نام «مدل توالی تمایزی» یا DSM معرفی کردند. این مدل بهجای آنکه هر واریانت را جداگانه پیشبینی کند، کل توالی ژنوتیپ را بهصورت یک زنجیره بههمپیوسته مدلسازی میکند. ایده اصلی این است که ژنوم هر فرد را میتوان دنبالهای از قطعات بهارثرسیده از نیاکان در نظر گرفت که در طول نسلها با فرایند نوترکیبی شکسته و بازچینی شدهاند. DSM از یک مدل آماری شناختهشده به نام مدل لی-استیفنز استفاده میکند که همین فرایند نوترکیبی و کپیبرداری از یک «پنل مرجع» از هاپلوتایپهای شناختهشده را توصیف میکند. سپس، این مدل لایهای دیگر به آن اضافه میکند که ارتباط میان واریانتها و سطوح بیان ژن را بهصورت عوامل احتمالی به نام «عامل QTL» وارد میکند. نکته مهم این است که همه این عوامل بهطور همزمان و مشترک آموزش داده میشوند تا احتمالات نهایی بهدرستی تنظیم شوند و همبستگیهای میان واریانتها و سیگنالهای تکراری میان ژنهای مختلف را در نظر بگیرند. این رویکرد «تمایزی» نامیده میشود زیرا مستقیماً احتمال ژنوتیپ را با توجه به بیان ژن مدل میکند، برخلاف روشهای قبلی که ابتدا توزیع بیان را مدل میکردند و سپس آن را معکوس میساختند. این تغییر نگرش، اگرچه در ظاهر فنی به نظر میرسد، پیامدهای عمیقی برای دقت و قابلیت اطمینان برآورد خطر دارد.
اجرای این مدل از نظر محاسباتی چالشبرانگیز است، زیرا در حالت دقیق، ترکیب دو هاپلوتایپ (یکی از مادر و یکی از پدر) در هر موقعیت ژنومی فضای حالتی بسیار بزرگی ایجاد میکند. برای حل این مشکل، پژوهشگران یک تقریب هاپلوتایپمحور معرفی کردند که در آن سیگنال پیشبینیکننده بیان ژن بهطور جداگانه برای هر هاپلوتایپ محاسبه و سپس بهصورت متقارن به هر دو هاپلوتایپ اعمال میشود. این تقریب باعث میشود که حافظه و زمان اجرا از رشد درجهدو به رشد خطی در تعداد هاپلوتایپهای مرجع و تعداد eQTLها کاهش یابد. به لطف همین بهینهسازی، پژوهشگران توانستند از پنل مرجع بزرگی با هزار هاپلوتایپ و پنجرههایی با ۷۵۰ eQTL استفاده کنند. آموزش مدل برای هر پنجره حدود هشت ساعت با ۷۵ گیگابایت حافظه زمان برد، اما پس از آموزش، مرحله تطبیق با حافظهای در حدود ۱۲ گیگابایت و زمانی حدود پنج دقیقه انجام شد. این هزینه محاسباتی بالا نشان میدهد که مهاجم برای اجرای چنین حملهای به منابع قابلتوجه نیاز دارد، اما با توجه به کاهش مستمر هزینههای محاسباتی و افزایش دسترسی به منابع ابری، چنین فرضی دور از ذهن نیست. از دیدگاه ارزیابی خطر، فرض کردن مهاجمی با منابع کافی، رویکردی محافظهکارانه و منطقی است.
ارزیابیها در چند سناریوی متفاوت انجام شد تا تصویری واقعبینانه از خطر ارائه شود. در نخستین سناریو، مدل روی بخشی از دادههای GTEx آموزش دید و روی بخش دیگری از همان مجموعه آزمایش شد. نتیجه نشان داد که DSM تقریباً همه افراد را بهدرستی تطبیق میدهد، حتی وقتی فقط از یک کروموزوم استفاده شود. در سناریوی دوم، مدل روی دادههای GTEx آموزش دید اما روی مجموعه FUSION آزمایش شد که شامل افراد فنلاندی با تبار ژنتیکی متفاوت از افراد آمریکاییتبار GTEx بود. این وضعیت دشوارتر است زیرا تفاوتهای جمعیتی میتوانند دقت پیشبینی را کاهش دهند. با این حال، DSM توانست ۲۹۱ نفر از ۲۹۲ نفر را با استفاده از کروموزوم ۱۹ بهتنهایی و همان تعداد را با ترکیب چهار کروموزوم بهدرستی تطبیق دهد. در سناریوی سوم، ۲۹۲ ژنوم اضافی از کنسرسیوم GOT2D به مجموعه نامزدها اضافه شد تا شرایطی شبیه به جستوجو در میان تعداد بیشتری از افراد ایجاد شود. در این حالت، دقت روشهای قبلی بهشدت افت کرد، در حالی که DSM همچنان ۲۹۱ نفر را بهدرستی تطبیق داد. این نتایج نشان میدهد که DSM نهتنها سیگنالهای قویتری از دادههای بیان ژن استخراج میکند، بلکه در برابر افزایش تعداد نامزدهای نامرتبط نیز بسیار مقاومتر است.
چالشبرانگیزترین آزمون زمانی بود که پژوهشگران ۲۲ هزار ژنوم اضافی از کنسرسیوم مرجع هاپلوتایپ (HRC) را به مجموعه نامزدها افزودند؛ یعنی حدود دو مرتبه بزرگی بیشتر از تعداد افراد اصلی. در چنین مقیاسی، یافتن تطبیق صحیح مانند یافتن سوزن در انبار کاه است. با این حال، DSM توانست ۹۴ درصد افراد را با ترکیب چهار کروموزوم بهدرستی تطبیق دهد، در حالی که دو روش قبلی بهترتیب حدود ۸۸ و ۸۴ درصد موفق بودند. اختلاف در کروموزومهای تکنفره چشمگیرتر بود؛ مثلاً در کروموزوم ۲۱ که تعداد eQTLهای آن کمتر است، DSM حدود ۱۵۷ نفر را تطبیق داد در حالی که روشهای قبلی فقط ۱۲۸ و ۱۳۰ نفر را شناسایی کردند. همچنین، پژوهشگران توانستند با محاسبه «مقدار p» آماری نشان دهند که فاصله امتیاز تطبیق درست از توزیع امتیازهای نادرست در DSM بسیار بیشتر از روشهای پیشین است. این یافته توضیح میدهد چرا DSM در برابر افزودن نامزدهای جدید مقاومتر است: هرچه این فاصله بیشتر باشد، احتمال اینکه یک فرد نامرتبط امتیاز بالاتری از تطبیق درست کسب کند، کمتر میشود. همخوانی بالای میان مقدار p مدلمحور و مقدار p تجربی بر روی ۵۰۰ نفر نمونه (با ضریب تعیین ۰٫۸۱) نشان میدهد که این معیار میتواند برای برآورد خطر در مقیاسهای بزرگ بهکار رود و به پژوهشگران امکان میدهد بدون آزمودن همه ترکیبهای ممکن، خطر را تخمین بزنند.
نتیجه کلی این پژوهش آن است که خطر افشای اطلاعات ژنتیکی از دادههای بیان ژن بسیار بیشتر از آن است که پیشتر تصور میشد. روشهای قبلی به دلیل سادهسازیهای آماری، بخش بزرگی از اطلاعات قابلاستخراج را نادیده میگرفتند. مدل جدید نشان میدهد که با ترکیب هوشمندانه همه eQTLها و در نظر گرفتن همبستگیهای ژنومی، میتوان حتی در میان دهها هزار فرد نامزد، تطبیق صحیح را یافت. این یافته پیامدهای مهمی برای سیاستگذاری در حوزه اشتراکگذاری داده دارد. از یک سو، پژوهشگران و نهادهای نظارتی باید بدانند که حذف نام و مشخصات آشکار از دادههای بیان ژن برای تضمین ناشناسماندن افراد کافی نیست. از سوی دیگر، ابزارهایی مانند پاکسازی داده، حفظ حریم خصوصی تفاضلی، و بسترهای تحلیل امن میتوانند برای کاهش این خطر بهکار روند. این پژوهش چارچوبی یکپارچه فراهم میکند که میتواند برای ارزیابی خطرات سایر انواع دادههای اومیکس، مانند دادههای پروتئومیکس، متیلاسیون DNA و بیان اختصاصی آلل، نیز بهکار رود. با این حال، پژوهشگران تأکید میکنند که کاربردهای واقعی این یافتهها به عواملی مانند تبار جمعیتی، بافت مورد مطالعه و پلتفرم اندازهگیری بستگی دارد و سطح مناسب حفاظت باید با توجه به شرایط خاص هر مجموعهداده تعیین شود. در نهایت، این کار گامی مهم در جهت شناخت دقیقتر خطرات حریم خصوصی دادههای ترنسکریپتومیک و حفاظت بهتر از شرکتکنندگان در پژوهشهای زیستپزشکی است؛ گامی که نشان میدهد امنیت دادههای زیستی نیازمند نگاهی جامعتر و ابزارهایی دقیقتر از آنچه تاکنون بهکار رفته، است.
| سرفصل | شماره صفحه |
|---|---|
| عنوان | ۱ |
| چکیده | ۲ |
| تقدیر و تشکر | ۴ |
| فهرست مطالب | ۶ |
| فهرست شکلها | ۸ |
| ۱. مقدمه | ۱۴ |
| ۲. روشها | ۱۶ |
| ۲.۱. توصیف مسئله و مدل تهدید | ۱۶ |
| ۲.۲. نمادگذاری و تعاریف | ۱۷ |
| ۲.۳. مروری بر روشهای پیوندی پیشین | ۱۷ |
| ۲.۴. رویکردهای جدید برای پیشبینی ژنوتیپ از بیان ژن | ۱۸ |
| ۲.۵. مدل توالی تمایزی (DSM) | ۲۰ |
| ۲.۶. جزئیات پیادهسازی | ۲۲ |
| ۲.۷. دسترسی به دادهها و کد | ۲۳ |
| ۳. نتایج | ۲۴ |
| ۳.۱. مروری بر مدلهای توالی تمایزی | ۲۴ |
| ۳.۲. مروری بر آزمایشها | ۲۵ |
| ۳.۳. DSM افراد بیشتری را نسبت به رویکردهای پیشین پیوند میدهد | ۲۵ |
| ۳.۴. DSM دقت پیوند بینمجموعهدادهای را بهبود میبخشد | ۲۶ |
| ۳.۵. DSM سیگنالهای شناسایی قویتری از بیان ژن استخراج میکند | ۲۸ |
| ۳.۶. یافتن سوزن در انبار کاه: DSM پیوند در برابر مجموعههای عظیم ژنوتیپ را ممکن میسازد | ۳۰ |
| ۴. نتایج (تکرار) | ۳۱ |
| ۴.۱. مروری بر مدلهای توالی تمایزی | ۳۱ |
| ۴.۲. مروری بر آزمایشها | ۳۲ |
| ۴.۳. DSM افراد بیشتری را نسبت به رویکردهای پیشین پیوند میدهد | ۳۲ |
| ۴.۴. DSM دقت پیوند بینمجموعهدادهای را بهبود میبخشد | ۳۳ |
| ۴.۵. DSM سیگنالهای شناسایی قویتری از بیان ژن استخراج میکند | ۳۵ |
| ۴.۶. یافتن سوزن در انبار کاه: DSM پیوند در برابر مجموعههای عظیم ژنوتیپ را ممکن میسازد | ۳۷ |
| ۵. بحث | ۳۸ |
| پیوست الف: شکلهای تکمیلی | ۴۰ |
| پیوست ب: یادداشتهای تکمیلی | ۴۵ |
| یادداشت تکمیلی ۱: الگوریتم پیشرو-پسرو برای DSM | ۴۵ |
| یادداشت تکمیلی ۲: برآورد مدلمحور مقادیر p | ۴۶ |
| مراجع | ۴۷ |
آیا دادههای بیان ژن، هویت شما را لو میدهند؟
وقتی یک آزمایش ساده ژنتیکی به یک «اثر انگشت» پنهان تبدیل میشود
ماجرا از کجا شروع شد؟
تصور کنید یک پژوهشگر مهربان، نتیجه آزمایش بیان ژن خود را در یک پایگاه داده عمومی به اشتراک میگذارد. هیچ نامی، هیچ نشانی، هیچ شمارهای. فقط اعداد خام. حالا تصور کنید فرد دیگری با یک لپتاپ معمولی و کمی دانش آماری، بتواند از همان اعداد بفهمد که این پروفایل بیان ژن متعلق به کدام ژنوم در یک پایگاه داده دیگر است. این دقیقاً همان چیزی است که یک پژوهش جدید نشان میدهد: دادههای بیان ژن بسیار بیشتر از آنچه فکر میکردیم، هویت ما را فاش میکنند.
بیان ژن چیست و چرا مهم است؟
هر سلول بدن ما یک نسخه از ژنوم را در خود دارد، اما همه ژنها در همه سلولها فعال نیستند. میزان فعالیت یا «بیان» هر ژن، تحت تأثیر تفاوتهای کوچکی در توالی DNA قرار میگیرد. به این تفاوتها «واریانت» میگویند. برخی از این واریانتها با سطح بیان ژنهای خاصی ارتباط دارند و به آنها eQTL میگویند.
به زبان ساده: اگر بدانیم یک ژن خاص در بدن شما چقدر فعال است، میتوانیم با احتمال خوبی حدس بزنیم که در یک جایگاه مشخص از ژنوم شما چه حرفی نوشته شده است. حالا اگر این حدس را برای هزاران جایگاه تکرار کنیم، به یک تصویر نسبتاً دقیق از ژنوم شما میرسیم. این همان چیزی است که «حمله پیوندی» نامیده میشود.
مشکل بزرگ روشهای قبلی
پژوهشگران قبلاً هم میدانستند که چنین حملهای ممکن است. اما مدلهای آماری آنها یک ضعف بزرگ داشتند: برای سادگی، هر واریانت را مستقل از دیگران در نظر میگرفتند. این در حالی است که واریانتهای مجاور در ژنوم اغلب با هم به ارث میرسند و همبستگی بالایی دارند؛ پدیدهای به نام «عدم تعادل پیوندی».
نتیجه این بود که آنها مجبور میشدند فقط زیرمجموعه کوچکی از eQTLها را که با هم همبستگی نداشتند، استفاده کنند. یعنی بخش بزرگی از اطلاعات موجود در دادههای بیان ژن نادیده گرفته میشد. به همین دلیل، خطر واقعی حریم خصوصی بسیار کمتر از آنچه هست، به نظر میرسید.
«این محدودیتها باعث میشد برآورد خطر واقعی حریم خصوصی بسیار کمتر از آنچه هست، به نظر برسد.»
راهحل جدید: مدل توالی تمایزی (DSM)
پژوهشگران یک مدل جدید به نام «مدل توالی تمایزی» یا DSM طراحی کردند. این مدل بهجای آنکه هر واریانت را جداگانه پیشبینی کند، کل توالی ژنوتیپ را بهصورت یک زنجیره بههمپیوسته مدلسازی میکند.
ایده اصلی این است که ژنوم هر فرد را میتوان دنبالهای از قطعات بهارثرسیده از نیاکان در نظر گرفت که در طول نسلها با فرایند نوترکیبی شکسته و بازچینی شدهاند. DSM از مدل لی-استیفنز استفاده میکند که همین فرایند را توصیف میکند، و سپس لایهای دیگر به آن اضافه میکند که ارتباط میان واریانتها و سطوح بیان ژن را وارد میکند.
نکته کلیدی این است که همه این عوامل بهطور همزمان و مشترک آموزش داده میشوند تا احتمالات نهایی بهدرستی تنظیم شوند. این رویکرد «تمایزی» نامیده میشود زیرا مستقیماً احتمال ژنوتیپ را با توجه به بیان ژن مدل میکند، برخلاف روشهای قبلی که ابتدا توزیع بیان را مدل میکردند و سپس آن را معکوس میساختند.
نتیجهای که شوکهکننده است
پژوهشگران مدل خود را در چند سناریوی متفاوت آزمایش کردند. در نخستین سناریو، مدل روی بخشی از دادههای GTEx آموزش دید و روی بخش دیگری از همان مجموعه آزمایش شد. نتیجه نشان داد که DSM تقریباً همه افراد را بهدرستی تطبیق میدهد.
در سناریوی دوم، مدل روی دادههای GTEx آموزش دید اما روی مجموعه FUSION آزمایش شد که شامل افراد فنلاندی با تبار ژنتیکی متفاوت از افراد آمریکاییتبار GTEx بود. با این حال، DSM توانست ۲۹۱ نفر از ۲۹۲ نفر را با استفاده از کروموزوم ۱۹ بهتنهایی بهدرستی تطبیق دهد.
اما چالشبرانگیزترین آزمون زمانی بود که ۲۲ هزار ژنوم اضافی به مجموعه نامزدها افزودند؛ یعنی حدود دو مرتبه بزرگی بیشتر از تعداد افراد اصلی. در چنین مقیاسی، یافتن تطبیق صحیح مانند یافتن سوزن در انبار کاه است. با این حال، DSM توانست ۹۴ درصد افراد را با ترکیب چهار کروموزوم بهدرستی تطبیق دهد، در حالی که دو روش قبلی بهترتیب حدود ۸۸ و ۸۴ درصد موفق بودند.
چرا این یافته مهم است؟
این پژوهش نشان میدهد که خطر افشای اطلاعات ژنتیکی از دادههای بیان ژن بسیار بیشتر از آن است که پیشتر تصور میشد. روشهای قبلی به دلیل سادهسازیهای آماری، بخش بزرگی از اطلاعات قابلاستخراج را نادیده میگرفتند.
این یافته پیامدهای مهمی برای سیاستگذاری در حوزه اشتراکگذاری داده دارد. از یک سو، پژوهشگران و نهادهای نظارتی باید بدانند که حذف نام و مشخصات آشکار از دادههای بیان ژن برای تضمین ناشناسماندن افراد کافی نیست. از سوی دیگر، ابزارهایی مانند پاکسازی داده، حفظ حریم خصوصی تفاضلی، و بسترهای تحلیل امن میتوانند برای کاهش این خطر بهکار روند.
«این کار گامی مهم در جهت شناخت دقیقتر خطرات حریم خصوصی دادههای ترنسکریپتومیک و حفاظت بهتر از شرکتکنندگان در پژوهشهای زیستپزشکی است.»
یک تأمل کوتاه
شاید فکر کنیم که دادههای زیستی ما فقط اعدادی بیمعنا هستند. اما این پژوهش نشان میدهد که همین اعداد میتوانند بهعنوان یک «اثر انگشت» عمل کنند. در دنیایی که هر روز دادههای بیشتری از ما جمعآوری و به اشتراک گذاشته میشود، این پرسش مطرح میشود: آیا ما واقعاً از میزان اطلاعاتی که درباره خودمان فاش میکنیم، آگاه هستیم؟
پاسخ این پرسش میتواند سرنوشت حریم خصوصی نسلهای آینده را تعیین کند.