چکیده
در دهههای اخیر، رشد بیسابقه حجم دادهها، افزایش پیچیدگی ساختار اطلاعات و گسترش کاربرد روشهای یادگیری ماشین، پژوهشگران اقتصاد، آمار و علوم داده را با چالشهای جدیدی در زمینه تحلیل داده و استنباط علّی مواجه کرده است. اگرچه روشهای کلاسیک اقتصادسنجی در تحلیل روابط علت و معلولی، ارزیابی سیاستهای عمومی و استخراج نتایج قابل استناد آماری عملکرد موفقی داشتهاند، اما بسیاری از این روشها برای دادههای بسیار بزرگ، پرنویز، ناقص یا دادههایی که به دلایل حفظ حریم خصوصی بهصورت عمدی دچار تغییر شدهاند، کارایی کافی ندارند. از سوی دیگر، الگوریتمهای مدرن یادگیری ماشین توانایی بسیار بالایی در پیشبینی و استخراج الگوهای پیچیده از دادهها دارند، اما معمولاً فاقد قابلیت ارائه تفسیر علّی و استنباط آماری دقیق هستند. این پایاننامه با هدف پر کردن این شکاف، چارچوبی جامع برای ترکیب قابلیتهای اقتصادسنجی و یادگیری ماشین ارائه میدهد تا بتوان هم از انعطافپذیری مدلهای یادگیری ماشین بهره برد و هم ویژگیهای ضروری استنباط علّی و تحلیل آماری معتبر را حفظ کرد.
مسئله اصلی این پژوهش آن است که بسیاری از مجموعهدادههای امروزی، بهویژه دادههای دولتی و آماری، به دلیل الزامات حفظ حریم خصوصی یا وجود خطاهای اندازهگیری، مقادیر گمشده، گسستهسازی دادهها و نویزهای مصنوعی، دیگر شرایط ایدهآل موردنیاز روشهای سنتی اقتصادسنجی را ندارند. برای نمونه، اداره سرشماری ایالات متحده در نسخههای جدید دادههای سرشماری، بهمنظور جلوگیری از افشای اطلاعات افراد، از تکنیکهای حریم خصوصی تفاضلی استفاده میکند که عمداً نویز آماری به دادهها اضافه میکنند. اگرچه این اقدام امنیت اطلاعات شهروندان را افزایش میدهد، اما میتواند دقت تحلیلهای اقتصادی و تصمیمگیریهای مبتنی بر داده را کاهش دهد. بنابراین پرسش اساسی این پایاننامه آن است که آیا میتوان بدون قربانی کردن کیفیت تحلیلهای علّی، همزمان از حریم خصوصی افراد نیز محافظت کرد.
برای پاسخ به این پرسش، پژوهش ابتدا تاریخچه شکلگیری مسئله را بررسی میکند. در سالهای گذشته پژوهشگران عمدتاً روی خطاهای اندازهگیری، دادههای ناقص یا مدلهای اقتصادسنجی کلاسیک تمرکز داشتند و هر یک از این مشکلات را بهصورت مستقل بررسی میکردند. با گسترش فناوری اطلاعات و افزایش نگرانیهای مربوط به امنیت دادهها، مفهوم حریم خصوصی تفاضلی به یکی از مهمترین استانداردهای حفاظت از اطلاعات تبدیل شد. در نتیجه، پژوهشگران دریافتند که روشهای متداول استنباط علّی دیگر پاسخگوی تحلیل دادههایی که عمداً دچار تغییر شدهاند نیستند. همزمان، یادگیری ماشین نیز به دلیل توانایی بالا در مدلسازی روابط غیرخطی و دادههای بزرگ، به ابزار اصلی تحلیل داده تبدیل شد؛ اما بیشتر الگوریتمهای آن صرفاً برای پیشبینی طراحی شدهاند و در تعیین روابط علت و معلولی یا ارائه فاصله اطمینان معتبر محدودیت دارند. این پایاننامه دقیقاً در نقطه تلاقی این دو حوزه قرار گرفته و تلاش میکند نقاط قوت هر دو رویکرد را در قالب یک چارچوب واحد ترکیب کند.
ساختار پژوهش بر سه محور اصلی استوار است. محور نخست به استنباط علّی در دادههای مخدوش اختصاص دارد. در این بخش نویسنده مدلی ارائه میدهد که قادر است بهطور همزمان با خطاهای اندازهگیری، دادههای گمشده، گسستهسازی و نویز ناشی از حریم خصوصی تفاضلی مقابله کند. مهمترین نوآوری این بخش، طراحی روشی برای پاکسازی خودکار دادهها و سپس انجام برآوردهای علّی همراه با بازههای اطمینان اصلاحشده است؛ بهگونهای که عدمقطعیت ناشی از فرآیند پاکسازی نیز در محاسبات آماری لحاظ میشود. برخلاف بسیاری از روشهای موجود، این چارچوب نیازی به اطلاع قبلی از نوع یا شدت دقیق خطاهای موجود در دادهها ندارد و میتواند خود را با شرایط مختلف تطبیق دهد.
یکی از مفروضات کلیدی پژوهش آن است که ساختار واقعی متغیرهای توضیحی دارای رتبه تقریبی پایین است؛ به بیان دیگر، بسیاری از متغیرهای مشاهدهشده در واقع نمایشهای متفاوتی از تعداد محدودی عامل پنهان هستند. نویسنده نشان میدهد که این فرض در بسیاری از مجموعهدادههای اقتصادی، بهویژه دادههای سرشماری، برقرار است و میتوان از آن برای بازسازی اطلاعات از دست رفته یا حذف نویزهای مصنوعی استفاده کرد. این ویژگی امکان میدهد حتی زمانی که دادهها بهشدت مخدوش شدهاند، اطلاعات اصلی بازیابی شده و تحلیل علّی با دقت قابل قبولی انجام گیرد.
بخش دوم پایاننامه به توسعه نظریه استنباط آماری برای رگرسیون ریج کرنل (Kernel Ridge Regression) اختصاص دارد. اگرچه این روش یکی از ابزارهای قدرتمند یادگیری ماشین برای مدلسازی روابط غیرخطی محسوب میشود، اما تاکنون چارچوب جامعی برای استنباط آماری معتبر آن وجود نداشت. پژوهش حاضر با توسعه تقریبهای گاوسی، روشهای بوتاسترپ و ارائه تضمینهای نظری جدید، امکان محاسبه بازههای اطمینان، آزمون فرض و ارزیابی عدمقطعیت در مدلهای کرنلی را فراهم میکند. بدین ترتیب، الگوریتمهای یادگیری ماشین از ابزارهای صرفاً پیشبینیکننده به ابزارهایی مناسب برای تحلیلهای علمی و سیاستگذاری تبدیل میشوند.
محور سوم پایاننامه بر مسائل پیچیدهتر استنباط علّی تمرکز دارد؛ مسائلی مانند اثرات بلندمدت سیاستها، اثرات پویا در طول زمان و تحلیل میانجیها. نویسنده برای این منظور چارچوبی مبتنی بر رگرسیون ناپارامتری متغیرهای ابزاری ارائه میدهد که امکان تحلیل روابط علّی پیچیده را بدون نیاز به فروض محدودکننده مدلهای خطی فراهم میسازد. الگوریتمهای پیشنهادی در این بخش قادرند اثرات مستقیم و غیرمستقیم سیاستها را در شرایطی که روابط میان متغیرها بسیار پیچیده و چندمرحلهای است، برآورد کنند.
از مهمترین دستاوردهای نظری این پایاننامه، توسعه روشهایی است که حتی در صورت کند بودن فرآیند پاکسازی دادهها نیز میتوانند برآوردهای علّی با نرخ همگرایی مطلوب و ویژگیهای آماری مناسب تولید کنند. همچنین روشهای پیشنهادی با استفاده از تکنیکهای نمونهبرداری، برآورد دوبار مقاوم، تقریبهای گاوسی و نظریههای جدید یادگیری آماری، تضمینهای ریاضی محکمی برای درستی نتایج ارائه میدهند. این ویژگی سبب میشود نتایج پژوهش نهتنها از لحاظ تجربی، بلکه از نظر نظری نیز قابل اتکا باشند.
برای ارزیابی عملکرد روشهای پیشنهادی، مجموعهای از شبیهسازیهای گسترده و مطالعات موردی انجام شده است. یکی از مهمترین مطالعات تجربی، بازتحلیل اثر رقابت وارداتی بر بازار کار آمریکا با استفاده از دادههای سرشماری است. در این آزمایش، دادهها بهصورت مصنوعی مطابق با استانداردهای حریم خصوصی سرشماری ۲۰۲۰ دچار نویز شدند و سپس روش پیشنهادی برای بازیابی اطلاعات و انجام تحلیل علّی به کار گرفته شد. نتایج نشان داد که در بسیاری از موارد، حتی پس از اعمال مکانیزمهای حفظ حریم خصوصی، میتوان برآوردهایی نزدیک به دادههای اصلی به دست آورد و کاهش محسوسی در دقت تحلیلهای اقتصادی مشاهده نکرد.
علاوه بر این، پژوهش نشان میدهد که ترکیب اقتصادسنجی و یادگیری ماشین صرفاً به افزایش دقت پیشبینی محدود نمیشود، بلکه میتواند کیفیت تصمیمگیریهای مبتنی بر داده را نیز بهبود بخشد. چارچوب ارائهشده قابلیت استفاده در طیف گستردهای از مسائل کاربردی مانند ارزیابی سیاستهای اقتصادی، تحلیل دادههای سلامت، علوم اجتماعی، مطالعات بازار کار، دادههای مالی و سامانههای تصمیمیار را دارد. انعطافپذیری بالای مدلها سبب میشود پژوهشگران بتوانند بدون وابستگی به فروض سادهکننده، دادههای واقعی و پیچیده را تحلیل کنند.
در مجموع، این پایاننامه سهم مهمی در توسعه روشهای نوین اقتصادسنجی، استنباط علّی و یادگیری ماشین ایفا میکند. نوآوری اصلی آن ارائه چارچوبی یکپارچه است که مشکلات ناشی از دادههای ناقص، خطادار و حفاظتشده را با استفاده از روشهای پیشرفته یادگیری ماشین برطرف کرده و در عین حال ویژگیهای اساسی استنباط آماری و تحلیل علّی را حفظ میکند. نتایج پژوهش نشان میدهد که تعارض میان حفظ حریم خصوصی و دقت تحلیلهای آماری الزاماً اجتنابناپذیر نیست و با طراحی الگوریتمهای مناسب میتوان میان این دو هدف تعادل برقرار کرد. این دستاورد میتواند مسیر تازهای برای پژوهشهای آینده در اقتصاد، آمار، علوم داده و هوش مصنوعی ایجاد کرده و زمینه توسعه نسل جدیدی از ابزارهای تحلیل داده را فراهم سازد که هم از نظر نظری مستحکم و هم از نظر کاربردی قابل استفاده در مسائل واقعی باشند.
“`html
فهرست مطالب
| سرفصل | شماره صفحه |
|---|---|
| فصل ۱: استنباط علّی با دادههای مخدوش: خطای اندازهگیری، دادههای گمشده، گسستهسازی و حریم خصوصی تفاضلی (Differential Privacy) | 19 |
| 1.1 مقدمه | 20 |
| 1.1.1 انگیزه و پرسش پژوهش | 20 |
| 1.1.2 نوآوریها و مشارکتهای پژوهش | 20 |
| 1.2 پژوهشهای مرتبط | 23 |
| 1.3 مروری بر مدل | 26 |
| 1.3.1 پارامتر علّی | 26 |
| 1.3.2 مخدوششدگی دادهها | 27 |
| 1.3.3 فرض کلیدی: اندازهگیریهای تکرارشونده تقریبی | 28 |
| 1.4 فاصله اطمینان اصلاحشده مبتنی بر پاکسازی داده | 30 |
| 1.4.1 چرا استنباط دشوار است؟ | 30 |
| 1.4.2 مروری بر روش پیشنهادی | 33 |
| 1.4.3 ویژگیهای روش | 36 |
| 1.4.4 انطباق با نوع و شدت مخدوششدگی داده | 39 |
| 1.5 تحلیل نمونه محدود | 41 |
| 1.5.1 مرحله اول: پاکسازی داده | 42 |
| 1.5.2 مرحله دوم: رگرسیون با خطای متغیرها (Error-in-Variables Regression) | 46 |
| 1.5.3 مرحله سوم: متوازنسازی با خطای متغیرها | 49 |
| 1.5.4 مرحله چهارم: برآورد و استنباط علّی | 52 |
| 1.5.5 اعتبار فرض کلیدی در مدلهای عاملی غیرخطی | 55 |
| 1.6 مطالعه موردی: اثر رقابت واردات با استفاده از دادههای سرشماری | 57 |
| 1.6.1 پرسش پژوهش اقتصادی | 57 |
| 1.6.2 بازیابی اثرات در حضور دادههای مخدوش | 58 |
| 1.6.3 صورتبندی حریم خصوصی | 59 |
| 1.6.4 تنظیم حریم خصوصی مطابق سرشماری آمریکا 2020 | 63 |
| 1.7 جمعبندی | 64 |
| فصل ۲: استنباط آماری در رگرسیون ریج کرنل (Kernel Ridge Regression) | 65 |
| 2.1 مقدمه | 65 |
| 2.1.1 انگیزه | 65 |
| 2.1.2 مروری بر نتایج | 66 |
| 2.1.3 پژوهشهای مرتبط | 68 |
| 2.2 چارچوب رسمی | 70 |
| 2.3 تقریبهای گاوسی در فضای RKHS (فضای هیلبرت با هسته بازتولیدکننده) | 72 |
| 2.3.1 طرح کلی اثبات | 75 |
| 2.4 تقریبهای بوتاسترپ متقارن | 76 |
| 2.4.1 طرح کلی اثبات | 77 |
| 2.5 استنباط در رگرسیون ریج کرنل | 78 |
| 2.5.1 طرح کلی اثبات | 81 |
| 2.6 بحث و نتیجهگیری | 84 |
| فصل ۳: رگرسیون ناپارامتری متغیرهای ابزاری تودرتو (Nested Nonparametric Instrumental Variable Regression): اثرات بلندمدت، پویا و میانجی | 85 |
| 3.1 مقدمه | 86 |
| 3.2 پژوهشهای مرتبط | 89 |
| 3.2.1 آمار نیمهپارامتری | 89 |
| 3.2.2 استنباط علّی طولی و یادگیری ماشین | 90 |
| 3.2.3 بومیسازی و متغیرهای جانشین (Proxies) | 91 |
| 3.2.4 برآورد خصمانه (Adversarial Estimation) در استنباط علّی | 92 |
| 3.3 چارچوب پژوهش | 92 |
| 3.3.1 پارامترهای علّی طولی | 92 |
| 3.3.2 مثال: اثر بلندمدت | 94 |
| 3.3.3 مثال: اثر درمان پویای ناهمگن | 96 |
| 3.3.4 مثال: تحلیل میانجی مجاور (Proximal Mediation) | 98 |
| 3.4 گشتاورهای چندبار مقاوم (Multiply Robust Moments) | 100 |
| 3.4.1 تابع گشتاور و تعامد (Orthogonality) | 100 |
| 3.4.2 بازنگری مثالها | 102 |
| 3.5 الگوریتم | 106 |
| 3.6 استنباط آماری | 109 |
| 3.6.1 نرخهای یادگیری | 109 |
| 3.6.2 تقریب گاوسی | 110 |
| 3.6.3 برآورد واریانس و فاصله اطمینان | 113 |
| 3.6.4 پارامترهای محلی | 115 |
| 3.6.5 بازنگری مثالها | 117 |
| 3.7 بررسی شرایط نرخ همگرایی | 120 |
| 3.7.1 رگرسیون ناپارامتری متغیرهای ابزاری تودرتو | 120 |
| 3.7.2 بازنگری مثالها | 121 |
| 3.7.3 برآوردگر عمومی و نرخ همگرایی | 122 |
| 3.8 جمعبندی | 125 |
| پیوست A: مطالب تکمیلی فصل اول | 127 |
| پیوست B: مطالب تکمیلی فصل دوم | 321 |
| پیوست C: مطالب تکمیلی فصل سوم | 433 |
“`
اقتصادسنجی دیگر مثل گذشته نیست؛ وقتی یادگیری ماشین، دادههای ناقص و حریم خصوصی کنار هم قرار میگیرند
هر روز دادههای بیشتری تولید میشوند، اما یک مشکل بزرگ وجود دارد: هرچه دادهها ارزشمندتر میشوند، حفظ حریم خصوصی افراد نیز اهمیت بیشتری پیدا میکند. از سوی دیگر، دادههای واقعی تقریباً هیچوقت کامل نیستند؛ بعضی اطلاعات گم شدهاند، برخی با خطا ثبت شدهاند و برخی نیز عمداً برای محافظت از اطلاعات شخصی تغییر داده میشوند.
پس سؤال مهم این است: اگر دادهها ناقص یا دستکاری شده باشند، آیا هنوز میتوان به نتایج علمی و اقتصادی اعتماد کرد؟
این پایاننامه دقیقاً به دنبال پاسخ همین سؤال است و نشان میدهد که پاسخ، برخلاف تصور رایج، «بله» است.
حفظ حریم خصوصی همیشه دشمن دقت نیست
سالها تصور میشد میان حفظ حریم خصوصی افراد و کیفیت تحلیلهای آماری یک معامله اجتنابناپذیر وجود دارد؛ یعنی هرچه دادهها امنتر شوند، تحلیلها بیدقتتر خواهند شد.
این پژوهش این باور را به چالش میکشد.
با معرفی روشهای جدید پاکسازی داده و اصلاح فرآیند استنباط آماری، نشان داده میشود که در بسیاری از شرایط میتوان هم اطلاعات شخصی افراد را حفظ کرد و هم نتایج اقتصادی قابل اعتمادی به دست آورد. این نتیجه برای سازمانهای آماری، دولتها و مراکز تحقیقاتی اهمیت بسیار زیادی دارد.
دادههای واقعی تقریباً همیشه ناقصاند
بیشتر مدلهای کلاسیک اقتصادسنجی فرض میکنند دادهها کامل، دقیق و بدون خطا هستند؛ اما واقعیت کاملاً متفاوت است.
در عمل ممکن است:
- بخشی از دادهها گم شده باشند.
- برخی متغیرها با خطای اندازهگیری ثبت شوند.
- دادهها برای حفظ حریم خصوصی نویز مصنوعی دریافت کنند.
- اطلاعات بهصورت گسسته یا خلاصهشده منتشر شوند.
این پایاننامه همه این مشکلات را بهصورت همزمان بررسی میکند؛ کاری که کمتر پژوهشی توانسته انجام دهد.
یادگیری ماشین بهتنهایی کافی نیست
الگوریتمهای یادگیری ماشین در پیشبینی فوقالعادهاند، اما معمولاً نمیتوانند به سؤال مهم پژوهشگران پاسخ دهند:
«آیا واقعاً این عامل باعث آن نتیجه شده است؟»
تفاوت میان «همبستگی» و «رابطه علّی» یکی از بزرگترین چالشهای علوم داده است.
این پایاننامه نشان میدهد چگونه میتوان قدرت یادگیری ماشین را با روشهای استنباط علّی ترکیب کرد تا علاوه بر پیشبینی، بتوان درباره علت رخدادها نیز با اطمینان بیشتری صحبت کرد.
پاکسازی هوشمند دادهها، قبل از تحلیل
یکی از جذابترین ایدههای این پژوهش آن است که قبل از انجام هرگونه تحلیل، دادهها بهصورت هوشمند بازسازی و پاکسازی شوند.
نکته مهم اینجاست که الگوریتم تنها دادهها را اصلاح نمیکند؛ بلکه اثر این اصلاحات را نیز در محاسبه خطای آماری و فاصله اطمینان لحاظ میکند.
در نتیجه پژوهشگر تصویری واقعیتر از میزان اطمینان به نتایج خود خواهد داشت.
فرض ساده اما قدرتمند: بیشتر دادهها اطلاعات تکراری دارند
ایده مرکزی پژوهش بسیار جالب است.
نویسنده فرض میکند بسیاری از متغیرهایی که در ظاهر متفاوتاند، در واقع اطلاعات مشابهی را از زوایای مختلف بیان میکنند.
برای مثال در دادههای اقتصادی، متغیرهایی مانند درآمد، اشتغال، بیمه، کمکهای اجتماعی و وضعیت آموزشی معمولاً بازتاب چند عامل پنهان مشترک هستند.
استفاده از این ویژگی باعث میشود حتی اگر بخشی از اطلاعات از بین برود یا دچار نویز شود، بتوان مقدار زیادی از آن را دوباره بازیابی کرد.
اقتصادسنجی مدرن دیگر فقط درباره رگرسیون نیست
سالها آموزش اقتصادسنجی حول محور مدلهای خطی و رگرسیون کلاسیک میچرخید.
اما این پایاننامه نشان میدهد نسل جدید اقتصادسنجی ترکیبی از موضوعات زیر است:
- یادگیری ماشین
- استنباط علّی
- آمار نیمهپارامتری
- تحلیل دادههای بزرگ
- نظریه هستهها (Kernel Methods)
- حریم خصوصی تفاضلی
- تکمیل ماتریس و پاکسازی دادهها
همین ترکیب باعث شده اقتصادسنجی از یک ابزار آماری سنتی به بستری برای تحلیل مسائل بسیار پیچیده دنیای واقعی تبدیل شود.
از نظریه تا کاربرد واقعی
یکی از نقاط قوت این پایاننامه آن است که صرفاً به ارائه مدلهای ریاضی اکتفا نمیکند.
برای ارزیابی روشهای پیشنهادی، دادههای واقعی بازار کار آمریکا و اطلاعات سرشماری مورد استفاده قرار گرفتهاند.
حتی پس از افزودن نویزهای مربوط به حفاظت از حریم خصوصی، روش پیشنهادی توانسته نتایجی بسیار نزدیک به دادههای اصلی تولید کند؛ موضوعی که ارزش عملی پژوهش را بهخوبی نشان میدهد.
چرا این پژوهش اهمیت دارد؟
نتایج این پایاننامه میتواند در حوزههای متنوعی استفاده شود؛ از جمله:
- ارزیابی سیاستهای اقتصادی
- تحلیل بازار کار
- مطالعات سلامت
- دادههای مالی
- علوم اجتماعی
- سامانههای تصمیمیار
- هوش مصنوعی قابل اعتماد
در واقع هر جایی که دادههای ناقص، بزرگ یا حساس وجود داشته باشد، ایدههای این پژوهش کاربرد خواهند داشت.
جمعبندی
این پایاننامه نشان میدهد آینده تحلیل داده تنها به ساخت مدلهای دقیقتر وابسته نیست؛ بلکه به توانایی ما در تحلیل دادههای ناقص، حفاظت از حریم خصوصی و استخراج روابط واقعی علت و معلولی بستگی دارد.
ترکیب اقتصادسنجی، یادگیری ماشین و روشهای نوین استنباط آماری، مسیر تازهای را پیش روی پژوهشگران قرار داده است؛ مسیری که در آن دیگر لازم نیست میان امنیت اطلاعات و کیفیت تحلیل یکی را انتخاب کنیم.
شاید مهمترین پرسش آینده این نباشد که «چقدر داده داریم؟»، بلکه این باشد که «چگونه میتوانیم حتی از دادههای ناقص، امن و پرنویز نیز دانش قابل اعتماد استخراج کنیم؟»
بسیار سریع و ساده می توانید اصل این پایان نامه را به صورت فایل PDF در اختیار داشته باشید.