چکیده

در دهه‌های اخیر، رشد بی‌سابقه حجم داده‌ها، افزایش پیچیدگی ساختار اطلاعات و گسترش کاربرد روش‌های یادگیری ماشین، پژوهشگران اقتصاد، آمار و علوم داده را با چالش‌های جدیدی در زمینه تحلیل داده و استنباط علّی مواجه کرده است. اگرچه روش‌های کلاسیک اقتصادسنجی در تحلیل روابط علت و معلولی، ارزیابی سیاست‌های عمومی و استخراج نتایج قابل استناد آماری عملکرد موفقی داشته‌اند، اما بسیاری از این روش‌ها برای داده‌های بسیار بزرگ، پرنویز، ناقص یا داده‌هایی که به دلایل حفظ حریم خصوصی به‌صورت عمدی دچار تغییر شده‌اند، کارایی کافی ندارند. از سوی دیگر، الگوریتم‌های مدرن یادگیری ماشین توانایی بسیار بالایی در پیش‌بینی و استخراج الگوهای پیچیده از داده‌ها دارند، اما معمولاً فاقد قابلیت ارائه تفسیر علّی و استنباط آماری دقیق هستند. این پایان‌نامه با هدف پر کردن این شکاف، چارچوبی جامع برای ترکیب قابلیت‌های اقتصادسنجی و یادگیری ماشین ارائه می‌دهد تا بتوان هم از انعطاف‌پذیری مدل‌های یادگیری ماشین بهره برد و هم ویژگی‌های ضروری استنباط علّی و تحلیل آماری معتبر را حفظ کرد.

مسئله اصلی این پژوهش آن است که بسیاری از مجموعه‌داده‌های امروزی، به‌ویژه داده‌های دولتی و آماری، به دلیل الزامات حفظ حریم خصوصی یا وجود خطاهای اندازه‌گیری، مقادیر گمشده، گسسته‌سازی داده‌ها و نویزهای مصنوعی، دیگر شرایط ایده‌آل موردنیاز روش‌های سنتی اقتصادسنجی را ندارند. برای نمونه، اداره سرشماری ایالات متحده در نسخه‌های جدید داده‌های سرشماری، به‌منظور جلوگیری از افشای اطلاعات افراد، از تکنیک‌های حریم خصوصی تفاضلی استفاده می‌کند که عمداً نویز آماری به داده‌ها اضافه می‌کنند. اگرچه این اقدام امنیت اطلاعات شهروندان را افزایش می‌دهد، اما می‌تواند دقت تحلیل‌های اقتصادی و تصمیم‌گیری‌های مبتنی بر داده را کاهش دهد. بنابراین پرسش اساسی این پایان‌نامه آن است که آیا می‌توان بدون قربانی کردن کیفیت تحلیل‌های علّی، هم‌زمان از حریم خصوصی افراد نیز محافظت کرد.

برای پاسخ به این پرسش، پژوهش ابتدا تاریخچه شکل‌گیری مسئله را بررسی می‌کند. در سال‌های گذشته پژوهشگران عمدتاً روی خطاهای اندازه‌گیری، داده‌های ناقص یا مدل‌های اقتصادسنجی کلاسیک تمرکز داشتند و هر یک از این مشکلات را به‌صورت مستقل بررسی می‌کردند. با گسترش فناوری اطلاعات و افزایش نگرانی‌های مربوط به امنیت داده‌ها، مفهوم حریم خصوصی تفاضلی به یکی از مهم‌ترین استانداردهای حفاظت از اطلاعات تبدیل شد. در نتیجه، پژوهشگران دریافتند که روش‌های متداول استنباط علّی دیگر پاسخگوی تحلیل داده‌هایی که عمداً دچار تغییر شده‌اند نیستند. هم‌زمان، یادگیری ماشین نیز به دلیل توانایی بالا در مدل‌سازی روابط غیرخطی و داده‌های بزرگ، به ابزار اصلی تحلیل داده تبدیل شد؛ اما بیشتر الگوریتم‌های آن صرفاً برای پیش‌بینی طراحی شده‌اند و در تعیین روابط علت و معلولی یا ارائه فاصله اطمینان معتبر محدودیت دارند. این پایان‌نامه دقیقاً در نقطه تلاقی این دو حوزه قرار گرفته و تلاش می‌کند نقاط قوت هر دو رویکرد را در قالب یک چارچوب واحد ترکیب کند.

ساختار پژوهش بر سه محور اصلی استوار است. محور نخست به استنباط علّی در داده‌های مخدوش اختصاص دارد. در این بخش نویسنده مدلی ارائه می‌دهد که قادر است به‌طور هم‌زمان با خطاهای اندازه‌گیری، داده‌های گمشده، گسسته‌سازی و نویز ناشی از حریم خصوصی تفاضلی مقابله کند. مهم‌ترین نوآوری این بخش، طراحی روشی برای پاک‌سازی خودکار داده‌ها و سپس انجام برآوردهای علّی همراه با بازه‌های اطمینان اصلاح‌شده است؛ به‌گونه‌ای که عدم‌قطعیت ناشی از فرآیند پاک‌سازی نیز در محاسبات آماری لحاظ می‌شود. برخلاف بسیاری از روش‌های موجود، این چارچوب نیازی به اطلاع قبلی از نوع یا شدت دقیق خطاهای موجود در داده‌ها ندارد و می‌تواند خود را با شرایط مختلف تطبیق دهد.

یکی از مفروضات کلیدی پژوهش آن است که ساختار واقعی متغیرهای توضیحی دارای رتبه تقریبی پایین است؛ به بیان دیگر، بسیاری از متغیرهای مشاهده‌شده در واقع نمایش‌های متفاوتی از تعداد محدودی عامل پنهان هستند. نویسنده نشان می‌دهد که این فرض در بسیاری از مجموعه‌داده‌های اقتصادی، به‌ویژه داده‌های سرشماری، برقرار است و می‌توان از آن برای بازسازی اطلاعات از دست رفته یا حذف نویزهای مصنوعی استفاده کرد. این ویژگی امکان می‌دهد حتی زمانی که داده‌ها به‌شدت مخدوش شده‌اند، اطلاعات اصلی بازیابی شده و تحلیل علّی با دقت قابل قبولی انجام گیرد.

بخش دوم پایان‌نامه به توسعه نظریه استنباط آماری برای رگرسیون ریج کرنل (Kernel Ridge Regression) اختصاص دارد. اگرچه این روش یکی از ابزارهای قدرتمند یادگیری ماشین برای مدل‌سازی روابط غیرخطی محسوب می‌شود، اما تاکنون چارچوب جامعی برای استنباط آماری معتبر آن وجود نداشت. پژوهش حاضر با توسعه تقریب‌های گاوسی، روش‌های بوت‌استرپ و ارائه تضمین‌های نظری جدید، امکان محاسبه بازه‌های اطمینان، آزمون فرض و ارزیابی عدم‌قطعیت در مدل‌های کرنلی را فراهم می‌کند. بدین ترتیب، الگوریتم‌های یادگیری ماشین از ابزارهای صرفاً پیش‌بینی‌کننده به ابزارهایی مناسب برای تحلیل‌های علمی و سیاست‌گذاری تبدیل می‌شوند.

محور سوم پایان‌نامه بر مسائل پیچیده‌تر استنباط علّی تمرکز دارد؛ مسائلی مانند اثرات بلندمدت سیاست‌ها، اثرات پویا در طول زمان و تحلیل میانجی‌ها. نویسنده برای این منظور چارچوبی مبتنی بر رگرسیون ناپارامتری متغیرهای ابزاری ارائه می‌دهد که امکان تحلیل روابط علّی پیچیده را بدون نیاز به فروض محدودکننده مدل‌های خطی فراهم می‌سازد. الگوریتم‌های پیشنهادی در این بخش قادرند اثرات مستقیم و غیرمستقیم سیاست‌ها را در شرایطی که روابط میان متغیرها بسیار پیچیده و چندمرحله‌ای است، برآورد کنند.

از مهم‌ترین دستاوردهای نظری این پایان‌نامه، توسعه روش‌هایی است که حتی در صورت کند بودن فرآیند پاک‌سازی داده‌ها نیز می‌توانند برآوردهای علّی با نرخ همگرایی مطلوب و ویژگی‌های آماری مناسب تولید کنند. همچنین روش‌های پیشنهادی با استفاده از تکنیک‌های نمونه‌برداری، برآورد دوبار مقاوم، تقریب‌های گاوسی و نظریه‌های جدید یادگیری آماری، تضمین‌های ریاضی محکمی برای درستی نتایج ارائه می‌دهند. این ویژگی سبب می‌شود نتایج پژوهش نه‌تنها از لحاظ تجربی، بلکه از نظر نظری نیز قابل اتکا باشند.

برای ارزیابی عملکرد روش‌های پیشنهادی، مجموعه‌ای از شبیه‌سازی‌های گسترده و مطالعات موردی انجام شده است. یکی از مهم‌ترین مطالعات تجربی، بازتحلیل اثر رقابت وارداتی بر بازار کار آمریکا با استفاده از داده‌های سرشماری است. در این آزمایش، داده‌ها به‌صورت مصنوعی مطابق با استانداردهای حریم خصوصی سرشماری ۲۰۲۰ دچار نویز شدند و سپس روش پیشنهادی برای بازیابی اطلاعات و انجام تحلیل علّی به کار گرفته شد. نتایج نشان داد که در بسیاری از موارد، حتی پس از اعمال مکانیزم‌های حفظ حریم خصوصی، می‌توان برآوردهایی نزدیک به داده‌های اصلی به دست آورد و کاهش محسوسی در دقت تحلیل‌های اقتصادی مشاهده نکرد.

علاوه بر این، پژوهش نشان می‌دهد که ترکیب اقتصادسنجی و یادگیری ماشین صرفاً به افزایش دقت پیش‌بینی محدود نمی‌شود، بلکه می‌تواند کیفیت تصمیم‌گیری‌های مبتنی بر داده را نیز بهبود بخشد. چارچوب ارائه‌شده قابلیت استفاده در طیف گسترده‌ای از مسائل کاربردی مانند ارزیابی سیاست‌های اقتصادی، تحلیل داده‌های سلامت، علوم اجتماعی، مطالعات بازار کار، داده‌های مالی و سامانه‌های تصمیم‌یار را دارد. انعطاف‌پذیری بالای مدل‌ها سبب می‌شود پژوهشگران بتوانند بدون وابستگی به فروض ساده‌کننده، داده‌های واقعی و پیچیده را تحلیل کنند.

در مجموع، این پایان‌نامه سهم مهمی در توسعه روش‌های نوین اقتصادسنجی، استنباط علّی و یادگیری ماشین ایفا می‌کند. نوآوری اصلی آن ارائه چارچوبی یکپارچه است که مشکلات ناشی از داده‌های ناقص، خطادار و حفاظت‌شده را با استفاده از روش‌های پیشرفته یادگیری ماشین برطرف کرده و در عین حال ویژگی‌های اساسی استنباط آماری و تحلیل علّی را حفظ می‌کند. نتایج پژوهش نشان می‌دهد که تعارض میان حفظ حریم خصوصی و دقت تحلیل‌های آماری الزاماً اجتناب‌ناپذیر نیست و با طراحی الگوریتم‌های مناسب می‌توان میان این دو هدف تعادل برقرار کرد. این دستاورد می‌تواند مسیر تازه‌ای برای پژوهش‌های آینده در اقتصاد، آمار، علوم داده و هوش مصنوعی ایجاد کرده و زمینه توسعه نسل جدیدی از ابزارهای تحلیل داده را فراهم سازد که هم از نظر نظری مستحکم و هم از نظر کاربردی قابل استفاده در مسائل واقعی باشند.
“`html

 

فهرست مطالب

سرفصل شماره صفحه
فصل ۱: استنباط علّی با داده‌های مخدوش: خطای اندازه‌گیری، داده‌های گمشده، گسسته‌سازی و حریم خصوصی تفاضلی (Differential Privacy) 19
1.1 مقدمه 20
1.1.1 انگیزه و پرسش پژوهش 20
1.1.2 نوآوری‌ها و مشارکت‌های پژوهش 20
1.2 پژوهش‌های مرتبط 23
1.3 مروری بر مدل 26
1.3.1 پارامتر علّی 26
1.3.2 مخدوش‌شدگی داده‌ها 27
1.3.3 فرض کلیدی: اندازه‌گیری‌های تکرارشونده تقریبی 28
1.4 فاصله اطمینان اصلاح‌شده مبتنی بر پاک‌سازی داده 30
1.4.1 چرا استنباط دشوار است؟ 30
1.4.2 مروری بر روش پیشنهادی 33
1.4.3 ویژگی‌های روش 36
1.4.4 انطباق با نوع و شدت مخدوش‌شدگی داده 39
1.5 تحلیل نمونه محدود 41
1.5.1 مرحله اول: پاک‌سازی داده 42
1.5.2 مرحله دوم: رگرسیون با خطای متغیرها (Error-in-Variables Regression) 46
1.5.3 مرحله سوم: متوازن‌سازی با خطای متغیرها 49
1.5.4 مرحله چهارم: برآورد و استنباط علّی 52
1.5.5 اعتبار فرض کلیدی در مدل‌های عاملی غیرخطی 55
1.6 مطالعه موردی: اثر رقابت واردات با استفاده از داده‌های سرشماری 57
1.6.1 پرسش پژوهش اقتصادی 57
1.6.2 بازیابی اثرات در حضور داده‌های مخدوش 58
1.6.3 صورت‌بندی حریم خصوصی 59
1.6.4 تنظیم حریم خصوصی مطابق سرشماری آمریکا 2020 63
1.7 جمع‌بندی 64
فصل ۲: استنباط آماری در رگرسیون ریج کرنل (Kernel Ridge Regression) 65
2.1 مقدمه 65
2.1.1 انگیزه 65
2.1.2 مروری بر نتایج 66
2.1.3 پژوهش‌های مرتبط 68
2.2 چارچوب رسمی 70
2.3 تقریب‌های گاوسی در فضای RKHS (فضای هیلبرت با هسته بازتولیدکننده) 72
2.3.1 طرح کلی اثبات 75
2.4 تقریب‌های بوت‌استرپ متقارن 76
2.4.1 طرح کلی اثبات 77
2.5 استنباط در رگرسیون ریج کرنل 78
2.5.1 طرح کلی اثبات 81
2.6 بحث و نتیجه‌گیری 84
فصل ۳: رگرسیون ناپارامتری متغیرهای ابزاری تو‌در‌تو (Nested Nonparametric Instrumental Variable Regression): اثرات بلندمدت، پویا و میانجی 85
3.1 مقدمه 86
3.2 پژوهش‌های مرتبط 89
3.2.1 آمار نیمه‌پارامتری 89
3.2.2 استنباط علّی طولی و یادگیری ماشین 90
3.2.3 بومی‌سازی و متغیرهای جانشین (Proxies) 91
3.2.4 برآورد خصمانه (Adversarial Estimation) در استنباط علّی 92
3.3 چارچوب پژوهش 92
3.3.1 پارامترهای علّی طولی 92
3.3.2 مثال: اثر بلندمدت 94
3.3.3 مثال: اثر درمان پویای ناهمگن 96
3.3.4 مثال: تحلیل میانجی مجاور (Proximal Mediation) 98
3.4 گشتاورهای چندبار مقاوم (Multiply Robust Moments) 100
3.4.1 تابع گشتاور و تعامد (Orthogonality) 100
3.4.2 بازنگری مثال‌ها 102
3.5 الگوریتم 106
3.6 استنباط آماری 109
3.6.1 نرخ‌های یادگیری 109
3.6.2 تقریب گاوسی 110
3.6.3 برآورد واریانس و فاصله اطمینان 113
3.6.4 پارامترهای محلی 115
3.6.5 بازنگری مثال‌ها 117
3.7 بررسی شرایط نرخ همگرایی 120
3.7.1 رگرسیون ناپارامتری متغیرهای ابزاری تو‌در‌تو 120
3.7.2 بازنگری مثال‌ها 121
3.7.3 برآوردگر عمومی و نرخ همگرایی 122
3.8 جمع‌بندی 125
پیوست A: مطالب تکمیلی فصل اول 127
پیوست B: مطالب تکمیلی فصل دوم 321
پیوست C: مطالب تکمیلی فصل سوم 433

“`

اقتصادسنجی دیگر مثل گذشته نیست؛ وقتی یادگیری ماشین، داده‌های ناقص و حریم خصوصی کنار هم قرار می‌گیرند

هر روز داده‌های بیشتری تولید می‌شوند، اما یک مشکل بزرگ وجود دارد: هرچه داده‌ها ارزشمندتر می‌شوند، حفظ حریم خصوصی افراد نیز اهمیت بیشتری پیدا می‌کند. از سوی دیگر، داده‌های واقعی تقریباً هیچ‌وقت کامل نیستند؛ بعضی اطلاعات گم شده‌اند، برخی با خطا ثبت شده‌اند و برخی نیز عمداً برای محافظت از اطلاعات شخصی تغییر داده می‌شوند.

پس سؤال مهم این است: اگر داده‌ها ناقص یا دستکاری شده باشند، آیا هنوز می‌توان به نتایج علمی و اقتصادی اعتماد کرد؟

این پایان‌نامه دقیقاً به دنبال پاسخ همین سؤال است و نشان می‌دهد که پاسخ، برخلاف تصور رایج، «بله» است.


حفظ حریم خصوصی همیشه دشمن دقت نیست

سال‌ها تصور می‌شد میان حفظ حریم خصوصی افراد و کیفیت تحلیل‌های آماری یک معامله اجتناب‌ناپذیر وجود دارد؛ یعنی هرچه داده‌ها امن‌تر شوند، تحلیل‌ها بی‌دقت‌تر خواهند شد.

این پژوهش این باور را به چالش می‌کشد.

با معرفی روش‌های جدید پاک‌سازی داده و اصلاح فرآیند استنباط آماری، نشان داده می‌شود که در بسیاری از شرایط می‌توان هم اطلاعات شخصی افراد را حفظ کرد و هم نتایج اقتصادی قابل اعتمادی به دست آورد. این نتیجه برای سازمان‌های آماری، دولت‌ها و مراکز تحقیقاتی اهمیت بسیار زیادی دارد.


داده‌های واقعی تقریباً همیشه ناقص‌اند

بیشتر مدل‌های کلاسیک اقتصادسنجی فرض می‌کنند داده‌ها کامل، دقیق و بدون خطا هستند؛ اما واقعیت کاملاً متفاوت است.

در عمل ممکن است:

  • بخشی از داده‌ها گم شده باشند.
  • برخی متغیرها با خطای اندازه‌گیری ثبت شوند.
  • داده‌ها برای حفظ حریم خصوصی نویز مصنوعی دریافت کنند.
  • اطلاعات به‌صورت گسسته یا خلاصه‌شده منتشر شوند.

این پایان‌نامه همه این مشکلات را به‌صورت هم‌زمان بررسی می‌کند؛ کاری که کمتر پژوهشی توانسته انجام دهد.


یادگیری ماشین به‌تنهایی کافی نیست

الگوریتم‌های یادگیری ماشین در پیش‌بینی فوق‌العاده‌اند، اما معمولاً نمی‌توانند به سؤال مهم پژوهشگران پاسخ دهند:

«آیا واقعاً این عامل باعث آن نتیجه شده است؟»

تفاوت میان «همبستگی» و «رابطه علّی» یکی از بزرگ‌ترین چالش‌های علوم داده است.

این پایان‌نامه نشان می‌دهد چگونه می‌توان قدرت یادگیری ماشین را با روش‌های استنباط علّی ترکیب کرد تا علاوه بر پیش‌بینی، بتوان درباره علت رخدادها نیز با اطمینان بیشتری صحبت کرد.


پاک‌سازی هوشمند داده‌ها، قبل از تحلیل

یکی از جذاب‌ترین ایده‌های این پژوهش آن است که قبل از انجام هرگونه تحلیل، داده‌ها به‌صورت هوشمند بازسازی و پاک‌سازی شوند.

نکته مهم اینجاست که الگوریتم تنها داده‌ها را اصلاح نمی‌کند؛ بلکه اثر این اصلاحات را نیز در محاسبه خطای آماری و فاصله اطمینان لحاظ می‌کند.

در نتیجه پژوهشگر تصویری واقعی‌تر از میزان اطمینان به نتایج خود خواهد داشت.


فرض ساده اما قدرتمند: بیشتر داده‌ها اطلاعات تکراری دارند

ایده مرکزی پژوهش بسیار جالب است.

نویسنده فرض می‌کند بسیاری از متغیرهایی که در ظاهر متفاوت‌اند، در واقع اطلاعات مشابهی را از زوایای مختلف بیان می‌کنند.

برای مثال در داده‌های اقتصادی، متغیرهایی مانند درآمد، اشتغال، بیمه، کمک‌های اجتماعی و وضعیت آموزشی معمولاً بازتاب چند عامل پنهان مشترک هستند.

استفاده از این ویژگی باعث می‌شود حتی اگر بخشی از اطلاعات از بین برود یا دچار نویز شود، بتوان مقدار زیادی از آن را دوباره بازیابی کرد.


اقتصادسنجی مدرن دیگر فقط درباره رگرسیون نیست

سال‌ها آموزش اقتصادسنجی حول محور مدل‌های خطی و رگرسیون کلاسیک می‌چرخید.

اما این پایان‌نامه نشان می‌دهد نسل جدید اقتصادسنجی ترکیبی از موضوعات زیر است:

  • یادگیری ماشین
  • استنباط علّی
  • آمار نیمه‌پارامتری
  • تحلیل داده‌های بزرگ
  • نظریه هسته‌ها (Kernel Methods)
  • حریم خصوصی تفاضلی
  • تکمیل ماتریس و پاک‌سازی داده‌ها

همین ترکیب باعث شده اقتصادسنجی از یک ابزار آماری سنتی به بستری برای تحلیل مسائل بسیار پیچیده دنیای واقعی تبدیل شود.


از نظریه تا کاربرد واقعی

یکی از نقاط قوت این پایان‌نامه آن است که صرفاً به ارائه مدل‌های ریاضی اکتفا نمی‌کند.

برای ارزیابی روش‌های پیشنهادی، داده‌های واقعی بازار کار آمریکا و اطلاعات سرشماری مورد استفاده قرار گرفته‌اند.

حتی پس از افزودن نویزهای مربوط به حفاظت از حریم خصوصی، روش پیشنهادی توانسته نتایجی بسیار نزدیک به داده‌های اصلی تولید کند؛ موضوعی که ارزش عملی پژوهش را به‌خوبی نشان می‌دهد.


چرا این پژوهش اهمیت دارد؟

نتایج این پایان‌نامه می‌تواند در حوزه‌های متنوعی استفاده شود؛ از جمله:

  • ارزیابی سیاست‌های اقتصادی
  • تحلیل بازار کار
  • مطالعات سلامت
  • داده‌های مالی
  • علوم اجتماعی
  • سامانه‌های تصمیم‌یار
  • هوش مصنوعی قابل اعتماد

در واقع هر جایی که داده‌های ناقص، بزرگ یا حساس وجود داشته باشد، ایده‌های این پژوهش کاربرد خواهند داشت.


جمع‌بندی

این پایان‌نامه نشان می‌دهد آینده تحلیل داده تنها به ساخت مدل‌های دقیق‌تر وابسته نیست؛ بلکه به توانایی ما در تحلیل داده‌های ناقص، حفاظت از حریم خصوصی و استخراج روابط واقعی علت و معلولی بستگی دارد.

ترکیب اقتصادسنجی، یادگیری ماشین و روش‌های نوین استنباط آماری، مسیر تازه‌ای را پیش روی پژوهشگران قرار داده است؛ مسیری که در آن دیگر لازم نیست میان امنیت اطلاعات و کیفیت تحلیل یکی را انتخاب کنیم.

شاید مهم‌ترین پرسش آینده این نباشد که «چقدر داده داریم؟»، بلکه این باشد که «چگونه می‌توانیم حتی از داده‌های ناقص، امن و پرنویز نیز دانش قابل اعتماد استخراج کنیم؟»

 

 

 

بسیار سریع و ساده می توانید اصل این پایان نامه را به صورت فایل PDF در اختیار داشته باشید.

پس از دریافت پایان‌نامه، کلیه اطلاعات کتاب‌شناختی موردنیاز برای استناد علمی، از جمله نام دانشگاه، عنوان پایان‌نامه، نام پژوهشگر، سال دفاع و سایر مشخصات مرتبط، جهت ارجاع‌دهی صحیح مطابق با استانداردهای رایج، در اختیار شما قرار خواهد گرفت.