این پایاننامه به بررسی و بهبود روشهای نوین بازیابی اطلاعات (Information Retrieval) با تمرکز بر دو رویکرد اصلی «بازیابی چگال» (Dense Retrieval) و «بازیابی تنک» (Sparse Retrieval) میپردازد. هدف اصلی پژوهش، رفع محدودیتهای هر دو روش و ارائه راهکارهایی برای افزایش دقت و کارایی سامانههای جستجو، بهویژه در کاربردهایی مانند موتورهای جستجو و سامانههای پرسش و پاسخ متنباز (Open-Domain Question Answering) است. نویسنده نشان میدهد که روشهای بازیابی چگال اگرچه در درک معنایی متن عملکرد بسیار خوبی دارند، اما به دلیل فشردهسازی اطلاعات در بردارهای ثابت، گاهی جزئیات واژگانی مهم را از دست میدهند. از سوی دیگر، روشهای بازیابی تنک وابسته به تطابق مستقیم کلمات هستند و در تشخیص ارتباطهای معنایی عمیق میان پرسش و اسناد ضعف دارند.
در بخش نخست پژوهش، چارچوبی جدید با نام یادگیری تقابلی مبتنی بر تفاوت (Difference-based Contrastive Learning یا DiffCSE) معرفی میشود. این روش با بهرهگیری از مدلهای زبانی از پیش آموزشدیده (Pre-trained Language Models) و یادگیری تقابلی (Contrastive Learning)، قادر است تفاوتهای ظریف میان جملات بسیار مشابه را بهتر تشخیص دهد. برای دستیابی به این هدف، علاوه بر تابع هزینه یادگیری تقابلی، از یک مدل تشخیص تفاوت نیز استفاده شده است تا نمایشهای معنایی دقیقتر و غنیتری از جملات تولید شود. نتایج آزمایشها نشان میدهد که این روش در وظایفی مانند سنجش شباهت معنایی متون، تولید بردارهای جمله (Sentence Embeddings) و بازیابی اطلاعات، نسبت به روشهای پیشین عملکرد بهتری ارائه میدهد.
در بخش دوم، پایاننامه به بهبود بازیابی تنک میپردازد و روشی برای گسترش پرسوجو (Query Expansion) و بازرتبهبندی پرسوجوها (Query Reranking) ارائه میکند. در این روش، ابتدا مدلهای زبانی بزرگ، نسخههای متنوعی از پرسوجوی کاربر تولید میکنند و سپس یک مدل بازرتبهبندی، مناسبترین پرسوجوها را انتخاب میکند تا احتمال یافتن اسناد مرتبط افزایش یابد. این راهکار ضمن حفظ سرعت و هزینه محاسباتی پایین روشهای تنک، دقت بازیابی را در مجموعهدادههای مختلف به شکل قابل توجهی افزایش میدهد و حتی در برخی آزمایشها عملکردی بهتر از روشهای بازیابی چگال ارائه میکند.
در مجموع، این پایاننامه نشان میدهد که ترکیب قابلیتهای مدلهای زبانی بزرگ با روشهای نوین یادگیری بازنمایی میتواند کیفیت بازیابی اطلاعات را به طور محسوسی ارتقا دهد. نتایج ارائهشده بیانگر آن است که با طراحی راهبردهای آموزشی مناسب و استفاده هوشمندانه از نمایشهای چگال و تنک، میتوان سامانههای جستجوی دقیقتر، سریعتر و کارآمدتری برای نسل جدید کاربردهای هوش مصنوعی و پردازش زبان طبیعی (Natural Language Processing) توسعه داد.
“`html
| فصل / سرفصل | شماره صفحه |
|---|---|
| فصل ۱: مقدمه | 17 |
| 1-1 بازیابی چگال (Dense Retrieval) | 17 |
| 1-2 بازیابی تنک (Sparse Retrieval) | 17 |
| 1-3 دستاوردها و نوآوریهای پژوهش (Contributions) | 18 |
| 1-4 ساختار پایاننامه | 19 |
| فصل ۲: DiffCSE؛ یادگیری تقابلی مبتنی بر تفاوت (Difference-based Contrastive Learning) برای نمایش برداری جملهها (Sentence Embeddings) و بازیابی چگال (Dense Retrieval) | 21 |
| 2-1 مقدمه | 21 |
| 2-2 پیشینه و پژوهشهای مرتبط | 23 |
| 2-2-1 پیشرفتهای اخیر در مدلهای زبانی از پیش آموزشدیده (Pretrained Language Models) | 23 |
| 2-2-2 یادگیری و ارزیابی نمایشهای برداری جمله (Sentence Embeddings) | 24 |
| 2-2-3 یادگیری تقابلی هموردا (Equivariant Contrastive Learning) | 25 |
| 2-3 یادگیری تقابلی مبتنی بر تفاوت (Difference-based Contrastive Learning) | 26 |
| 2-4 آزمایشها | 28 |
| 2-4-1 تنظیمات آزمایش | 28 |
| 2-4-2 دادهها | 28 |
| 2-4-3 نتایج | 29 |
| 2-5 مطالعات حذف مؤلفهها (Ablation Studies) | 31 |
| 2-5-1 حذف تابع هزینه یادگیری تقابلی (Contrastive Loss) | 31 |
| 2-5-2 جمله بعدی در برابر همان جمله | 31 |
| 2-5-3 سایر وظایف پیشآموزش شرطی | 32 |
| 2-5-4 روشهای افزایش داده: درج، حذف و جایگزینی | 33 |
| 2-5-5 انتخاب لایه تجمیع (Pooler) | 33 |
| 2-5-6 اندازه مولد (Generator) | 34 |
| 2-5-7 نسبت پوشاندن (Masking Ratio) | 35 |
| 2-5-8 ضریب λ | 35 |
| 2-6 تحلیل نتایج | 36 |
| 2-6-1 مطالعه کیفی | 36 |
| 2-6-2 وظیفه بازیابی اطلاعات | 36 |
| 2-6-3 توزیع نمایشهای برداری جمله | 37 |
| 2-6-4 یکنواختی و همترازی (Uniformity and Alignment) | 38 |
| 2-7 توسعه روش برای بازیابی چگال گذرگاهها (Dense Passage Retrieval) | 39 |
| 2-8 استفاده از افزایش دادهها بهعنوان نمونههای مثبت و منفی | 40 |
| 2-9 جمعبندی فصل | 41 |
| فصل ۳: گسترش، بازرتبهبندی و بازیابی؛ بازرتبهبندی پرسوجو برای سامانههای پرسش و پاسخ متنباز (Open-Domain Question Answering) | 43 |
| 3-1 مقدمه | 43 |
| 3-2 پیشینه | 46 |
| 3-2-1 بازیابی تقویتشده با تولید (Generation-Augmented Retrieval) | 46 |
| 3-2-2 آزمایشهای مقدماتی | 47 |
| 3-3 روش پیشنهادی | 47 |
| 3-3-1 بازرتبهبند مستقل از بازیابی (Retrieval-Independent Reranker) | 48 |
| 3-3-2 بازرتبهبند وابسته به بازیابی (Retrieval-Dependent Reranker) | 49 |
| 3-3-3 ساخت نمونههای آموزشی | 49 |
| 3-4 آزمایشها | 51 |
| 3-4-1 دادهها | 51 |
| 3-4-2 تنظیمات آزمایش | 51 |
| 3-4-3 روشهای مبنا (Baselines) | 52 |
| 3-4-4 نتایج روی مجموعهداده همدامنه | 52 |
| 3-4-5 نتایج تعمیم بین مجموعهدادهها | 53 |
| 3-4-6 نتایج سامانه کامل پرسش و پاسخ با FiD | 54 |
| 3-5 مقایسه بازرتبهبندی پرسوجو و بازرتبهبندی گذرگاه | 55 |
| 3-6 بحث | 57 |
| 3-6-1 تولید نمونههای آموزشی با GAR | 57 |
| 3-6-2 EAR با بازیابهای چگال | 58 |
| 3-6-3 کاهش تعداد پرسوجوهای کاندید | 59 |
| 3-7 مطالعه کیفی | 59 |
| 3-8 هزینه محاسباتی و تأخیر | 61 |
| 3-9 پژوهشهای مرتبط | 63 |
| 3-10 محدودیتها | 64 |
| 3-11 جمعبندی فصل | 64 |
| فصل ۴: نتیجهگیری و پژوهشهای آینده | 65 |
| 4-1 نتیجهگیری | 65 |
| 4-2 پیشنهادهایی برای پژوهشهای آینده | 66 |
| پیوست A: جزئیات آزمایشهای فصل دوم | 69 |
| A-1 جزئیات آموزش | 69 |
| پیوست B: جزئیات آزمایشهای فصل سوم | 71 |
| B-1 جزئیات آموزش | 71 |
| B-2 جزئیات بازرتبهبندی گذرگاهها | 73 |
| B-3 جزئیات استنتاج (Inference) | 73 |
“`
خلاصه پایاننامه
این پایاننامه با عنوان «Information Retrieval with Dense and Sparse Representations» به یکی از مهمترین چالشهای حوزه پردازش زبان طبیعی (Natural Language Processing) و هوش مصنوعی، یعنی بازیابی اطلاعات (Information Retrieval) میپردازد. بازیابی اطلاعات هسته اصلی بسیاری از سامانههای هوشمند مانند موتورهای جستجو، سامانههای پرسش و پاسخ، دستیارهای هوشمند و مدلهای زبانی بزرگ (Large Language Models) است. هرچه یک سامانه بتواند اسناد مرتبطتر و دقیقتری را از میان حجم عظیمی از دادهها پیدا کند، کیفیت پاسخهای تولیدشده نیز افزایش خواهد یافت. نویسنده در این پایاننامه تلاش کرده است محدودیتهای دو خانواده اصلی روشهای بازیابی اطلاعات، یعنی بازیابی چگال (Dense Retrieval) و بازیابی تنک (Sparse Retrieval) را بررسی کرده و برای هر کدام راهکارهای جدیدی ارائه دهد.
در فصل نخست، ابتدا مفهوم بازیابی اطلاعات و اهمیت آن در سامانههای هوشمند توضیح داده میشود. نویسنده بیان میکند که در سالهای اخیر دو رویکرد اصلی برای بازیابی اطلاعات توسعه یافتهاند. نخست، بازیابی چگال که از مدلهای یادگیری عمیق و نمایشهای برداری (Dense Vector Representations) استفاده میکند و قادر است ارتباط معنایی میان پرسش و اسناد را حتی در صورت تفاوت واژگان تشخیص دهد. دوم، بازیابی تنک که بیشتر بر تطابق مستقیم کلمات کلیدی و روشهایی مانند BM25 متکی است. هر یک از این دو روش مزایا و معایب خاص خود را دارند؛ بنابراین هدف اصلی پایاننامه، افزایش دقت هر دو رویکرد و در عین حال حفظ سرعت و کارایی آنها است.
یکی از مشکلات مهم بازیابی چگال این است که مدل باید کل معنای یک متن یا یک پاراگراف را در قالب یک بردار با ابعاد ثابت ذخیره کند. این فرآیند باعث ایجاد نوعی «گلوگاه اطلاعاتی» (Information Bottleneck) میشود؛ به این معنا که بخشی از جزئیات مهم متن، بهویژه تفاوتهای کوچک واژگانی یا نامهای خاص، ممکن است در هنگام تبدیل متن به بردار از بین بروند. در نتیجه، اگر دو جمله از نظر کلی شبیه باشند اما تنها در یک واژه مهم تفاوت داشته باشند، بسیاری از مدلهای موجود قادر به تشخیص این تفاوت نخواهند بود و اسناد نامرتبط را بازیابی خواهند کرد.
برای حل این مشکل، نویسنده در فصل دوم روشی جدید با نام DiffCSE معرفی میکند. ایده اصلی DiffCSE آن است که مدل نه تنها باید شباهت میان جملات را یاد بگیرد، بلکه باید نسبت به تغییرات کوچک و معنیدار نیز حساس باشد. در روشهای رایج یادگیری تقابلی (Contrastive Learning)، هدف نزدیک کردن نمایش برداری نمونههای مشابه و دور کردن نمونههای متفاوت است. اما این روشها معمولاً تغییرات جزئی در متن را نادیده میگیرند. DiffCSE این نقص را با افزودن یک وظیفه مکمل برطرف میکند.
در این چارچوب، ابتدا جمله اصلی توسط یک مدل زبانی از پیش آموزشدیده پردازش میشود. سپس بخشی از کلمات جمله به صورت تصادفی تغییر داده یا جایگزین میشوند. در ادامه یک بخش تشخیصدهنده (Discriminator) باید تشخیص دهد که کدام کلمات نسبت به جمله اصلی تغییر کردهاند. از آنجا که این تشخیص تنها زمانی ممکن است که مدل مفهوم دقیق جمله را درک کرده باشد، مدل مجبور میشود نمایش معنایی بسیار غنیتر و دقیقتری از جمله تولید کند. به همین دلیل، بردارهای تولیدشده اطلاعات معنایی بیشتری نسبت به روشهای قبلی در خود نگه میدارند.
پس از معرفی DiffCSE، نویسنده مجموعه گستردهای از آزمایشها را روی مجموعهدادههای استاندارد انجام میدهد. ارزیابیها شامل وظایف سنجش شباهت معنایی جملات (Semantic Textual Similarity)، طبقهبندی جملات و بازیابی اطلاعات است. نتایج نشان میدهد که DiffCSE تقریباً در تمام معیارهای ارزیابی عملکرد بهتری نسبت به روش مشهور SimCSE ارائه میدهد. علاوه بر این، آزمایشهای حذف مؤلفهها (Ablation Studies) نیز نشان میدهد که هر بخش از معماری پیشنهادی در بهبود عملکرد مدل نقش مؤثری داشته است. نویسنده همچنین تحلیلهای کیفی مختلفی بر روی فضای بردارهای تولیدشده انجام میدهد و نشان میدهد که نمایشهای ایجادشده دارای توزیع مناسبتر و قدرت تفکیک بیشتری هستند.
بخش دوم پایاننامه به بازیابی تنک اختصاص دارد. اگرچه این روشها سرعت بسیار بالایی دارند و از نظر محاسباتی بسیار مقرونبهصرفه هستند، اما تنها زمانی عملکرد مناسبی دارند که پرسش کاربر و سند هدف دارای کلمات مشترک باشند. اگر کاربر پرسشی را با واژگانی متفاوت از متن سند مطرح کند، روشهای تنک معمولاً قادر به یافتن پاسخ مناسب نیستند.
نویسنده برای رفع این مشکل از توانایی مدلهای زبانی بزرگ استفاده میکند. ایده اصلی این است که به جای جستجو با همان پرسش اولیه، ابتدا چندین نسخه متفاوت از پرسش تولید شود که هر کدام واژگان و ساختار متفاوتی دارند اما همان مفهوم را بیان میکنند. این فرآیند با عنوان گسترش پرسوجو (Query Expansion) شناخته میشود. مشکل اینجاست که همه پرسشهای تولیدشده کیفیت یکسانی ندارند و برخی حتی ممکن است باعث کاهش دقت بازیابی شوند.
برای حل این مسئله، نویسنده روشی با نام EAR (Expand and Rerank) ارائه میدهد. در این روش ابتدا مدل زبانی تعداد زیادی پرسش توسعهیافته تولید میکند. سپس یک مدل بازرتبهبندی (Query Reranker) تمامی این پرسشها را ارزیابی کرده و بهترین آنها را انتخاب میکند. تنها پرسشهای منتخب وارد موتور بازیابی میشوند. این فرآیند باعث میشود هم مزیت سرعت بازیابی تنک حفظ شود و هم کیفیت نتایج به شکل محسوسی افزایش یابد.
در ادامه، نویسنده دو نوع مختلف بازرتبهبند معرفی میکند. نوع اول Retrieval-Independent است که مستقل از نتایج بازیابی عمل میکند و تنها کیفیت پرسش تولیدشده را ارزیابی میکند. نوع دوم Retrieval-Dependent علاوه بر متن پرسش، نتایج اولیه بازیابی را نیز بررسی کرده و بر اساس آن تصمیم میگیرد کدام پرسش مناسبتر است. هر دو روش روی مجموعهدادههای مختلف آزمایش میشوند و نتایج نشان میدهد که استفاده از بازرتبهبندی باعث افزایش قابل توجه دقت بازیابی میشود.
آزمایشهای فصل سوم تنها به یک مجموعهداده محدود نیستند، بلکه روی مجموعهدادههای مختلف مانند Natural Questions و TriviaQA نیز انجام شدهاند. همچنین توانایی تعمیم مدل به دادههایی که در آموزش مشاهده نکرده است بررسی میشود. نتایج نشان میدهد که روش پیشنهادی نه تنها روی دادههای آموزشی، بلکه روی دادههای جدید نیز عملکرد بسیار خوبی دارد. علاوه بر این، نویسنده هزینه محاسباتی، زمان پاسخگویی و میزان تأخیر سیستم را نیز اندازهگیری کرده و نشان میدهد که افزایش دقت با افزایش اندک هزینه محاسباتی همراه است و همچنان مزیت اصلی بازیابی تنک یعنی سرعت بالا حفظ میشود.
یکی از ویژگیهای ارزشمند این پایاننامه آن است که تنها به ارائه یک مدل جدید اکتفا نمیکند، بلکه تلاش میکند دلیل موفقیت روشهای پیشنهادی را نیز تحلیل کند. برای این منظور، نویسنده مطالعات کیفی، تحلیل توزیع بردارها، بررسی تأثیر پارامترهای مختلف، تحلیل حساسیت مدل و مقایسه با روشهای موجود را انجام داده است. این بررسیها نشان میدهد که علت اصلی بهبود عملکرد، توانایی مدل در حفظ اطلاعات معنایی دقیقتر و تشخیص بهتر تفاوتهای جزئی میان متون است.
در فصل پایانی، نویسنده جمعبندی میکند که هیچیک از دو رویکرد بازیابی چگال و بازیابی تنک به تنهایی کامل نیستند. بازیابی چگال از نظر درک معنایی بسیار قوی است اما ممکن است جزئیات واژگانی را از دست بدهد، در حالی که بازیابی تنک در تطابق کلمات عملکرد مناسبی دارد اما درک معنایی محدودی ارائه میدهد. راهکارهای ارائهشده در این پایاننامه نشان میدهند که میتوان با طراحی روشهای آموزشی جدید و استفاده هوشمندانه از مدلهای زبانی از پیش آموزشدیده، نقاط ضعف هر دو رویکرد را تا حد زیادی برطرف کرد.
به طور کلی، مهمترین دستاوردهای این پایاننامه شامل ارائه چارچوب DiffCSE برای تولید نمایشهای برداری دقیقتر جملات، توسعه روش EAR برای بهبود بازیابی تنک از طریق گسترش و بازرتبهبندی پرسوجو، ارائه آزمایشهای جامع روی مجموعهدادههای معتبر، تحلیل دقیق عملکرد مدلها و ارائه راهکارهایی برای افزایش دقت سامانههای بازیابی اطلاعات در عصر مدلهای زبانی بزرگ است. نتایج این پژوهش نشان میدهد که ترکیب نمایشهای چگال و تنک همراه با مدلهای زبانی پیشرفته میتواند نسل جدیدی از سامانههای جستجو و پرسش و پاسخ را ایجاد کند که هم از نظر کیفیت پاسخ و هم از نظر سرعت اجرا عملکرد بسیار مطلوبتری نسبت به روشهای پیشین داشته باشند.
بسیار سریع و ساده می توانید اصل این پایان نامه را به صورت فایل PDF در اختیار داشته باشید.