در سال‌های اخیر، پیشرفت چشمگیر یادگیری عمیق و مدل‌های زبانی بزرگ، تحولی اساسی در حوزه پردازش زبان طبیعی ایجاد کرده است. مدل‌هایی مانند BERT و RoBERTa که بر پایه معماری ترنسفورمر توسعه یافته‌اند، توانسته‌اند عملکرد بسیار موفقی در طیف گسترده‌ای از وظایف از جمله طبقه‌بندی متن، تحلیل احساسات، پاسخ به پرسش و استخراج اطلاعات ارائه دهند. با این حال، موفقیت این مدل‌ها تا حد زیادی به دسترسی به حجم زیادی از داده‌های آموزشی وابسته است. در بسیاری از کاربردهای واقعی، به‌ویژه در حوزه‌های تخصصی مانند پزشکی، حقوق، مالی یا زبان‌های کم‌منبع، تهیه مجموعه‌داده‌های بزرگ و برچسب‌خورده بسیار پرهزینه، زمان‌بر و گاهی حتی غیرممکن است. این مسئله که به عنوان «کمبود داده» شناخته می‌شود، یکی از مهم‌ترین چالش‌های یادگیری ماشین و پردازش زبان طبیعی محسوب می‌شود و باعث کاهش دقت، افزایش بیش‌برازش (Overfitting) و افت توانایی تعمیم مدل‌ها می‌شود.

برای غلبه بر این مشکل، طی سال‌های گذشته دو راهکار اصلی مورد توجه پژوهشگران قرار گرفته است. نخست، یادگیری انتقالی (Transfer Learning) که در آن از مدل‌های از پیش آموزش‌دیده بر روی مجموعه‌داده‌های عظیم استفاده می‌شود و سپس این مدل‌ها برای مسئله موردنظر با داده‌های محدود تنظیم مجدد (Fine-tuning) می‌شوند. دوم، افزایش داده (Data Augmentation) که با ایجاد نمونه‌های آموزشی جدید از روی داده‌های موجود، اندازه مؤثر مجموعه‌داده را افزایش می‌دهد. هر دو روش تاکنون موفقیت‌های فراوانی داشته‌اند، اما همچنان با محدودیت‌هایی مواجه هستند. در یادگیری انتقالی، اگر داده‌های هدف بسیار محدود باشند، فرآیند تنظیم مجدد مدل نمی‌تواند به‌خوبی دانش مدل را با ویژگی‌های مسئله جدید تطبیق دهد. از سوی دیگر، در روش‌های متداول افزایش داده، تغییرات معمولاً به‌صورت تصادفی انجام می‌شوند و ممکن است باعث تغییر معنای جمله، ایجاد نویز یا کاهش کیفیت داده‌های تولیدشده شوند.

تاریخچه تحقیقات در زمینه افزایش داده نشان می‌دهد که در ابتدا روش‌هایی مانند جایگزینی واژه با مترادف، حذف تصادفی کلمات، درج واژه‌های جدید یا جابه‌جایی ترتیب کلمات به عنوان راهکارهای ساده و کم‌هزینه معرفی شدند. این روش‌ها که تحت عنوان Easy Data Augmentation (EDA) شناخته می‌شوند، در برخی مسائل توانستند عملکرد مدل‌های یادگیری ماشین سنتی را بهبود دهند. با این وجود، پژوهش‌های بعدی نشان دادند که هنگام استفاده از مدل‌های زبانی بزرگ و از پیش آموزش‌دیده، این روش‌های تصادفی معمولاً بهبود قابل توجهی ایجاد نمی‌کنند و در بسیاری از موارد افزایش دقت کمتر از یک درصد است. علت این موضوع آن است که این مدل‌ها پیش از این روی حجم عظیمی از داده‌ها آموزش دیده‌اند و نسبت به بسیاری از تغییرات ساده و تصادفی، تا حد زیادی مقاوم شده‌اند. بنابراین، نیاز به طراحی روش‌های هوشمندتر برای انتخاب محل اعمال تغییرات در متن بیش از گذشته احساس می‌شود.

پایان‌نامه حاضر دقیقاً با هدف بررسی این چالش تدوین شده است. ایده اصلی پژوهش آن است که به جای اعمال تغییرات تصادفی بر روی کلمات، از اطلاعات استخراج‌شده از مکانیزم توجه (Attention Mechanism) در مدل‌های ترنسفورمر استفاده شود. در معماری ترنسفورمر، هر واژه دارای امتیاز توجه است که میزان اهمیت آن را در درک مفهوم جمله نشان می‌دهد. فرض اصلی پژوهش این است که اگر عملیات افزایش داده روی کلماتی انجام شود که اهمیت بیشتری در تصمیم‌گیری مدل دارند، داده‌های تولیدشده طبیعی‌تر، هدفمندتر و مؤثرتر خواهند بود و در نتیجه عملکرد مدل نیز بهبود پیدا خواهد کرد.

در این تحقیق، نویسنده روشی جدید برای افزایش داده مبتنی بر نقاب‌های توجه (Attention Masks) پیشنهاد می‌کند. در این روش ابتدا متن توسط یک مدل ترنسفورمر پردازش شده و امتیاز اهمیت هر واژه با استفاده از وزن‌های توجه استخراج می‌شود. سپس واژه‌ها بر اساس میزان اهمیت مرتب شده و عملیات مختلف افزایش داده مانند جایگزینی مترادف، درج واژه، حذف واژه یا جابه‌جایی کلمات روی مهم‌ترین موقعیت‌ها اعمال می‌شود. برخلاف روش‌های سنتی که محل تغییرات را به‌صورت تصادفی انتخاب می‌کنند، در این روش انتخاب محل تغییرات کاملاً آگاهانه و مبتنی بر اطلاعات زمینه‌ای متن انجام می‌شود.

برای ارزیابی این ایده، پژوهش حاضر مجموعه‌ای از آزمایش‌های جامع را طراحی کرده است. دو مدل مشهور BERT و RoBERTa انتخاب شده‌اند و عملکرد آن‌ها در دو مسئله متفاوت شامل طبقه‌بندی دودویی احساسات با استفاده از مجموعه‌داده IMDB و طبقه‌بندی چندکلاسه اخبار AG News مورد بررسی قرار گرفته است. علاوه بر این، تأثیر اندازه مجموعه داده افزوده‌شده در سه سطح ۱۰، ۲۰ و ۳۰ درصد نیز ارزیابی شده است تا مشخص شود افزایش حجم داده چه تأثیری بر عملکرد مدل‌ها دارد. همچنین تمامی روش‌های پیشنهادی با روش‌های کلاسیک افزایش داده مقایسه شده‌اند تا میزان برتری یا ضعف روش جدید به‌صورت دقیق مشخص شود.

در بخش روش‌شناسی، نویسنده تلاش کرده است ضمن حفظ دقت علمی، هزینه محاسباتی آزمایش‌ها را نیز کنترل کند. به همین دلیل پارامترهایی مانند اندازه دسته (Batch Size)، تعداد دوره‌های آموزش (Epoch)، نرخ یادگیری (Learning Rate) و روش انباشت گرادیان (Gradient Accumulation) به گونه‌ای انتخاب شده‌اند که علاوه بر استفاده بهینه از حافظه پردازنده گرافیکی، امکان انجام مقایسه‌ای منصفانه میان روش‌های مختلف فراهم شود. همچنین الگوریتم پیشنهادی به گونه‌ای طراحی شده است که بتواند به سادگی با مدل‌های مختلف ترنسفورمر ترکیب شود و در آینده نیز قابل توسعه باشد.

نتایج به‌دست‌آمده از آزمایش‌ها نشان می‌دهد که اگرچه ایده استفاده از نقاب‌های توجه از نظر تئوری بسیار جذاب به نظر می‌رسد، اما در عمل بهبود قابل توجهی نسبت به روش‌های کلاسیک ایجاد نکرده است. تقریباً در تمامی آزمایش‌ها میزان افزایش دقت کمتر از یک درصد بوده و در بسیاری از موارد تفاوت محسوسی میان افزایش داده مبتنی بر توجه و افزایش داده تصادفی مشاهده نشده است. این یافته‌ها با نتایج تحقیقات پیشین نیز همخوانی دارد و نشان می‌دهد که مدل‌های زبانی بزرگ به دلیل آموزش روی داده‌های بسیار گسترده، نسبت به بسیاری از تغییرات ساده مقاوم هستند و افزایش داده به تنهایی نمی‌تواند بهبود چشمگیری در عملکرد آن‌ها ایجاد کند.

یکی از مهم‌ترین نتایج این پایان‌نامه آن است که وزن‌های توجه لزوماً معیار کاملی برای تعیین اهمیت واقعی کلمات نیستند. از آنجا که امتیازهای توجه از میانگین‌گیری روی چندین سر توجه (Attention Heads) و چندین لایه مدل استخراج می‌شوند، ممکن است اطلاعات ارزشمند موجود در هر لایه از بین برود و اهمیت واقعی برخی واژه‌ها به درستی نمایش داده نشود. بنابراین، پژوهش نشان می‌دهد که هرچند مکانیزم توجه در عملکرد داخلی ترنسفورمر نقش اساسی دارد، اما استفاده مستقیم از آن برای هدایت فرآیند افزایش داده نیازمند تحقیقات بیشتری است.

از دیگر دستاوردهای مهم این پژوهش می‌توان به ارائه یک چارچوب تجربی کامل برای مقایسه روش‌های مختلف افزایش داده اشاره کرد. این چارچوب امکان ارزیابی انواع سیاست‌های افزایش داده، بررسی اثر اندازه داده‌های افزوده‌شده، مقایسه مدل‌های مختلف و تحلیل رفتار آن‌ها در مسائل دودویی و چندکلاسه را فراهم می‌کند. چنین چارچوبی می‌تواند در تحقیقات آینده نیز مورد استفاده قرار گیرد و مبنایی برای توسعه الگوریتم‌های پیشرفته‌تر باشد.

در بخش جمع‌بندی، نویسنده نتیجه می‌گیرد که اگرچه روش پیشنهادی نتوانسته است بهبود چشمگیری در عملکرد مدل‌های BERT و RoBERTa ایجاد کند، اما یافته‌های این تحقیق ارزش علمی قابل توجهی دارند؛ زیرا نشان می‌دهند بسیاری از فرضیات رایج درباره نقش مستقیم مکانیزم توجه در افزایش داده نیازمند بازنگری هستند. این پایان‌نامه علاوه بر ارزیابی دقیق نقاط قوت و ضعف روش پیشنهادی، مسیرهای جدیدی برای تحقیقات آینده پیشنهاد می‌کند؛ از جمله توسعه روش‌های جدید استخراج امتیاز اهمیت واژه‌ها، استفاده از نمایش‌های معنایی عمیق‌تر، بهره‌گیری از تعبیه‌های واژگانی (Word Embeddings)، تحلیل نحوی و برچسب‌گذاری نقش کلمات برای تولید داده‌های مصنوعی با کیفیت بالاتر.

به طور کلی، این پایان‌نامه پژوهشی کاربردی در حوزه پردازش زبان طبیعی و یادگیری عمیق است که با تمرکز بر یکی از اساسی‌ترین چالش‌های این حوزه، یعنی کمبود داده، تلاش می‌کند راهکاری نوین برای افزایش کیفیت داده‌های آموزشی ارائه دهد. هرچند نتایج عملی نشان می‌دهد که استفاده از نقاب‌های توجه به تنهایی نمی‌تواند تحول بزرگی در عملکرد مدل‌های ترنسفورمر ایجاد کند، اما تحلیل‌های دقیق انجام‌شده، محدودیت‌های موجود را آشکار ساخته و زمینه را برای توسعه نسل جدیدی از روش‌های هوشمند افزایش داده فراهم می‌کند. این پژوهش نشان می‌دهد که آینده بهبود مدل‌های زبانی احتمالاً در ترکیب دانش معنایی، اطلاعات زمینه‌ای و روش‌های پیشرفته‌تر افزایش داده نهفته است، نه صرفاً استفاده از تغییرات تصادفی یا حتی اتکا به وزن‌های توجه.
“`html

 

فهرست مطالب

سرفصل شماره صفحه
فصل اول: مقدمه 5
فصل دوم: پیشینه پژوهش (Related Work) 7
2-1. کاستی‌های سیاست‌های تصادفی افزایش داده 7
2-2. امتیازهای توجه (Attention Scores) به‌عنوان معیاری برای اهمیت توکن‌ها (Token Importance) 7
2-3. تأثیر سیاست‌های افزایش داده بر مدل‌های از پیش آموزش‌دیده (Pre-trained Models) 8
فصل سوم: روش‌شناسی پژوهش (Methodology) 9
3-1. ارزیابی و مقایسه روش‌های موجود (Benchmarking Existing Methods) 9
3-2. ابرپارامترها (Hyper-parameters) 9
3-2-1. اندازه دسته (Batch Size) و مراحل انباشت گرادیان (Gradient Accumulation Steps) 9
3-2-2. تعداد دوره‌های آموزش (Epoch) 10
3-2-3. نرخ یادگیری (Learning Rate) 10
3-3. طبقه‌بندی دودویی (Binary) در برابر طبقه‌بندی چندکلاسه (Multi-class) 10
3-4. الگوریتم افزایش داده مبتنی بر مکانیزم توجه (Attention-based Augmentation Algorithm) 10
فصل چهارم: نتایج 12
4-1. نتایج مدل BERT در طبقه‌بندی دودویی 12
4-2. نتایج مدل RoBERTa در طبقه‌بندی دودویی 13
4-3. نتایج مدل BERT در طبقه‌بندی چندکلاسه 13
4-4. نتایج مدل RoBERTa در طبقه‌بندی چندکلاسه 13
فصل پنجم: نتیجه‌گیری 14
5-1. پیشنهادهایی برای پژوهش‌های آینده (Future Work) 14
پیوست الف: فهرست کدهای برنامه (Code Listing) 16
منابع 22

“`

چرا هوش مصنوعی هنوز مشکل کمبود داده را حل نکرده است؟ راز جالب پشت نقشه‌های توجه (Attention) در مدل‌های زبانی

اگر فکر می‌کنید هرچه مدل‌های هوش مصنوعی بزرگ‌تر شوند، دیگر به داده‌های زیاد نیازی ندارند، باید بگوییم واقعیت کمی پیچیده‌تر است. بسیاری از پیشرفته‌ترین مدل‌های پردازش زبان طبیعی هنوز هم هنگام مواجهه با داده‌های کم، با افت عملکرد روبه‌رو می‌شوند. این موضوع باعث شده پژوهشگران به دنبال راهکارهای خلاقانه‌ای برای افزایش کیفیت داده‌های آموزشی باشند. یکی از جذاب‌ترین ایده‌های مطرح‌شده، استفاده از «نقشه‌های توجه» (Attention Masks) برای تولید داده‌های هوشمند است. اما آیا این ایده واقعاً جواب داده است؟


کمبود داده؛ مشکلی که هنوز پابرجاست

یکی از بزرگ‌ترین موانع توسعه سیستم‌های هوش مصنوعی، نبود داده‌های برچسب‌خورده کافی است. در بسیاری از حوزه‌ها مانند پزشکی، حقوق، علوم شناختی یا زبان‌های کم‌منبع، جمع‌آوری داده‌های مناسب هزینه و زمان بسیار زیادی نیاز دارد.

به همین دلیل، پژوهشگران سال‌هاست دو راهکار اصلی را دنبال می‌کنند:

  • استفاده از مدل‌های از پیش آموزش‌دیده (Transfer Learning)
  • تولید داده‌های مصنوعی یا همان Data Augmentation

هر دو روش موفق بوده‌اند، اما هیچ‌کدام مشکل را به طور کامل برطرف نکرده‌اند.


افزایش داده؛ ایده‌ای ساده با محدودیت‌های بزرگ

در روش‌های رایج افزایش داده، تغییراتی مانند:

  • جایگزینی کلمات با مترادف
  • حذف برخی واژه‌ها
  • افزودن کلمات جدید
  • جابه‌جایی ترتیب کلمات

روی متن اعمال می‌شود.

مشکل اینجاست که این تغییرات معمولاً کاملاً تصادفی هستند. در نتیجه ممکن است معنی جمله تغییر کند یا اطلاعات مهم از بین برود و حتی عملکرد مدل کاهش پیدا کند.


ایده‌ای هوشمندانه؛ چرا فقط روی مهم‌ترین کلمات تغییر ایجاد نکنیم؟

اینجا دقیقاً نقطه‌ای است که این پایان‌نامه ایده‌ای متفاوت ارائه می‌دهد.

مدل‌های ترنسفورمر مانند BERT و RoBERTa هنگام پردازش متن مشخص می‌کنند کدام کلمات اهمیت بیشتری در درک جمله دارند. این اهمیت توسط مکانیزمی به نام Attention اندازه‌گیری می‌شود.

ایده پژوهش بسیار ساده اما هوشمندانه است:

به جای اینکه تغییرات را روی کلمات تصادفی اعمال کنیم، آن‌ها را روی مهم‌ترین کلمات جمله انجام دهیم.

در نگاه اول، این ایده منطقی به نظر می‌رسد؛ زیرا مدل دقیقاً روی همان بخش‌هایی آموزش می‌بیند که بیشترین تأثیر را در تصمیم‌گیری دارند.


پژوهش چگونه این ایده را آزمایش کرد؟

برای بررسی این فرضیه، پژوهشگران:

  • دو مدل مشهور BERT و RoBERTa را انتخاب کردند.
  • دو مجموعه داده معروف شامل IMDB و AG News را بررسی کردند.
  • چهار نوع افزایش داده مختلف را آزمایش کردند.
  • اندازه داده‌های افزوده‌شده را در سه سطح ۱۰، ۲۰ و ۳۰ درصد مقایسه کردند.

سپس عملکرد روش پیشنهادی با روش‌های سنتی افزایش داده مقایسه شد.


نتیجه‌ای که همه را غافلگیر کرد

جذاب‌ترین بخش این تحقیق دقیقاً همین‌جاست.

بر خلاف انتظار، استفاده از نقشه‌های توجه تقریباً هیچ برتری محسوسی نسبت به روش‌های تصادفی ایجاد نکرد.

در اغلب آزمایش‌ها افزایش دقت کمتر از یک درصد بود.

یعنی حتی وقتی مهم‌ترین کلمات انتخاب شدند، مدل‌های زبانی عملکرد بسیار بهتری از روش‌های معمول نشان ندادند.


چرا چنین اتفاقی افتاد؟

تحلیل پژوهش چند دلیل مهم را مطرح می‌کند.

اول اینکه مدل‌های بزرگی مانند BERT و RoBERTa قبلاً روی میلیاردها کلمه آموزش دیده‌اند و نسبت به بسیاری از تغییرات زبانی مقاوم شده‌اند.

دلیل دوم این است که امتیازهای Attention الزاماً معیار دقیقی برای سنجش اهمیت واقعی کلمات نیستند؛ زیرا این امتیازها از میانگین چندین لایه و چندین سر توجه استخراج می‌شوند و ممکن است اطلاعات مهم در این فرآیند از بین برود.

به عبارت دیگر، چیزی که مدل هنگام پیش‌بینی به آن توجه می‌کند، همیشه بهترین معیار برای تولید داده‌های جدید نیست.


ارزش واقعی این پایان‌نامه چیست؟

شاید بزرگ‌ترین دستاورد این پژوهش این نباشد که روشی انقلابی معرفی کرده است؛ بلکه نشان می‌دهد یک ایده منطقی همیشه در عمل نتیجه مطلوب نمی‌دهد.

این تحقیق با آزمایش‌های دقیق نشان می‌دهد که:

  • همه روش‌های افزایش داده برای مدل‌های بزرگ مؤثر نیستند.
  • مکانیزم Attention هنوز به طور کامل شناخته نشده است.
  • برای بهبود عملکرد مدل‌های زبانی باید به سراغ روش‌های هوشمندتر و عمیق‌تر رفت.

این یافته‌ها مسیر تحقیقات آینده را روشن‌تر می‌کنند.


آینده افزایش داده در هوش مصنوعی

پژوهش پیشنهاد می‌کند که تحقیقات آینده به جای اتکا صرف به Attention، از روش‌هایی مانند:

  • تحلیل معنایی متن
  • بردارهای معنایی واژگان (Word Embeddings)
  • تحلیل نحوی جملات
  • برچسب‌گذاری نقش کلمات
  • روش‌های ترکیبی مبتنی بر زمینه

استفاده کنند تا داده‌های مصنوعی با کیفیت بالاتری تولید شود.


جمع‌بندی

این پایان‌نامه نشان می‌دهد که حل مشکل کمبود داده، بسیار پیچیده‌تر از آن چیزی است که در نگاه اول به نظر می‌رسد. استفاده از نقشه‌های توجه ایده‌ای خلاقانه و علمی بود، اما نتوانست جهش قابل توجهی در عملکرد مدل‌های زبانی ایجاد کند. با این حال، ارزش واقعی این تحقیق در آشکار کردن محدودیت‌های روش‌های موجود و ارائه مسیرهای تازه برای پژوهش‌های آینده است.

شاید سؤال مهم امروز این نباشد که «چگونه داده بیشتری تولید کنیم؟» بلکه این باشد که چگونه داده‌ای تولید کنیم که واقعاً چیز جدیدی به مدل یاد بدهد؟

 

 

 

بسیار سریع و ساده می توانید اصل این پایان نامه را به صورت فایل PDF در اختیار داشته باشید.

پس از دریافت پایان‌نامه، کلیه اطلاعات کتاب‌شناختی موردنیاز برای استناد علمی، از جمله نام دانشگاه، عنوان پایان‌نامه، نام پژوهشگر، سال دفاع و سایر مشخصات مرتبط، جهت ارجاع‌دهی صحیح مطابق با استانداردهای رایج، در اختیار شما قرار خواهد گرفت.