این پایاننامه به بررسی یکی از چالشهای مهم در حوزه یادگیری ماشین، آمار بیزی و همجوشی دادههای چندوجهی میپردازد؛ چالشی که به استخراج ساختارهای پنهان از دادههایی با منابع اطلاعاتی متفاوت، مانند صوت و تصویر، مربوط میشود. با گسترش کاربرد سامانههای هوشمند در حوزههایی نظیر بینایی ماشین، رباتیک، پردازش گفتار، پزشکی، خودروهای خودران و تعامل انسان و رایانه، نیاز به روشهایی که بتوانند اطلاعات حاصل از چند حسگر یا چند نوع داده را به صورت یکپارچه تحلیل کنند، بیش از گذشته احساس میشود. در بسیاری از این کاربردها، دادهها تنها از یک منبع به دست نمیآیند، بلکه همزمان از چندین منبع مختلف مانند دوربین، میکروفون، حسگرهای حرکتی یا تجهیزات تصویربرداری پزشکی جمعآوری میشوند. هر یک از این منابع تنها بخشی از واقعیت را نمایش میدهند و درک صحیح محیط نیازمند ترکیب هوشمند این اطلاعات است. از همین رو، مسئله «همجوشی دادههای چندوجهی» (Multi-modal Data Fusion) به یکی از موضوعات مهم پژوهشی در سالهای اخیر تبدیل شده است.
پیشینه این مسئله به مدلهای آماری کلاسیک مانند فیلتر کالمن، مدلهای مارکوف مخفی و روشهای احتمالاتی برمیگردد. این روشها اگرچه در بسیاری از مسائل موفق بودهاند، اما اغلب نیازمند تعیین تعداد خوشهها، ساختار مدل یا پارامترهای اولیه هستند و در مواجهه با دادههای پیچیده و دارای ساختار ناشناخته، انعطاف کافی ندارند. در سالهای بعد، روشهای یادگیری عمیق نیز وارد این حوزه شدند و توانستند پیشرفتهای قابل توجهی ایجاد کنند، اما این روشها معمولاً به حجم عظیمی از دادههای برچسبخورده نیاز دارند و تفسیر نتایج آنها نیز ساده نیست. بنابراین پژوهشگران به دنبال مدلهایی بودند که بدون نیاز به تعیین تعداد خوشهها یا ساختار داده، بتوانند روابط پنهان میان دادههای چندوجهی را به صورت خودکار کشف کنند. این موضوع زمینه استفاده از مدلهای بیزی ناپارامتری، بهویژه فرآیند دیریکله سلسلهمراتبی (Hierarchical Dirichlet Process) و نسخه چندوجهی آن را فراهم کرد.
هدف اصلی این پایاننامه توسعه و ارزیابی مدلی مبتنی بر «فرآیند سلسلهمراتبی دیریکله چندوجهی» (mmHDP) برای تحلیل همزمان دادههای صوتی و تصویری است. این مدل قادر است بدون مشخص بودن تعداد خوشهها، ساختارهای مشترک میان چند نوع داده را شناسایی کند و ارتباطات موجود بین آنها را بیاموزد. یکی از ویژگیهای مهم این مدل، استفاده از دیدگاه «دادههای سانسورشده» است. در این دیدگاه، برخلاف بسیاری از روشهای موجود، نیازی نیست که برای هر نمونه صوتی الزاماً یک نمونه تصویری متناظر وجود داشته باشد. در عوض، دادهها در سطح گروهی با یکدیگر مرتبط میشوند و مدل میتواند حتی در شرایطی که بخشی از اطلاعات یک یا چند وجه داده در دسترس نیست، فرآیند یادگیری را ادامه دهد. این ویژگی باعث افزایش انعطافپذیری مدل در کاربردهای واقعی میشود؛ زیرا در بسیاری از مسائل عملی، دادههای ناقص یا گمشده امری اجتنابناپذیر هستند.
در این پژوهش، ابتدا مبانی نظری مدلهای گرافی بیزی، فرآیند دیریکله، مدلهای اختلاط نامتناهی، فرآیند دیریکله سلسلهمراتبی و نسخه چندوجهی آنها بهصورت کامل بررسی شده است. سپس نحوه مدلسازی دادههای چندوجهی، ارتباط بین دادههای صوتی و تصویری و روشهای مختلف همجوشی اطلاعات توضیح داده میشود تا چارچوب نظری لازم برای ارائه مدل پیشنهادی فراهم گردد. پس از آن، نویسنده یک زنجیره پردازشی کامل طراحی کرده است که استخراج ویژگیها از دادههای ویدئویی، آمادهسازی دادهها، برازش مدل mmHDP و تحلیل خروجیهای مدل را شامل میشود.
یکی از نوآوریهای اصلی این پایاننامه، طراحی چارچوب جدیدی برای ارزیابی معناداری آماری ساختارهای یادگرفتهشده توسط مدل است. از آنجا که مدلهای بیزی ناپارامتری به صورت بدون ناظر (Unsupervised) عمل میکنند، معمولاً تعیین اینکه خوشههای ایجاد شده واقعاً بیانگر ساختارهای واقعی داده هستند یا تنها حاصل تصادفاند، کار سادهای نیست. برای رفع این مشکل، پژوهش حاضر یک آزمون آماری مبتنی بر جایگشت (Permutation Test) ارائه میکند. در این روش، دادهها بارها به صورت تصادفی جابهجا میشوند و مدل روی دادههای بازآراییشده اجرا میشود. سپس مقدار تابع درستنمایی (Likelihood) دادههای اصلی با نتایج دادههای تصادفی مقایسه شده و مقدار احتمال (P-Value) محاسبه میشود. اگر مقدار P-Value کوچک باشد، میتوان نتیجه گرفت که ساختارهای استخراجشده توسط مدل از نظر آماری معنادار بوده و صرفاً حاصل تصادف نیستند. این چارچوب امکان ارزیابی کمی کیفیت مدل را فراهم میکند؛ قابلیتی که در بسیاری از مدلهای مشابه وجود ندارد.
برای ارزیابی عملی مدل، نویسنده از دادههای صوتی و تصویری مربوط به اجرای موسیقی استفاده کرده است. در این مجموعه داده، ویژگیهای تصویری از فریمهای ویدئو و ویژگیهای صوتی از سیگنال موسیقی استخراج شدهاند. سپس مدل mmHDP روی این دادهها آموزش داده شده و روابط میان ویژگیهای صوتی و تصویری تحلیل شده است. نتایج نشان میدهد که مدل قادر است ساختارهای مشترکی میان حرکت دست نوازنده، موقعیت کلیدهای پیانو و فرکانسهای صوتی متناظر با نتهای موسیقی پیدا کند. این موضوع نشان میدهد که مدل میتواند وابستگیهای واقعی میان دو نوع داده را بدون دریافت هیچ برچسب آموزشی کشف کند.
در ادامه، پژوهش سه آزمایش مختلف برای ارزیابی چارچوب پیشنهادی انجام میدهد. در آزمایش نخست، دادههای مصنوعی با وابستگی واقعی میان وجههای مختلف تولید میشوند. در آزمایش دوم، دادههای مستقل ایجاد میشوند تا مشخص شود مدل در نبود ارتباط واقعی چگونه رفتار میکند. در آزمایش سوم نیز دادههای واقعی صوتی و تصویری مورد بررسی قرار میگیرند. نتایج هر سه آزمایش نشان میدهد که آزمون جایگشت قادر است تفاوت میان دادههای دارای ساختار واقعی و دادههای فاقد ساختار را به خوبی تشخیص دهد و بنابراین ابزار مناسبی برای سنجش اعتبار مدل محسوب میشود.
یکی دیگر از بخشهای مهم پایاننامه، تحلیل دقیق پارامترهای یادگرفتهشده توسط مدل است. نویسنده علاوه بر ارائه نتایج کمی، رفتار خوشهها، توزیع اتمهای سراسری و محلی، وابستگی زمانی دادهها، ویژگیهای صوتی غالب، ویژگیهای تصویری متناظر و ارتباط میان این ساختارها را به صورت کیفی نیز بررسی کرده است. این تحلیلها نشان میدهد که مدل تنها خوشهبندی ساده انجام نمیدهد، بلکه میتواند روابط معنایی میان اطلاعات چندوجهی را نیز استخراج کند. به همین دلیل، خروجیهای مدل از قابلیت تفسیر بالایی برخوردار هستند و پژوهشگر میتواند علت شکلگیری هر خوشه را بررسی کند.
این پایاننامه همچنین نشان میدهد که استفاده از فرآیند دیریکله سلسلهمراتبی چندوجهی نسبت به بسیاری از روشهای متداول مزایای قابل توجهی دارد. مهمترین مزیت آن، عدم نیاز به تعیین تعداد خوشهها پیش از شروع آموزش است. مدل به صورت خودکار و متناسب با پیچیدگی دادهها تعداد ساختارهای مورد نیاز را یاد میگیرد. علاوه بر این، وجود دیدگاه دادههای سانسورشده باعث میشود دادههای ناقص نیز قابل استفاده باشند و محدودیت همزمان بودن کامل دادههای صوتی و تصویری از بین برود. همچنین روش پیشنهادی به دلیل ماهیت بیزی خود قادر است عدم قطعیت موجود در دادهها را نیز مدلسازی کند که این موضوع در بسیاری از کاربردهای واقعی اهمیت فراوانی دارد.
در جمعبندی میتوان گفت این پایاننامه با ترکیب مدلهای بیزی ناپارامتری، همجوشی دادههای چندوجهی و آزمونهای آماری مبتنی بر جایگشت، چارچوبی جامع برای تحلیل دادههای صوتی و تصویری ارائه کرده است. مهمترین دستاورد پژوهش، توسعه یک روش جدید برای اندازهگیری معناداری ساختارهای استخراجشده توسط مدل mmHDP است؛ موضوعی که پیش از این کمتر مورد توجه قرار گرفته بود. نتایج تجربی نشان میدهد که مدل پیشنهادی قادر است روابط واقعی میان دادههای صوتی و تصویری را با دقت مناسب استخراج کند و آزمون جایگشت نیز اعتبار آماری این روابط را تأیید میکند. به همین دلیل، روش ارائهشده میتواند در حوزههایی مانند پردازش گفتار، بینایی ماشین، رباتیک، پزشکی، سیستمهای هوشمند، تحلیل ویدئو، تعامل انسان و رایانه و سایر کاربردهای مبتنی بر دادههای چندوجهی مورد استفاده قرار گیرد و زمینه را برای توسعه نسل جدیدی از سامانههای هوشمند مبتنی بر یادگیری بدون ناظر فراهم سازد.
“`html
فهرست مطالب
| سرفصل | شماره صفحه |
|---|---|
| چکیده | iii |
| قدردانی | v |
| فصل اول: مقدمه | 1 |
| ۱-۱. نوآوریها و دستاوردهای پژوهش (Contributions) | 2 |
| ۱-۲. ساختار پایاننامه (Thesis Organization) | 2 |
| فصل دوم: مبانی نظری (Background) | 5 |
| ۲-۱. همجوشی دادههای چندوجهی (Multi-modal Data Fusion) | 5 |
| ۲-۱-۱. همبستگی و تطبیق دادهها (Data Association) | 6 |
| ۲-۲. مدلهای گرافی (Graphical Models) | 7 |
| ۲-۲-۱. مدلسازی سلسلهمراتبی (Hierarchical Modeling) | 8 |
| ۲-۲-۲. مدلهای بیزی ناپارامتری (Non-parametric Bayesian Models) | 9 |
| ۲-۳. فرآیند دیریکله (Dirichlet Process) | 11 |
| ۲-۳-۱. ساختار شکست چوب (Stick-breaking Construction) | 12 |
| ۲-۳-۲. فرآیند رستوران چینی (Chinese Restaurant Process) | 13 |
| ۲-۴. مدلهای اختلاط مبتنی بر فرآیند دیریکله (Dirichlet Process Mixture Models) | 15 |
| ۲-۴-۱. فرآیند سلسلهمراتبی دیریکله (Hierarchical Dirichlet Process) | 17 |
| ۲-۴-۲. استنتاج مبتنی بر نمونهگیری (Sampling-Based Inference) | 21 |
| ۲-۴-۳. فرآیند سلسلهمراتبی دیریکله چندوجهی (Multi-modal Hierarchical Dirichlet Process) | 24 |
| ۲-۴-۴. روش تیپها (Method of Types) | 29 |
| ۲-۵. آزمون فرض (Hypothesis Testing) | 30 |
| ۲-۵-۱. چارچوب آزمون فرض | 30 |
| ۲-۵-۲. نواحی مورد علاقه (Regions of Interest) | 33 |
| ۲-۵-۳. آزمونهای مبتنی بر جایگشت (Permutation Tests) | 35 |
| فصل سوم: روش پیشنهادی (Approach) | 39 |
| ۳-۱. پژوهشهای مرتبط (Related Work) | 39 |
| ۳-۱-۱. همجوشی دادههای چندوجهی | 39 |
| ۳-۱-۲. آزمون معناداری مبتنی بر جایگشت | 40 |
| ۳-۲. نوآوریها و دستاوردهای پژوهش | 41 |
| ۳-۳. خط لوله پردازش دادههای صوتی و تصویری (Processing Pipeline) | 41 |
| ۳-۳-۱. دیدگاه دادههای سانسورشده (Censored-data Perspective) | 41 |
| ۳-۳-۲. پیشپردازش دادهها (Data Pre-processing) | 42 |
| ۳-۳-۳. برازش مدل (Model Fitting) | 45 |
| ۳-۴. آزمون فرض مبتنی بر جایگشت | 47 |
| ۳-۴-۱. درستنمایی بهعنوان آماره آزمون (Likelihood as a Test Statistic) | 47 |
| ۳-۴-۲. چارچوب آزمون جایگشت | 47 |
| ۳-۴-۳. بررسی وابستگیهای زمانی (Checking Temporal Dependencies) | 50 |
| فصل چهارم: نتایج تجربی و تحلیل (Empirical Results and Analysis) | 51 |
| ۴-۱. دستاوردهای این فصل | 51 |
| ۴-۲. کاربرد مدل mmHDP بر روی دادههای موسیقی | 51 |
| ۴-۲-۱. مجموعه داده و پارامترهای آزمایش | 51 |
| ۴-۲-۲. نتایج و تحلیل | 52 |
| ۴-۳. ارزیابی معناداری با آزمونهای جایگشت | 55 |
| ۴-۳-۱. بررسی وابستگیهای زمانی | 57 |
| ۴-۳-۲. آزمایش اول: وجههای وابسته (Coupled Modalities) | 57 |
| ۴-۳-۳. آزمایش دوم: وجههای مستقل (Independent Modalities) | 58 |
| ۴-۳-۴. آزمایش سوم: دادههای صوتی و تصویری | 58 |
| ۴-۳-۵. بحث و جمعبندی | 59 |
| فصل پنجم: نتیجهگیری و پیشنهادهای آینده (Conclusions and Future Work) | 71 |
| پیوست A: مطالب تکمیلی (Supplemental Materials) | 73 |
| A-1. تمایز اتم و ویژگی (Atom and Feature Distinction) | 73 |
| A-2. معیار شباهت نسبت درستنمایی (Likelihood Ratio Similarity Measure) | 74 |
| منابع (Bibliography) | 81 |
“`
چگونه هوش مصنوعی میتواند بدون هیچ برچسبی رابطه بین صدا و تصویر را کشف کند؟ راز یک مدل آماری شگفتانگیز
تصور کنید ویدئویی از نوازندگی پیانو در اختیار یک کامپیوتر قرار میدهید، اما هیچ اطلاعاتی درباره نتهای موسیقی، محل قرارگیری انگشتان یا حتی ارتباط بین تصویر و صدا به آن نمیدهید. آیا چنین سیستمی میتواند خودش متوجه شود که هر حرکت دست با چه صدایی مرتبط است؟ شاید عجیب به نظر برسد، اما موضوع اصلی این پایاننامه دقیقاً پاسخ به همین سؤال است. پژوهش حاضر با ترکیب مدلهای بیزی پیشرفته و آزمونهای آماری، روشی ارائه میکند که بدون نیاز به دادههای برچسبگذاریشده، ساختارهای پنهان میان اطلاعات صوتی و تصویری را کشف میکند.
مدل بدون اینکه بداند چند الگو وجود دارد، خودش آنها را پیدا میکند
بیشتر الگوریتمهای یادگیری ماشین از قبل باید بدانند چند دسته یا خوشه در دادهها وجود دارد؛ اما در دنیای واقعی چنین اطلاعاتی معمولاً در دسترس نیست. این پایاننامه از «فرآیند سلسلهمراتبی دیریکله چندوجهی (mmHDP)» استفاده میکند؛ مدلی که تعداد خوشهها را از قبل فرض نمیکند و همزمان با مشاهده دادهها، ساختار مناسب را میآموزد.
این ویژگی باعث میشود مدل بتواند با دادههای بسیار پیچیده و ناشناخته نیز سازگار شود و بدون دخالت انسان، الگوهای واقعی موجود در داده را استخراج کند.
دادههای ناقص دیگر یک مانع نیستند
یکی از مشکلات رایج در سامانههای چندرسانهای، ناقص بودن اطلاعات است. ممکن است بخشی از تصویر وجود نداشته باشد یا کیفیت صدای ضبطشده مناسب نباشد. بسیاری از روشهای موجود در چنین شرایطی عملکرد خود را از دست میدهند.
نوآوری مهم این پایاننامه استفاده از دیدگاه «دادههای سانسورشده» است. در این روش، مدل مجبور نیست برای هر نمونه صوتی دقیقاً یک نمونه تصویری متناظر داشته باشد. تنها کافی است دادهها در قالب گروههای مرتبط قرار بگیرند تا الگوریتم بتواند ارتباط میان آنها را یاد بگیرد.
این ایده باعث میشود روش پیشنهادی در شرایط واقعی بسیار کاربردیتر از بسیاری از مدلهای کلاسیک باشد.
وقتی کامپیوتر خودش ارتباط بین حرکت دست و صدای پیانو را کشف میکند
برای ارزیابی مدل، پژوهشگر از ویدئوهای اجرای پیانو استفاده کرده است. ابتدا ویژگیهای تصویری مانند نقاط مهم تصویر و ویژگیهای صوتی مانند فرکانسهای موسیقی استخراج شدند. سپس مدل بدون دریافت هیچ اطلاعاتی درباره نتهای موسیقی یا محل قرارگیری انگشتان آموزش داده شد.
نتیجه جالب بود؛ الگوریتم توانست ارتباط میان حرکت دست نوازنده، موقعیت کلیدهای پیانو و فرکانسهای صوتی متناظر را بهصورت خودکار کشف کند.
این یعنی مدل واقعاً ساختارهای مشترک میان صدا و تصویر را یاد گرفته است، نه اینکه صرفاً دادهها را خوشهبندی کرده باشد.
مهمترین سؤال: از کجا بفهمیم مدل واقعاً چیزی یاد گرفته است؟
بسیاری از مدلهای هوش مصنوعی خروجی تولید میکنند، اما همیشه مشخص نیست این خروجی واقعاً معنیدار است یا صرفاً حاصل تصادف.
همین مسئله بزرگترین انگیزه بخش دوم این پژوهش بوده است.
نویسنده چارچوب جدیدی بر پایه «آزمون جایگشت (Permutation Test)» طراحی کرده است. ایده بسیار ساده اما قدرتمند است:
- دادههای اصلی تحلیل میشوند.
- سپس همان دادهها بارها بهصورت تصادفی جابهجا میشوند.
- مدل دوباره روی دادههای تصادفی اجرا میشود.
- در پایان نتایج واقعی با نتایج تصادفی مقایسه میشوند.
اگر دادههای واقعی عملکرد بسیار بهتری نسبت به دادههای جابهجا شده داشته باشند، میتوان نتیجه گرفت که مدل واقعاً ساختارهای معنادار را کشف کرده است.
این روش برای نخستین بار امکان ارزیابی آماری کیفیت ساختارهای یادگرفتهشده توسط مدل mmHDP را فراهم میکند.
«اگر با جابهجایی تصادفی دادهها ساختار مدل از بین برود، یعنی الگوریتم واقعاً رابطهای واقعی را یاد گرفته است، نه یک الگوی تصادفی.»
آزمایشها نشان دادند مدل واقعاً روابط پنهان را کشف میکند
برای اطمینان از عملکرد روش پیشنهادی، سه مجموعه آزمایش مستقل انجام شد.
در آزمایش اول، دادههای مصنوعی با ارتباط واقعی بین صدا و تصویر ساخته شدند.
در آزمایش دوم، دادههایی تولید شدند که هیچ ارتباطی میان بخشهای مختلف آنها وجود نداشت.
در نهایت، مدل روی دادههای واقعی صوتی و تصویری اجرا شد.
نتایج هر سه آزمایش نشان داد آزمون پیشنهادی بهدرستی میتواند بین دادههای دارای ساختار واقعی و دادههای تصادفی تفاوت قائل شود. این موضوع اعتبار علمی روش ارائهشده را به شکل قابل توجهی افزایش میدهد.
چرا این پژوهش اهمیت زیادی دارد؟
اگرچه مثال این پایاننامه روی موسیقی اجرا شده است، اما کاربردهای آن بسیار گستردهتر هستند.
همین روش میتواند در زمینههایی مانند:
- خودروهای خودران
- رباتیک
- پزشکی هوشمند
- پردازش گفتار
- بینایی ماشین
- تحلیل ویدئو
- سامانههای امنیتی
- تعامل انسان و رایانه
مورد استفاده قرار گیرد؛ یعنی هر جایی که چند نوع داده بهطور همزمان تولید میشوند.
جمعبندی
این پایاننامه نشان میدهد که آینده هوش مصنوعی تنها در استفاده از شبکههای عصبی بزرگ خلاصه نمیشود. مدلهای بیزی ناپارامتری هنوز ظرفیت فوقالعادهای برای کشف ساختارهای پیچیده دارند؛ بهویژه زمانی که دادهها ناقص، بدون برچسب و چندوجهی باشند.
ترکیب مدل mmHDP با آزمونهای آماری مبتنی بر جایگشت، راهکاری ارائه میدهد که هم قادر به یادگیری روابط پنهان میان دادههای صوتی و تصویری است و هم میتواند از نظر آماری اثبات کند که این روابط واقعی هستند.
شاید سؤال مهم آینده این باشد: اگر چنین مدلهایی بتوانند بدون هیچ دانش قبلی روابط میان صدا و تصویر را کشف کنند، آیا در آینده خواهند توانست ارتباط میان انواع بسیار پیچیدهتر دادهها را نیز مانند انسان درک کنند؟
بسیار سریع و ساده می توانید اصل این پایان نامه را به صورت فایل PDF در اختیار داشته باشید.