این پایان‌نامه به بررسی یکی از چالش‌های مهم در حوزه یادگیری ماشین، آمار بیزی و همجوشی داده‌های چندوجهی می‌پردازد؛ چالشی که به استخراج ساختارهای پنهان از داده‌هایی با منابع اطلاعاتی متفاوت، مانند صوت و تصویر، مربوط می‌شود. با گسترش کاربرد سامانه‌های هوشمند در حوزه‌هایی نظیر بینایی ماشین، رباتیک، پردازش گفتار، پزشکی، خودروهای خودران و تعامل انسان و رایانه، نیاز به روش‌هایی که بتوانند اطلاعات حاصل از چند حسگر یا چند نوع داده را به صورت یکپارچه تحلیل کنند، بیش از گذشته احساس می‌شود. در بسیاری از این کاربردها، داده‌ها تنها از یک منبع به دست نمی‌آیند، بلکه هم‌زمان از چندین منبع مختلف مانند دوربین، میکروفون، حسگرهای حرکتی یا تجهیزات تصویربرداری پزشکی جمع‌آوری می‌شوند. هر یک از این منابع تنها بخشی از واقعیت را نمایش می‌دهند و درک صحیح محیط نیازمند ترکیب هوشمند این اطلاعات است. از همین رو، مسئله «همجوشی داده‌های چندوجهی» (Multi-modal Data Fusion) به یکی از موضوعات مهم پژوهشی در سال‌های اخیر تبدیل شده است.

پیشینه این مسئله به مدل‌های آماری کلاسیک مانند فیلتر کالمن، مدل‌های مارکوف مخفی و روش‌های احتمالاتی برمی‌گردد. این روش‌ها اگرچه در بسیاری از مسائل موفق بوده‌اند، اما اغلب نیازمند تعیین تعداد خوشه‌ها، ساختار مدل یا پارامترهای اولیه هستند و در مواجهه با داده‌های پیچیده و دارای ساختار ناشناخته، انعطاف کافی ندارند. در سال‌های بعد، روش‌های یادگیری عمیق نیز وارد این حوزه شدند و توانستند پیشرفت‌های قابل توجهی ایجاد کنند، اما این روش‌ها معمولاً به حجم عظیمی از داده‌های برچسب‌خورده نیاز دارند و تفسیر نتایج آن‌ها نیز ساده نیست. بنابراین پژوهشگران به دنبال مدل‌هایی بودند که بدون نیاز به تعیین تعداد خوشه‌ها یا ساختار داده، بتوانند روابط پنهان میان داده‌های چندوجهی را به صورت خودکار کشف کنند. این موضوع زمینه استفاده از مدل‌های بیزی ناپارامتری، به‌ویژه فرآیند دیریکله سلسله‌مراتبی (Hierarchical Dirichlet Process) و نسخه چندوجهی آن را فراهم کرد.

هدف اصلی این پایان‌نامه توسعه و ارزیابی مدلی مبتنی بر «فرآیند سلسله‌مراتبی دیریکله چندوجهی» (mmHDP) برای تحلیل هم‌زمان داده‌های صوتی و تصویری است. این مدل قادر است بدون مشخص بودن تعداد خوشه‌ها، ساختارهای مشترک میان چند نوع داده را شناسایی کند و ارتباطات موجود بین آن‌ها را بیاموزد. یکی از ویژگی‌های مهم این مدل، استفاده از دیدگاه «داده‌های سانسورشده» است. در این دیدگاه، برخلاف بسیاری از روش‌های موجود، نیازی نیست که برای هر نمونه صوتی الزاماً یک نمونه تصویری متناظر وجود داشته باشد. در عوض، داده‌ها در سطح گروهی با یکدیگر مرتبط می‌شوند و مدل می‌تواند حتی در شرایطی که بخشی از اطلاعات یک یا چند وجه داده در دسترس نیست، فرآیند یادگیری را ادامه دهد. این ویژگی باعث افزایش انعطاف‌پذیری مدل در کاربردهای واقعی می‌شود؛ زیرا در بسیاری از مسائل عملی، داده‌های ناقص یا گمشده امری اجتناب‌ناپذیر هستند.

در این پژوهش، ابتدا مبانی نظری مدل‌های گرافی بیزی، فرآیند دیریکله، مدل‌های اختلاط نامتناهی، فرآیند دیریکله سلسله‌مراتبی و نسخه چندوجهی آن‌ها به‌صورت کامل بررسی شده است. سپس نحوه مدل‌سازی داده‌های چندوجهی، ارتباط بین داده‌های صوتی و تصویری و روش‌های مختلف همجوشی اطلاعات توضیح داده می‌شود تا چارچوب نظری لازم برای ارائه مدل پیشنهادی فراهم گردد. پس از آن، نویسنده یک زنجیره پردازشی کامل طراحی کرده است که استخراج ویژگی‌ها از داده‌های ویدئویی، آماده‌سازی داده‌ها، برازش مدل mmHDP و تحلیل خروجی‌های مدل را شامل می‌شود.

یکی از نوآوری‌های اصلی این پایان‌نامه، طراحی چارچوب جدیدی برای ارزیابی معناداری آماری ساختارهای یادگرفته‌شده توسط مدل است. از آنجا که مدل‌های بیزی ناپارامتری به صورت بدون ناظر (Unsupervised) عمل می‌کنند، معمولاً تعیین اینکه خوشه‌های ایجاد شده واقعاً بیانگر ساختارهای واقعی داده هستند یا تنها حاصل تصادف‌اند، کار ساده‌ای نیست. برای رفع این مشکل، پژوهش حاضر یک آزمون آماری مبتنی بر جایگشت (Permutation Test) ارائه می‌کند. در این روش، داده‌ها بارها به صورت تصادفی جابه‌جا می‌شوند و مدل روی داده‌های بازآرایی‌شده اجرا می‌شود. سپس مقدار تابع درست‌نمایی (Likelihood) داده‌های اصلی با نتایج داده‌های تصادفی مقایسه شده و مقدار احتمال (P-Value) محاسبه می‌شود. اگر مقدار P-Value کوچک باشد، می‌توان نتیجه گرفت که ساختارهای استخراج‌شده توسط مدل از نظر آماری معنادار بوده و صرفاً حاصل تصادف نیستند. این چارچوب امکان ارزیابی کمی کیفیت مدل را فراهم می‌کند؛ قابلیتی که در بسیاری از مدل‌های مشابه وجود ندارد.

برای ارزیابی عملی مدل، نویسنده از داده‌های صوتی و تصویری مربوط به اجرای موسیقی استفاده کرده است. در این مجموعه داده، ویژگی‌های تصویری از فریم‌های ویدئو و ویژگی‌های صوتی از سیگنال موسیقی استخراج شده‌اند. سپس مدل mmHDP روی این داده‌ها آموزش داده شده و روابط میان ویژگی‌های صوتی و تصویری تحلیل شده است. نتایج نشان می‌دهد که مدل قادر است ساختارهای مشترکی میان حرکت دست نوازنده، موقعیت کلیدهای پیانو و فرکانس‌های صوتی متناظر با نت‌های موسیقی پیدا کند. این موضوع نشان می‌دهد که مدل می‌تواند وابستگی‌های واقعی میان دو نوع داده را بدون دریافت هیچ برچسب آموزشی کشف کند.

در ادامه، پژوهش سه آزمایش مختلف برای ارزیابی چارچوب پیشنهادی انجام می‌دهد. در آزمایش نخست، داده‌های مصنوعی با وابستگی واقعی میان وجه‌های مختلف تولید می‌شوند. در آزمایش دوم، داده‌های مستقل ایجاد می‌شوند تا مشخص شود مدل در نبود ارتباط واقعی چگونه رفتار می‌کند. در آزمایش سوم نیز داده‌های واقعی صوتی و تصویری مورد بررسی قرار می‌گیرند. نتایج هر سه آزمایش نشان می‌دهد که آزمون جایگشت قادر است تفاوت میان داده‌های دارای ساختار واقعی و داده‌های فاقد ساختار را به خوبی تشخیص دهد و بنابراین ابزار مناسبی برای سنجش اعتبار مدل محسوب می‌شود.

یکی دیگر از بخش‌های مهم پایان‌نامه، تحلیل دقیق پارامترهای یادگرفته‌شده توسط مدل است. نویسنده علاوه بر ارائه نتایج کمی، رفتار خوشه‌ها، توزیع اتم‌های سراسری و محلی، وابستگی زمانی داده‌ها، ویژگی‌های صوتی غالب، ویژگی‌های تصویری متناظر و ارتباط میان این ساختارها را به صورت کیفی نیز بررسی کرده است. این تحلیل‌ها نشان می‌دهد که مدل تنها خوشه‌بندی ساده انجام نمی‌دهد، بلکه می‌تواند روابط معنایی میان اطلاعات چندوجهی را نیز استخراج کند. به همین دلیل، خروجی‌های مدل از قابلیت تفسیر بالایی برخوردار هستند و پژوهشگر می‌تواند علت شکل‌گیری هر خوشه را بررسی کند.

این پایان‌نامه همچنین نشان می‌دهد که استفاده از فرآیند دیریکله سلسله‌مراتبی چندوجهی نسبت به بسیاری از روش‌های متداول مزایای قابل توجهی دارد. مهم‌ترین مزیت آن، عدم نیاز به تعیین تعداد خوشه‌ها پیش از شروع آموزش است. مدل به صورت خودکار و متناسب با پیچیدگی داده‌ها تعداد ساختارهای مورد نیاز را یاد می‌گیرد. علاوه بر این، وجود دیدگاه داده‌های سانسورشده باعث می‌شود داده‌های ناقص نیز قابل استفاده باشند و محدودیت هم‌زمان بودن کامل داده‌های صوتی و تصویری از بین برود. همچنین روش پیشنهادی به دلیل ماهیت بیزی خود قادر است عدم قطعیت موجود در داده‌ها را نیز مدل‌سازی کند که این موضوع در بسیاری از کاربردهای واقعی اهمیت فراوانی دارد.

در جمع‌بندی می‌توان گفت این پایان‌نامه با ترکیب مدل‌های بیزی ناپارامتری، همجوشی داده‌های چندوجهی و آزمون‌های آماری مبتنی بر جایگشت، چارچوبی جامع برای تحلیل داده‌های صوتی و تصویری ارائه کرده است. مهم‌ترین دستاورد پژوهش، توسعه یک روش جدید برای اندازه‌گیری معناداری ساختارهای استخراج‌شده توسط مدل mmHDP است؛ موضوعی که پیش از این کمتر مورد توجه قرار گرفته بود. نتایج تجربی نشان می‌دهد که مدل پیشنهادی قادر است روابط واقعی میان داده‌های صوتی و تصویری را با دقت مناسب استخراج کند و آزمون جایگشت نیز اعتبار آماری این روابط را تأیید می‌کند. به همین دلیل، روش ارائه‌شده می‌تواند در حوزه‌هایی مانند پردازش گفتار، بینایی ماشین، رباتیک، پزشکی، سیستم‌های هوشمند، تحلیل ویدئو، تعامل انسان و رایانه و سایر کاربردهای مبتنی بر داده‌های چندوجهی مورد استفاده قرار گیرد و زمینه را برای توسعه نسل جدیدی از سامانه‌های هوشمند مبتنی بر یادگیری بدون ناظر فراهم سازد.
“`html

 

فهرست مطالب

سرفصل شماره صفحه
چکیده iii
قدردانی v
فصل اول: مقدمه 1
۱-۱. نوآوری‌ها و دستاوردهای پژوهش (Contributions) 2
۱-۲. ساختار پایان‌نامه (Thesis Organization) 2
فصل دوم: مبانی نظری (Background) 5
۲-۱. همجوشی داده‌های چندوجهی (Multi-modal Data Fusion) 5
۲-۱-۱. همبستگی و تطبیق داده‌ها (Data Association) 6
۲-۲. مدل‌های گرافی (Graphical Models) 7
۲-۲-۱. مدل‌سازی سلسله‌مراتبی (Hierarchical Modeling) 8
۲-۲-۲. مدل‌های بیزی ناپارامتری (Non-parametric Bayesian Models) 9
۲-۳. فرآیند دیریکله (Dirichlet Process) 11
۲-۳-۱. ساختار شکست چوب (Stick-breaking Construction) 12
۲-۳-۲. فرآیند رستوران چینی (Chinese Restaurant Process) 13
۲-۴. مدل‌های اختلاط مبتنی بر فرآیند دیریکله (Dirichlet Process Mixture Models) 15
۲-۴-۱. فرآیند سلسله‌مراتبی دیریکله (Hierarchical Dirichlet Process) 17
۲-۴-۲. استنتاج مبتنی بر نمونه‌گیری (Sampling-Based Inference) 21
۲-۴-۳. فرآیند سلسله‌مراتبی دیریکله چندوجهی (Multi-modal Hierarchical Dirichlet Process) 24
۲-۴-۴. روش تیپ‌ها (Method of Types) 29
۲-۵. آزمون فرض (Hypothesis Testing) 30
۲-۵-۱. چارچوب آزمون فرض 30
۲-۵-۲. نواحی مورد علاقه (Regions of Interest) 33
۲-۵-۳. آزمون‌های مبتنی بر جایگشت (Permutation Tests) 35
فصل سوم: روش پیشنهادی (Approach) 39
۳-۱. پژوهش‌های مرتبط (Related Work) 39
۳-۱-۱. همجوشی داده‌های چندوجهی 39
۳-۱-۲. آزمون معناداری مبتنی بر جایگشت 40
۳-۲. نوآوری‌ها و دستاوردهای پژوهش 41
۳-۳. خط لوله پردازش داده‌های صوتی و تصویری (Processing Pipeline) 41
۳-۳-۱. دیدگاه داده‌های سانسورشده (Censored-data Perspective) 41
۳-۳-۲. پیش‌پردازش داده‌ها (Data Pre-processing) 42
۳-۳-۳. برازش مدل (Model Fitting) 45
۳-۴. آزمون فرض مبتنی بر جایگشت 47
۳-۴-۱. درست‌نمایی به‌عنوان آماره آزمون (Likelihood as a Test Statistic) 47
۳-۴-۲. چارچوب آزمون جایگشت 47
۳-۴-۳. بررسی وابستگی‌های زمانی (Checking Temporal Dependencies) 50
فصل چهارم: نتایج تجربی و تحلیل (Empirical Results and Analysis) 51
۴-۱. دستاوردهای این فصل 51
۴-۲. کاربرد مدل mmHDP بر روی داده‌های موسیقی 51
۴-۲-۱. مجموعه داده و پارامترهای آزمایش 51
۴-۲-۲. نتایج و تحلیل 52
۴-۳. ارزیابی معناداری با آزمون‌های جایگشت 55
۴-۳-۱. بررسی وابستگی‌های زمانی 57
۴-۳-۲. آزمایش اول: وجه‌های وابسته (Coupled Modalities) 57
۴-۳-۳. آزمایش دوم: وجه‌های مستقل (Independent Modalities) 58
۴-۳-۴. آزمایش سوم: داده‌های صوتی و تصویری 58
۴-۳-۵. بحث و جمع‌بندی 59
فصل پنجم: نتیجه‌گیری و پیشنهادهای آینده (Conclusions and Future Work) 71
پیوست A: مطالب تکمیلی (Supplemental Materials) 73
A-1. تمایز اتم و ویژگی (Atom and Feature Distinction) 73
A-2. معیار شباهت نسبت درست‌نمایی (Likelihood Ratio Similarity Measure) 74
منابع (Bibliography) 81

“`

چگونه هوش مصنوعی می‌تواند بدون هیچ برچسبی رابطه بین صدا و تصویر را کشف کند؟ راز یک مدل آماری شگفت‌انگیز

تصور کنید ویدئویی از نوازندگی پیانو در اختیار یک کامپیوتر قرار می‌دهید، اما هیچ اطلاعاتی درباره نت‌های موسیقی، محل قرارگیری انگشتان یا حتی ارتباط بین تصویر و صدا به آن نمی‌دهید. آیا چنین سیستمی می‌تواند خودش متوجه شود که هر حرکت دست با چه صدایی مرتبط است؟ شاید عجیب به نظر برسد، اما موضوع اصلی این پایان‌نامه دقیقاً پاسخ به همین سؤال است. پژوهش حاضر با ترکیب مدل‌های بیزی پیشرفته و آزمون‌های آماری، روشی ارائه می‌کند که بدون نیاز به داده‌های برچسب‌گذاری‌شده، ساختارهای پنهان میان اطلاعات صوتی و تصویری را کشف می‌کند.


مدل بدون اینکه بداند چند الگو وجود دارد، خودش آن‌ها را پیدا می‌کند

بیشتر الگوریتم‌های یادگیری ماشین از قبل باید بدانند چند دسته یا خوشه در داده‌ها وجود دارد؛ اما در دنیای واقعی چنین اطلاعاتی معمولاً در دسترس نیست. این پایان‌نامه از «فرآیند سلسله‌مراتبی دیریکله چندوجهی (mmHDP)» استفاده می‌کند؛ مدلی که تعداد خوشه‌ها را از قبل فرض نمی‌کند و همزمان با مشاهده داده‌ها، ساختار مناسب را می‌آموزد.

این ویژگی باعث می‌شود مدل بتواند با داده‌های بسیار پیچیده و ناشناخته نیز سازگار شود و بدون دخالت انسان، الگوهای واقعی موجود در داده را استخراج کند.


داده‌های ناقص دیگر یک مانع نیستند

یکی از مشکلات رایج در سامانه‌های چندرسانه‌ای، ناقص بودن اطلاعات است. ممکن است بخشی از تصویر وجود نداشته باشد یا کیفیت صدای ضبط‌شده مناسب نباشد. بسیاری از روش‌های موجود در چنین شرایطی عملکرد خود را از دست می‌دهند.

نوآوری مهم این پایان‌نامه استفاده از دیدگاه «داده‌های سانسورشده» است. در این روش، مدل مجبور نیست برای هر نمونه صوتی دقیقاً یک نمونه تصویری متناظر داشته باشد. تنها کافی است داده‌ها در قالب گروه‌های مرتبط قرار بگیرند تا الگوریتم بتواند ارتباط میان آن‌ها را یاد بگیرد.

این ایده باعث می‌شود روش پیشنهادی در شرایط واقعی بسیار کاربردی‌تر از بسیاری از مدل‌های کلاسیک باشد.


وقتی کامپیوتر خودش ارتباط بین حرکت دست و صدای پیانو را کشف می‌کند

برای ارزیابی مدل، پژوهشگر از ویدئوهای اجرای پیانو استفاده کرده است. ابتدا ویژگی‌های تصویری مانند نقاط مهم تصویر و ویژگی‌های صوتی مانند فرکانس‌های موسیقی استخراج شدند. سپس مدل بدون دریافت هیچ اطلاعاتی درباره نت‌های موسیقی یا محل قرارگیری انگشتان آموزش داده شد.

نتیجه جالب بود؛ الگوریتم توانست ارتباط میان حرکت دست نوازنده، موقعیت کلیدهای پیانو و فرکانس‌های صوتی متناظر را به‌صورت خودکار کشف کند.

این یعنی مدل واقعاً ساختارهای مشترک میان صدا و تصویر را یاد گرفته است، نه اینکه صرفاً داده‌ها را خوشه‌بندی کرده باشد.


مهم‌ترین سؤال: از کجا بفهمیم مدل واقعاً چیزی یاد گرفته است؟

بسیاری از مدل‌های هوش مصنوعی خروجی تولید می‌کنند، اما همیشه مشخص نیست این خروجی واقعاً معنی‌دار است یا صرفاً حاصل تصادف.

همین مسئله بزرگ‌ترین انگیزه بخش دوم این پژوهش بوده است.

نویسنده چارچوب جدیدی بر پایه «آزمون جایگشت (Permutation Test)» طراحی کرده است. ایده بسیار ساده اما قدرتمند است:

  • داده‌های اصلی تحلیل می‌شوند.
  • سپس همان داده‌ها بارها به‌صورت تصادفی جابه‌جا می‌شوند.
  • مدل دوباره روی داده‌های تصادفی اجرا می‌شود.
  • در پایان نتایج واقعی با نتایج تصادفی مقایسه می‌شوند.

اگر داده‌های واقعی عملکرد بسیار بهتری نسبت به داده‌های جابه‌جا شده داشته باشند، می‌توان نتیجه گرفت که مدل واقعاً ساختارهای معنادار را کشف کرده است.

این روش برای نخستین بار امکان ارزیابی آماری کیفیت ساختارهای یادگرفته‌شده توسط مدل mmHDP را فراهم می‌کند.

«اگر با جابه‌جایی تصادفی داده‌ها ساختار مدل از بین برود، یعنی الگوریتم واقعاً رابطه‌ای واقعی را یاد گرفته است، نه یک الگوی تصادفی.»


آزمایش‌ها نشان دادند مدل واقعاً روابط پنهان را کشف می‌کند

برای اطمینان از عملکرد روش پیشنهادی، سه مجموعه آزمایش مستقل انجام شد.

در آزمایش اول، داده‌های مصنوعی با ارتباط واقعی بین صدا و تصویر ساخته شدند.

در آزمایش دوم، داده‌هایی تولید شدند که هیچ ارتباطی میان بخش‌های مختلف آن‌ها وجود نداشت.

در نهایت، مدل روی داده‌های واقعی صوتی و تصویری اجرا شد.

نتایج هر سه آزمایش نشان داد آزمون پیشنهادی به‌درستی می‌تواند بین داده‌های دارای ساختار واقعی و داده‌های تصادفی تفاوت قائل شود. این موضوع اعتبار علمی روش ارائه‌شده را به شکل قابل توجهی افزایش می‌دهد.


چرا این پژوهش اهمیت زیادی دارد؟

اگرچه مثال این پایان‌نامه روی موسیقی اجرا شده است، اما کاربردهای آن بسیار گسترده‌تر هستند.

همین روش می‌تواند در زمینه‌هایی مانند:

  • خودروهای خودران
  • رباتیک
  • پزشکی هوشمند
  • پردازش گفتار
  • بینایی ماشین
  • تحلیل ویدئو
  • سامانه‌های امنیتی
  • تعامل انسان و رایانه

مورد استفاده قرار گیرد؛ یعنی هر جایی که چند نوع داده به‌طور همزمان تولید می‌شوند.


جمع‌بندی

این پایان‌نامه نشان می‌دهد که آینده هوش مصنوعی تنها در استفاده از شبکه‌های عصبی بزرگ خلاصه نمی‌شود. مدل‌های بیزی ناپارامتری هنوز ظرفیت فوق‌العاده‌ای برای کشف ساختارهای پیچیده دارند؛ به‌ویژه زمانی که داده‌ها ناقص، بدون برچسب و چندوجهی باشند.

ترکیب مدل mmHDP با آزمون‌های آماری مبتنی بر جایگشت، راهکاری ارائه می‌دهد که هم قادر به یادگیری روابط پنهان میان داده‌های صوتی و تصویری است و هم می‌تواند از نظر آماری اثبات کند که این روابط واقعی هستند.

شاید سؤال مهم آینده این باشد: اگر چنین مدل‌هایی بتوانند بدون هیچ دانش قبلی روابط میان صدا و تصویر را کشف کنند، آیا در آینده خواهند توانست ارتباط میان انواع بسیار پیچیده‌تر داده‌ها را نیز مانند انسان درک کنند؟

 

 

 

بسیار سریع و ساده می توانید اصل این پایان نامه را به صورت فایل PDF در اختیار داشته باشید.

پس از دریافت پایان‌نامه، کلیه اطلاعات کتاب‌شناختی موردنیاز برای استناد علمی، از جمله نام دانشگاه، عنوان پایان‌نامه، نام پژوهشگر، سال دفاع و سایر مشخصات مرتبط، جهت ارجاع‌دهی صحیح مطابق با استانداردهای رایج، در اختیار شما قرار خواهد گرفت.