ارتباطات صوتی جانوران همواره یکی از مهم‌ترین و در عین حال پیچیده‌ترین موضوعات در حوزه‌های زیست‌شناسی، علوم شناختی، پردازش سیگنال و هوش مصنوعی بوده است. در میان گونه‌های مختلف، نهنگ عنبر (Sperm Whale) به دلیل برخورداری از ساختار ارتباطی بسیار پیچیده، رفتارهای اجتماعی پیشرفته و استفاده از الگوهای صوتی منظم موسوم به «کلیک» (Click) و «کودا» (Coda)، به عنوان یکی از بهترین گزینه‌ها برای مطالعه زبان غیرانسانی شناخته می‌شود. پژوهش‌های چند دهه اخیر نشان داده‌اند که این جانوران از الگوهای صوتی متفاوت برای برقراری ارتباط، هماهنگی اجتماعی، انتقال اطلاعات و تعاملات گروهی استفاده می‌کنند. با وجود پیشرفت‌های فراوان در ثبت داده‌های صوتی، یکی از بزرگ‌ترین موانع پیش روی پژوهشگران، تبدیل حجم عظیم فایل‌های صوتی خام به داده‌های ساختاریافته و قابل تحلیل است؛ فرآیندی که تاکنون عمدتاً به صورت دستی انجام شده و نیازمند صرف زمان بسیار زیاد، نیروی انسانی متخصص و دقت بالا است.

مشکل اصلی که این پایان‌نامه به دنبال حل آن است، خودکارسازی فرآیند شناسایی هویت نهنگ تولیدکننده هر کلیک صوتی در مکالمات نهنگ‌های عنبر است. در روش‌های سنتی، پژوهشگران باید ساعت‌ها به فایل‌های صوتی گوش دهند، محل وقوع هر کلیک را مشخص کنند، کلیک‌ها را در قالب کوداها گروه‌بندی نمایند و در نهایت تشخیص دهند که هر کلیک توسط کدام نهنگ تولید شده است. این فرآیند علاوه بر زمان‌بر بودن، به شدت در معرض خطای انسانی قرار دارد و با افزایش حجم داده‌ها عملاً مقیاس‌پذیر نیست. از این‌رو، توسعه سامانه‌ای هوشمند که بتواند بدون دخالت انسان، هویت گوینده هر کلیک را تشخیص دهد، یکی از نیازهای اساسی تحقیقات نوین در حوزه زبان جانوران محسوب می‌شود.

هدف اصلی این پایان‌نامه طراحی و ارزیابی مدلی مبتنی بر یادگیری ماشین برای تفکیک هویت نهنگ‌ها در مکالمات صوتی است تا بتوان آن را در کنار سامانه تشخیص کلیک به یک سامانه کامل رونویسی خودکار مکالمات نهنگ‌های عنبر تبدیل کرد. چنین سامانه‌ای می‌تواند داده‌های خام صوتی را به اطلاعات ساختاریافته شامل زمان وقوع کلیک، گروه‌بندی کوداها و هویت هر نهنگ تبدیل کند و زمینه را برای تحلیل‌های پیشرفته‌تر درباره ساختار زبان، رفتار اجتماعی، الگوهای ارتباطی و حتی شناخت شناختی این گونه فراهم سازد.

در این پژوهش ابتدا پیشینه مطالعات مربوط به ارتباطات صوتی نهنگ‌های عنبر مرور شده است. تحقیقات گذشته نشان داده‌اند که کلیک‌های این جانوران دارای ساختارهای زمانی مشخص بوده و کوداها شباهت‌هایی با لهجه‌ها و الگوهای زبانی انسان دارند. همچنین پژوهش‌های جدید بیان می‌کنند که ساختار این پیام‌های صوتی دارای ویژگی‌های ترکیبی و وابسته به زمینه است؛ موضوعی که اهمیت استفاده از روش‌های یادگیری ماشین و پردازش زبان طبیعی را برای تحلیل این داده‌ها افزایش داده است. این پایان‌نامه نیز در ادامه همین مسیر تحقیقاتی قرار گرفته و بخشی از چشم‌انداز بلندمدت پروژه رمزگشایی زبان نهنگ‌های عنبر را دنبال می‌کند.

داده‌های مورد استفاده در این تحقیق شامل هزاران ساعت ضبط صوتی انجام‌شده در آب‌های دومینیکا طی سال‌های ۲۰۱۴ تا ۲۰۲۳ است. مجموعه داده شامل بیش از ۲۱ هزار کلیک استخراج‌شده از ۴۶ نمونه صوتی است که هر کلیک علاوه بر زمان وقوع، دارای برچسب هویت نهنگ و شماره کودا نیز می‌باشد. این داده‌ها به مجموعه‌های آموزش، اعتبارسنجی و آزمون تقسیم شده‌اند تا عملکرد مدل‌ها به صورت علمی ارزیابی شود.

برای حل مسئله، سه رویکرد مختلف طراحی و پیاده‌سازی شده است. نخستین روش، یک مدل مبتنی بر قواعد ابتکاری (Heuristic-Based) است که تلاش می‌کند تنها با استفاده از ویژگی دامنه یا شدت سیگنال صوتی، میان کلیک‌های نهنگ نزدیک به میکروفون و سایر نهنگ‌ها تمایز ایجاد کند. فرض اولیه این بود که کلیک‌های نهنگ دارای حسگر صوتی شدت بیشتری خواهند داشت؛ اما نتایج نشان داد به دلیل هم‌پوشانی زیاد دامنه سیگنال‌ها و تغییرات شرایط ضبط، این فرض در عمل کارایی کافی ندارد و مدل قادر به جداسازی دقیق هویت نهنگ‌ها نیست.

در گام دوم، پژوهش از یک مدل یادگیری عمیق استفاده می‌کند که فرآیند تشخیص کلیک و تشخیص هویت نهنگ را به صورت هم‌زمان آموزش می‌دهد. در این معماری، ابتدا ویژگی‌های صوتی توسط شبکه SoundNet استخراج شده و سپس به دو بخش مجزا برای تشخیص محل وقوع کلیک و شناسایی هویت نهنگ ارسال می‌شوند. برای آموزش بخش تشخیص هویت از یادگیری نظارت‌شده مبتنی بر یادگیری تقابلی (Supervised Contrastive Learning) استفاده شده است تا بردارهای ویژگی متعلق به یک نهنگ به یکدیگر نزدیک و نمونه‌های متعلق به نهنگ‌های مختلف از هم دور شوند. هرچند این مدل در تشخیص محل وقوع کلیک عملکرد بسیار مناسبی داشت، اما به دلیل عدم توازن داده‌ها، وجود حجم زیاد پنجره‌های فاقد کلیک و تداخل اهداف آموزشی دو بخش مختلف شبکه، دقت قابل قبولی در شناسایی هویت نهنگ‌ها به دست نیاورد.

در سومین و مهم‌ترین بخش پژوهش، معماری مدل بازطراحی شد و سامانه تشخیص هویت نهنگ به صورت مستقل از سامانه تشخیص کلیک آموزش داده شد. در این روش تنها پنجره‌هایی که واقعاً شامل کلیک بودند وارد شبکه شدند و مدل صرفاً بر یادگیری تفاوت میان گویندگان تمرکز کرد. همچنین برای جلوگیری از اشتباه در برچسب‌گذاری، هر دسته آموزشی تنها شامل داده‌های یک مکالمه بود تا شناسه نهنگ‌ها در طول آموزش ثابت باقی بماند. خروجی مدل به صورت بردارهای ویژگی تولید شده و سپس با استفاده از الگوریتم‌های خوشه‌بندی مانند Spectral Clustering و K-Means، هویت نهنگ‌ها تعیین شد.

نتایج آزمایش‌ها نشان دادند که این روش نسبت به دو رویکرد قبلی پیشرفت قابل توجهی ایجاد کرده است. مدل مستقل توانست در تفکیک نهنگ اصلی و سایر نهنگ‌ها دقتی در حدود ۷۸ درصد و در شناسایی چند نهنگ مختلف نیز عملکردی به مراتب بهتر از مدل‌های پیشین ارائه دهد. تحلیل نتایج نشان می‌دهد که حذف وابستگی به فرآیند تشخیص کلیک و تمرکز کامل بر یادگیری ویژگی‌های گوینده، مهم‌ترین عامل افزایش دقت مدل بوده است.

علاوه بر ارائه یک مدل جدید، این پایان‌نامه دلایل موفقیت و شکست هر یک از روش‌های پیشنهادی را نیز تحلیل می‌کند. نویسنده نشان می‌دهد که محدودیت حجم داده، تفاوت شرایط ضبط، تغییر تعداد نهنگ‌ها در مکالمات مختلف و شباهت ویژگی‌های صوتی میان برخی افراد از مهم‌ترین عوامل کاهش دقت مدل هستند. همچنین پیشنهاد می‌شود در تحقیقات آینده از مجموعه داده‌های بزرگ‌تر، معماری‌های عمیق‌تر، الگوریتم‌های خوشه‌بندی پیشرفته‌تر و مدل‌های مبتنی بر ترنسفورمر برای استفاده از اطلاعات زمانی و زمینه‌ای مکالمات بهره گرفته شود.

در مجموع، این پایان‌نامه گامی مؤثر در مسیر توسعه سامانه‌های هوشمند رونویسی خودکار مکالمات نهنگ‌های عنبر محسوب می‌شود. دستاورد اصلی آن ارائه روشی کارآمد برای شناسایی هویت گویندگان در داده‌های صوتی است که می‌تواند سرعت تولید داده‌های برچسب‌گذاری‌شده را به طور چشمگیری افزایش دهد و امکان تحلیل‌های گسترده‌تر در زمینه زبان، رفتار اجتماعی و شناخت جانوران را فراهم سازد. افزون بر این، چارچوب ارائه‌شده محدود به نهنگ‌های عنبر نیست و می‌تواند در آینده برای مطالعه ارتباطات صوتی سایر گونه‌های جانوری نیز توسعه یابد. این پژوهش در نهایت پلی میان یادگیری ماشین، پردازش سیگنال، زیست‌شناسی دریایی و علوم شناختی ایجاد کرده و گامی مهم در مسیر فهم زبان گونه‌های غیرانسانی و توسعه سامانه‌های هوشمند تحلیل ارتباطات طبیعی به شمار می‌آید.

در صورت نیاز، می‌توانم این چکیده را به سبک پایان‌نامه‌های فارسی دانشگاه‌های ایران (حدود ۱۲۰۰ تا ۱۵۰۰ کلمه با لحن کاملاً آکادمیک) نیز بازنویسی کنم.

فهرست مطالب

سرفصل شماره صفحه
صفحه عنوان 1
چکیده 3
قدردانی 5
فصل اول: مقدمه 13
1-1. مفاهیم کلیدی و اصطلاحات (Key Concepts and Terminology) 15
1-2. پژوهش‌های مرتبط (Related Work) 18
1-3. مجموعه داده‌ها (Dataset) 19
فصل دوم: سامانه تفکیک هویت نهنگ (Whale-Identity Separator) 21
2-1. فرایند برچسب‌گذاری دستی (Manual Annotation Pipeline) 22
2-2. معیارهای ارزیابی (Evaluation Measures) 23
2-3. سامانه تفکیک هویت نهنگ مبتنی بر قواعد ابتکاری (Heuristic-Based Whale-Identity Separator) 26
2-3-1. معماری مدل (Architecture) 26
2-3-2. نتایج 29
2-4. تشخیص همزمان کلیک همراه با سامانه تفکیک هویت نهنگ (Joint Click Detection with Whale Separator) 32
2-4-1. معماری مدل (Architecture) 32
2-4-2. نتایج 37
2-5. سامانه مستقل تفکیک هویت نهنگ (Isolated Whale-Identity Separator) 42
2-5-1. معماری مدل (Architecture) 42
2-5-2. نتایج 45
2-6. مقایسه میان رویکردهای پیشنهادی (Comparison Between Approaches) 51
فصل سوم: کارهای آینده (Future Work) 53
فصل چهارم: نتیجه‌گیری (Conclusion) 55
منابع 57

 

آیا روزی زبان نهنگ‌ها را خواهیم فهمید؟ هوش مصنوعی یک قدم بزرگ به رمزگشایی مکالمات نهنگ‌های عنبر نزدیک‌تر شد!

تصور کنید بتوانید به گفت‌وگوی دو نهنگ در اعماق اقیانوس گوش دهید و بفهمید هر کدام چه می‌گویند. تا چند سال پیش این ایده بیشتر شبیه داستان‌های علمی‌تخیلی بود، اما امروز هوش مصنوعی در حال نزدیک کردن ما به چنین رؤیایی است. البته پیش از آنکه بتوان معنای پیام‌های نهنگ‌ها را فهمید، باید یک سؤال بسیار مهم پاسخ داده شود: چه کسی در حال صحبت کردن است؟

همین سؤال، محور اصلی یکی از جذاب‌ترین پژوهش‌های اخیر در حوزه یادگیری ماشین، پردازش سیگنال و زیست‌شناسی دریایی است. در ادامه با مهم‌ترین و شگفت‌انگیزترین نکات این تحقیق آشنا می‌شویم.


اولین مانع، فهمیدن گوینده است نه معنی پیام

وقتی انسان‌ها با هم صحبت می‌کنند، معمولاً بدون فکر کردن تشخیص می‌دهیم که هر جمله را چه کسی گفته است. اما در مکالمات نهنگ‌های عنبر چنین کاری بسیار دشوار است.

صدها ساعت فایل صوتی از نهنگ‌ها وجود دارد که در آن چندین نهنگ هم‌زمان کلیک‌های صوتی تولید می‌کنند. پژوهشگران تاکنون مجبور بودند این فایل‌ها را به صورت دستی گوش دهند، زمان هر کلیک را ثبت کنند و سپس حدس بزنند هر صدا متعلق به کدام نهنگ بوده است.

این فرایند ساعت‌ها زمان می‌برد و احتمال خطا نیز بسیار زیاد است. بنابراین اگر قرار باشد روزی زبان نهنگ‌ها رمزگشایی شود، نخست باید این مرحله کاملاً خودکار شود.


هوش مصنوعی قرار نیست زبان نهنگ‌ها را ترجمه کند؛ فعلاً فقط گوینده را پیدا می‌کند

شاید تصور کنید این پروژه به دنبال ترجمه صحبت‌های نهنگ‌هاست، اما واقعیت کمی متفاوت است.

هدف این پایان‌نامه ساخت مدلی است که بتواند از روی صدای ثبت‌شده تشخیص دهد هر «کلیک» توسط کدام نهنگ تولید شده است. این مرحله درست مانند این است که قبل از رونویسی یک جلسه، ابتدا مشخص کنیم هر جمله متعلق به کدام سخنران بوده است.

شاید این کار ساده به نظر برسد، اما در عمل یکی از سخت‌ترین مراحل تحلیل ارتباطات جانوران محسوب می‌شود.


اولین ایده بسیار منطقی بود؛ اما تقریباً شکست خورد!

محقق ابتدا فرض کرد نهنگی که به میکروفون نزدیک‌تر است، صدای بلندتری تولید می‌کند. بنابراین شاید بتوان فقط با اندازه‌گیری شدت صدا، گوینده را تشخیص داد.

روی کاغذ، ایده بسیار منطقی بود.

اما داده‌های واقعی چیز دیگری نشان دادند. شدت صدای نهنگ‌های مختلف آن‌قدر روی هم هم‌پوشانی داشت که این روش تقریباً هیچ برتری نسبت به حدس زدن نداشت.

این بخش یادآوری می‌کند که طبیعت معمولاً از آنچه تصور می‌کنیم پیچیده‌تر است و راه‌حل‌های ساده همیشه جواب نمی‌دهند.


وقتی دو هوش مصنوعی هم‌زمان آموزش دیدند، نتیجه بهتر نشد

در مرحله بعد، پژوهشگر تصمیم گرفت دو وظیفه را هم‌زمان به یک شبکه عصبی بسپارد:

  • تشخیص زمان وقوع کلیک
  • تشخیص هویت نهنگ

در نگاه اول، این کار باید باعث یادگیری بهتر می‌شد؛ اما نتیجه برعکس بود.

مدل در تشخیص محل کلیک‌ها عملکرد بسیار خوبی داشت، اما هنگام تشخیص هویت نهنگ‌ها دچار سردرگمی می‌شد. علت نیز جالب بود؛ بیشتر داده‌های آموزشی اصلاً فاقد کلیک بودند و شبکه بیشتر یاد می‌گرفت «هیچ صدایی وجود ندارد» تا اینکه تفاوت میان نهنگ‌ها را درک کند.

این دقیقاً یکی از نمونه‌های کلاسیک تضاد اهداف در یادگیری چندوظیفه‌ای است.


راه‌حل نهایی، ساده‌تر اما هوشمندانه‌تر بود

نقطه عطف تحقیق زمانی رخ داد که پژوهشگر تصمیم گرفت دو مسئله را از هم جدا کند.

به جای اینکه مدل هم‌زمان چند کار انجام دهد، یک شبکه عصبی فقط روی شناسایی هویت نهنگ‌ها آموزش داده شد و تنها کلیک‌های واقعی وارد آن شدند.

نتیجه چشمگیر بود.

دقت مدل نسبت به روش‌های قبلی افزایش قابل توجهی پیدا کرد و توانست نهنگ اصلی و سایر نهنگ‌ها را با موفقیت بیشتری از یکدیگر تفکیک کند.

گاهی بهترین راه‌حل، افزودن پیچیدگی نیست؛ بلکه حذف پیچیدگی‌های غیرضروری است.


یادگیری تقابلی؛ روشی که به هوش مصنوعی «شباهت» را یاد می‌دهد

یکی از جذاب‌ترین بخش‌های این پایان‌نامه استفاده از یادگیری تقابلی (Supervised Contrastive Learning) است.

در این روش، مدل به جای حفظ کردن برچسب‌ها، یاد می‌گیرد نمونه‌هایی که متعلق به یک نهنگ هستند را در فضای ویژگی‌ها به هم نزدیک کند و نمونه‌های متعلق به نهنگ‌های مختلف را از هم دور نگه دارد.

این دقیقاً همان روشی است که امروز در بسیاری از سامانه‌های تشخیص چهره، تشخیص گوینده و بازیابی تصاویر نیز استفاده می‌شود.

به همین دلیل، این تحقیق تنها برای زیست‌شناسی ارزشمند نیست؛ بلکه نمونه‌ای جالب از کاربرد روش‌های مدرن هوش مصنوعی در علوم طبیعی محسوب می‌شود.


این پروژه فقط درباره نهنگ‌ها نیست

شاید مهم‌ترین پیام این تحقیق همین باشد.

اگر بتوان مکالمات نهنگ‌های عنبر را به‌صورت خودکار تحلیل کرد، همین چارچوب می‌تواند برای گونه‌های دیگری مانند دلفین‌ها، پرندگان، خفاش‌ها و حتی سایر جانوران اجتماعی نیز توسعه پیدا کند.

به بیان دیگر، این پایان‌نامه تنها یک پروژه پردازش صوت نیست؛ بلکه گامی در مسیر ساخت ابزارهایی است که شاید روزی بتوانند زبان گونه‌های مختلف جانوری را بهتر از همیشه مطالعه کنند.


آینده‌ای که شاید دور نباشد

پژوهشگر معتقد است با افزایش حجم داده‌ها، استفاده از مدل‌های عمیق‌تر، الگوریتم‌های خوشه‌بندی پیشرفته‌تر و مدل‌های ترنسفورمر، دقت این سامانه‌ها باز هم افزایش خواهد یافت.

هدف نهایی، ساخت سامانه‌ای کاملاً خودکار است که فایل خام صوتی را دریافت کند و بدون دخالت انسان، مکالمه نهنگ‌ها را به داده‌ای ساختاریافته و آماده تحلیل تبدیل کند.

این تنها یک پیشرفت فنی نیست؛ بلکه پلی میان علوم رایانه، زیست‌شناسی، زبان‌شناسی و علوم شناختی است.


جمع‌بندی

شاید هنوز تا روزی که بتوانیم معنای واقعی «گفت‌وگوی نهنگ‌ها» را بفهمیم فاصله داشته باشیم، اما این پژوهش نشان می‌دهد که نخستین قدم‌ها با سرعت در حال برداشته شدن هستند. هوش مصنوعی امروز یاد گرفته است که تشخیص دهد «چه کسی صحبت می‌کند» و شاید فردا بتواند پاسخ دهد که «درباره چه چیزی صحبت می‌شود».

و این سؤال همچنان ذهن را درگیر می‌کند:

اگر روزی بتوانیم زبان نهنگ‌ها را بفهمیم، آیا نگاه ما به هوش، ارتباط و حتی جایگاه انسان در طبیعت تغییر نخواهد کرد؟

 

بسیار سریع و ساده می توانید اصل این پایان نامه را به صورت فایل PDF در اختیار داشته باشید.

پس از دریافت پایان‌نامه، کلیه اطلاعات کتاب‌شناختی موردنیاز برای استناد علمی، از جمله نام دانشگاه، عنوان پایان‌نامه، نام پژوهشگر، سال دفاع و سایر مشخصات مرتبط، جهت ارجاع‌دهی صحیح مطابق با استانداردهای رایج، در اختیار شما قرار خواهد گرفت.