ارتباطات صوتی جانوران همواره یکی از مهمترین و در عین حال پیچیدهترین موضوعات در حوزههای زیستشناسی، علوم شناختی، پردازش سیگنال و هوش مصنوعی بوده است. در میان گونههای مختلف، نهنگ عنبر (Sperm Whale) به دلیل برخورداری از ساختار ارتباطی بسیار پیچیده، رفتارهای اجتماعی پیشرفته و استفاده از الگوهای صوتی منظم موسوم به «کلیک» (Click) و «کودا» (Coda)، به عنوان یکی از بهترین گزینهها برای مطالعه زبان غیرانسانی شناخته میشود. پژوهشهای چند دهه اخیر نشان دادهاند که این جانوران از الگوهای صوتی متفاوت برای برقراری ارتباط، هماهنگی اجتماعی، انتقال اطلاعات و تعاملات گروهی استفاده میکنند. با وجود پیشرفتهای فراوان در ثبت دادههای صوتی، یکی از بزرگترین موانع پیش روی پژوهشگران، تبدیل حجم عظیم فایلهای صوتی خام به دادههای ساختاریافته و قابل تحلیل است؛ فرآیندی که تاکنون عمدتاً به صورت دستی انجام شده و نیازمند صرف زمان بسیار زیاد، نیروی انسانی متخصص و دقت بالا است.
مشکل اصلی که این پایاننامه به دنبال حل آن است، خودکارسازی فرآیند شناسایی هویت نهنگ تولیدکننده هر کلیک صوتی در مکالمات نهنگهای عنبر است. در روشهای سنتی، پژوهشگران باید ساعتها به فایلهای صوتی گوش دهند، محل وقوع هر کلیک را مشخص کنند، کلیکها را در قالب کوداها گروهبندی نمایند و در نهایت تشخیص دهند که هر کلیک توسط کدام نهنگ تولید شده است. این فرآیند علاوه بر زمانبر بودن، به شدت در معرض خطای انسانی قرار دارد و با افزایش حجم دادهها عملاً مقیاسپذیر نیست. از اینرو، توسعه سامانهای هوشمند که بتواند بدون دخالت انسان، هویت گوینده هر کلیک را تشخیص دهد، یکی از نیازهای اساسی تحقیقات نوین در حوزه زبان جانوران محسوب میشود.
هدف اصلی این پایاننامه طراحی و ارزیابی مدلی مبتنی بر یادگیری ماشین برای تفکیک هویت نهنگها در مکالمات صوتی است تا بتوان آن را در کنار سامانه تشخیص کلیک به یک سامانه کامل رونویسی خودکار مکالمات نهنگهای عنبر تبدیل کرد. چنین سامانهای میتواند دادههای خام صوتی را به اطلاعات ساختاریافته شامل زمان وقوع کلیک، گروهبندی کوداها و هویت هر نهنگ تبدیل کند و زمینه را برای تحلیلهای پیشرفتهتر درباره ساختار زبان، رفتار اجتماعی، الگوهای ارتباطی و حتی شناخت شناختی این گونه فراهم سازد.
در این پژوهش ابتدا پیشینه مطالعات مربوط به ارتباطات صوتی نهنگهای عنبر مرور شده است. تحقیقات گذشته نشان دادهاند که کلیکهای این جانوران دارای ساختارهای زمانی مشخص بوده و کوداها شباهتهایی با لهجهها و الگوهای زبانی انسان دارند. همچنین پژوهشهای جدید بیان میکنند که ساختار این پیامهای صوتی دارای ویژگیهای ترکیبی و وابسته به زمینه است؛ موضوعی که اهمیت استفاده از روشهای یادگیری ماشین و پردازش زبان طبیعی را برای تحلیل این دادهها افزایش داده است. این پایاننامه نیز در ادامه همین مسیر تحقیقاتی قرار گرفته و بخشی از چشمانداز بلندمدت پروژه رمزگشایی زبان نهنگهای عنبر را دنبال میکند.
دادههای مورد استفاده در این تحقیق شامل هزاران ساعت ضبط صوتی انجامشده در آبهای دومینیکا طی سالهای ۲۰۱۴ تا ۲۰۲۳ است. مجموعه داده شامل بیش از ۲۱ هزار کلیک استخراجشده از ۴۶ نمونه صوتی است که هر کلیک علاوه بر زمان وقوع، دارای برچسب هویت نهنگ و شماره کودا نیز میباشد. این دادهها به مجموعههای آموزش، اعتبارسنجی و آزمون تقسیم شدهاند تا عملکرد مدلها به صورت علمی ارزیابی شود.
برای حل مسئله، سه رویکرد مختلف طراحی و پیادهسازی شده است. نخستین روش، یک مدل مبتنی بر قواعد ابتکاری (Heuristic-Based) است که تلاش میکند تنها با استفاده از ویژگی دامنه یا شدت سیگنال صوتی، میان کلیکهای نهنگ نزدیک به میکروفون و سایر نهنگها تمایز ایجاد کند. فرض اولیه این بود که کلیکهای نهنگ دارای حسگر صوتی شدت بیشتری خواهند داشت؛ اما نتایج نشان داد به دلیل همپوشانی زیاد دامنه سیگنالها و تغییرات شرایط ضبط، این فرض در عمل کارایی کافی ندارد و مدل قادر به جداسازی دقیق هویت نهنگها نیست.
در گام دوم، پژوهش از یک مدل یادگیری عمیق استفاده میکند که فرآیند تشخیص کلیک و تشخیص هویت نهنگ را به صورت همزمان آموزش میدهد. در این معماری، ابتدا ویژگیهای صوتی توسط شبکه SoundNet استخراج شده و سپس به دو بخش مجزا برای تشخیص محل وقوع کلیک و شناسایی هویت نهنگ ارسال میشوند. برای آموزش بخش تشخیص هویت از یادگیری نظارتشده مبتنی بر یادگیری تقابلی (Supervised Contrastive Learning) استفاده شده است تا بردارهای ویژگی متعلق به یک نهنگ به یکدیگر نزدیک و نمونههای متعلق به نهنگهای مختلف از هم دور شوند. هرچند این مدل در تشخیص محل وقوع کلیک عملکرد بسیار مناسبی داشت، اما به دلیل عدم توازن دادهها، وجود حجم زیاد پنجرههای فاقد کلیک و تداخل اهداف آموزشی دو بخش مختلف شبکه، دقت قابل قبولی در شناسایی هویت نهنگها به دست نیاورد.
در سومین و مهمترین بخش پژوهش، معماری مدل بازطراحی شد و سامانه تشخیص هویت نهنگ به صورت مستقل از سامانه تشخیص کلیک آموزش داده شد. در این روش تنها پنجرههایی که واقعاً شامل کلیک بودند وارد شبکه شدند و مدل صرفاً بر یادگیری تفاوت میان گویندگان تمرکز کرد. همچنین برای جلوگیری از اشتباه در برچسبگذاری، هر دسته آموزشی تنها شامل دادههای یک مکالمه بود تا شناسه نهنگها در طول آموزش ثابت باقی بماند. خروجی مدل به صورت بردارهای ویژگی تولید شده و سپس با استفاده از الگوریتمهای خوشهبندی مانند Spectral Clustering و K-Means، هویت نهنگها تعیین شد.
نتایج آزمایشها نشان دادند که این روش نسبت به دو رویکرد قبلی پیشرفت قابل توجهی ایجاد کرده است. مدل مستقل توانست در تفکیک نهنگ اصلی و سایر نهنگها دقتی در حدود ۷۸ درصد و در شناسایی چند نهنگ مختلف نیز عملکردی به مراتب بهتر از مدلهای پیشین ارائه دهد. تحلیل نتایج نشان میدهد که حذف وابستگی به فرآیند تشخیص کلیک و تمرکز کامل بر یادگیری ویژگیهای گوینده، مهمترین عامل افزایش دقت مدل بوده است.
علاوه بر ارائه یک مدل جدید، این پایاننامه دلایل موفقیت و شکست هر یک از روشهای پیشنهادی را نیز تحلیل میکند. نویسنده نشان میدهد که محدودیت حجم داده، تفاوت شرایط ضبط، تغییر تعداد نهنگها در مکالمات مختلف و شباهت ویژگیهای صوتی میان برخی افراد از مهمترین عوامل کاهش دقت مدل هستند. همچنین پیشنهاد میشود در تحقیقات آینده از مجموعه دادههای بزرگتر، معماریهای عمیقتر، الگوریتمهای خوشهبندی پیشرفتهتر و مدلهای مبتنی بر ترنسفورمر برای استفاده از اطلاعات زمانی و زمینهای مکالمات بهره گرفته شود.
در مجموع، این پایاننامه گامی مؤثر در مسیر توسعه سامانههای هوشمند رونویسی خودکار مکالمات نهنگهای عنبر محسوب میشود. دستاورد اصلی آن ارائه روشی کارآمد برای شناسایی هویت گویندگان در دادههای صوتی است که میتواند سرعت تولید دادههای برچسبگذاریشده را به طور چشمگیری افزایش دهد و امکان تحلیلهای گستردهتر در زمینه زبان، رفتار اجتماعی و شناخت جانوران را فراهم سازد. افزون بر این، چارچوب ارائهشده محدود به نهنگهای عنبر نیست و میتواند در آینده برای مطالعه ارتباطات صوتی سایر گونههای جانوری نیز توسعه یابد. این پژوهش در نهایت پلی میان یادگیری ماشین، پردازش سیگنال، زیستشناسی دریایی و علوم شناختی ایجاد کرده و گامی مهم در مسیر فهم زبان گونههای غیرانسانی و توسعه سامانههای هوشمند تحلیل ارتباطات طبیعی به شمار میآید.
در صورت نیاز، میتوانم این چکیده را به سبک پایاننامههای فارسی دانشگاههای ایران (حدود ۱۲۰۰ تا ۱۵۰۰ کلمه با لحن کاملاً آکادمیک) نیز بازنویسی کنم.
فهرست مطالب
| سرفصل | شماره صفحه |
|---|---|
| صفحه عنوان | 1 |
| چکیده | 3 |
| قدردانی | 5 |
| فصل اول: مقدمه | 13 |
| 1-1. مفاهیم کلیدی و اصطلاحات (Key Concepts and Terminology) | 15 |
| 1-2. پژوهشهای مرتبط (Related Work) | 18 |
| 1-3. مجموعه دادهها (Dataset) | 19 |
| فصل دوم: سامانه تفکیک هویت نهنگ (Whale-Identity Separator) | 21 |
| 2-1. فرایند برچسبگذاری دستی (Manual Annotation Pipeline) | 22 |
| 2-2. معیارهای ارزیابی (Evaluation Measures) | 23 |
| 2-3. سامانه تفکیک هویت نهنگ مبتنی بر قواعد ابتکاری (Heuristic-Based Whale-Identity Separator) | 26 |
| 2-3-1. معماری مدل (Architecture) | 26 |
| 2-3-2. نتایج | 29 |
| 2-4. تشخیص همزمان کلیک همراه با سامانه تفکیک هویت نهنگ (Joint Click Detection with Whale Separator) | 32 |
| 2-4-1. معماری مدل (Architecture) | 32 |
| 2-4-2. نتایج | 37 |
| 2-5. سامانه مستقل تفکیک هویت نهنگ (Isolated Whale-Identity Separator) | 42 |
| 2-5-1. معماری مدل (Architecture) | 42 |
| 2-5-2. نتایج | 45 |
| 2-6. مقایسه میان رویکردهای پیشنهادی (Comparison Between Approaches) | 51 |
| فصل سوم: کارهای آینده (Future Work) | 53 |
| فصل چهارم: نتیجهگیری (Conclusion) | 55 |
| منابع | 57 |
آیا روزی زبان نهنگها را خواهیم فهمید؟ هوش مصنوعی یک قدم بزرگ به رمزگشایی مکالمات نهنگهای عنبر نزدیکتر شد!
تصور کنید بتوانید به گفتوگوی دو نهنگ در اعماق اقیانوس گوش دهید و بفهمید هر کدام چه میگویند. تا چند سال پیش این ایده بیشتر شبیه داستانهای علمیتخیلی بود، اما امروز هوش مصنوعی در حال نزدیک کردن ما به چنین رؤیایی است. البته پیش از آنکه بتوان معنای پیامهای نهنگها را فهمید، باید یک سؤال بسیار مهم پاسخ داده شود: چه کسی در حال صحبت کردن است؟
همین سؤال، محور اصلی یکی از جذابترین پژوهشهای اخیر در حوزه یادگیری ماشین، پردازش سیگنال و زیستشناسی دریایی است. در ادامه با مهمترین و شگفتانگیزترین نکات این تحقیق آشنا میشویم.
اولین مانع، فهمیدن گوینده است نه معنی پیام
وقتی انسانها با هم صحبت میکنند، معمولاً بدون فکر کردن تشخیص میدهیم که هر جمله را چه کسی گفته است. اما در مکالمات نهنگهای عنبر چنین کاری بسیار دشوار است.
صدها ساعت فایل صوتی از نهنگها وجود دارد که در آن چندین نهنگ همزمان کلیکهای صوتی تولید میکنند. پژوهشگران تاکنون مجبور بودند این فایلها را به صورت دستی گوش دهند، زمان هر کلیک را ثبت کنند و سپس حدس بزنند هر صدا متعلق به کدام نهنگ بوده است.
این فرایند ساعتها زمان میبرد و احتمال خطا نیز بسیار زیاد است. بنابراین اگر قرار باشد روزی زبان نهنگها رمزگشایی شود، نخست باید این مرحله کاملاً خودکار شود.
هوش مصنوعی قرار نیست زبان نهنگها را ترجمه کند؛ فعلاً فقط گوینده را پیدا میکند
شاید تصور کنید این پروژه به دنبال ترجمه صحبتهای نهنگهاست، اما واقعیت کمی متفاوت است.
هدف این پایاننامه ساخت مدلی است که بتواند از روی صدای ثبتشده تشخیص دهد هر «کلیک» توسط کدام نهنگ تولید شده است. این مرحله درست مانند این است که قبل از رونویسی یک جلسه، ابتدا مشخص کنیم هر جمله متعلق به کدام سخنران بوده است.
شاید این کار ساده به نظر برسد، اما در عمل یکی از سختترین مراحل تحلیل ارتباطات جانوران محسوب میشود.
اولین ایده بسیار منطقی بود؛ اما تقریباً شکست خورد!
محقق ابتدا فرض کرد نهنگی که به میکروفون نزدیکتر است، صدای بلندتری تولید میکند. بنابراین شاید بتوان فقط با اندازهگیری شدت صدا، گوینده را تشخیص داد.
روی کاغذ، ایده بسیار منطقی بود.
اما دادههای واقعی چیز دیگری نشان دادند. شدت صدای نهنگهای مختلف آنقدر روی هم همپوشانی داشت که این روش تقریباً هیچ برتری نسبت به حدس زدن نداشت.
این بخش یادآوری میکند که طبیعت معمولاً از آنچه تصور میکنیم پیچیدهتر است و راهحلهای ساده همیشه جواب نمیدهند.
وقتی دو هوش مصنوعی همزمان آموزش دیدند، نتیجه بهتر نشد
در مرحله بعد، پژوهشگر تصمیم گرفت دو وظیفه را همزمان به یک شبکه عصبی بسپارد:
- تشخیص زمان وقوع کلیک
- تشخیص هویت نهنگ
در نگاه اول، این کار باید باعث یادگیری بهتر میشد؛ اما نتیجه برعکس بود.
مدل در تشخیص محل کلیکها عملکرد بسیار خوبی داشت، اما هنگام تشخیص هویت نهنگها دچار سردرگمی میشد. علت نیز جالب بود؛ بیشتر دادههای آموزشی اصلاً فاقد کلیک بودند و شبکه بیشتر یاد میگرفت «هیچ صدایی وجود ندارد» تا اینکه تفاوت میان نهنگها را درک کند.
این دقیقاً یکی از نمونههای کلاسیک تضاد اهداف در یادگیری چندوظیفهای است.
راهحل نهایی، سادهتر اما هوشمندانهتر بود
نقطه عطف تحقیق زمانی رخ داد که پژوهشگر تصمیم گرفت دو مسئله را از هم جدا کند.
به جای اینکه مدل همزمان چند کار انجام دهد، یک شبکه عصبی فقط روی شناسایی هویت نهنگها آموزش داده شد و تنها کلیکهای واقعی وارد آن شدند.
نتیجه چشمگیر بود.
دقت مدل نسبت به روشهای قبلی افزایش قابل توجهی پیدا کرد و توانست نهنگ اصلی و سایر نهنگها را با موفقیت بیشتری از یکدیگر تفکیک کند.
گاهی بهترین راهحل، افزودن پیچیدگی نیست؛ بلکه حذف پیچیدگیهای غیرضروری است.
یادگیری تقابلی؛ روشی که به هوش مصنوعی «شباهت» را یاد میدهد
یکی از جذابترین بخشهای این پایاننامه استفاده از یادگیری تقابلی (Supervised Contrastive Learning) است.
در این روش، مدل به جای حفظ کردن برچسبها، یاد میگیرد نمونههایی که متعلق به یک نهنگ هستند را در فضای ویژگیها به هم نزدیک کند و نمونههای متعلق به نهنگهای مختلف را از هم دور نگه دارد.
این دقیقاً همان روشی است که امروز در بسیاری از سامانههای تشخیص چهره، تشخیص گوینده و بازیابی تصاویر نیز استفاده میشود.
به همین دلیل، این تحقیق تنها برای زیستشناسی ارزشمند نیست؛ بلکه نمونهای جالب از کاربرد روشهای مدرن هوش مصنوعی در علوم طبیعی محسوب میشود.
این پروژه فقط درباره نهنگها نیست
شاید مهمترین پیام این تحقیق همین باشد.
اگر بتوان مکالمات نهنگهای عنبر را بهصورت خودکار تحلیل کرد، همین چارچوب میتواند برای گونههای دیگری مانند دلفینها، پرندگان، خفاشها و حتی سایر جانوران اجتماعی نیز توسعه پیدا کند.
به بیان دیگر، این پایاننامه تنها یک پروژه پردازش صوت نیست؛ بلکه گامی در مسیر ساخت ابزارهایی است که شاید روزی بتوانند زبان گونههای مختلف جانوری را بهتر از همیشه مطالعه کنند.
آیندهای که شاید دور نباشد
پژوهشگر معتقد است با افزایش حجم دادهها، استفاده از مدلهای عمیقتر، الگوریتمهای خوشهبندی پیشرفتهتر و مدلهای ترنسفورمر، دقت این سامانهها باز هم افزایش خواهد یافت.
هدف نهایی، ساخت سامانهای کاملاً خودکار است که فایل خام صوتی را دریافت کند و بدون دخالت انسان، مکالمه نهنگها را به دادهای ساختاریافته و آماده تحلیل تبدیل کند.
این تنها یک پیشرفت فنی نیست؛ بلکه پلی میان علوم رایانه، زیستشناسی، زبانشناسی و علوم شناختی است.
جمعبندی
شاید هنوز تا روزی که بتوانیم معنای واقعی «گفتوگوی نهنگها» را بفهمیم فاصله داشته باشیم، اما این پژوهش نشان میدهد که نخستین قدمها با سرعت در حال برداشته شدن هستند. هوش مصنوعی امروز یاد گرفته است که تشخیص دهد «چه کسی صحبت میکند» و شاید فردا بتواند پاسخ دهد که «درباره چه چیزی صحبت میشود».
و این سؤال همچنان ذهن را درگیر میکند:
اگر روزی بتوانیم زبان نهنگها را بفهمیم، آیا نگاه ما به هوش، ارتباط و حتی جایگاه انسان در طبیعت تغییر نخواهد کرد؟
بسیار سریع و ساده می توانید اصل این پایان نامه را به صورت فایل PDF در اختیار داشته باشید.