پژوهش پیشرو به بررسی کاربرد هوش مصنوعی در تحلیل گفتار برای تشخیص و پایش اختلالات شناختی میپردازد. با توجه به اینکه بیماریهایی مانند آلزایمر، زوال عقل فرونتوتمپورال و آفازی پیشرونده اولیه، تأثیرات عمیقی بر تواناییهای زبانی و صوتی افراد میگذارند، این مطالعه بر آن است تا روشی غیرتهاجمی، در دسترس و کمهزینه را جایگزین روشهای تشخیصی فعلی کند. روشهای رایج مانند تصویربرداری پت اسکن، هزینهبر و تهاجمی هستند، در حالی که تحلیل گفتار میتواند به عنوان یک ابزار غربالگری اولیه، نشانههای اولیه بیماری را شناسایی کرده و روند پیشرفت آن را پایش کند. هدف نهایی این پژوهش، کمک به بهبود فرایند تشخیص، طراحی کارآزماییهای بالینی مؤثرتر و در نهایت ارتقای کیفیت زندگی بیماران است.
در گام نخست، پژوهشگران به سراغ بیماری آلزایمر رفتند که شایعترین نوع دمانس در میان سالمندان است. با استفاده از مجموعه دادهای متعادل که از نظر سن و جنسیت تنظیم شده بود، مدلهای یادگیری ماشین بر روی ویژگیهای استخراجشده از گفتار آزاد افراد آموزش داده شدند. این ویژگیها شامل بردارهای کلمات، جاسازیهای عمیق زبانی و شاخصهای روانشناختی متن بودند. نتایج نشان داد که مدلهای مبتنی بر معماری برت، با دقتی بیش از ۸۵ درصد قادر به تشخیص بیماران از افراد سالم هستند. همچنین، مدلهای رگرسیونی توانستند نمرات آزمونهای شناختی را با خطای ریشه میانگین مربعات حدود ۴.۵ پیشبینی کنند که نشاندهنده همبستگی معنادار بین گفتار و شدت اختلال شناختی است.
یکی از چالشهای اساسی در این حوزه، کمبود دادههای گفتاری از بیماران است. برای رفع این مشکل، مجموعه دادهای جدید با عنوان «کورپوس ارزیابی زبان مبتنی بر جمعسپاری» گردآوری شد. این مجموعه شامل ضبطهای صوتی از بیش از هزار و هشتصد گوینده سالم از سراسر ایالات متحده و یازده کشور دیگر است. گویندگان وظایف متنوعی مانند توصیف تصاویر، خواندن متون، تکرار کلمات و شمارش اعداد را انجام دادند. این تنوع وظایف، امکان مطالعه ابعاد مختلف گفتار مانند روانی کلام، تلفظ و کیفیت تکرار را فراهم میکند. دادههای این مجموعه علاوه بر کمک به پژوهش فعلی، به صورت عمومی در دسترس محققان قرار گرفته است تا بتوانند از آن به عنوان دادههای پایه برای جمعیت سالم استفاده کنند.
در ادامه، پژوهش به یکی از زیرشاخههای آفازی پیشرونده اولیه به نام نوع لوگوپنیک پرداخته است که با اختلال در تکرار کلمات و جملهها شناخته میشود. روشهای سنتی ارزیابی تکرار، نیازمند حضور متخصص و زمانبر هستند. در این تحقیق، رویکردی نوین برای اندازهگیری خودکار کیفیت تکرار ارائه شده است که مستقل از زبان و محتوای کلام عمل میکند. این روش با تحلیل ماتریسهای خودفاصلهای و تبدیل فوریه بر روی سیگنال صوتی، الگوهای تکراری را شناسایی کرده و یک نمره عینی برای کیفیت تکرار محاسبه میکند. آزمایشها نشان داد که این رویکرد میتواند بیماران مبتلا به نوع لوگوپنیک را با دقت بیش از ۸۵ درصد از افراد سالم تشخیص دهد، که تأییدکننده کارایی آن در محیطهای بالینی است.
در بخش دیگری از این پژوهش، تلاش شده است تا انواع مختلف زوال عقل فرونتوتمپورال و آفازی پیشرونده اولیه از یکدیگر تفکیک شوند. این بیماریها شامل نوع لوگوپنیک، نوع معنایی، نوع ناروان و نوع رفتاری هستند که هرکدام الگوهای گفتاری متمایزی دارند. برای این منظور، از مدلهای پیشرفته جاسازی جمله مانند دیفسیای و ترنسانکودر استفاده شد. این مدلها که بر روی متون گسترده آموزش دیدهاند، توانستند تفاوتهای ظریف زبانی بین گروههای مختلف را شناسایی کنند. نتایج نشان داد که این مدلها با دقت بیش از ۹۰ درصد میتوانند هر یک از این زیرگروهها را از جمعیت سالم تشخیص دهند. همچنین مشخص شد که استفاده از سیستمهای بازشناسی گفتار خودکار مانند ویسپر، میتواند جایگزین مناسبی برای پیادهسازی دستی باشد و زمان و هزینه را به میزان قابل توجهی کاهش دهد.
آزمایشهای تکمیلی بر روی عواملی مانند حذف علائم نگارشی، کلمات پرکننده و گفتار مصاحبهگر انجام شد تا مشخص شود مدلهای هوش مصنوعی به چه جنبههایی از متن توجه میکنند. یافتهها نشان داد که علائم نگارشی و مکثهای کلامی، نقش مهمی در تشخیص برخی زیرگروهها دارند. به عنوان مثال، حذف علائم نگارشی از متون بیماران مبتلا به نوع لوگوپنیک، کاهش قابل توجهی در دقت تشخیص ایجاد کرد، در حالی که برای نوع ناروان، تأثیر چندانی نداشت. همچنین، حضور کلمات پرکننده مانند «ام» و «اوه» در تشخیص نوع رفتاری مؤثر بود. این مشاهدات نشان میدهد که مدلهای زبانی صرفاً به معنای لغوی کلمات توجه نمیکنند، بلکه به ساختار نحوی و ویژگیهای فرازبانی نیز حساس هستند و این ویژگیها را به نوعی در جاسازیهای خود رمزگذاری میکنند.
در مجموع، این پژوهش گامی مؤثر در جهت استفاده از هوش مصنوعی برای ارتقای سلامت انسان برداشته است. رویکردهای ارائه شده، پتانسیل بالایی برای کاربرد در محیطهای بالینی واقعی دارند و میتوانند به پزشکان در تشخیص زودهنگام، پایش پیشرفت بیماری و ارزیابی اثربخشی درمانها کمک کنند. با توجه به غیرتهاجمی و کمهزینه بودن روشهای مبتنی بر گفتار، انتظار میرود در آینده نزدیک، این ابزارها به بخشی جداییناپذیر از فرایند تشخیص و مدیریت بیماریهای شناختی تبدیل شوند. همچنین، توسعه و بهبود مجموعه دادههای گفتاری و بهکارگیری مدلهای زبانی چندزبانه، میتواند دامنه کاربرد این روشها را به سایر زبانها و جمعیتهای مختلف گسترش دهد و گامی مؤثر در جهت عدالت در سلامت باشد.
| سرفصل | شماره صفحه |
|---|---|
| مقدمه | ۳۱ |
| طبقهبندی بیماری آلزایمر از روی گفتار و متن | ۳۵ |
| پیکره زبانی ارزیابی جمعسپاری شده (CLAC) | ۶۱ |
| ارزیابی تکرار در اختلالات گفتار و زبان: مطالعهای بر روی نوع لوگوپنیک آفازی پیشرونده اولیه | ۷۳ |
| طبقهبندی آفازی پیشرونده اولیه و زوال عقل فرونتوتمپورال از روی گفتار | ۸۹ |
| نتیجهگیری | ۱۱۱ |
| پیوست: اطلاعات تکمیلی | ۱۱۷ |
| پیوست: تصاویر وظایف پلتفرم AMT (مکمل فصل ۳) | ۱۴۳ |
| پیوست: جداول کامل نتایج (مکمل فصل ۵) | ۱۵۵ |
| کتابنامه | ۱۷۵ |
چگونه هوش مصنوعی، رازهای پنهان در گفتار را برای تشخیص آلزایمر فاش میکند؟
تصور کنید روزی برسد که با ضبط چند دقیقه صحبت کردن، بتوانید از سلامت مغز خود مطمئن شوید. نیازی به آزمایشهای گرانقیمت، نمونهبرداری یا انتظار طولانی نباشد. این دقیقاً همان چیزی است که پژوهشگران حوزه هوش مصنوعی و گفتاردرمانی روی آن کار میکنند. اما سوال اصلی این است: آیا کامپیوتر واقعاً میتواند از لابهلای کلمات، نشانههای یک بیماری را پیدا کند؟ پاسخ، شگفتانگیز است.
وقتی مغز فراموش میکند، زبان لو میدهد
بیماریهای شناختی مانند آلزایمر، قبل از اینکه حافظه را هدف قرار دهند، روی الگوهای گفتاری اثر میگذارند. مکثهای طولانیتر، استفاده کمتر از کلمات خاص، یا تکرار عبارتهای تکراری، همگی زنگهای هشداری هستند که در دادههای صوتی ثبت میشوند. تحقیقات نشان داده که مدلهای زبانی پیشآموزشدیده مانند برت، میتوانند این تفاوتهای ظریف را با دقتی بالاتر از ۸۵ درصد شناسایی کنند. این یعنی سیستمی که فقط با متن سروکار دارد، میتواند تشخیص دهد که آیا گوینده به آلزایمر مبتلاست یا نه – بدون اینکه حتی یک بار اسم بیماری را شنیده باشد.
چالش بزرگی به نام «کمبود داده»
یکی از بزرگترین موانع در این مسیر، کمبود نمونههای گفتاری از بیماران است. برای حل این مشکل، پژوهشگران یک مجموعه داده عظیم از بیش از ۱۸۰۰ فرد سالم جمعآوری کردند. این مجموعه که با کمک پلتفرمهای جمعسپاری تهیه شده، شامل انواع وظایف گفتاری مانند توصیف تصویر، خواندن متن و تکرار کلمات است. نکته جالب اینجاست که حتی گفتار سالم هم میتواند اطلاعات ارزشمندی درباره تنوع طبیعی زبان در اختیار مدلها بگذارد و به آنها کمک کند تا بیماران را بهتر تشخیص دهند.
تکرار، آینهای از سلامت مغز
یکی از جذابترین بخشهای این پژوهش، ارائه روشی برای ارزیابی خودکار «کیفیت تکرار» است. آیا میدانستید که نحوه تکرار یک کلمه ساده مانند «فاجعه»، میتواند نشاندهنده نوع خاصی از آفازی باشد؟ روش ابداعی در این پژوهش، بدون نیاز به متن از پیشتعیینشده و مستقل از زبان، الگوهای تکراری در سیگنال صوتی را تحلیل میکند و نمره عینی به آن میدهد. آزمایشها نشان داد که این روش میتواند بیماران مبتلا به نوع لوگوپنیک آفازی را با دقت بیش از ۸۵ درصد از افراد سالم جدا کند. این یعنی یک ابزار بالینی قدرتمند که میتواند در کمترین زمان، نتیجهای قابل اتکا ارائه دهد.
آیندهای که از روی صدا ساخته میشود
شاید باورکردنی نباشد، اما سیستمهای بازشناسی گفتار امروزی مانند ویسپر، آنقدر دقیق شدهاند که میتوانند جایگزین پیادهسازی دستی متنها شوند. این یعنی فرایند تشخیص میتواند کاملاً خودکار شود و هزینهها را به شدت کاهش دهد. علاوه بر این، مدلهای هوش مصنوعی نشان دادهاند که به عواملی مانند نقطهگذاری، مکثها و کلمات پرکننده مانند «ام» و «اوه» هم حساس هستند. در واقع، این جزئیات کوچک هستند که گاهی بیشتر از کلمات اصلی، رازهای بیماری را فاش میکنند. با گسترش این فناوری، به زودی ممکن است گوشی همراه شما، اولین پزشک تشخیصدهنده آلزایمر باشد.
«تحلیل گفتار، دریچهای غیرتهاجمی به اعماق عملکرد مغز است که میتواند انقلابی در تشخیص زودهنگام بیماریهای عصبی ایجاد کند.»