این پایاننامه یک سیستم آموزشی تعاملی و چندوجهی را معرفی میکند که با ترکیب متن، تصویر و تعامل گرافیکی، به دانشآموزان در حل مسائل ریاضی و استدلال بصری کمک میکند. ایده اصلی این است که یادگیری مؤثر، بهویژه در موضوعاتی مانند هندسه، توابع و نمودارها، تنها با متن و زبان بهدست نمیآید؛ بلکه نیازمند دیدن، ترسیم، اشاره و تعامل با مفاهیم است. سیستم توسعهیافته در این پژوهش، با نام «دفترچه تعاملی» (Interactive Sketchpad)، از مدلهای بزرگ چندوجهی (LMMs) استفاده میکند تا همزمان با درک ورودیهای متنی و تصویری، راهنماییهای گامبهگام و نمودارهای بصری تولید کند. این سیستم بهجای ارائه مستقیم پاسخ نهایی، دانشآموز را به سمت کشف مستقل راهحل هدایت میکند. برخلاف بسیاری از سیستمهای آموزش هوشمند که تنها بر متن تکیه دارند و پاسخ را مستقیماً در اختیار کاربر قرار میدهند، این سیستم تلاش میکند فرایند یادگیری فعال و استدلال مستقل را تقویت کند. هدف نهایی این است که هوش مصنوعی در آموزش، نه بهعنوان یک ماشین پاسخدهی، بلکه بهعنوان یک همکار بصری و تعاملی عمل کند که به درک عمیقتر مفاهیم کمک میرساند.
پیشینه پژوهش نشان میدهد که انسانها بهطور طبیعی برای درک مفاهیم انتزاعی از ژست، ترسیم و ابزارهای بصری استفاده میکنند. در آموزش ریاضی، نمودارها و ترسیمها نقش کلیدی در درک روابط فضایی و مفاهیم نظری دارند. پژوهشهای قبلی نشان دادهاند که دانشآموزانی که با artifacts بصری درگیر میشوند، درک عمیقتری از مفاهیم پیدا میکنند. با این حال، بسیاری از سیستمهای آموزش هوشمند موجود، عمدتاً متنی هستند و پاسخ را مستقیماً ارائه میدهند که میتواند فرایند یادگیری فعال و استدلال مستقل را مختل کند. سیستمهای آموزشی چندوجهی مانند Desmos و GeoGebra نشان دادهاند که visuals پویا میتوانند درک ریاضی و استدلال فضایی را بهبود بخشند، اما بیشتر این سیستمها فاقد توانایی درک عمیق و پاسخ هوشمندانه به ورودیهای متنوع هستند. این پژوهش با بهرهگیری از پیشرفتهای اخیر در مدلهای چندوجهی، به دنبال پر کردن این شکاف است تا تجربه یادگیری را طبیعیتر، تعاملیتر و مؤثرتر سازد.
مدلهای بزرگ چندوجهی (LMMs) توانایی پردازش همزمان انواع دادهها مانند متن، تصویر، صدا و ویدیو را دارند. این مدلها معمولاً از یک رمزگذار بصری برای تبدیل تصاویر به embedding، یک مدل زبانی برای پردازش مشترک متن و embeddingهای بصری، و یک مکانیزم fusion چندوجهی برای یکپارچهسازی اطلاعات بصری و متنی تشکیل شدهاند. یکی از قابلیتهای مهم این مدلها، یادگیری درونزمینه (in-context learning) است که به آنها اجازه میدهد بدون بهروزرسانی وزنها، وظایف جدید را با چند مثال در prompt انجام دهند. این انعطافپذیری، آنها را برای کاربردهای آموزشی که تعریف وظایف میتواند بهسرعت تغییر کند، بسیار مفید میسازد. برخی از LMMها حتی قادر به تولید تصویر بهعنوان بخشی از خروجی خود هستند که میتواند برای توضیح، بازخورد و درک مفهومی استفاده شود. نمونههای شاخص این مدلها شامل GPT-4o، Gemini 1.5، Qwen-VL و Llama هستند.
روششناسی این پژوهش در دو مرحله اصلی توسعه یافته است. در مراحل اولیه، دو رویکرد مورد آزمایش قرار گرفت: یکی استفاده از ژستهای دستی برای تعامل با تخته سفید و دیگری تولید تصاویر با مدلهای متنبهتصویر مانند DALL-E و Stable Diffusion. در رویکرد اول، یک رابط بینایی با OpenCV پیادهسازی شد که حرکات آزاد دست را بهصورت فریمهای ویدیویی ضبط میکرد و سپس با استفاده از یک مدل CNN مبتنی بر TensorFlow، شکلها را طبقهبندی میکرد. اگرچه دقت طبقهبندی ۹۵٪ بود، اما تنوع حرکات کاربران و ناسازگاریهای کوچک در ترتیب strokeها منجر به شناسایی نادرست شکلها میشد. به همین دلیل، تفسیر ژست در نسخه نهایی سیستم غیرفعال شد. در رویکرد دوم، اگرچه کیفیت زیباییشناختی خروجیهای متنبهتصویر بالا بود، اما دقت معنایی نمودارهای تولیدشده ناسازگار بود. بهعنوان مثال، در یک نمودار هندسی دایره با مثلث متساویالساقین محاطی، نقطه C روی محیط دایره قرار نمیگرفت، خط مماس ناهمتراز بود و زاویه CDE نادرست ترسیم شده بود. علاوه بر این، این نمودارها بهراحتی قابل تفسیر یا ویرایش توسط سیستم نبودند و ادغام آنها در حلقه بازخورد چندوجهی را دشوار میکردند. در نتیجه، سیستم نهایی از تولید کد پایتون برای ترسیم نمودارهای دقیق با کتابخانههایی مانند Matplotlib و Numpy استفاده میکند که کنترل کامل بر مختصات، برچسبها و روابط هندسی را ممکن میسازد.
سیستم «دفترچه تعاملی» از چند بخش اصلی تشکیل شده است. نخست، تحلیل مسئله: سیستم ورودی کاربر (متن، تصویر یا هر دو) را بررسی میکند و با استفاده از مدل GPT-4o تعیین میکند که آیا یک نمودار بصری میتواند به درک بهتر کمک کند یا خیر. این مرحله ضروری است زیرا همه مسائل از visuals بهره نمیبرند و در برخی موارد، نمودار میتواند مانع باشد. بهعنوان مثال، حل یک انتگرال میتواند از تجسم فضای زیر نمودار تابع بهره ببرد، اما حل یک دستگاه معادلات ممکن است نیاز چندانی به visual نداشته باشد. دوم، تولید مصنوع بصری: در صورت نیاز، سیستم کد پایتون مناسب برای ترسیم نمودار تولید میکند و با استفاده از OpenAI Code Interpreter آن را اجرا میکند. اگر کد با خطا مواجه شود، مدل بهصورت تکراری کد را اصلاح میکند تا visualization موفقیتآمیزی تولید شود. سوم، تولید راهنمای متنی: سیستم با درک پیشرفت کاربر، راهنماییهای کوتاه و گامبهگام ارائه میدهد که بر پاسخهای قبلی بنا میشوند و کاربر را به سمت حل مسئله هدایت میکنند. این راهنماها بهگونهای طراحی شدهاند که پاسخ نهایی را مستقیماً فاش نکنند و کاربر را به تفکر وادارند. چهارم، تعامل با تخته سفید: کاربر میتواند روی یک تخته سفید دیجیتال یادداشتبرداری، ترسیم و علامتگذاری کند و سیستم از این ورودیها برای درک بهتر وضعیت دانشآموز استفاده میکند. رابط چتبات نیز برای تعامل متنی و تصویری در دسترس است.
برای ارزیابی اثربخشی سیستم، آزمایشهایی روی مجموعهداده استاندارد IsoBench انجام شد که شامل مسائل الگوریتمی، توابع ریاضی و مسائل علمی است. هر مثال آزمایشی شامل یک جفت نمایش تصویری و یک نمایش متنی جایگزین است. معیار اصلی ارزیابی، دقت دقیق (exact accuracy) بود که درصد سوالاتی را محاسبه میکند که مدل پاسخ نهایی صحیح را输出 میدهد. نتایج نشان داد که «دفترچه تعاملی» با ترکیب استدلال بصری و اجرای کد، دقت بالاتری نسبت به مدل پایه GPT-4o و سیستم Visual Sketchpad دارد. بهعنوان مثال، در مسائل مربوط به حداکثر جریان (Maxflow)، دقت سیستم به ۱۰۰٪ رسید، در حالی که GPT-4o تنها ۲۵٪ و Visual Sketchpad ۶۶.۳٪ دقت داشتند. در مسائل Isomorphism، دقت سیستم ۷۵٪ بود در مقابل ۵۰.۸٪ برای GPT-4o و ۶۵.۳٪ برای Visual Sketchpad. در مسائل Connectivity، Convexity و Parity نیز سیستم بهترتیب دقت ۹۹.۲٪، ۹۶.۵٪ و ۹۵.۶٪ را کسب کرد که در همه موارد بالاتر از baselineها بود. این بهبود نشان میدهد که ترکیب محاسبات دقیق با درک بصری، خطاهای ناشی از محاسبات ذهنی مدلهای زبانی را کاهش میدهد و پاسخها را قابلاعتمادتر میسازد.
علاوه بر آزمایشهای کمی، یک مطالعه کاربری با ۱۵ دانشجوی کارشناسی از یک مجموعه موضوعی دانشگاهی انجام شد. شرکتکنندگان در جبر و هندسه مهارت داشتند اما در همه حوزههای ریاضی متخصص نبودند. هر شرکتکننده چهار مسئله ریاضی را در شرایط مختلف حل کرد: سوال ۱ بهعنوان تمرین با سیستم، سوال ۲ بهعنوان آزمون بدون ابزار برای سنجش انتقال یادگیری، سوال ۳ بهعنوان تمرین بدون ابزار برای موضوع جدید، و سوال ۴ بهعنوان آزمون بدون ابزار برای همان موضوع جدید. این طراحی به شرکتکنندگان اجازه میداد تا بهعنوان کنترل خود عمل کنند و اثرات یادگیری را با کمترین تأثیر تفاوتهای فردی تفسیر کنند. پس از جلسه حل مسئله، شرکتکنندگان یک پرسشنامه پس از مطالعه شامل موارد Likert و سوالات باز را تکمیل کردند. نتایج کیفی نشان داد که کاربران visualizationها را برای درک مفهومی بسیار مفید میدانستند و از اینکه سیستم پاسخ را مستقیماً ارائه نمیدهد و آنها را به تفکر وامیدارد، قدردانی کردند. یکی از شرکتکنندگان گفت: «نمودارها به من کمک کرد تا فراتر از معادلات، درک مفهومی بهتری پیدا کنم.» دیگری گفت: «دوست داشتم که مرا از طریق رویکرد حل مسئله راهنمایی میکند بدون اینکه مستقیم به پاسخ بپرد، مثل ChatGPT.» شرکتکنندگان اظهار داشتند که این ابزار فرایند یادگیری آنها را داربستبندی میکند و تفکر فعال را بهجای مصرف منفعل تشویق میکند.
نتایج کمی نیز رضایت بالای کاربران را نشان داد. میانگین امتیاز intuitive بودن رابط ۴.۷۱ از ۵، پاسخدهی سیستم ۴.۴۳، وضوح visuals ۴.۵۷، دقت visuals ۴.۷۱ و اثربخشی راهنماها ۴.۵۷ بود. بالاترین امتیازها مربوط به intuitive بودن ابزار و دقت کمکهای بصری تولیدشده بود. امتیاز کمی پایینتر پاسخدهی سیستم نشاندهنده پتانسیل بهینهسازی در کاهش تأخیر سیستم، بهویژه در تولید راهنماها یا پاسخهای مبتنی بر ترسیم است. این امتیازات ارزش بازخورد چندوجهی در زمینههای آموزشی را تأیید میکند و رضایت بالای کاربران از «دفترچه تعاملی» بهعنوان یک همراه یادگیری را نشان میدهد. در مجموع، یافتههای کیفی و کمی نشان میدهد که سیستم در ارائه تجربه یادگیری بصری و تعاملی دلپذیر عملکرد قوی داشته است.
در بخش کارهای آینده، دو جهت اصلی پیشنهاد شده است. نخست، بهبود دقت visualizationها از طریق یادگیری تقویتی: با وجود کنترل کد، گاهی مدل مقادیر را بهصورت hard-code وارد میکند که منجر به ناهمترازی نقاط روی نمودار میشود. بهعنوان مثال، در یک نمودار دایره، اگر شعاع بهصورت متغیر تنظیم شود و حاشیهنویسیها نسبت به نقاط دادهشده باشند، visualization دقیق خواهد بود؛ اما اگر شعاع به ۱۰۰ hard-code شود و حاشیهنویسیها ثابت باشند، نقاط روی دایره ناهمتراز میشوند. استفاده از یادگیری تقویتی و راستیآزمایی بصری میتواند کیفیت نمودارها را قبل از ارائه به دانشآموز تضمین کند. اگر تصویر معیوب باشد، کل تجربه یادگیری تضعیف میشود، زیرا نمودارها برای درک مفاهیم انتزاعی حیاتی هستند. دوم، ارزیابی تأثیر بلندمدت از طریق مطالعه طولی: برای سنجش ماندگاری دانش و انتقال آن به مسائل جدید، باید دانشآموزان را در طول یک ترم تحصیلی دنبال کرد و پیشرفت آنها را با گروه کنترل مقایسه نمود. این مطالعه میتواند شامل آزمونهای تشخیصی قبل و بعد، تحلیل تعاملات، و مصاحبههای نگهداری باشد. معیارهای ثانویه مانند اعتماد به نفس دانشآموز، نگرش به مسائل ناآشنا و توانایی انتقال دانش به مسائل جدید نیز میتوانند بررسی شوند. پژوهشهای قبلی نشان دادهاند که توضیحات بصری و کاوش فعال میتوانند انعطافپذیری در حل مسئله و مهارتهای شناختی را تقویت کنند. فرضیه این است که «دفترچه تعاملی» این ویژگیها را مؤثرتر از ابزارهای متنی یا منفعل پرورش میدهد. در مجموع، این پایاننامه نشان میدهد که سیستمهای چندوجهی میتوانند نقش هوش مصنوعی در آموزش را از یک پاسخدهنده صرف، به یک همکار بصری و تعاملی تغییر دهند که استدلال عمیقتر و یادگیری معنادارتر را پرورش میدهد.
| فهرست مطالب | شماره صفحه |
|---|---|
| ۱ مقدمه | ۱۳ |
| ۱.۱ پیشینه | ۱۳ |
| ۱.۱.۱ تعاملات بصری و چندوجهی در استدلال انسانی | ۱۳ |
| ۱.۱.۲ سیستمهای آموزشی هوشمند (Intelligent Tutoring Systems) | ۱۴ |
| ۱.۱.۳ پیشرفتها در مدلهای بزرگ چندوجهی (Large Multimodal Models) | ۱۵ |
| ۱.۲ کارهای مرتبط | ۱۶ |
| ۱.۲.۱ رابطهای آموزشی چندوجهی | ۱۶ |
| ۱.۲.۲ مصورسازی از طریق تولید کد | ۱۶ |
| ۱.۲.۳ زنجیره تفکر بصری (Visual Chain-of-Thought) | ۱۷ |
| ۲ روشها | ۱۹ |
| ۲.۱ روشهای اولیه | ۱۹ |
| ۲.۱.۱ وجه اشتراکی ژست (Gesture Modality) | ۱۹ |
| ۲.۱.۲ تولیدات مدل متنبهتصویر (Text-to-Image Model Generations) | ۲۰ |
| ۲.۲ دفترچه تعاملی (Interactive Sketchpad) | ۲۲ |
| ۲.۲.۱ تحلیل مسئله (Problem Analysis) | ۲۲ |
| ۲.۲.۲ تولید مصنوع بصری (Visual Artifact Generation) | ۲۴ |
| ۲.۲.۳ تولید راهنمای متنی (Textual Hint Generation) | ۲۴ |
| ۲.۲.۴ تعامل با تخته سفید (Whiteboard Interaction) | ۲۶ |
| ۳ آزمایشها و نتایج مطالعات کاربری | ۲۹ |
| ۳.۱ آزمایشها | ۲۹ |
| ۳.۱.۱ تنظیمات آزمایش (Experimental Setup) | ۳۰ |
| ۳.۱.۲ خطوط پایه و پیکربندی دفترچه تعاملی | ۳۰ |
| ۳.۱.۳ معیارهای ارزیابی و نتایج | ۳۱ |
| ۳.۱.۴ تحلیل کیفی | ۳۱ |
| ۳.۲ مطالعات کاربری | ۳۲ |
| ۳.۲.۱ اهداف مطالعه | ۳۲ |
| ۳.۲.۲ شرکتکنندگان | ۳۳ |
| ۳.۲.۳ شرایط آزمایشی و طراحی وظیفه | ۳۳ |
| ۳.۲.۴ نتایج و تحلیل کیفی | ۳۵ |
| ۳.۲.۵ نتایج و تحلیل کمی | ۳۶ |
| ۴ کارهای آینده | ۳۷ |
| ۴.۱ بهبود دقت مصورسازی از طریق یادگیری تقویتی (Reinforcement Learning) | ۳۷ |
| ۴.۲ ارزیابی تأثیر بلندمدت از طریق مطالعه طولی کاربر | ۳۹ |
| ۵ نتیجهگیری | ۴۱ |
| پیوست الف: پرامپتها (Prompts) | ۴۳ |
| الف.۱ پرامپت سیستم راهنما و تولید با استفاده از کد | ۴۳ |
| الف.۲ پرامپت سیستم حل مستقیم مسئله | ۴۵ |
| الف.۳ پرامپت پانویس IsoBench | ۴۶ |
| منابع | ۴۷ |
وقتی هوش مصنوعی بهجای جواب دادن، یاد میدهد فکر کنیم!
تصور کنید در حال حل یک مسئله هندسی هستید و از هوش مصنوعی کمک میخواهید. انتظار دارید چه چیزی دریافت کنید؟ یک پاسخ آماده و نهایی؟ یا یک راهنمای گامبهگام که شما را به سمت کشف راهحل هدایت کند؟ بیشتر سیستمهای امروزی پاسخ را مستقیم تحویل میدهند و همین موضوع باعث میشود فرایند یادگیری و تفکر مستقل کاربر مختل شود. اما پژوهشی جدید نشان میدهد ترکیب متن، تصویر و تعامل گرافیکی میتواند این معادله را کاملاً تغییر دهد.
چرا یادگیری فقط با متن کافی نیست؟
انسانها بهطور طبیعی برای درک مفاهیم انتزاعی از ژست، ترسیم و ابزارهای بصری استفاده میکنند. در ریاضیات، نمودارها و ترسیمها نقش کلیدی در درک روابط فضایی دارند. با این حال، بسیاری از سیستمهای آموزش هوشمند تنها بر متن تکیه دارند و پاسخ را مستقیماً ارائه میدهند. این رویکرد اگرچه سریع است، اما فرایند یادگیری فعال را تضعیف میکند و کاربر را به مصرفکننده منفعل تبدیل میکند.
دفترچه تعاملی: یک همکار بصری، نه یک ماشین پاسخدهی
سیستم «دفترچه تعاملی» (Interactive Sketchpad) با استفاده از مدلهای بزرگ چندوجهی، ورودیهای متنی و تصویری را همزمان درک میکند و بهجای ارائه پاسخ نهایی، راهنماییهای گامبهگام و نمودارهای بصری تولید میکند. این سیستم ابتدا تحلیل میکند که آیا مسئله به نمودار نیاز دارد یا خیر، سپس کد پایتون مناسب را برای ترسیم دقیق تولید و اجرا میکند. در نهایت، با درک پیشرفت کاربر، راهنماییهای کوتاه و هدفمندی ارائه میدهد که او را به سمت حل مستقل مسئله سوق میدهد.
نکته جالب اینجاست که کاربر میتواند روی یک تخته سفید دیجیتال یادداشتبرداری، ترسیم و علامتگذاری کند و سیستم از این ورودیها برای درک بهتر وضعیت دانشآموز استفاده میکند. این تعامل چندوجهی، تجربه یادگیری را طبیعیتر و مؤثرتر میسازد.
نتایجی که شگفتزدهکننده است
در آزمایشهایی روی مجموعهداده استاندارد IsoBench، «دفترچه تعاملی» با ترکیب استدلال بصری و اجرای کد، دقت بالاتری نسبت به مدل پایه GPT-4o و سیستم Visual Sketchpad کسب کرد. بهعنوان مثال، در مسائل مربوط به حداکثر جریان (Maxflow)، دقت سیستم به ۱۰۰٪ رسید، در حالی که GPT-4o تنها ۲۵٪ و Visual Sketchpad ۶۶.۳٪ دقت داشتند. این بهبود چشمگیر نشان میدهد که ترکیب محاسبات دقیق با درک بصری، خطاهای ناشی از محاسبات ذهنی مدلهای زبانی را بهشدت کاهش میدهد.
در یک مطالعه کاربری با ۱۵ دانشجوی کارشناسی، شرکتکنندگان اظهار داشتند که visualizationها به آنها کمک کرد تا فراتر از معادلات، درک مفهومی بهتری پیدا کنند. یکی از شرکتکنندگان گفت: «نمودارها به من کمک کرد تا فراتر از معادلات، درک مفهومی بهتری پیدا کنم.» دیگری گفت: «دوست داشتم که مرا از طریق رویکرد حل مسئله راهنمایی میکند بدون اینکه مستقیم به پاسخ بپرد، مثل ChatGPT.» این بازخوردها نشان میدهد که کاربران نهتنها از سیستم راضی بودند، بلکه آن را بهعنوان یک همراه یادگیری مؤثر میدیدند.
چرا این پژوهش مهم است؟
این پژوهش نشان میدهد که هوش مصنوعی در آموزش میتواند نقش یک همکار بصری و تعاملی را ایفا کند، نه یک پاسخدهنده صرف. این تغییر پارادایم میتواند یادگیری را عمیقتر، معنادارتر و پایدارتر کند. در دنیایی که آموزش آنلاین و ابزارهای هوشمند بهسرعت در حال گسترش هستند، طراحی سیستمهایی که تفکر مستقل را تشویق میکنند، یک ضرورت است. «دفترچه تعاملی» گامی مهم در این مسیر است و نشان میدهد که ترکیب متن، تصویر و تعامل میتواند تجربه یادگیری را متحول کند.
«من دوست دارم که مرا از طریق رویکرد حل مسئله راهنمایی میکند بدون اینکه مستقیم به پاسخ بپرد، مثل ChatGPT.»
اگر به دنبال درک عمیقتر این سیستم و جزئیات فنی آن هستید، مطالعه کامل پایاننامه را از دست ندهید. این پژوهش نهتنها برای متخصصان هوش مصنوعی، بلکه برای هر کسی که به آینده آموزش علاقهمند است، الهامبخش خواهد بود.