این پایان‌نامه یک سیستم آموزشی تعاملی و چندوجهی را معرفی می‌کند که با ترکیب متن، تصویر و تعامل گرافیکی، به دانش‌آموزان در حل مسائل ریاضی و استدلال بصری کمک می‌کند. ایده اصلی این است که یادگیری مؤثر، به‌ویژه در موضوعاتی مانند هندسه، توابع و نمودارها، تنها با متن و زبان به‌دست نمی‌آید؛ بلکه نیازمند دیدن، ترسیم، اشاره و تعامل با مفاهیم است. سیستم توسعه‌یافته در این پژوهش، با نام «دفترچه تعاملی» (Interactive Sketchpad)، از مدل‌های بزرگ چندوجهی (LMMs) استفاده می‌کند تا هم‌زمان با درک ورودی‌های متنی و تصویری، راهنمایی‌های گام‌به‌گام و نمودارهای بصری تولید کند. این سیستم به‌جای ارائه مستقیم پاسخ نهایی، دانش‌آموز را به سمت کشف مستقل راه‌حل هدایت می‌کند. برخلاف بسیاری از سیستم‌های آموزش هوشمند که تنها بر متن تکیه دارند و پاسخ را مستقیماً در اختیار کاربر قرار می‌دهند، این سیستم تلاش می‌کند فرایند یادگیری فعال و استدلال مستقل را تقویت کند. هدف نهایی این است که هوش مصنوعی در آموزش، نه به‌عنوان یک ماشین پاسخ‌دهی، بلکه به‌عنوان یک همکار بصری و تعاملی عمل کند که به درک عمیق‌تر مفاهیم کمک می‌رساند.

پیشینه پژوهش نشان می‌دهد که انسان‌ها به‌طور طبیعی برای درک مفاهیم انتزاعی از ژست، ترسیم و ابزارهای بصری استفاده می‌کنند. در آموزش ریاضی، نمودارها و ترسیم‌ها نقش کلیدی در درک روابط فضایی و مفاهیم نظری دارند. پژوهش‌های قبلی نشان داده‌اند که دانش‌آموزانی که با artifacts بصری درگیر می‌شوند، درک عمیق‌تری از مفاهیم پیدا می‌کنند. با این حال، بسیاری از سیستم‌های آموزش هوشمند موجود، عمدتاً متنی هستند و پاسخ را مستقیماً ارائه می‌دهند که می‌تواند فرایند یادگیری فعال و استدلال مستقل را مختل کند. سیستم‌های آموزشی چندوجهی مانند Desmos و GeoGebra نشان داده‌اند که visuals پویا می‌توانند درک ریاضی و استدلال فضایی را بهبود بخشند، اما بیشتر این سیستم‌ها فاقد توانایی درک عمیق و پاسخ هوشمندانه به ورودی‌های متنوع هستند. این پژوهش با بهره‌گیری از پیشرفت‌های اخیر در مدل‌های چندوجهی، به دنبال پر کردن این شکاف است تا تجربه یادگیری را طبیعی‌تر، تعاملی‌تر و مؤثرتر سازد.

مدل‌های بزرگ چندوجهی (LMMs) توانایی پردازش هم‌زمان انواع داده‌ها مانند متن، تصویر، صدا و ویدیو را دارند. این مدل‌ها معمولاً از یک رمزگذار بصری برای تبدیل تصاویر به embedding، یک مدل زبانی برای پردازش مشترک متن و embeddingهای بصری، و یک مکانیزم fusion چندوجهی برای یکپارچه‌سازی اطلاعات بصری و متنی تشکیل شده‌اند. یکی از قابلیت‌های مهم این مدل‌ها، یادگیری درون‌زمینه (in-context learning) است که به آن‌ها اجازه می‌دهد بدون به‌روزرسانی وزن‌ها، وظایف جدید را با چند مثال در prompt انجام دهند. این انعطاف‌پذیری، آن‌ها را برای کاربردهای آموزشی که تعریف وظایف می‌تواند به‌سرعت تغییر کند، بسیار مفید می‌سازد. برخی از LMMها حتی قادر به تولید تصویر به‌عنوان بخشی از خروجی خود هستند که می‌تواند برای توضیح، بازخورد و درک مفهومی استفاده شود. نمونه‌های شاخص این مدل‌ها شامل GPT-4o، Gemini 1.5، Qwen-VL و Llama هستند.

روش‌شناسی این پژوهش در دو مرحله اصلی توسعه یافته است. در مراحل اولیه، دو رویکرد مورد آزمایش قرار گرفت: یکی استفاده از ژست‌های دستی برای تعامل با تخته سفید و دیگری تولید تصاویر با مدل‌های متن‌به‌تصویر مانند DALL-E و Stable Diffusion. در رویکرد اول، یک رابط بینایی با OpenCV پیاده‌سازی شد که حرکات آزاد دست را به‌صورت فریم‌های ویدیویی ضبط می‌کرد و سپس با استفاده از یک مدل CNN مبتنی بر TensorFlow، شکل‌ها را طبقه‌بندی می‌کرد. اگرچه دقت طبقه‌بندی ۹۵٪ بود، اما تنوع حرکات کاربران و ناسازگاری‌های کوچک در ترتیب strokeها منجر به شناسایی نادرست شکل‌ها می‌شد. به همین دلیل، تفسیر ژست در نسخه نهایی سیستم غیرفعال شد. در رویکرد دوم، اگرچه کیفیت زیبایی‌شناختی خروجی‌های متن‌به‌تصویر بالا بود، اما دقت معنایی نمودارهای تولیدشده ناسازگار بود. به‌عنوان مثال، در یک نمودار هندسی دایره با مثلث متساوی‌الساقین محاطی، نقطه C روی محیط دایره قرار نمی‌گرفت، خط مماس ناهم‌تراز بود و زاویه CDE نادرست ترسیم شده بود. علاوه بر این، این نمودارها به‌راحتی قابل تفسیر یا ویرایش توسط سیستم نبودند و ادغام آن‌ها در حلقه بازخورد چندوجهی را دشوار می‌کردند. در نتیجه، سیستم نهایی از تولید کد پایتون برای ترسیم نمودارهای دقیق با کتابخانه‌هایی مانند Matplotlib و Numpy استفاده می‌کند که کنترل کامل بر مختصات، برچسب‌ها و روابط هندسی را ممکن می‌سازد.

سیستم «دفترچه تعاملی» از چند بخش اصلی تشکیل شده است. نخست، تحلیل مسئله: سیستم ورودی کاربر (متن، تصویر یا هر دو) را بررسی می‌کند و با استفاده از مدل GPT-4o تعیین می‌کند که آیا یک نمودار بصری می‌تواند به درک بهتر کمک کند یا خیر. این مرحله ضروری است زیرا همه مسائل از visuals بهره نمی‌برند و در برخی موارد، نمودار می‌تواند مانع باشد. به‌عنوان مثال، حل یک انتگرال می‌تواند از تجسم فضای زیر نمودار تابع بهره ببرد، اما حل یک دستگاه معادلات ممکن است نیاز چندانی به visual نداشته باشد. دوم، تولید مصنوع بصری: در صورت نیاز، سیستم کد پایتون مناسب برای ترسیم نمودار تولید می‌کند و با استفاده از OpenAI Code Interpreter آن را اجرا می‌کند. اگر کد با خطا مواجه شود، مدل به‌صورت تکراری کد را اصلاح می‌کند تا visualization موفقیت‌آمیزی تولید شود. سوم، تولید راهنمای متنی: سیستم با درک پیشرفت کاربر، راهنمایی‌های کوتاه و گام‌به‌گام ارائه می‌دهد که بر پاسخ‌های قبلی بنا می‌شوند و کاربر را به سمت حل مسئله هدایت می‌کنند. این راهنماها به‌گونه‌ای طراحی شده‌اند که پاسخ نهایی را مستقیماً فاش نکنند و کاربر را به تفکر وادارند. چهارم، تعامل با تخته سفید: کاربر می‌تواند روی یک تخته سفید دیجیتال یادداشت‌برداری، ترسیم و علامت‌گذاری کند و سیستم از این ورودی‌ها برای درک بهتر وضعیت دانش‌آموز استفاده می‌کند. رابط چت‌بات نیز برای تعامل متنی و تصویری در دسترس است.

برای ارزیابی اثربخشی سیستم، آزمایش‌هایی روی مجموعه‌داده استاندارد IsoBench انجام شد که شامل مسائل الگوریتمی، توابع ریاضی و مسائل علمی است. هر مثال آزمایشی شامل یک جفت نمایش تصویری و یک نمایش متنی جایگزین است. معیار اصلی ارزیابی، دقت دقیق (exact accuracy) بود که درصد سوالاتی را محاسبه می‌کند که مدل پاسخ نهایی صحیح را输出 می‌دهد. نتایج نشان داد که «دفترچه تعاملی» با ترکیب استدلال بصری و اجرای کد، دقت بالاتری نسبت به مدل پایه GPT-4o و سیستم Visual Sketchpad دارد. به‌عنوان مثال، در مسائل مربوط به حداکثر جریان (Maxflow)، دقت سیستم به ۱۰۰٪ رسید، در حالی که GPT-4o تنها ۲۵٪ و Visual Sketchpad ۶۶.۳٪ دقت داشتند. در مسائل Isomorphism، دقت سیستم ۷۵٪ بود در مقابل ۵۰.۸٪ برای GPT-4o و ۶۵.۳٪ برای Visual Sketchpad. در مسائل Connectivity، Convexity و Parity نیز سیستم به‌ترتیب دقت ۹۹.۲٪، ۹۶.۵٪ و ۹۵.۶٪ را کسب کرد که در همه موارد بالاتر از baselineها بود. این بهبود نشان می‌دهد که ترکیب محاسبات دقیق با درک بصری، خطاهای ناشی از محاسبات ذهنی مدل‌های زبانی را کاهش می‌دهد و پاسخ‌ها را قابل‌اعتمادتر می‌سازد.

علاوه بر آزمایش‌های کمی، یک مطالعه کاربری با ۱۵ دانشجوی کارشناسی از یک مجموعه موضوعی دانشگاهی انجام شد. شرکت‌کنندگان در جبر و هندسه مهارت داشتند اما در همه حوزه‌های ریاضی متخصص نبودند. هر شرکت‌کننده چهار مسئله ریاضی را در شرایط مختلف حل کرد: سوال ۱ به‌عنوان تمرین با سیستم، سوال ۲ به‌عنوان آزمون بدون ابزار برای سنجش انتقال یادگیری، سوال ۳ به‌عنوان تمرین بدون ابزار برای موضوع جدید، و سوال ۴ به‌عنوان آزمون بدون ابزار برای همان موضوع جدید. این طراحی به شرکت‌کنندگان اجازه می‌داد تا به‌عنوان کنترل خود عمل کنند و اثرات یادگیری را با کمترین تأثیر تفاوت‌های فردی تفسیر کنند. پس از جلسه حل مسئله، شرکت‌کنندگان یک پرسشنامه پس از مطالعه شامل موارد Likert و سوالات باز را تکمیل کردند. نتایج کیفی نشان داد که کاربران visualizationها را برای درک مفهومی بسیار مفید می‌دانستند و از اینکه سیستم پاسخ را مستقیماً ارائه نمی‌دهد و آن‌ها را به تفکر وامی‌دارد، قدردانی کردند. یکی از شرکت‌کنندگان گفت: «نمودارها به من کمک کرد تا فراتر از معادلات، درک مفهومی بهتری پیدا کنم.» دیگری گفت: «دوست داشتم که مرا از طریق رویکرد حل مسئله راهنمایی می‌کند بدون اینکه مستقیم به پاسخ بپرد، مثل ChatGPT.» شرکت‌کنندگان اظهار داشتند که این ابزار فرایند یادگیری آن‌ها را داربست‌بندی می‌کند و تفکر فعال را به‌جای مصرف منفعل تشویق می‌کند.

نتایج کمی نیز رضایت بالای کاربران را نشان داد. میانگین امتیاز intuitive بودن رابط ۴.۷۱ از ۵، پاسخ‌دهی سیستم ۴.۴۳، وضوح visuals ۴.۵۷، دقت visuals ۴.۷۱ و اثربخشی راهنماها ۴.۵۷ بود. بالاترین امتیازها مربوط به intuitive بودن ابزار و دقت کمک‌های بصری تولیدشده بود. امتیاز کمی پایین‌تر پاسخ‌دهی سیستم نشان‌دهنده پتانسیل بهینه‌سازی در کاهش تأخیر سیستم، به‌ویژه در تولید راهنماها یا پاسخ‌های مبتنی بر ترسیم است. این امتیازات ارزش بازخورد چندوجهی در زمینه‌های آموزشی را تأیید می‌کند و رضایت بالای کاربران از «دفترچه تعاملی» به‌عنوان یک همراه یادگیری را نشان می‌دهد. در مجموع، یافته‌های کیفی و کمی نشان می‌دهد که سیستم در ارائه تجربه یادگیری بصری و تعاملی دلپذیر عملکرد قوی داشته است.

در بخش کارهای آینده، دو جهت اصلی پیشنهاد شده است. نخست، بهبود دقت visualizationها از طریق یادگیری تقویتی: با وجود کنترل کد، گاهی مدل مقادیر را به‌صورت hard-code وارد می‌کند که منجر به ناهم‌ترازی نقاط روی نمودار می‌شود. به‌عنوان مثال، در یک نمودار دایره، اگر شعاع به‌صورت متغیر تنظیم شود و حاشیه‌نویسی‌ها نسبت به نقاط داده‌شده باشند، visualization دقیق خواهد بود؛ اما اگر شعاع به ۱۰۰ hard-code شود و حاشیه‌نویسی‌ها ثابت باشند، نقاط روی دایره ناهم‌تراز می‌شوند. استفاده از یادگیری تقویتی و راستی‌آزمایی بصری می‌تواند کیفیت نمودارها را قبل از ارائه به دانش‌آموز تضمین کند. اگر تصویر معیوب باشد، کل تجربه یادگیری تضعیف می‌شود، زیرا نمودارها برای درک مفاهیم انتزاعی حیاتی هستند. دوم، ارزیابی تأثیر بلندمدت از طریق مطالعه طولی: برای سنجش ماندگاری دانش و انتقال آن به مسائل جدید، باید دانش‌آموزان را در طول یک ترم تحصیلی دنبال کرد و پیشرفت آن‌ها را با گروه کنترل مقایسه نمود. این مطالعه می‌تواند شامل آزمون‌های تشخیصی قبل و بعد، تحلیل تعاملات، و مصاحبه‌های نگهداری باشد. معیارهای ثانویه مانند اعتماد به نفس دانش‌آموز، نگرش به مسائل ناآشنا و توانایی انتقال دانش به مسائل جدید نیز می‌توانند بررسی شوند. پژوهش‌های قبلی نشان داده‌اند که توضیحات بصری و کاوش فعال می‌توانند انعطاف‌پذیری در حل مسئله و مهارت‌های شناختی را تقویت کنند. فرضیه این است که «دفترچه تعاملی» این ویژگی‌ها را مؤثرتر از ابزارهای متنی یا منفعل پرورش می‌دهد. در مجموع، این پایان‌نامه نشان می‌دهد که سیستم‌های چندوجهی می‌توانند نقش هوش مصنوعی در آموزش را از یک پاسخ‌دهنده صرف، به یک همکار بصری و تعاملی تغییر دهند که استدلال عمیق‌تر و یادگیری معنادارتر را پرورش می‌دهد.

فهرست مطالب شماره صفحه
۱ مقدمه ۱۳
۱.۱ پیشینه ۱۳
۱.۱.۱ تعاملات بصری و چندوجهی در استدلال انسانی ۱۳
۱.۱.۲ سیستم‌های آموزشی هوشمند (Intelligent Tutoring Systems) ۱۴
۱.۱.۳ پیشرفت‌ها در مدل‌های بزرگ چندوجهی (Large Multimodal Models) ۱۵
۱.۲ کارهای مرتبط ۱۶
۱.۲.۱ رابط‌های آموزشی چندوجهی ۱۶
۱.۲.۲ مصورسازی از طریق تولید کد ۱۶
۱.۲.۳ زنجیره تفکر بصری (Visual Chain-of-Thought) ۱۷
۲ روش‌ها ۱۹
۲.۱ روش‌های اولیه ۱۹
۲.۱.۱ وجه اشتراکی ژست (Gesture Modality) ۱۹
۲.۱.۲ تولیدات مدل متن‌به‌تصویر (Text-to-Image Model Generations) ۲۰
۲.۲ دفترچه تعاملی (Interactive Sketchpad) ۲۲
۲.۲.۱ تحلیل مسئله (Problem Analysis) ۲۲
۲.۲.۲ تولید مصنوع بصری (Visual Artifact Generation) ۲۴
۲.۲.۳ تولید راهنمای متنی (Textual Hint Generation) ۲۴
۲.۲.۴ تعامل با تخته سفید (Whiteboard Interaction) ۲۶
۳ آزمایش‌ها و نتایج مطالعات کاربری ۲۹
۳.۱ آزمایش‌ها ۲۹
۳.۱.۱ تنظیمات آزمایش (Experimental Setup) ۳۰
۳.۱.۲ خطوط پایه و پیکربندی دفترچه تعاملی ۳۰
۳.۱.۳ معیارهای ارزیابی و نتایج ۳۱
۳.۱.۴ تحلیل کیفی ۳۱
۳.۲ مطالعات کاربری ۳۲
۳.۲.۱ اهداف مطالعه ۳۲
۳.۲.۲ شرکت‌کنندگان ۳۳
۳.۲.۳ شرایط آزمایشی و طراحی وظیفه ۳۳
۳.۲.۴ نتایج و تحلیل کیفی ۳۵
۳.۲.۵ نتایج و تحلیل کمی ۳۶
۴ کارهای آینده ۳۷
۴.۱ بهبود دقت مصورسازی از طریق یادگیری تقویتی (Reinforcement Learning) ۳۷
۴.۲ ارزیابی تأثیر بلندمدت از طریق مطالعه طولی کاربر ۳۹
۵ نتیجه‌گیری ۴۱
پیوست الف: پرامپت‌ها (Prompts) ۴۳
الف.۱ پرامپت سیستم راهنما و تولید با استفاده از کد ۴۳
الف.۲ پرامپت سیستم حل مستقیم مسئله ۴۵
الف.۳ پرامپت پانویس IsoBench ۴۶
منابع ۴۷

وقتی هوش مصنوعی به‌جای جواب دادن، یاد می‌دهد فکر کنیم!

تصور کنید در حال حل یک مسئله هندسی هستید و از هوش مصنوعی کمک می‌خواهید. انتظار دارید چه چیزی دریافت کنید؟ یک پاسخ آماده و نهایی؟ یا یک راهنمای گام‌به‌گام که شما را به سمت کشف راه‌حل هدایت کند؟ بیشتر سیستم‌های امروزی پاسخ را مستقیم تحویل می‌دهند و همین موضوع باعث می‌شود فرایند یادگیری و تفکر مستقل کاربر مختل شود. اما پژوهشی جدید نشان می‌دهد ترکیب متن، تصویر و تعامل گرافیکی می‌تواند این معادله را کاملاً تغییر دهد.

چرا یادگیری فقط با متن کافی نیست؟

انسان‌ها به‌طور طبیعی برای درک مفاهیم انتزاعی از ژست، ترسیم و ابزارهای بصری استفاده می‌کنند. در ریاضیات، نمودارها و ترسیم‌ها نقش کلیدی در درک روابط فضایی دارند. با این حال، بسیاری از سیستم‌های آموزش هوشمند تنها بر متن تکیه دارند و پاسخ را مستقیماً ارائه می‌دهند. این رویکرد اگرچه سریع است، اما فرایند یادگیری فعال را تضعیف می‌کند و کاربر را به مصرف‌کننده منفعل تبدیل می‌کند.

دفترچه تعاملی: یک همکار بصری، نه یک ماشین پاسخ‌دهی

سیستم «دفترچه تعاملی» (Interactive Sketchpad) با استفاده از مدل‌های بزرگ چندوجهی، ورودی‌های متنی و تصویری را هم‌زمان درک می‌کند و به‌جای ارائه پاسخ نهایی، راهنمایی‌های گام‌به‌گام و نمودارهای بصری تولید می‌کند. این سیستم ابتدا تحلیل می‌کند که آیا مسئله به نمودار نیاز دارد یا خیر، سپس کد پایتون مناسب را برای ترسیم دقیق تولید و اجرا می‌کند. در نهایت، با درک پیشرفت کاربر، راهنمایی‌های کوتاه و هدفمندی ارائه می‌دهد که او را به سمت حل مستقل مسئله سوق می‌دهد.

نکته جالب اینجاست که کاربر می‌تواند روی یک تخته سفید دیجیتال یادداشت‌برداری، ترسیم و علامت‌گذاری کند و سیستم از این ورودی‌ها برای درک بهتر وضعیت دانش‌آموز استفاده می‌کند. این تعامل چندوجهی، تجربه یادگیری را طبیعی‌تر و مؤثرتر می‌سازد.

نتایجی که شگفت‌زده‌کننده است

در آزمایش‌هایی روی مجموعه‌داده استاندارد IsoBench، «دفترچه تعاملی» با ترکیب استدلال بصری و اجرای کد، دقت بالاتری نسبت به مدل پایه GPT-4o و سیستم Visual Sketchpad کسب کرد. به‌عنوان مثال، در مسائل مربوط به حداکثر جریان (Maxflow)، دقت سیستم به ۱۰۰٪ رسید، در حالی که GPT-4o تنها ۲۵٪ و Visual Sketchpad ۶۶.۳٪ دقت داشتند. این بهبود چشمگیر نشان می‌دهد که ترکیب محاسبات دقیق با درک بصری، خطاهای ناشی از محاسبات ذهنی مدل‌های زبانی را به‌شدت کاهش می‌دهد.

در یک مطالعه کاربری با ۱۵ دانشجوی کارشناسی، شرکت‌کنندگان اظهار داشتند که visualizationها به آن‌ها کمک کرد تا فراتر از معادلات، درک مفهومی بهتری پیدا کنند. یکی از شرکت‌کنندگان گفت: «نمودارها به من کمک کرد تا فراتر از معادلات، درک مفهومی بهتری پیدا کنم.» دیگری گفت: «دوست داشتم که مرا از طریق رویکرد حل مسئله راهنمایی می‌کند بدون اینکه مستقیم به پاسخ بپرد، مثل ChatGPT.» این بازخوردها نشان می‌دهد که کاربران نه‌تنها از سیستم راضی بودند، بلکه آن را به‌عنوان یک همراه یادگیری مؤثر می‌دیدند.

چرا این پژوهش مهم است؟

این پژوهش نشان می‌دهد که هوش مصنوعی در آموزش می‌تواند نقش یک همکار بصری و تعاملی را ایفا کند، نه یک پاسخ‌دهنده صرف. این تغییر پارادایم می‌تواند یادگیری را عمیق‌تر، معنادارتر و پایدارتر کند. در دنیایی که آموزش آنلاین و ابزارهای هوشمند به‌سرعت در حال گسترش هستند، طراحی سیستم‌هایی که تفکر مستقل را تشویق می‌کنند، یک ضرورت است. «دفترچه تعاملی» گامی مهم در این مسیر است و نشان می‌دهد که ترکیب متن، تصویر و تعامل می‌تواند تجربه یادگیری را متحول کند.

«من دوست دارم که مرا از طریق رویکرد حل مسئله راهنمایی می‌کند بدون اینکه مستقیم به پاسخ بپرد، مثل ChatGPT.»

اگر به دنبال درک عمیق‌تر این سیستم و جزئیات فنی آن هستید، مطالعه کامل پایان‌نامه را از دست ندهید. این پژوهش نه‌تنها برای متخصصان هوش مصنوعی، بلکه برای هر کسی که به آینده آموزش علاقه‌مند است، الهام‌بخش خواهد بود.

بسیار سریع و ساده می توانید اصل این پایان نامه را به صورت فایل PDF در اختیار داشته باشید.

پس از دریافت پایان‌نامه، کلیه اطلاعات کتاب‌شناختی موردنیاز برای استناد علمی، از جمله نام دانشگاه، عنوان پایان‌نامه، نام پژوهشگر، سال دفاع و سایر مشخصات مرتبط، جهت ارجاع‌دهی صحیح مطابق با استانداردهای رایج، در اختیار شما قرار خواهد گرفت.