چکیده

در سال‌های اخیر، با گسترش روزافزون کاربرد پردازنده‌های گرافیکی (GPU) در حوزه‌هایی نظیر محاسبات علمی، یادگیری ماشین، شبیه‌سازی‌های عددی، پردازش تصویر و تحلیل داده‌های حجیم، نیاز به زبان‌های برنامه‌نویسی سطح بالا که بتوانند ضمن حفظ سادگی توسعه، عملکردی نزدیک به زبان‌های سطح پایین ارائه دهند، بیش از پیش احساس شده است. زبان برنامه‌نویسی جولیا (Julia) یکی از مهم‌ترین پاسخ‌ها به این نیاز محسوب می‌شود. این زبان با بهره‌گیری از معماری کامپایل Just-In-Time (JIT)، سیستم نوع‌دهی قدرتمند، قابلیت چندریختی پویا (Dynamic Multiple Dispatch) و یکپارچه‌سازی مناسب با LLVM، امکان تولید کدهای بسیار بهینه را فراهم کرده و در سال‌های اخیر جایگاه ویژه‌ای در محاسبات علمی پیدا کرده است. با وجود این مزایا، یکی از چالش‌های اساسی در استفاده از جولیا، زمان نسبتاً زیاد اولین اجرای برنامه‌ها یا همان Time To First Execution (TTFX) است؛ مشکلی که هنگام استفاده از کدهای GPU به شکل محسوس‌تری خود را نشان می‌دهد.

ریشه این مسئله به فرآیند کامپایل پویا در جولیا بازمی‌گردد. در اولین اجرای هر تابع، کامپایلر باید عملیات متعددی شامل استنتاج نوع‌ها، تولید نمایش میانی، بهینه‌سازی‌های مختلف، تولید کد LLVM و در نهایت تولید کد بومی را انجام دهد. اگرچه نتایج این فرآیند در طول اجرای همان نشست برنامه در حافظه نگهداری می‌شوند، اما با پایان یافتن اجرای برنامه یا بارگذاری مجدد بسته‌ها، این اطلاعات از بین می‌روند و بخش عمده‌ای از فرآیند کامپایل باید مجدداً انجام شود. در کدهای CPU، مکانیزم‌هایی برای ذخیره‌سازی بخشی از نتایج کامپایل در قالب کش پایدار وجود دارد، اما در مسیر کامپایل GPU چنین قابلیتی وجود نداشته و همین موضوع باعث افزایش چشمگیر زمان اولین اجرا می‌شود.

پایان‌نامه حاضر با هدف رفع این محدودیت، به طراحی، پیاده‌سازی و ارزیابی یک سامانه کش پایدار آفلاین برای فرآیند کامپایل GPU در اکوسیستم جولیا می‌پردازد. ایده اصلی پژوهش آن است که نتایج فرآیند کامپایل، اعم از اطلاعات استنتاج نوع و همچنین کد بومی تولیدشده، پس از اولین کامپایل روی حافظه دائمی ذخیره شوند تا در اجرای مجدد برنامه یا بارگذاری دوباره بسته‌ها، بدون نیاز به تکرار کامل فرآیند کامپایل قابل استفاده باشند. این رویکرد باعث می‌شود زمان آماده‌سازی برنامه برای اجرا به میزان قابل توجهی کاهش یافته و تجربه کاربری توسعه‌دهندگان و پژوهشگران بهبود یابد.

برای دستیابی به این هدف، پژوهش حاضر معماری داخلی کامپایلر جولیا، نحوه عملکرد GPUCompiler.jl، ساختار MethodInstance و CodeInstance، فرآیند پیش‌کامپایل (Precompilation)، مدیریت World Age و مکانیزم اعتبارسنجی نتایج کامپایل را به‌صورت دقیق بررسی کرده است. بر اساس این تحلیل، معماری پیشنهادی به گونه‌ای طراحی شده که بدون ایجاد تغییرات اساسی در هسته کامپایلر، امکان افزودن قابلیت کش پایدار را فراهم سازد. این ویژگی موجب می‌شود راهکار ارائه‌شده با نسخه‌های موجود اکوسیستم جولیا سازگار بوده و احتمال بروز ناسازگاری یا خطاهای جانبی به حداقل برسد.

معماری ارائه‌شده مبتنی بر کش در سطح بسته‌های نرم‌افزاری (Package-Level Persistent Offline Cache) است. در این رویکرد، هر بسته می‌تواند مجموعه توابعی را که نیازمند پیش‌کامپایل هستند مشخص کرده و تنها اطلاعات مرتبط با همان بسته را در فایل کش ذخیره کند. این تصمیم علاوه بر ساده‌سازی فرآیند مدیریت کش، موجب حفظ سازگاری با مکانیزم اعتبارسنجی بسته‌های جولیا شده و از کامپایل مجدد غیرضروری سایر بسته‌ها جلوگیری می‌کند. همچنین با استفاده از سیستم سریال‌سازی و بازیابی اطلاعات موجود در جولیا، عملیات ذخیره‌سازی و بازیابی داده‌ها بدون نیاز به ایجاد زیرساخت جدید انجام می‌شود.

برای پیاده‌سازی این معماری، مجموعه‌ای از رابط‌های برنامه‌نویسی شامل ایجاد Snapshot از وضعیت کش، تولید Delta Snapshot، درج مجدد اطلاعات کش و پیش‌کامپایل اختصاصی GPU توسعه یافته است. Snapshot اولیه وضعیت موجود کش را ثبت می‌کند و در پایان فرآیند پیش‌کامپایل، تنها تغییرات ایجادشده نسبت به آن استخراج و ذخیره می‌شوند. این رویکرد علاوه بر کاهش حجم فایل‌های کش، موجب افزایش سرعت عملیات ذخیره‌سازی و بازیابی اطلاعات نیز می‌شود. هنگام راه‌اندازی مجدد بسته، اطلاعات ذخیره‌شده مجدداً وارد کش GPU شده و بدون نیاز به بازتولید کامل کد، برنامه آماده اجرا خواهد بود.

یکی از مهم‌ترین جنبه‌های این پژوهش، تضمین صحت عملکرد کش ایجادشده است. برای این منظور مکانیزم‌هایی جهت جلوگیری از استفاده از داده‌های منقضی، مدیریت صحیح World Age، کنترل اعتبار MethodInstanceها و جلوگیری از ناسازگاری بین نسخه‌های مختلف توابع طراحی و پیاده‌سازی شده‌اند. همچنین با بررسی سناریوهای پیچیده‌ای مانند Diamond Inheritance، نشان داده شده است که سیستم پیشنهادی حتی در شرایطی که چندین بسته به‌صورت هم‌زمان تغییراتی روی توابع مشترک ایجاد می‌کنند نیز عملکرد صحیح خود را حفظ می‌کند و نسخه مناسب هر تابع را در اختیار برنامه قرار می‌دهد.

به منظور ارزیابی کارایی روش پیشنهادی، آزمایش‌های متعددی روی بسته‌های مطرح اکوسیستم جولیا از جمله CUDA.jl، Oceananigans.jl، OceanScalingTests.jl و Enzyme.jl انجام شده است. این بسته‌ها نماینده کاربردهای واقعی در محاسبات علمی و پردازش GPU هستند و ارزیابی آن‌ها می‌تواند دید مناسبی از عملکرد سامانه در پروژه‌های عملی ارائه دهد. نتایج آزمایش‌ها نشان می‌دهد که استفاده از کش پایدار، به‌ویژه در حالتی که کد بومی نیز ذخیره می‌شود، می‌تواند زمان اولین اجرای برنامه را حدود دو تا سه برابر کاهش دهد. علاوه بر این، میزان حافظه اختصاص‌یافته و تعداد تخصیص‌های حافظه نیز به شکل محسوسی کاهش یافته است که بیانگر بهبود بهره‌وری کلی فرآیند کامپایل است.

بررسی سربار ناشی از ایجاد Snapshot، محاسبه Delta و بازیابی کش نیز نشان می‌دهد که هزینه زمانی و حافظه‌ای این عملیات در مقایسه با صرفه‌جویی حاصل از حذف کامپایل مجدد بسیار ناچیز است. بنابراین استفاده از سامانه پیشنهادی نه‌تنها باعث کاهش زمان اجرای اولیه برنامه‌ها می‌شود، بلکه از نظر هزینه‌های محاسباتی نیز کاملاً توجیه‌پذیر است.

در جریان اجرای پژوهش، برخی محدودیت‌های موجود در بسته Enzyme.jl نیز شناسایی شد. آزمایش‌ها نشان دادند که بخشی از فرآیند پیش‌کامپایل این بسته دارای مشکلاتی است که مانع بهره‌برداری کامل از کش پایدار می‌شود. اگرچه رفع کامل این مشکلات خارج از محدوده این پایان‌نامه بوده است، اما شناسایی این نقاط ضعف و ارائه راهکارهای اولیه برای اصلاح آن‌ها، از دیگر دستاوردهای ارزشمند این پژوهش به شمار می‌رود و زمینه مناسبی برای تحقیقات آینده فراهم می‌کند.

به طور کلی، این پایان‌نامه نشان می‌دهد که افزودن یک سامانه کش پایدار آفلاین به فرآیند کامپایل GPU در جولیا می‌تواند بدون ایجاد تغییرات بنیادین در معماری کامپایلر، بخش مهمی از مشکل TTFX را برطرف کند. این راهکار موجب می‌شود توسعه‌دهندگان تنها یک بار هزینه کامپایل را پرداخت کرده و در اجراهای بعدی بتوانند از نتایج ذخیره‌شده استفاده کنند. کاهش زمان انتظار، افزایش بهره‌وری، بهبود تجربه توسعه نرم‌افزارهای علمی و فراهم‌سازی بستری مناسب برای توسعه بسته‌های محاسباتی بزرگ، از مهم‌ترین مزایای این رویکرد محسوب می‌شوند. نتایج به‌دست‌آمده نشان می‌دهد که سامانه پیشنهادی علاوه بر حفظ صحت و سازگاری فرآیند کامپایل، عملکرد قابل توجهی در کاهش زمان اولین اجرا داشته و می‌تواند به‌عنوان گامی مؤثر در توسعه زیرساخت‌های محاسباتی زبان جولیا و بهینه‌سازی اجرای برنامه‌های مبتنی بر GPU مورد استفاده قرار گیرد.
“`html

 

سرفصل شماره صفحه
چکیده 3
فصل 1: مقدمه 8
1-1 مقدمه 8
1-2 انگیزه پژوهش 10
1-3 اهداف پژوهش 12
1-4 مشارکت‌های پژوهش 14
1-5 ساختار پایان‌نامه 16
فصل 2: پیشینه و مبانی نظری 17
2-1 زبان برنامه‌نویسی جولیا (Julia) 17
2-1-1 سیستم نوع‌دهی (Type System) 18
2-1-2 چندریختی پویا (Dynamic Multiple Dispatch) 22
2-1-3 فرابرنامه‌نویسی (Metaprogramming) 22
2-1-4 کامپایل هم‌زمان (Just-In-Time Compilation) 22
2-2 پیش‌کامپایل (Precompilation) 22
2-2-1 ساختار داخلی پیش‌کامپایل 23
2-2-2 سن جهان (World Ages) 23
2-2-3 ساختارهای داخلی کامپایل در جولیا 23
2-2-4 کامپایل GPU در جولیا 24
2-2-5 کاربران GPUCompiler 24
2-2-6 چالش‌های موجود 24
فصل 3: طراحی 25
3-1 کش پایدار آفلاین در سطح بسته (Package-Level Offline Persistent Caching) 25
3-1-1 رابط برنامه‌نویسی کاربردی (API) 25
3-1-2 دلایل انتخاب کش در سطح بسته 27
3-1-3 طراحی‌های جایگزین 27
3-2 نمای کلی طراحی 28
3-2-1 راه‌اندازی کامپایلر جولیا (Compiler Bootstrapping) 28
3-2-2 راه‌اندازی کامپایلر GPU 29
3-2-3 تغییرات اعمال‌شده در GPUCompiler 29
فصل 4: پیاده‌سازی 31
4-1 پیاده‌سازی رابط برنامه‌نویسی (API) 31
4-1-1 تابع ci_cache_snapshot() 31
4-1-2 تابع ci_cache_delta() 32
4-1-3 تابع ci_cache_insert() 32
4-1-4 تابع precompile_gpucompiler() 32
4-2 اعتبارسنجی (Validation) 33
4-2-1 جلوگیری از منسوخ شدن داده‌ها (Preventing Staleness) 33
4-2-2 تضمین صحت سن جهان (Ensuring Correct World Ages) 33
فصل 5: ارزیابی 35
5-1 مشخصات محیط آزمایش 35
5-2 بهبود عملکرد پیش‌کامپایل 36
5-2-1 ارزیابی CUDA 36
5-2-2 ارزیابی Oceananigans 39
5-2-3 ارزیابی Enzyme 43
5-3 بررسی صحت عملکرد 46
5-4 محدودیت‌ها و بحث 49
فصل 6: نتیجه‌گیری و پیشنهادات آینده 52
6-1 جمع‌بندی 52
6-2 دستاوردهای پژوهش 54
6-3 پیشنهاد برای تحقیقات آینده 56
منابع 57

“`

خداحافظ انتظارهای طولانی! چگونه یک نوآوری ساده، اجرای برنامه‌های GPU در جولیا را چند برابر سریع‌تر کرد؟

اگر با زبان Julia کار کرده باشید، احتمالاً این تجربه را داشته‌اید: کدتان آماده است، همه چیز درست به نظر می‌رسد، اما اولین اجرا زمان غیرمنتظره‌ای طول می‌کشد. این مشکل که با عنوان Time To First Execution (TTFX) شناخته می‌شود، سال‌ها یکی از بزرگ‌ترین موانع تجربه کاربری جولیا، به‌ویژه در برنامه‌های مبتنی بر GPU، بوده است.

اما اگر بتوان تنها یک بار هزینه کامپایل را پرداخت و دفعات بعد تقریباً بدون انتظار برنامه را اجرا کرد چه؟ این دقیقاً همان ایده‌ای است که این پژوهش دنبال کرده است.


مشکل واقعی؛ کامپایل مجددی که هیچ چیز جدیدی تولید نمی‌کند

یکی از مهم‌ترین مزایای جولیا، استفاده از کامپایل Just-In-Time (JIT) است. این روش باعث می‌شود کدها با سرعت بسیار بالایی اجرا شوند، اما یک هزینه هم دارد؛ اولین اجرای هر تابع باید ابتدا کامپایل شود.

برای برنامه‌هایی که روی GPU اجرا می‌شوند، این فرآیند بسیار سنگین‌تر است. حتی اگر هیچ تغییری در برنامه ایجاد نشده باشد، در اجرای بعدی دوباره بخش بزرگی از این مراحل تکرار می‌شود.

نتیجه؟

  • انتظار طولانی برای اولین اجرا
  • اتلاف منابع پردازشی
  • کاهش بهره‌وری توسعه‌دهندگان

ایده‌ای که همه چیز را تغییر داد؛ ذخیره نتیجه کامپایل

به جای اینکه هر بار از ابتدا کامپایل انجام شود، این پایان‌نامه پیشنهاد می‌کند نتیجه کامپایل یک بار ذخیره شود.

به بیان ساده، سیستم یک کش پایدار آفلاین (Persistent Offline Cache) ایجاد می‌کند که اطلاعات کامپایل را روی حافظه دائمی نگه می‌دارد.

در اجرای بعدی، به جای ساخت دوباره همه چیز، تنها اطلاعات ذخیره‌شده بازیابی می‌شوند.

«یک بار کامپایل کن؛ بارها اجرا کن.»

همین ایده ساده، بخش بزرگی از زمان انتظار کاربران را حذف می‌کند.


چرا کش در سطح بسته‌های نرم‌افزاری انتخاب شد؟

شاید تصور شود بهتر است تمام اطلاعات کامپایل در یک کش بزرگ ذخیره شوند، اما پژوهش مسیر هوشمندانه‌تری را انتخاب کرده است.

هر Package تنها اطلاعات مربوط به خودش را ذخیره می‌کند.

مزایای این تصمیم عبارت‌اند از:

  • کاهش حجم اطلاعات ذخیره‌شده
  • جلوگیری از کامپایل مجدد بسته‌های غیرمرتبط
  • ساده‌تر شدن اعتبارسنجی داده‌ها
  • سازگاری کامل با ساختار فعلی جولیا

در واقع طراحی سیستم به گونه‌ای انجام شده که بدون ایجاد تغییر اساسی در کامپایلر فعلی، قابلیت جدید به آن اضافه شود.


پیاده‌سازی با کمترین تغییر در هسته جولیا

یکی از نکات جالب این پروژه، نحوه پیاده‌سازی آن است.

به جای بازنویسی کامپایلر، تنها چند API جدید طراحی شده‌اند که وظیفه آن‌ها عبارت است از:

  • ثبت وضعیت اولیه کش
  • استخراج تغییرات ایجادشده
  • ذخیره اطلاعات جدید
  • بازیابی کش هنگام اجرای مجدد

این رویکرد باعث شده قابلیت جدید تقریباً بدون ایجاد اختلال در اکوسیستم جولیا اضافه شود.


یکی از سخت‌ترین چالش‌ها؛ اطمینان از صحت اطلاعات ذخیره‌شده

ذخیره کردن اطلاعات ساده است؛ اما از کجا مطمئن شویم اطلاعات قدیمی باعث خطا نمی‌شوند؟

این پایان‌نامه برای این موضوع مکانیزم‌های دقیقی طراحی کرده است:

  • مدیریت اعتبار داده‌ها
  • کنترل نسخه توابع
  • مدیریت World Age
  • جلوگیری از استفاده از کدهای منسوخ

به همین دلیل، حتی اگر چندین بسته هم‌زمان تغییر کنند، سیستم همچنان نسخه صحیح هر تابع را انتخاب می‌کند.


نتایج آزمایش‌ها واقعاً چشمگیر هستند

ارزیابی سیستم روی پروژه‌های واقعی مانند:

  • CUDA.jl
  • Oceananigans.jl
  • OceanScalingTests.jl
  • Enzyme.jl

نشان داد که استفاده از کش پایدار می‌تواند:

  • زمان اولین اجرا را حدود ۲ تا ۳ برابر کاهش دهد
  • تعداد تخصیص‌های حافظه را به شکل محسوسی کم کند
  • حجم حافظه مصرفی را کاهش دهد
  • سربار ایجاد کش را در حد چند صد میلی‌ثانیه نگه دارد

به بیان دیگر، هزینه ایجاد کش بسیار ناچیزتر از زمانی است که از کامپایل مجدد صرفه‌جویی می‌شود.


حتی مشکلات پنهان پروژه‌های دیگر هم آشکار شدند

یکی از اتفاقات جالب این پژوهش، کشف یک مشکل قدیمی در بسته Enzyme.jl بود.

در جریان آزمایش‌ها مشخص شد بخشی از فرآیند پیش‌کامپایل این بسته باعث بروز رفتارهای غیرمنتظره می‌شود و امکان استفاده کامل از کش را محدود می‌کند.

گرچه رفع کامل این مشکل خارج از محدوده پایان‌نامه بود، اما شناسایی آن می‌تواند مسیر تحقیقات آینده را هموارتر کند.


چرا این پژوهش اهمیت دارد؟

در نگاه اول شاید این پروژه تنها درباره کاهش زمان کامپایل باشد، اما در واقع تأثیر آن بسیار گسترده‌تر است.

کاهش زمان انتظار یعنی:

  • توسعه سریع‌تر نرم‌افزار
  • آزمایش راحت‌تر الگوریتم‌ها
  • افزایش بهره‌وری پژوهشگران
  • تجربه کاربری بهتر
  • استفاده مؤثرتر از توان پردازنده‌های گرافیکی

به عبارت دیگر، این پژوهش یکی از موانع اصلی استفاده از جولیا در پروژه‌های بزرگ علمی را هدف قرار داده است.


جمع‌بندی

گاهی بزرگ‌ترین پیشرفت‌ها حاصل ایده‌های پیچیده نیستند، بلکه نتیجه حذف یک اتلاف قدیمی‌اند. این پایان‌نامه دقیقاً چنین کاری انجام داده است؛ با ذخیره هوشمند نتایج کامپایل GPU، زمان انتظار کاربران را به شکل محسوسی کاهش داده و بدون تغییرات بنیادی در ساختار جولیا، راهکاری عملی، مقیاس‌پذیر و کارآمد ارائه کرده است.

اگر روزی اجرای اولین برنامه در جولیا تقریباً آنی شود، آیا کش پایدار آفلاین می‌تواند یکی از مهم‌ترین دلایل آن باشد؟

 

 

 

بسیار سریع و ساده می توانید اصل این پایان نامه را به صورت فایل PDF در اختیار داشته باشید.

پس از دریافت پایان‌نامه، کلیه اطلاعات کتاب‌شناختی موردنیاز برای استناد علمی، از جمله نام دانشگاه، عنوان پایان‌نامه، نام پژوهشگر، سال دفاع و سایر مشخصات مرتبط، جهت ارجاع‌دهی صحیح مطابق با استانداردهای رایج، در اختیار شما قرار خواهد گرفت.