در دنیای امروز، حجم اسنادی که سازمانها و شرکتها به صورت روزانه پردازش میکنند به سرعت در حال افزایش است. این اسناد شامل انواع مختلفی از اطلاعات هستند که استخراج دستی آنها زمانبر، پرهزینه و مستعد خطاست. یکی از مهمترین انواع این اسناد، اسناد مشخصات فنی محصولات هستند که اطلاعات حیاتی مانند شماره قطعه، ابعاد، جنس مواد، محدوده دمای عملیاتی و سایر ویژگیهای فنی را در خود جای دادهاند. استخراج خودکار جفتهای کلید-مقدار از این اسناد، یعنی شناسایی یک عنوان مانند «شماره قطعه» و یافتن مقدار متناظر با آن، چالشی اساسی در حوزه پردازش اسناد محسوب میشود. روشهای تجاری موجود مانند سرویسهای ابری مختلف، اگرچه در برخورد با اسناد ساده و استاندارد عملکرد خوبی دارند، اما در مواجهه با تنوع بالای قالبها و پیچیدگیهای اسناد مشخصات فنی، توانایی تعمیمپذیری کافی را از خود نشان نمیدهند. این محدودیت ناشی از آن است که هر راهحل تجاری معمولاً برای نوع خاصی از اسناد طراحی شده و فاقد دانش دامنهای لازم برای درک ساختارهای متفاوت است. از سوی دیگر، استخراج دستی اطلاعات از این اسناد نه تنها نیازمند صرف زمان و تلاش قابل توجهی است، بلکه به دلیل حجم عظیم دادههایی که باید پردازش شوند، میتواند بسیار خطاپذیر باشد. به همین دلیل، نیاز به روشهای خودکار و هوشمند برای استخراج اطلاعات از اسناد مشخصات فنی، به یک ضرورت جدی تبدیل شده است.
برای غلبه بر این محدودیتها، یک خط لوله پردازش اسناد به صورت ترکیبی طراحی شده است که هدف آن استخراج جفتهای کلید-مقدار از اسناد مشخصات فنی با دقت بالای ۸۵ درصد است. این خط لوله به صورت کاملاً خودکار عمل میکند و قادر است کلیدها را درون سند ورودی مکانیابی کرده و مقادیر متناظر با آنها را از میان اشیاء و متنهای اطراف شناسایی کند. این پروژه در همکاری با یک شرکت توزیعکننده قطعات الکترونیکی توسعه یافته و در طول زمان دچار تحولات متعددی شده است. دو نسخه اخیر این خط لوله، یعنی خط لوله عمومی و خط لوله الگوریتمی، در این پژوهش معرفی شدهاند. خط لوله عمومی نسخهای اولیه است که برای مجموعهای سادهتر از اسناد طراحی شده و عمدتاً بر یادگیری ماشین تکیه دارد. در مقابل، خط لوله الگوریتمی نسخهای فعلی است که برای پردازش مجموعه دادهای بسیار بزرگتر و پیچیدهتر ساخته شده و از رویکردی برنامهمحورتر بهره میبرد. علاوه بر این، مراحل اولیه یک ماژول مجزا نیز برای استخراج اطلاعات از نوع خاصی از اسناد مشخصات فنی به نام «فرم سفارش» پیشنهاد شده است. این خط لوله ترکیبی، از ترکیب روشهای مبتنی بر قواعد و یادگیری ماشین بهره میبرد تا بتواند طیف گستردهای از انواع اسناد را پوشش دهد.
خط لوله عمومی از دو ماژول اصلی تشکیل شده است: ماژول تشخیص ناحیه و ماژول استخراج. ماژول تشخیص ناحیه مسئول شناسایی جداول و بلوکهای متنی درون اسناد اسکنشده است. برای این منظور، سه راهحل مختلف پیادهسازی و آزمایش شدهاند: شبکه عصبی کانولوشنی مبتنی بر ناحیه، مدل ترکیبی کانولوشنی-بازگشتی، و رویکردی مبتنی بر تشخیص نویسه نوری که از موتورهای تجاری بهره میبرد. در رویکرد مبتنی بر تشخیص نویسه نوری، کادرهای محدودکننده متن استخراج شده و به صورت تکراری بر اساس معیارهای شباهت با یکدیگر ادغام میشوند تا نواحی نهایی متن و جدول مشخص شوند. ماژول استخراج نیز پس از دریافت این نواحی، با استفاده از ترکیبی از معیارهای استاندارد و قواعد ابداعی، اقدام به شناسایی کلیدها از میان یک بانک واژگان از پیش تعریفشده و سپس یافتن مقادیر متناظر با آنها میکند. در این مرحله از معیارهایی مانند فاصله لونشتاین برای تطبیق تقریبی واژهها استفاده میشود تا خطاهای احتمالی در تشخیص نویسه نوری و تفاوتهای جزئی در قالببندی کلیدها جبران شود. این خط لوله بر روی چهار ترکیب مختلف تولیدکننده-خط تولید ارزیابی شده و به دقت کلی ۸۷.۱ درصد دست یافته است. دقت در نواحی جدولی حدود ۹۰ درصد و در نواحی متنی حدود ۸۶.۵ درصد گزارش شده است که نشاندهنده عملکرد بهتر مدل در برخورد با ساختارهای جدولی است.
با افزایش حجم دادهها و تنوع قالبها، محدودیتهای خط لوله عمومی آشکار شد. یکی از مشکلات اساسی، وجود خطاها و ناسازگاریها در دادههای مرجع بود که به صورت دستی برچسبگذاری شده بودند. برای مثال، در برخی موارد سلولهای خالی برای مقادیری که در سند وجود داشتند، یا مقادیر مورد انتظار برای کلیدهایی که در سند یافت نمیشدند، در فایلهای مرجع ثبت شده بود. همچنین ناسازگاری در واحدهای اندازهگیری، مانند کیلوگرم در مقابل گرم، فرآیند آموزش مدل را دشوارتر میکرد، زیرا مدل نه تنها باید نحوه شناسایی کلیدها و مقادیر را میآموخت، بلکه میبایست تبدیل بین واحدهای مختلف را نیز درک میکرد که خود منبع خطاهای اضافی بود. به همین دلیل، خط لوله الگوریتمی با رویکردی برنامهمحورتر توسعه یافت تا بتواند نتایج سریع و دقیقی برای انواع خاصی از اسناد ارائه دهد. این خط لوله نیز از دو ماژول تشکیل شده است: ماژول طبقهبندی و ماژول استخراج. ماژول طبقهبندی ابتدا نوع سند را بر اساس سه ویژگی تولیدکننده، خط تولید و قالب سند مشخص میکند. برای این کار دو رویکرد توسعه یافته است: رویکرد ترتیبی که مراحل را به صورت زنجیرهای و از تولیدکننده به خط تولید و سپس به قالب سند طی میکند، و رویکرد چندوجهی که از کل سند، جداول و متنهای درون آن برای تولید یک بردار ویژگی ترکیبی استفاده کرده و سپس با یک شبکه عصبی کاملاً متصل، طبقهبندی نهایی را انجام میدهد.
ماژول استخراج در خط لوله الگوریتمی بر پایه توسعه قالبهای اختصاصی عمل میکند. هر قالب مجموعهای از قواعد الگوریتمی است که برای استخراج جفتهای کلید-مقدار از یک نوع خاص از اسناد طراحی شده است. این قواعد شامل ترکیبهای متنوعی از قوانین سادهتر مانند قاعده واژه، قاعده بین دو واژه، قاعده سطر و قاعده ستون هستند که عمدتاً از عبارات باقاعده برای شناسایی و استخراج مقادیر استفاده میکنند. پس از طبقهبندی سند ورودی، قالب مناسب از کتابخانه قالبها انتخاب شده و بر روی خروجی تشخیص نویسه نوری سند اعمال میشود. با توجه به افزایش خطاها در دادههای مرجع، فرآیند تأیید قالبها نیز به بخشی جداییناپذیر از توسعه تبدیل شد. در این فرآیند، ابتدا اسکریپتی بر روی تعداد مشخصی از اسناد به صورت تصادفی اجرا میشود و سپس اعضای تیم به صورت دستی صحت مقادیر استخراجشده را بررسی میکنند. قالبهایی که دقت بالای ۸۵ درصد را کسب کنند، برای تأیید نهایی به شرکت همکار ارسال میشوند. در حال حاضر کتابخانه قالبها شامل حدود ۴۰ قالب است که مرحله اول تأیید را گذراندهاند و ۱۹ قالب نیز موفق به عبور از مرحله دوم شدهاند. این خط لوله توانسته است به دقت کلی حدود ۹۷.۵ درصد در ۱۹ ترکیب مختلف تولیدکننده-خط تولید دست یابد که به طور قابل توجهی بالاتر از خط لوله عمومی است.
علاوه بر خط لوله الگوریتمی، یک ماژول جداگانه برای پردازش «فرمهای سفارش» توسعه یافته است. فرمهای سفارش نوع خاصی از اسناد مشخصات فنی هستند که برخلاف اسناد معمولی، یک سند واحد ممکن است اطلاعات مربوط به چندین محصول یا حتی میلیونها محصول مختلف را پوشش دهد. هدف اصلی این خط لوله، تولید فهرستی از شمارههای قطعه معتبر بر اساس اطلاعات موجود در جداول فرم سفارش است. در این اسناد، سه نوع جدول اصلی وجود دارد: جدول اطلاعات سفارش که نحوه ترکیب مقادیر برای ساخت شماره محصول را مشخص میکند، جداول مرجع که ویژگیهای پارامتری محصول را ارائه میدهند، و جداول اعتبارسنجی که نشان میدهند کدام ترکیبها منجر به شماره محصول معتبر میشوند. برای استخراج دقیق محتوای این جداول، راهحلهای مختلف تجاری و متنباز مورد بررسی قرار گرفته و در نهایت مدل تحلیل چیدمان مایکروسافت آژور به عنوان بهترین گزینه انتخاب شده است، زیرا توانایی مدیریت سلولهای ادغامشده، حفظ ساختار جدول و یکپارچهسازی قابلیت تشخیص نویسه نوری را به طور همزمان داراست. برای تولید شمارههای قطعه معتبر، دو رویکرد اصلی توسعه یافته است: رویکرد استخراج مستقیم از جدول اطلاعات سفارش که تمام ترکیبهای ممکن را تولید کرده و سپس با مراجعه به جداول اعتبارسنجی، ترکیبهای نامعتبر را حذف میکند، و رویکرد معکوس که از جداول اعتبارسنجی برای کاهش فضای جستجو و افزایش سرعت استفاده میکند. ارزیابیهای اولیه نشان میدهد که این خط لوله به دقت کلی ۸۷.۴ درصد در تولید شمارههای قطعه دست یافته است.
نتایج حاصل از ارزیابی خط لوله الگوریتمی نشان میدهد که این خط لوله به دقت کلی حدود ۹۷.۵ درصد در ۱۹ ترکیب مختلف تولیدکننده-خط تولید دست یافته است. مقایسه با سرویس تجاری تحلیل فرم نشان میدهد که خط لوله پیشنهادی در تمامی موارد آزمایششده عملکرد بهتری داشته است. این برتری ناشی از آن است که بسیاری از راهحلهای تجاری فاقد دانش دامنهای لازم برای استخراج جفتهای کلید-مقدار از اسناد پیچیده هستند و معمولاً در برخورد با جداول ساختاریافته عملکرد بهتری نسبت به متنهای آزاد دارند. با این حال، محدودیتهایی نیز وجود دارد. یکی از چالشهای اصلی، مقیاسپذیری توسعه قالبهاست، زیرا این رویکرد در بلندمدت برای پوشش تمام ۹۹۰ ترکیب تولیدکننده-خط تولید موجود در مجموعه داده، عملی نیست و نیازمند نیروی انسانی قابل توجهی است. راهکارهای آینده شامل توسعه خودکار قالبها و یکپارچهسازی مدلهای زبانی بزرگ در خط لوله است. این مدلها میتوانند برای تولید جاسازیهای اطلاعاتی دقیقتر در ماژول طبقهبندی، و همچنین به عنوان مکانیزم پیشپردازش یا پسپردازش در ماژول استخراج مورد استفاده قرار گیرند. با این حال، استفاده از آنها چالشهایی مانند مسائل حریم خصوصی دادهها و نیاز به توان محاسباتی بالا را به همراه دارد. ادغام ماژول فرم سفارش در خط لوله الگوریتمی نیز گامی دیگر به سوی ایجاد یک خط لوله کاملاً خودکار و یکپارچه برای پردازش انواع مختلف اسناد مشخصات فنی است. به طور کلی، این پژوهش نشان میدهد که رویکرد ترکیبی مبتنی بر قواعد و یادگیری ماشین میتواند به دقت بالایی در استخراج اطلاعات از اسناد فنی دست یابد، اما برای تعمیمپذیری کامل، نیازمند راهکارهای مقیاسپذیرتر و خودکارتر در آینده است.
| عنوان | شماره صفحه |
|---|---|
| فصل ۱: مقدمه | ۱۳ |
| ۱.۱ انگیزه | ۱۳ |
| ۱.۲ بیان مسئله و هدف | ۱۴ |
| ۱.۳ مرور پایاننامه | ۱۵ |
| فصل ۲: پیشینه | ۱۷ |
| ۲.۱ کارهای مرتبط | ۱۷ |
| ۲.۱.۱ استخراج جفت کلید-مقدار | ۱۸ |
| ۲.۱.۲ برگههای مشخصات فنی | ۱۹ |
| ۲.۲ مجموعه داده | ۲۰ |
| ۲.۲.۱ دستههای اولیه | ۲۰ |
| ۲.۲.۲ دسته فعلی | ۲۰ |
| ۲.۲.۳ ناسازگاریهای داده مرجع | ۲۲ |
| فصل ۳: خط لوله عمومی | ۲۵ |
| ۳.۱ مرور کلی خط لوله | ۲۵ |
| ۳.۲ مدل تشخیص ناحیه | ۲۵ |
| ۳.۲.۱ شبکه عصبی کانولوشنی مبتنی بر ناحیه (RCNN) | ۲۷ |
| ۳.۲.۲ مدل ترکیبی کانولوشنی-بازگشتی (CNN-RNN) | ۲۹ |
| ۳.۲.۳ رویکرد مبتنی بر تشخیص نویسه نوری (OCR) | ۳۰ |
| ۳.۳ ماژول استخراج | ۳۱ |
| ۳.۳.۱ شناسایی کلید | ۳۲ |
| ۳.۳.۲ استخراج مقدار | ۳۲ |
| فصل ۴: خط لوله الگوریتمی | ۳۵ |
| ۴.۱ مرور کلی خط لوله | ۳۵ |
| ۴.۲ ماژول طبقهبندی | ۳۵ |
| ۴.۲.۱ رویکرد ترتیبی | ۳۷ |
| ۴.۲.۲ رویکرد چندوجهی | ۳۸ |
| ۴.۳ ماژول استخراج | ۴۰ |
| ۴.۳.۱ توسعه قالب | ۴۱ |
| ۴.۳.۲ تأیید قالب | ۴۱ |
| فصل ۵: خط لوله فرم سفارش | ۴۳ |
| ۵.۱ مرور کلی خط لوله | ۴۳ |
| ۵.۲ مرور کلی قالب سند | ۴۳ |
| ۵.۳ استخراج جدول | ۴۵ |
| ۵.۴ روشهای استخراج شماره قطعه | ۴۸ |
| ۵.۴.۱ استخراج جدول اطلاعات سفارش | ۴۸ |
| ۵.۴.۲ استخراج جدول اعتبارسنجی | ۴۹ |
| فصل ۶: نتایج | ۵۱ |
| ۶.۱ خط لوله عمومی | ۵۱ |
| ۶.۲ خط لوله الگوریتمی | ۵۲ |
| ۶.۳ خط لوله فرم سفارش | ۵۵ |
| ۶.۳.۱ آمار کد محصول و ویژگی پارامتری | ۵۵ |
| ۶.۳.۲ محدودیتهای تشخیص نویسه نوری و داده مرجع | ۵۶ |
| فصل ۷: نتیجهگیری | ۵۹ |
| فصل ۸: کارهای آینده | ۶۱ |
| ۸.۱ خط لولههای الگوریتمی و فرم سفارش | ۶۱ |
| ۸.۲ بهکارگیری مدلهای زبانی بزرگ | ۶۱ |
| منابع | ۶۳ |
وقتی ماشینها «مشخصات فنی» را میفهمند: نگاهی به یک خط لوله ترکیبی برای استخراج کلید-مقدار
تصور کنید هزاران برگه مشخصات فنی روی میز شما ریخته شده است. هر برگه پر از جدول، نمودار، شماره قطعه، جنس مواد و دهها عدد ریز و درشت است. قرار است از دل این انبوه کاغذ، فقط یک چیز بیرون بکشید: «کلید» و «مقدار» متناظر با آن. مثلاً کلید «شماره قطعه» و مقدار «VJ0612Y104KXAAT». انسان برای انجام این کار باید ساعتها وقت بگذارد، اما ماشین میتواند این کار را در چند ثانیه انجام دهد. مسئله اینجاست که این «چند ثانیه» فقط زمانی اتفاق میافتد که ماشین بداند دقیقاً به کجا نگاه کند. پژوهش پیشرو، روایت یک تلاش چندساله برای ساختن چنین ماشینی است.
چرا روشهای آماده به دادِ اسناد فنی نمیرسند؟
امروزه سرویسهای ابری متعددی برای پردازش اسناد وجود دارند. کافی است یک تصویر را به آنها بدهید تا متن را استخراج کنند، حتی جداول را تشخیص دهند و ساختارشان را برگردانند. اما وقتی پای اسناد مشخصات فنی به میان میآید، این سرویسها معمولاً کم میآورند.
دلیلش ساده است: هر تولیدکننده، هر خط تولید و حتی هر محصول، قالب سند مخصوص خودش را دارد. یک شرکت قطعات الکترونیکی ممکن است دهها نوع برگه فنی مختلف داشته باشد. سرویسهای تجاری که برای «یک» قالب طراحی شدهاند، در برابر این تنوع رنگ میبازند. آنها نمیدانند که در فلان سند، مقدار «جنس مواد» باید از کدام سلول جدول بیرون کشیده شود، یا اینکه عدد «۱۴.۵» در کدام واحد اندازهگیری است. اینجاست که دانش دامنهای (Domain Knowledge) به میدان میآید؛ چیزی که ماشینهای عمومی از آن بیبهرهاند.
خط لوله عمومی: اولین قدم با یادگیری ماشین
اولین راهحل این تیم، یک خط لوله دو ماژولی بود. ماژول اول با استفاده از یادگیری ماشین، نواحی مختلف سند را تشخیص میداد: کدام قسمت جدول است و کدام قسمت متن آزاد. برای این کار سه روش مختلف آزمایش شد؛ از شبکههای عصبی کانولوشنی مبتنی بر ناحیه گرفته تا مدلهای ترکیبی و حتی استفاده از موتورهای تشخیص نویسه نوری تجاری.
ماژول دوم، یعنی ماژول استخراج، کار هوشمندانهتری انجام میداد. ابتدا با استفاده از یک بانک واژگان از پیش تعریفشده، کلیدها را در متن پیدا میکرد. اما چون تشخیص نویسه نوری همیشه بینقص نیست و ممکن است کلمهای را با یک حرف اشتباه بخواند، از معیار «فاصله لونشتاین» استفاده میشد. این معیار محاسبه میکند که برای تبدیل یک کلمه به کلمه دیگر، چند حرف باید اضافه، حذف یا جابهجا شود. به این ترتیب، حتی اگر ماشین «شماره قطعه» را «شماره قطیعه» خوانده باشد، باز هم میتواند کلید درست را تشخیص دهد.
نتیجه؟ دقت کلی ۸۷.۱ درصد روی چهار ترکیب مختلف تولیدکننده-خط تولید. عدد بدی نیست، اما کافی نیست. زیرا دادههای مرجع (Ground Truth) که به صورت دستی برچسبگذاری شده بودند، پر از خطا و ناسازگاری بودند. گاهی مقداری در سند وجود داشت اما در فایل مرجع خالی بود. گاهی واحد اندازهگیری در سند «گرم» بود اما در فایل مرجع «کیلوگرم» ثبت شده بود. آموزش یک مدل یادگیری ماشین روی چنین دادهای، مثل ساختن خانه روی زمین سست است.
خط لوله الگوریتمی: وقتی قواعد جای یادگیری را میگیرند
وقتی مجموعه داده از چند ده سند به هزاران سند رسید و تعداد قالبها سر به فلک کشید، تیم تصمیم گرفت مسیر متفاوتی را امتحان کند. به جای اینکه یک مدل یادگیری ماشین را روی همه اسناد آموزش دهد، برای هر نوع سند یک «قالب» اختصاصی بسازد. این قالبها مجموعهای از قواعد برنامهنویسیشده هستند که دقیقاً میدانند کلید مورد نظر کجاست و مقدارش را از کجا بردارند.
اما قبل از استخراج، باید نوع سند مشخص شود. اینجا ماژول طبقهبندی وارد میشود. دو رویکرد برای این کار توسعه یافت: رویکرد ترتیبی که مثل یک درخت تصمیمگیری از تولیدکننده به خط تولید و سپس به قالب سند میرسد، و رویکرد چندوجهی که همزمان به تصویر کل سند، جداول و متنهای آن نگاه میکند و با یک شبکه عصبی، بردار ویژگی ترکیبی میسازد.
نتیجه این تغییر رویکرد، جهشی چشمگیر بود: دقت ۹۷.۵ درصد در ۱۹ ترکیب مختلف تولیدکننده-خط تولید. در مقایسه با سرویس تجاری «تحلیل فرم» گوگل، این خط لوله در تمامی موارد آزمایششده برنده شد. جالب اینکه سرویس تجاری در اسنادی که اطلاعاتشان داخل جداول ساختاریافته بود، عملکرد بهتری داشت؛ اما در اسناد پیچیدهتر که نیاز به دانش دامنهای داشتند، به شدت ضعیف عمل کرد.
فرمهای سفارش: وقتی یک سند، میلیونها محصول را در خود جا میدهد
در میان اسناد مشخصات فنی، نوع خاصی وجود دارد که با بقیه فرق میکند: «فرم سفارش». در یک فرم سفارش، ممکن است اطلاعات مربوط به میلیونها محصول مختلف در یک سند واحد جمع شده باشد. اینجا دیگر خبری از یک کلید و یک مقدار ساده نیست؛ باید ترکیبهای مختلف مقادیر را کنار هم گذاشت تا شماره محصول نهایی ساخته شود.
در این اسناد سه نوع جدول وجود دارد: جدول اطلاعات سفارش که نحوه ترکیب مقادیر را نشان میدهد، جداول مرجع که ویژگیهای پارامتری محصول را ارائه میدهند، و جداول اعتبارسنجی که مشخص میکنند کدام ترکیبها معتبر هستند. تیم برای استخراج دقیق این جداول، چندین راهحل تجاری را آزمایش کرد و در نهایت مدل «تحلیل چیدمان» مایکروسافت آژور را انتخاب کرد، چون هم سلولهای ادغامشده را مدیریت میکرد، هم ساختار جدول را حفظ میکرد و هم قابلیت تشخیص نویسه نوری داشت.
دو رویکرد برای تولید شمارههای قطعه معتبر توسعه یافت. رویکرد اول همه ترکیبهای ممکن را میساخت و سپس با جدول اعتبارسنجی، نامعتبرها را حذف میکرد. رویکرد دوم از جدول اعتبارسنجی شروع میکرد و به عقب برمیگشت. نتیجه نهایی: دقت ۸۷.۴ درصد در تولید شماره قطعه، که برای مرحله اولیه توسعه، عدد امیدوارکنندهای است.
چرا این پژوهش مهم است؟
اهمیت این کار فقط در اعداد و درصدها نیست. این پژوهش نشان میدهد که ترکیب «قواعد» و «یادگیری ماشین» میتواند از هر کدام به تنهایی قویتر باشد. قواعد، دانش دامنهای را وارد سیستم میکنند و یادگیری ماشین، انعطافپذیری را. اما بزرگترین درس این پژوهش چیز دیگری است: داده مرجع تمیز و قابل اعتماد، پیشنیاز هر سیستم هوشمندی است. اگر دادهای که به مدل میدهید پر از خطا باشد، بهترین الگوریتمها هم نمیتوانند معجزه کنند.
نگاه به آینده نیز بخشی از این روایت است. تیم پیشنهاد میکند که در نسخههای بعدی، از مدلهای زبانی بزرگ (LLM) استفاده شود. این مدلها میتوانند جاسازیهای اطلاعاتی دقیقتری بسازند، متن را پیشپردازش کنند و حتی خودشان جفتهای کلید-مقدار را استخراج کنند. اما چالشهایی هم وجود دارد: مسائل حریم خصوصی دادهها و هزینه محاسباتی بالا. با این حال، مسیر پیشرو روشن است: خودکارسازی هرچه بیشتر، تعمیمپذیری بالاتر و کاهش وابستگی به نیروی انسانی.
سخن آخر
این پایاننامه روایت یک سفر است؛ از یک خط لوله ساده که فقط چهار نوع سند را میشناخت، تا سیستمی که دهها هزار سند را با دقت بالای ۹۷ درصد پردازش میکند. در این مسیر، تیم یاد گرفت که هیچ راهحل جادویی وجود ندارد. باید ترکیب درستی از قواعد، یادگیری ماشین، دانش دامنهای و داده باکیفیت را کنار هم گذاشت. و شاید مهمترین درس برای هر کسی که در حوزه پردازش اسناد کار میکند این باشد: قبل از اینکه به فکر مدلهای پیچیده باشید، اول دادههایتان را تمیز کنید.