چالش‌ها و راهکارهای بهبود سیستم‌های RAG در صنایع مهندسی سنگین

چالش‌ها و راهکارهای بهبود سیستم‌های RAG در صنایع مهندسی سنگین

در سال‌های اخیر، بسیاری از شرکت‌ها و سازمان‌ها به منظور مدیریت دانش سازمانی و دسترسی سریع به اطلاعات، از سیستم‌های بازیابی اطلاعات مبتنی بر مدل‌های زبان بزرگ (RAG) استفاده کرده‌اند. این سیستم‌ها با هدف ساده‌سازی و دموکراتیزه کردن دانش سازمانی، امکان جستجو و استخراج اطلاعات از اسناد مختلف مانند فایل‌های PDF را فراهم می‌کنند. با این حال، در صنایع مهندسی سنگین که مستندات فنی پیچیده و ساختارمند دارند، عملکرد این سیستم‌ها اغلب رضایت‌بخش نبوده است.

یکی از مشکلات اصلی در این حوزه، نحوه پردازش اولیه اسناد است. سیستم‌های RAG معمولاً اسناد را به صورت رشته‌های متنی ساده و بدون توجه به ساختار و محتوای بصری آن‌ها پردازش می‌کنند. روش رایج «تقسیم‌بندی با اندازه ثابت» که متن را هر ۵۰۰ کاراکتر یک بار می‌شکند، در متون فنی و مهندسی باعث از بین رفتن پیوستگی منطقی و ساختار اطلاعات می‌شود. به عنوان مثال، جداول مهمی که شامل مشخصات فنی هستند، به بخش‌های جداگانه تقسیم می‌شوند و ارتباط بین سرفصل‌ها و مقادیر مربوطه قطع می‌شود. این امر باعث می‌شود که هنگام جستجو، سیستم تنها بخشی از اطلاعات را بازیابی کند و مدل زبان بزرگ مجبور به حدس زدن پاسخ شود که منجر به خطا و هذیان‌گویی می‌شود.

راهکار اصلی برای رفع این مشکل، استفاده از «تقسیم‌بندی معنایی» است. در این روش به جای تقسیم متن بر اساس تعداد کاراکتر، از ابزارهای تحلیل ساختار سند مانند Azure Document Intelligence استفاده می‌شود تا بخش‌های مختلف سند بر اساس فصل‌ها، بخش‌ها، پاراگراف‌ها و ساختار منطقی آن تقسیم‌بندی شوند. این کار باعث حفظ انسجام منطقی بخش‌ها و همچنین نگهداری کامل جداول به صورت یکپارچه می‌شود. نتایج آزمایش‌های داخلی نشان داده است که این روش دقت بازیابی اطلاعات از جداول فنی را به طور قابل توجهی افزایش می‌دهد و از تکه‌تکه شدن اطلاعات جلوگیری می‌کند.

مشکل دوم در سیستم‌های RAG، ناتوانی در پردازش داده‌های بصری است. بسیاری از اطلاعات مهم در صنایع مهندسی در قالب نمودارهای جریان، دیاگرام‌های سیستم و نقشه‌های معماری وجود دارد که مدل‌های متنی استاندارد قادر به درک آن‌ها نیستند و در فرایند نمایه‌سازی نادیده گرفته می‌شوند. این موضوع باعث می‌شود که پاسخ‌های سیستم به سوالات مرتبط با این داده‌ها ناقص یا نادرست باشد.

برای حل این مشکل، رویکردی به نام «متن‌سازی چندرسانه‌ای» معرفی شده است. در این روش ابتدا با استفاده از مدل‌های بینایی مانند GPT-4o، متن‌های داخل تصاویر با دقت بالا استخراج می‌شوند. سپس مدل بینایی به تحلیل تصویر پرداخته و توضیحی طبیعی و مفصل درباره محتوای آن تولید می‌کند، مثلاً “نموداری که نشان می‌دهد فرآیند A به فرآیند B منتهی می‌شود اگر دما بالای ۵۰ درجه باشد”. این توضیحات به عنوان متادیتا به همراه تصویر در پایگاه داده ذخیره می‌شوند تا هنگام جستجو، سیستم بتواند بر اساس این توضیحات پاسخ‌های مرتبط را ارائه دهد.

یکی دیگر از چالش‌های مهم در استفاده از سیستم‌های RAG در محیط‌های سازمانی، اعتماد کاربران به پاسخ‌های ارائه شده است. در بسیاری از موارد، کاربران برای اطمینان از صحت پاسخ‌ها مجبور به دانلود اسناد و جستجوی دستی در صفحات می‌شوند که فرآیندی زمان‌بر و ناکارآمد است. برای رفع این مشکل، معماری سیستم باید قابلیت «ارجاع بصری» را پیاده‌سازی کند. به این معنا که پاسخ ارائه شده همراه با نمایش دقیق جدول، نمودار یا بخشی از سند که مبنای پاسخ بوده است، به کاربر نشان داده شود. این قابلیت امکان بررسی و تایید سریع پاسخ‌ها را فراهم می‌کند و شکاف اعتماد بین انسان و هوش مصنوعی را کاهش می‌دهد.

از منظر آینده‌نگری، روش فعلی متن‌سازی چندرسانه‌ای که شامل تبدیل تصاویر به توضیحات متنی است، راهکاری عملی و قابل اجرا محسوب می‌شود، اما روند توسعه مدل‌های چندرسانه‌ای بومی (native multimodal embeddings) مانند Embed ۴ شرکت Cohere نشان می‌دهد که در آینده می‌توان متن و تصویر را به طور مستقیم در یک فضای برداری مشترک نگاشت کرد بدون نیاز به مرحله میانی تولید توضیحات. این پیشرفت‌ها می‌تواند کارایی و دقت سیستم‌های RAG را بیش از پیش افزایش دهد.

همچنین با توسعه مدل‌های زبان بزرگ با قابلیت پردازش متن‌های طولانی (long context LLMs)، ممکن است نیاز به تقسیم‌بندی اسناد کاهش یابد و کل مستندات به صورت یکجا در مدل پردازش شود. اما تا زمانی که هزینه و تاخیر پردازش این مدل‌ها کاهش نیافته است، استفاده از تقسیم‌بندی معنایی و پیش‌پردازش دقیق همچنان بهترین راهکار اقتصادی و عملی برای سیستم‌های RAG در محیط‌های واقعی است.

در نهایت، تفاوت اصلی بین یک دمو یا نمونه آزمایشی سیستم RAG و یک سیستم عملیاتی در نحوه مدیریت پیچیدگی‌ها و واقعیت‌های داده‌های سازمانی نهفته است. اسناد سازمانی را نباید صرفاً به عنوان رشته‌های متنی ساده در نظر گرفت. احترام به ساختار و محتوای بصری اسناد، کلید تبدیل سیستم‌های بازیابی اطلاعات از جستجوگرهای کلمات کلیدی به دستیاران دانش واقعی است که می‌توانند به طور موثری در صنایع مهندسی سنگین مورد استفاده قرار گیرند و ارزش افزوده قابل توجهی ایجاد کنند.

درباره مدیر سیستم

مانتیک، ارائه دهنده فضایی برای دانلود قالب پاورپوینت، گوگل اسلاید، کی‌نوت، موکاپ، طرح های وکتور، طرح های ایلاستریتور، قالب سایت، بروشور، فایل های فتوشاپ، براش و