پس از همهگیر شدن استفاده از مدلهای زبانی بزرگ (LLMs) در صنعت، بهرهگیری از آنها برای تبدیل متن به کوئریهای پایگاه داده (Text-to-SQL) به یکی از جذابترین راهکارها در حوزه تحلیل داده تبدیل شد؛ راهکاری که به کاربران اجازه میدهد پرسشهای خود را به زبان طبیعی مطرح کرده و پاسخ دقیق را بر اساس دادههای موجود در پایگاه داده دریافت کنند. ایده اولیه بر پایه اتصال مستقیم مدل به پایگاه داده از طریق معرفی ساختار (Schema) و اطلاعات مورد نیاز استوار بود. اما در محیطهای عملیاتی و واقعی سازمانها، این روش با چالشهای جدی مواجه میشود.
در واقع، علاوه بر ابهامات متداول در درک زبان طبیعی انسان، تولید کوئریهای نادرست به دلیل عدم درک منطق کسبوکار، چالشهای مربوط به مدیریت امنیت، تعیین سطح دسترسی و ریسک نشت داده از مشکلات کلیدی این رویکرد به شمار میروند؛ ضمن آنکه نباید از هزینههای بالای پردازش و کاهش سرعت به دلیل ارسال حجم عظیم دادهها به مدل نیز غافل شد.
مقاله «Beyond Text-to-SQL: Building a Governed Agentic Data Stack» با بررسی راهکار شرکتهای پیشرو نظیر Anthropic نشان میدهد که حل این چالشها نیازمند اصلاح زیرساخت و حاکمیت داده (Data Governance) است و با مهندسی پرامپت ساده برطرف نمیشود. در واقع، پیام اصلی این مقاله آن است که نباید دسترسی مستقیم به پایگاه داده خام را در اختیار مدلهای زبانی قرار داد؛ بلکه باید یک معماری چندلایه طراحی کرد تا بستری امن، استاندارد و قابل اعتماد برای تحلیلهای دقیقِ عاملهای هوشمند (Agents) فراهم شود.
Beyond Text-to-SQL: Building a Governed Agentic Data Stack