شرکت ریسکد (Redis) سرویس جدیدی تحت عنوان LangCache را به صورت پیش‌نمایش عمومی روی پلتفرم Redis Cloud منتشر کرده است. این سرویس یک لایه کش معنایی مدیریت‌شده است که در میان برنامه کاربردی و مدل زبانی بزرگ (LLM) قرار می‌گیرد تا با شناسایی درخواست‌های تکراری، هزینه‌های استفاده از API را کاهش دهد.

بر اساس اعلام ریسکد، LangCache قادر است هزینه‌های API را تا ۹۰ درصد کاهش داده و سرعت پاسخ‌دهی در حالت‌هایی که پاسخ از کش برگردانده می‌شود، را تا ۱۵ برابر سریع‌تر کند. این در حالی است که در یک آزمایش عملیاتی داخلی، سرعت پاسخ‌دهی حدود ۶ برابر بهبود یافت.

چرایی نیاز به کش معنایی#

در بسیاری از کاربردهای تولیدی مانند دستیاران پشتیبانی مشتریان، هزاران سوال با مفاهیم یکسان اما با بیان‌های متفاوت ارسال می‌شود. روش‌های سنتی مثل «کش پیشوند» (Prefix Caching) تنها بخشی از هزینه پردازش را کاهش می‌دهند، اما همچنان درخواست به مدل ارسالی می‌شود. LangCache با ذخیره خود پاسخ نهایی، از انجام مجدد محاسبات مدل در صورت تشابهت معنایی جلوگیری می‌کند.

  • عملکرد: قبل از ارسال به مدل، پرس‌وجو از طریق REST API جستجو می‌شود. اگر شباهت معنایی آستانه تعیین‌شده را پاس کند، پاسخ قبلی بازگردانده می‌شود.
  • ذخیره‌سازی: در صورت عدم وجود پاسخ مشابه، درخواست به مدل فرستاده شده و نتیجه جدید ذخیره می‌شود.

محاسبه صرفه‌جویی و محدودیت‌ها#

صرفه‌جویی اصلی ناشی از حذف هزینه توکن‌های خروجی مدل است. ریسکد فرمولی ساده ارائه می‌دهد: هزینه ماهانه توکن‌های خروجی ضرب‌در نرخ برخورد کش. با این حال، موفقیت این سیستم وابسته به تنظیم دقیق آستانه شباهت و سیاست‌های انقضا (TTL) است. آستانه پایین منجر به پاسخ‌های نادرست و آستانه بالا باعث می‌شود کش کارایی لازم را نداشته باشد.

این سرویس از طریق SDK های پایتون و جاوااسکریپت در دسترس است و دیتای کاربران روی سرورهای آن‌ها باقی می‌ماند. شرکت ریسکد اعلام کرده که از داده‌ها برای آموزش مدل‌ها استفاده نخواهد کرد.

منبع: MarkTechPost