Fastino Labs مدل GLiNER2.5-Decide را منتشر کرد: یک طبقه‌بند غیرتولیدی با ۳۴۰ میلیون پارامتر که برای تصمیم‌گیری‌های مکرر داخل خط‌لوله‌های ایجنت طراحی شده — مسیریابی، تریاژ، انتخاب ابزار و گاردریل. مدل روی انکودر DeBERTa-v3-large ساخته شده و از gliner2-large-v1 فاین‌تیون شده است. مجوز Apache 2.0 دارد، با pip install gliner2 نصب می‌شود و روی CPU، GPU یا محیط‌های آیرگپ قابل اجراست.

ساختار و نحوه کار#

GLiNER2.5-Decide هیچ توکنی تولید نمی‌کند و به پرامپت‌تمپلیت نیاز ندارد. در زمان فراخوانی، مجموعه‌برچسب‌ها به‌صورت طرح (schema) پاس داده می‌شوند. هر سؤال در طرح مشخص می‌کند چه پاسخ‌هایی مجاز است و آیا یک پاسخ، چند پاسخ یا یک مقدار ترتیبی انتظار دارد. خط‌لوله دو مرحله دارد: انکودر متن و طرح را با هم می‌خواند و هر پاسخ مجاز را امتیازدهی می‌کند؛ سپس یک دیکودر مقید، بالاترین امتیاز اشتراکی را که قواعد اعلام‌شده اجازه می‌دهند، جست‌وجو می‌کند.

Fastino صریح است که مدل استدلال نمی‌کند، توضیح نمی‌دهد و به سؤالات باز پاسخ نمی‌دهد. این یک متخصص تصمیم‌های عملیاتی است.

چرا دیکودینگ مشترک مهم است#

در یک مثال گاردریل، وقتی پاسخ‌ها مستقل دیکود شدند، مدل حمله پرامپت‌اینجکشن را با ۰.۸۲ تشخیص داد و همان پرامپت را با ۰.۵۲ «امن» برچسب زد. دیکودینگ مشترک با قاعده‌ای که هر آسیب تشخیص‌داده‌شده حکم «ناامن» می‌طلبد، safety=unsafe و harm_type=prompt_injection را همزمان برمی‌گرداند. کد پایین‌دست می‌تواند از این امتیازها برای بلاک، مسیریابی یا تشدید استفاده کند.

مقایسه‌بندی و تأخیر#

مدل روی مجموعه‌داده داخلی Fast Decisions (۵٬۱۰۰ نمونه، ۱۷ دیتاست) میانگین دقت ۶۰.۱٪ به دست آورد و در ۹ دیتاست از ۱۷ پیشتاز بود. در مسیریابی نیت، ۷۵.۳٪ (پشتیبانی) و ۶۴.۳٪ (بانکی) ثبت شد — به‌ترتیب ۱۸.۶ و ۸.۶ امتیاز جلوتر از نزدیک‌ترین رقیب.

تأخیر p50 در batch 1 با طرح ۲ سؤالی و ۱۵ برچسب:

  • ۱۶۷.۳ میلی‌ثانیه روی Intel Xeon Platinum 8581C (۴۸ vCPU)
  • ۳۸.۳ میلی‌ثانیه روی NVIDIA V100
  • ۴۳.۶ میلی‌ثانیه روی T4
  • ۴۷.۳ میلی‌ثانیه روی A100

خانواده مدل#

Fastino نسخه GLiNER2.5-Decide-1B را هم منتشر کرده که روی انکودر Ettin 1B ساخته شده و ۵۹.۶٪ دقت می‌گیرد. برای ورودی چندزبانه، مدل GLiNER2.5-multi-Decide با ۲۸۷ میلیون پارامتر و دقت ۵۶.۷٪ در دسترس است. فاین‌تیونینگ محلی با LoRA یا کامل از طریق GLiNER2 trainer ممکن است.

خوانش تحریریه#

این مدل برای کسی که ایجنت می‌سازد و می‌خواهد لایه تصمیم‌گیری را از LLM جدا کند، گزینه مشخصی است: ارزان‌تر، سریع‌تر و قابل‌اجرا روی سخت‌افزار موجود. اما باید توجه داشت که دقت ۶۰.۱٪ روی یک بنچمارک داخلی و خودساخته گزارش شده و مقایسه با مدل‌های ۴ میلیاردی ممکن است شرایط یکسانی نداشته باشد. اگر طرح سؤالات شما پیچیده و چندمرحله‌ای است، هنوز LLM بزرگ‌تر ابزار مناسب‌تری است. GLiNER2.5-Decide جایی می‌درخشد که تصمیم‌های تک‌لایه، پرتکرار و با تأخیر کم دارید.

منبع: MarkTechPost