Contrastive-LM مدل CLM-8B را منتشر کرد؛ اولین مدل متن‌باز در کلاس جدیدی به نام مدل‌های زبان تقابل‌یافته (CLMs). این مدل برخلاف مدل‌های زبانی متعارف، متن تولید نمی‌کند؛ بلکه مجموعه‌ای از اقدامات نامزد را در برابر وضعیت فعلی ارزیابی کرده و احتمال آن‌ها را برمی‌گرداند. رقیب اصلی این مدل، Jev نام دارد؛ یک مدل انحصاری سیستم یک از شرکت TypeSafe AI.

قابلیت استقرار و رابط کاربری#

مدل CLM-8B تحت مجوز Apache-2.0 منتشر شده و حجم بخش قابل آموزش (head) آن تنها ۷۵ مگابایت است. این مدل روی یک کارت گرافیک NVIDIA تحت لینوکس اجرا می‌شود و از vLLM برای سرویس‌دهی به انکودر Qwen3-8B استفاده می‌کند. مخزن GitHub پروژه، CLM-8B را پشت یک API سازگار با TypeSafe ارائه می‌دهد که سه نوع درخواست را پشتیبانی می‌کند:

  • Noul: احتمال درست بودن یک گزاره را برمی‌گرداند.
  • Choice: یک گزینه را از میان مجموعه‌ای اعلام‌شده به همراه احتمال انتخاب می‌کند.
  • Score: سطح مورد انتظار را روی یک مقیاس رتبه‌بندی‌شده برمی‌گرداند.

معماری و آموزش#

CLM با یک انکودر وضعیت و یک انکودر اقدام کار می‌کند که هر دو از بدنه‌ی منجمد Qwen3-8B و یک بخش قابل آموزش ۲۰ میلیون پارامتری تشکیل شده‌اند. این مدل با تابع زیان InfoNCE دوطرفه آموزش دیده و در زمان استنتاج، هر نامزد را با ضرب نقطه‌ای بردارهای وضعیت و اقدام امتیازدهی می‌کند. استفاده از حافظه کش‌شده روی GPU باعث می‌شود زمان دسترسی به وضعیت‌های تکراری در یک حلقه ایجنت از ۱.۷ میلی‌ثانیه به ۰.۶ میلی‌ثانیه کاهش یابد.

فرآیند آموزش در سه مرحله انجام شده است: پیش‌آموزش روی حدود ۶۰ میلیون جفت پرسش و پاسخ Nemotron DQA، میانه‌آموزش روی ۳۰ میلیون نمونه منفی سخت ساخته‌شده توسط Gemini 2.5 Flash-Lite، و پس‌آموزش روی حدود ۱ میلیون مسیر ایجنت. در تست‌های zero-shot روی بازی T-Rex، مدل CLM با تأخیر ۱۶.۵ میلی‌ثانیه در برابر ۱۴۹.۸ میلی‌ثانیه مدل Jev، همان دقت ۵ از ۵ را کسب کرد.

تحلیل تحریریه: چرا این مدل برای ایجنت‌سازان اهمیت دارد؟#

انتشار CLM-8B نشان می‌دهد که می‌توان بخش «تصمیم‌گیری» در ایجنت‌های زبانی را از فرآیند سنگین «تولید متن» جدا کرد. اگرچه این مدل در دقت محض (مثلاً در فراخوانی ابزار) هنوز به پای Jev نمی‌رسد، اما سرعت ۴ تا ۹ برابری آن با هزینه محاسباتی بسیار پایین‌تر، آن را به گزینه‌ای ایده‌آل برای ایجنت‌هایی تبدیل می‌کند که باید در هر گام، ده‌ها یا صدها نامزد را ارزیابی کنند. برای توسعه‌دهندگانی که از روش‌هایی مثل Best-of-N استفاده می‌کنند، جایگزینی یک مدل زبانی سنگین با یک مدل امتیازدهنده سبک مثل CLM می‌تواند هزینه‌های عملیاتی را به‌شدت کاهش دهد، به شرطی که دقت مورد نیاز پروژه در سطح قابل قبولی تأمین شود.

منبع: MarkTechPost