شرکت Liquid AI مدل LFM2.5-VL-3B-DSpark را به‌عنوان یک مدل پیش‌نویس (Drafter) آزمایشی برای افزایش سرعت استنتاج مدل بینایی-زبانی LFM2.5-VL-3B معرفی کرد. این مدل با افزودن حدود ۲۸۰ میلیون پارامتر به مدل اصلی، سرعت تولید توکن را افزایش می‌دهد بدون اینکه خروجی نهایی تغییر کند.

مدل‌های استاندارد زبانی هر بار فقط یک توکن تولید می‌کنند، اما روش کدگذاری حدسی از یک مدل کوچک‌تر برای پیشنهاد چند توکن همزمان استفاده می‌کند و سپس مدل اصلی، صحت آن‌ها را در یک مرحله بررسی می‌کند. مدل DSpark از روشی مشابه مدل‌های متنی Liquid AI پیروی می‌کند و حالت‌های پنهان (Hidden States) مدل هدف را از چندین لایه می‌خواند. نکته کلیدی اینجاست که برای این مدل پیش‌نویس، نوع داده (متن یا تصویر) فرقی نمی‌کند، زیرا در لایه‌های پنهان، توکن‌های متنی و پچ‌های تصویری هر دو به صورت تانسور در می‌آیند.

معماری مدل پیش‌نویس شامل ۴ لایه توجه (Attention) و یک بخش پیش‌بینی مارکوف است. این مدل از داده‌های آموزش با نظارت کامل (Supervised Fine-Tuning) برای ۱۰ دوره آموزش دیده و تمام آزمایش‌ها روی سخت‌افزارهای AMD انجام شده است.

عملکرد در سخت‌افزارهای مختلف#

بر اساس نتایج ارائه‌شده، این مدل افزایش سرعت زیر را در پیکربندی‌های مختلف داشته است:

  • Apple M5 Max (با MLX-VLM): افزایش سرعت استنتاج تا ۳.۱۳ برابر و افزایش سرعت کل تا ۲.۶۲ برابر.
  • NVIDIA H100 (با SGLang): افزایش سرعت استنتاج تا ۲.۶۶ برابر و افزایش سرعت کل تا ۲.۲۷ برابر.
  • Apple M3 Ultra (با llama.cpp): افزایش سرعت استنتاج تا ۲.۱۴ برابر و افزایش سرعت کل تا ۱.۷۷ برابر.

توجه به این نکته ضروری است که افزایش سرعت کل (End-to-End) همیشه کمتر از افزایش سرعت استنتاج است. دلیل آن این است که بخش‌های کدگذاری تصویر و پیش‌پردازش (Prefill) همچنان با سرعت قبلی اجرا می‌شوند. در دستگاه‌های Edge که قدرت پردازشی کمتری دارند، این محدودیت بیشتر حس می‌شود.

دسترسی و محدودیت‌ها#

مدل LFM2.5-VL-3B-DSpark در حال حاضر در Hugging Face با فرمت‌های Safetensors و GGUF در دسترس است و از همان روز اول در SGLang، MLX-VLM و llama.cpp پشتیبانی می‌شود. این مدل تحت مجوز LFM Open License v1.0 منتشر شده که استفاده تجاری رایگان را فقط برای شرکت‌هایی با درآمد سالانه کمتر از ۱۰ میلیون دلار مجاز می‌داند.

تحلیل تحریریه#

انتشار این مدل نشان می‌دهد که روش کدگذاری حدسی از مدل‌های متنی خالص خارج شده و به حوزه مدل‌های چندوجهی (Multimodal) رسیده است. برای توسعه‌دهندگانی که از مدل‌های بینایی-زبانی روی سخت‌افزارهای محدود مثل لپ‌تاپ‌های Apple Silicon یا GPUهای تک‌نفره استفاده می‌کنند، این مدل می‌تواند تجربه کاربری را بهبود بخشد. با این حال، باید در نظر داشت که این مدل هنوز در مرحله آزمایشی است و شتاب‌دهی به مدل‌های کوانتیزه‌شده (Quantized) هنوز پیاده‌سازی نشده است. همچنین، محدودیت‌های مجوز استفاده تجاری، آن را برای استارتاپ‌های کوچک مناسب می‌کند اما شرکت‌های بزرگ‌تر را از استفاده رایگان محروم می‌سازد.

منبع: MarkTechPost