تیم Qwen علی‌بابا در ۱۸ سپتامبر ۲۰۲۶ مدل Qwen3.8-Omni-Flash را معرفی کرد. این مدل نخستین مدل چندوجهی (omni-modal) این تیم است که حول قابلیت‌های عامل‌محور (agentic) طراحی شده: ورودی آن متن، تصویر، صوت و ویدئو است و خروجی فقط متن. درک صوتی-تصویری، استدلال و استفاده از ابزار در یک مدل واحد جمع شده‌اند.

معماری و محدودیت‌ها#

Qwen3.8-Omni-Flash بر پایه معماری Qwen3.8-Flash-Next ساخته شده که وزن‌های باز خود را در اوت ۲۰۲۶ منتشر کرده بود. اما این مدل در لحظه انتشار فقط از طریق API در دسترس است و وزن‌های باز ندارد. پنجره زمینه ۱M توکن است: حداکثر ۹۹۱K ورودی و ۱۳۱K خروجی، با حداکثر طول استدلال ۲۶۲K توکن. حالت تفکر (thinking) به‌صورت پیش‌فرض روشن است و reasoning_effort روی xhigh تنظیم شده.

محدودیت‌های ورودی رسانه‌ای شامل این موارد است:

  • ویدئو تا ۲ ساعت و ۲ گیگابایت (از طریق URL)
  • صوت تا ۳ ساعت
  • ورودی صوتی در ۱۱۳ زبان و گویش
  • پایدار تا ۱۵ fps برای نمونه‌برداری ویدئو
  • پشتیبانی از استریو دوکاناله و صدای فضایی FOA چهارکاناله

درک عامل‌محور ویدئو#

تیم پژوهشی Qwen روشی متفاوت از خوانش خطی ویدئو را توضیح می‌دهد: عامل از سؤال شروع می‌کند، تصمیم می‌گیرد چه چیزی را ببیند و بشنود، و در چند دور از کل به جزء شواهد جمع می‌کند. روی OmniVideoBench دقت از ۶۳.۴ به ۶۷.۸ رسیده و مصرف توکن از ۱۴۵,۷۳۶ به ۷۹,۱۱۷ کاهش یافته — حدود ۴۵.۷٪ کمتر. در ۲۹ ارزیابی، میانگین امتیاز بیش از ۲۵٪ نسبت به Qwen3.5-Omni-Plus بهبود یافته است.

قیمت و ابزارهای متن‌باز#

قیمت در QwenCloud برای هر ۱M توکن ورودی ۰.۱۵ دلار و برای خروجی ۰.۴۷ دلار است. ضربه‌های حافظه پنهان ضمنی ۰.۰۱۶ دلار محاسبه می‌شوند. تیم Qwen پروژه Qwen-MM-Plugins را تحت مجوز Apache-2.0 متن‌باز کرده که قابلیت‌های چندوجهی را به هارنس‌های عاملی مثل Claude Code، Codex و Gemini CLI اضافه می‌کند.

خوانش تحریریه#

برای کسی که همین حالا ایجنت می‌سازد، دو چیز در این خبر عملی است: نخست، روش درک عامل‌محور ویدئو — شروع از سؤال به‌جای خوانش خطی — یک تغییر معماری واقعی است که هزینه توکن را در سناریوهای ویدئوی بلند به‌طور محسوس پایین می‌آورد. دوم، Qwen-MM-Plugins نشان می‌دهد که Qwen فقط مدل نمی‌سازد، بلکه زیرساخت هارنس را هم هدف گرفته. اما توجه کنید: همه اعداد بنچمارک از خود Qwen هستند و هنوز نتیجه مستقلی منتشر نشده. ادعای نزدیکی به Gemini 3.8 Flash را تا تأیید بیرونی باید با احتیاط خواند. همچنین نبود وزن‌های باز یعنی اگر به کنترل محلی نیاز دارید، فعلاً گزینه‌ای ندارید.

منبع: MarkTechPost