تیم Qwen علیبابا در ۱۸ سپتامبر ۲۰۲۶ مدل Qwen3.8-Omni-Flash را معرفی کرد. این مدل نخستین مدل چندوجهی (omni-modal) این تیم است که حول قابلیتهای عاملمحور (agentic) طراحی شده: ورودی آن متن، تصویر، صوت و ویدئو است و خروجی فقط متن. درک صوتی-تصویری، استدلال و استفاده از ابزار در یک مدل واحد جمع شدهاند.
معماری و محدودیتها#
Qwen3.8-Omni-Flash بر پایه معماری Qwen3.8-Flash-Next ساخته شده که وزنهای باز خود را در اوت ۲۰۲۶ منتشر کرده بود. اما این مدل در لحظه انتشار فقط از طریق API در دسترس است و وزنهای باز ندارد. پنجره زمینه ۱M توکن است: حداکثر ۹۹۱K ورودی و ۱۳۱K خروجی، با حداکثر طول استدلال ۲۶۲K توکن. حالت تفکر (thinking) بهصورت پیشفرض روشن است و reasoning_effort روی xhigh تنظیم شده.
محدودیتهای ورودی رسانهای شامل این موارد است:
- ویدئو تا ۲ ساعت و ۲ گیگابایت (از طریق URL)
- صوت تا ۳ ساعت
- ورودی صوتی در ۱۱۳ زبان و گویش
- پایدار تا ۱۵ fps برای نمونهبرداری ویدئو
- پشتیبانی از استریو دوکاناله و صدای فضایی FOA چهارکاناله
درک عاملمحور ویدئو#
تیم پژوهشی Qwen روشی متفاوت از خوانش خطی ویدئو را توضیح میدهد: عامل از سؤال شروع میکند، تصمیم میگیرد چه چیزی را ببیند و بشنود، و در چند دور از کل به جزء شواهد جمع میکند. روی OmniVideoBench دقت از ۶۳.۴ به ۶۷.۸ رسیده و مصرف توکن از ۱۴۵,۷۳۶ به ۷۹,۱۱۷ کاهش یافته — حدود ۴۵.۷٪ کمتر. در ۲۹ ارزیابی، میانگین امتیاز بیش از ۲۵٪ نسبت به Qwen3.5-Omni-Plus بهبود یافته است.
قیمت و ابزارهای متنباز#
قیمت در QwenCloud برای هر ۱M توکن ورودی ۰.۱۵ دلار و برای خروجی ۰.۴۷ دلار است. ضربههای حافظه پنهان ضمنی ۰.۰۱۶ دلار محاسبه میشوند. تیم Qwen پروژه Qwen-MM-Plugins را تحت مجوز Apache-2.0 متنباز کرده که قابلیتهای چندوجهی را به هارنسهای عاملی مثل Claude Code، Codex و Gemini CLI اضافه میکند.
خوانش تحریریه#
برای کسی که همین حالا ایجنت میسازد، دو چیز در این خبر عملی است: نخست، روش درک عاملمحور ویدئو — شروع از سؤال بهجای خوانش خطی — یک تغییر معماری واقعی است که هزینه توکن را در سناریوهای ویدئوی بلند بهطور محسوس پایین میآورد. دوم، Qwen-MM-Plugins نشان میدهد که Qwen فقط مدل نمیسازد، بلکه زیرساخت هارنس را هم هدف گرفته. اما توجه کنید: همه اعداد بنچمارک از خود Qwen هستند و هنوز نتیجه مستقلی منتشر نشده. ادعای نزدیکی به Gemini 3.8 Flash را تا تأیید بیرونی باید با احتیاط خواند. همچنین نبود وزنهای باز یعنی اگر به کنترل محلی نیاز دارید، فعلاً گزینهای ندارید.
منبع: MarkTechPost






دیدگاهها
برای گذاشتن دیدگاه وارد شو
دیدگاهها فقط از حسابهای کاربری پذیرفته میشوند.
ورود / ثبتنامهنوز دیدگاهی ثبت نشده — اولین نفر باش.