کیوتای (Kyutai) دو مدل گفتار-به-گفتار با وزن‌های متن‌باز تحت عنوان Voice of Reason منتشر کرد که برای حل مسائل ریاضی به‌صورت گفتاری طراحی شده‌اند. هر دو مدل از پایه‌ی GLM-4-Voice-9B توسعه یافته و با ترکیب تنظیم دقیق نظارت‌شده (SFT) و یادگیری تقویتی (RL) آموزش دیده‌اند. نکته‌ی کلیدی این است که در این معماری هیچ مرحله‌ی تبدیل گفتار به متن (Transcription) و هیچ مدل زبانی متنی جداگانه‌ای در چرخه‌ی پردازش وجود ندارد. دقت این مدل‌ها در حل مسائل گفتاری GSM8K از ۲۷.۳ درصد در مدل پایه به ۷۷.۱ درصد رسیده است.

چرا مدل‌های گفتاری در ریاضی ضعف دارند؟#

خطوط لوله‌ی آبشاری (Cascaded) که گفتار را به متن، متن را به پاسخ و پاسخ را دوباره به گفتار تبدیل می‌کنند، همچنان در استدلال برتری دارند؛ اما هر مرحله تأخیر ایجاد می‌کند و نشانه‌های فرازبانی (Paralinguistic) مانند لحن از بین می‌رود. مدل‌های بومیِ گفتار باید در بازه‌های منظم خروجی صوتی تولید کنند تا تعاملی باقی بمانند، که این محدودیت تعداد توکن‌های پنهان استدلال را کاهش می‌دهد. روش STITCH پیش‌تر دقت را تا ۵۸.۷ درصد بالا برده بود، اما کیوتای ادعا می‌کند که کار آن‌ها نخستین کاربرد یادگیری تقویتی برای استدلال ریاضی در مدل‌های بومی گفتار است.

جزئیات آموزش#

مدل GLM-4-Voice خروجی خود را به‌صورت متناوب تولید می‌کند: ۱۳ توکن متنی و سپس ۲۶ توکن صوتی. در مرحله‌ی اول SFT، از ۱۵۰,۶۱۶ مسئله‌ی Orca-Math استفاده شد که توسط Qwen3-235B بازنویسی و سپس با سیستم TTS کیوتای به گفتار تبدیل شدند. این مرحله دقت را از ۲۷.۳ به ۶۱.۷ درصد رساند.

در مرحله‌ی دوم RL، برای هر سوال گفتاری ۴ پاسخ نمونه‌برداری می‌شود و یک داور (Qwen3-235B-A22B-2507) امتیاز صفر و یک می‌دهد. آموزش روی ۱۶ کارت گرافیک H100 و در ۱,۵۰۰ به‌روزرسانی انجام شد. دو تصمیم طراحی حیاتی بودند:

  • تصحیح دما: لوگاریتم احتمال‌ها پیش از محاسبه‌ی تابع زیان بر دمای نمونه‌برداری تقسیم می‌شوند. بدون این کار، دقت از ۶۵.۵ به ۱۲.۳ درصد سقوط می‌کند.
  • ادغام توکن‌های صوتی: تمام احتمالات واژگان صوتی در هر موقعیت به یک توکن انتزاعی تبدیل می‌شوند تا مدل فقط بداند صدایی باید تولید شود، نه کدام صدای خاص.

مدل‌های منتشرشده#

نسخه‌ی glm-4-voice-of-reason-9b بدون توکن‌های استدلالی اضافی، پاسخ را مستقیماً به‌صورت گفتاری می‌دهد. نسخه‌ی glm-4-voice-of-reason-stitch-9b بین بلوک‌های گفتاری، ۱۰۰ توکن استدلالی بی‌صدا تولید می‌کند که طبق ادعای کیوتای، همزمان با پخش گفتار قبلی ساخته می‌شوند و تأخیر اضافی ایجاد نمی‌کنند.

نتایج و محدودیت‌ها#

بر اساس جدول نتایج، مدل Stitch به دقت ۷۴.۸ درصد (و در نسخه‌ی نهایی منتشرشده ۷۷.۱ درصد) دست یافت. این در حالی است که مدل‌های بزرگ‌تر چندوجهی مانند Qwen3-Omni (با خروجی متنی) به ۹۴.۶ درصد می‌رسند، اما این مقایسه‌ی مستقیمی نیست. جالب آنکه یادگیری تقویتی باعث کوتاه‌تر شدن پاسخ‌های گفتاری شد (از ۴۱.۹ به ۳۶.۴ ثانیه) و طبیعی بودن صدا پس از RL حفظ شد (امتیاز UTMOSv2 تقریباً ثابت ماند). با این حال، دقت در پرسش‌های عمومی (TriviaQA) کاهش یافت.

خوانش تحریریه#

این خبر نشان می‌دهد که فاصله‌ی عملکردی بین مدل‌های بومی گفتار و خطوط لوله‌ی متنی در حوزه‌ی ریاضی به‌طور محسوسی در حال کم شدن است. برای توسعه‌دهندگانی که به دنبال حذف تأخیر و حفظ لحن در دستیارهای صوتی هستند، انتشار این وزن‌ها روی Hugging Face و امکان اجرای آن‌ها روی یک کارت H100، گزینه‌ی عملی جدیدی است. اما باید احتیاط کرد: این مدل‌ها هنوز به سطح دقت مدل‌های زبانی متنی بزرگ نرسیده‌اند و کاهش عملکرد در دانش عمومی (TriviaQA) نشان می‌دهد که بهینه‌سازی برای استدلال ریاضی ممکن است هزینه‌هایی برای کاربردهای عمومی‌تر داشته باشد.

منبع: MarkTechPost