شرکت ان‌ویدیا (NVIDIA) مدل جدید خود را با نام Nemotron 3 Diarization منتشر کرد. این مدل با ۱۰۰ میلیون پارامتر و به‌صورت وزن‌باز (Open-Weight) روی پلتفرم Hugging Face قرار گرفته و هدف آن پاسخ به این پرسش است که «چه کسی، چه زمانی» صحبت کرده است. قابلیت اصلی این مدل، ردیابی همزمان تا ۸ گوینده حتی در زمان‌های هم‌پوشانی صداست.

تغییرات نسبت به نسخه قبلی#

در مقایسه با مدل قبلی ان‌ویدیا یعنی Streaming Sortformer که تنها از ۴ گوینده پشتیبانی می‌کرد، نسخه جدید این سقف را دو برابر کرده است. معمار این مدل برای مدیریت صداهای شلوغ و چندطرفه طراحی شده که در آن افراد به‌صورت همزمان صحبت می‌کنند. این مدل با پردازش ورودی‌های صوتی با نرخ نمونه‌برداری ۱۶ کیلوهرتز، از یک رمزگذار ۳۱ لایه‌ی ترانسفورمر با امبدینگ‌های چرخشی (RoPE) استفاده می‌کند.

کارایی و تأخیر زمانی#

مدل جدید در چهار سطح مختلف تأخیر زمانی (Latency) عمل می‌کند که کاربر می‌تواند بسته به نیاز خود یکی را انتخاب کند:

  • حالت آفلاین: تأخیر ۳۰.۴ ثانیه با نرخ خطای ۱۲.۷۳٪.
  • حالت کم‌تأخیر: تأخیر ۱.۰۴ ثانیه با نرخ خطای ۱۳.۱۸٪.
  • حالت بسیار کم‌تأخیر: تأخیر ۰.۶۴ ثانیه با نرخ خطای ۱۳.۲۸٪.
  • حالت فوق‌کم‌تأخیر: تأخیر ۰.۳۲ ثانیه با نرخ خطای ۱۳.۵۵٪.

در آزمون‌های انجام‌شده روی Voice Arena، این مدل با نرخ خطای ۱۴.۷۲٪ در میان ۱۲ سیستم رتبه اول را کسب کرد. این عدد نسبت به رتبه دوم، کاهش نسبی حدود ۲۴ درصدی را نشان می‌دهد.

داده‌های آموزشی و دسترسی#

برای آموزش این مدل از حدود ۱۰,۰۰۰ ساعت مکالمه واقعی و ۸۲,۶۱۱ ساعت مکالمه شبیه‌سازی‌شده در ۲۱ زبان مختلف استفاده شده است. مجوز OpenMDW-1.1 امکان استفاده تجاری از این مدل را فراهم می‌کند. کاربران می‌توانند از طریق کتابخانه NVIDIA NeMo روی کارت‌های گرافیک Ampere به بالا از این مدل استفاده کنند. البته هنوز دسترسی به این مدل از طریق Hugging Face Inference Providers فراهم نشده است.

تحلیل تحریریه#

انتشار این مدل برای توسعه‌دهندگانی که روی ساخت دستیارهای صوتی یا تحلیل تماس‌های مشتریان کار می‌کنند، گامی مهم است. افزایش سقف گویندگان از ۴ به ۸ و کاهش نرخ خطا در سناریوهای شلوغ، یعنی این مدل حالا برای جلسات رسمی یا تماس‌های پشتیبانی چندجانبه قابل‌اتکاتر از قبل است. با این حال، توسعه‌دهندگان باید توجه داشته باشند که اگرچه مجوز آن اجازه استفاده تجاری می‌دهد، اما مدل همچنان در محیط‌های با نویز بسیار شدید یا صداهای دور از میکروفون (Far-field) ممکن است دچار افت عملکرد شود.

منبع: MarkTechPost