شرکت SpaceXAI به‌طور رسمی نسخه جدید مدل تبدیل گفتار به نوشتار خود با نام Grok Voice Transcribe 2.0 را عرضه کرد. این شرکت مدعی است که دقت این مدل دو برابر نسخه قبلی آن است، در حالی که قیمت آن بدون تغییر باقی مانده و همچنان از طریق API در دسترس است. این مدل برای کار با فایل‌های صوتی دشوار مانند خطوط تلفنی پر نویز، صداهای همپوشانی و لهجه‌های محلی طراحی شده و در دو حالت دسته‌ای و پخش زنده (Streaming) کار می‌کند.

بر اساس گزارش‌های SpaceXAI، این مدل در جدول رتبه‌بندی Artificial Analysis در بین ۳۲ مدل پخش زنده، رتبه اول دقت را کسب کرده است. نتایج داخلی نشان می‌دهد که نرخ خطای کلمه در عبارات کوتاه و چندزبانه از ۲۰.۶ درصد به ۶.۸ درصد کاهش یافته است که حدود ۶۷ درصد کاهش خطا را نشان می‌دهد.

ویژگی‌های کلیدی و قیمت‌گذاری#

  • قیمت: ۰.۱۰ دلار برای هر ساعت در حالت دسته‌ای و ۰.۲۰ دلار در حالت پخش زنده.
  • امکانات: شامل برچسب‌گذاری زمان کلمه، تفکیک گویندگان و پشتیبانی از تا ۸ کانال صوتی.
  • پشتیبانی زبانی: تشخیص خودکار زبان و پشتیبانی از فرمت‌دهی متنی برای ۲۵ زبان.

تحلیل تحریریه#

برای توسعه‌دهندگانی که به دنبال راه‌حل‌های مقرون‌به‌صرفه برای تبدیل گفتار به نوشتار هستند، این خبر یک گام مثبت است. اگرچه دقت دو برابری ادعا شده بسیار جذاب به نظر می‌رسد، اما باید توجه داشت که نتایج هنوز به صورت مستقل بازتولید نشده‌اند. همچنین، عدم انتشار وزن‌های مدل (Open Weights) به این معنی است که شما نمی‌توانید مدل را به صورت محلی میزبانی کنید و همچنان به سرویس ابری وابسته‌اید. این تغییرات برای شرکت‌هایی که از Loom یا ابزارهای مشابه استفاده می‌کنند، می‌تواند به بهبود کیفیت خروجی‌های خودکار کمک کند.

منبع: MarkTechPost