شرکت SpaceXAI بهطور رسمی نسخه جدید مدل تبدیل گفتار به نوشتار خود با نام Grok Voice Transcribe 2.0 را عرضه کرد. این شرکت مدعی است که دقت این مدل دو برابر نسخه قبلی آن است، در حالی که قیمت آن بدون تغییر باقی مانده و همچنان از طریق API در دسترس است. این مدل برای کار با فایلهای صوتی دشوار مانند خطوط تلفنی پر نویز، صداهای همپوشانی و لهجههای محلی طراحی شده و در دو حالت دستهای و پخش زنده (Streaming) کار میکند.
بر اساس گزارشهای SpaceXAI، این مدل در جدول رتبهبندی Artificial Analysis در بین ۳۲ مدل پخش زنده، رتبه اول دقت را کسب کرده است. نتایج داخلی نشان میدهد که نرخ خطای کلمه در عبارات کوتاه و چندزبانه از ۲۰.۶ درصد به ۶.۸ درصد کاهش یافته است که حدود ۶۷ درصد کاهش خطا را نشان میدهد.
ویژگیهای کلیدی و قیمتگذاری#
- قیمت: ۰.۱۰ دلار برای هر ساعت در حالت دستهای و ۰.۲۰ دلار در حالت پخش زنده.
- امکانات: شامل برچسبگذاری زمان کلمه، تفکیک گویندگان و پشتیبانی از تا ۸ کانال صوتی.
- پشتیبانی زبانی: تشخیص خودکار زبان و پشتیبانی از فرمتدهی متنی برای ۲۵ زبان.
تحلیل تحریریه#
برای توسعهدهندگانی که به دنبال راهحلهای مقرونبهصرفه برای تبدیل گفتار به نوشتار هستند، این خبر یک گام مثبت است. اگرچه دقت دو برابری ادعا شده بسیار جذاب به نظر میرسد، اما باید توجه داشت که نتایج هنوز به صورت مستقل بازتولید نشدهاند. همچنین، عدم انتشار وزنهای مدل (Open Weights) به این معنی است که شما نمیتوانید مدل را به صورت محلی میزبانی کنید و همچنان به سرویس ابری وابستهاید. این تغییرات برای شرکتهایی که از Loom یا ابزارهای مشابه استفاده میکنند، میتواند به بهبود کیفیت خروجیهای خودکار کمک کند.
منبع: MarkTechPost






دیدگاهها
برای گذاشتن دیدگاه وارد شو
دیدگاهها فقط از حسابهای کاربری پذیرفته میشوند.
ورود / ثبتنامهنوز دیدگاهی ثبت نشده — اولین نفر باش.