دقیقترین هوش مصنوعی تبدیل گفتار به متن جهان معرفی شد
گراک با معرفی مدل تبدیل گفتار به متن Voice Transcribe 2.0، دقت شناسایی صدا را بدون تغییر قیمت دو برابر کرد.
گراک با معرفی مدل تبدیل گفتار به متن Voice Transcribe 2.0، دقت شناسایی صدا را بدون تغییر قیمت دو برابر کرد.
اسپیسایکسایآی مدل تبدیل گفتار به متن Voice Transcribe 2.0 را معرفی کرد ؛ ابزاری که بدون افزایش قیمت، دقتی دو برابر نسل قبلی خود ارائه میدهد. اسپیسایکسایآی میگوید، نسخهی جدید میان ۳۲ مدل استریمینگ در لیدربورد عمومی Artificial Analysis رتبهی نخست را در زمینهی دقت کسب کرده است.
Voice Transcribe 2.0 بر پایهی مدل صوتی گراک توسعه یافته که در حال حاضر روزانه دهها هزار تماس پشتیبانی مشتریان و میلیونها ساعت روایت ویدئویی را پردازش میکند. دستیارهای صوتی گراک در محصولات فیزیکی نظیر خودروهای تسلا نیز از همین ساختار بهره میبرند.
مدل Voice Transcribe 2.0 در شرایط واقعی مانند اتصالات ضعیف تلفنی، حضور چند گوینده، لهجههای محلی و اطلاعات هویتی گفتاری بهبودهای فراوانی نشان میدهد. توسعهدهندگان عملکرد سیستم را در مقایسه با هفت رقیب در چهار بخش شامل تماسهای تلفنی پشتیبانی، مکالمات با گراک، اطلاعات حساس هویتی و دستورهای کوتاه صوتی چندزبانه سنجیدهاند.
در آزمونهای تلفنی با صدای ۸ کیلوهرتز، نرخ خطای کلمات از ۱۰٫۶ درصد در نسخهی پیشین به ۷٫۱ درصد کاهش یافت. نرخ خطای مکالمات نیز از ۸٫۷ درصد به ۳٫۳ درصد رسید و خطای ثبت شمارهتماس و نشانیهای ایمیل تا ۳٫۲ درصد پایین آمد.
سیستم بیش از دهها زبان را همراه با تشخیص خودکار و تغییر زبان حین ضبط پشتیبانی میکند؛ طوری که خطای عبارتهای کوتاه در ۱۹ زبان از ۲۰٫۶ درصد به ۶٫۸ درصد کاهش یافته است.
تعرفهی خدمات بدون تغییر مانده و هزینهی رونویسی دستهای ۰٫۱۰ دلار به ازای هر ساعت صوت و پخش زنده ۰٫۲۰ دلار تعیین شده است. امکاناتی نظیر تفکیک گویندگان، برچسب زمانی برای تکتک واژهها و سوگیری اصطلاحات کلیدی بدون هزینهی اضافی ارائه میشوند. Voice Transcribe 2.0 طی هفتههای آینده به مدل پیشفرض در Speech-to-Text API تبدیل خواهد شد.