پرش به محتوای اصلی

مایکروسافت با مدل صوتی جدید رکورد سرعت و دقت هوش مصنوعی را شکست

زومیت۱۴۰۵ مهر ۹, پنجشنبه، ساعت ۲۳:۰۸حدود 2 دقیقه مطالعه

مایکروسافت با رونمایی از MAI-Transcribe-2-Streaming و دستیابی به نرخ خطای ۲٫۵ درصد در ۰٫۱۳ ثانیه، صدر جدول تبدیل بلادرنگ صوت به متن را تصاحب کرد.

مایکروسافت با رونمایی از MAI-Transcribe-2-Streaming و دستیابی به نرخ خطای ۲٫۵ درصد در ۰٫۱۳ ثانیه، صدر جدول تبدیل بلادرنگ صوت به متن را تصاحب کرد.

مایکروسافت در تازه‌ترین گام خود برای تصاحب بازار پردازش صوت، از مدل پیشرفته‌ی MAI-Transcribe-2-Streaming رونمایی کرد. مدل جدید ردموندی‌ها در بنچمارک معتبر AA-WER Streaming موفق شد با ثبت نرخ خطای کلمه‌ای (WER) خیره‌کننده‌ی ۲٫۵ درصد در زمان پاسخ‌دهی شگفت‌انگیز ۰٫۱۳ ثانیه پس از پایان صحبت، جایگاه نخست دقت و سرعت جهان را در میان ۳۸ مدل رقیب به دست آورد.

این مدل توانست رقبای سرسختی نظیر Grok Voice Transcribe 2.0 متعلق به اسپیس‌ایکس‌ای‌آی را که پیش‌تر با نرخ خطای ۲٫۷ درصد و تاخیر ۰٫۴۹ ثانیه پیشتاز بود، با فاصله‌ای محسوس پشت سر بگذارد.

پردازش صوت در محیط‌های زنده نیازمند سرعت واکنشی است که با ریتم مکالمات انسانی هم‌خوانی داشته باشد و خروجی جدید مایکروسافت گامی بزرگ در محقق ساختن رونویسی بی‌وقفه و بلادرنگ به شمار می‌رود.

عملکرد مدل‌ها در تبدیل جریان گفتار به متن بر اساس دو مؤلفه‌ی دقت متن نهایی (Final Transcript) و اولین خروجی جزئی (First Partial Transcript) ارزیابی می‌شود. مایکروسافت در هر دو شاخص دست بالا را دارد و موفق شده استانداردهای تازه‌ای ثبت کند.

دسترسی به بالاترین سطح فناوری هزینه‌ی بیشتری نیز طلب می‌کند. مایکروسافت مدل جدید را با نرخ ۰٫۵۴ دلار به ازای هر ساعت صدا یا ۹٫۰۰ دلار برای هر ۱٬۰۰۰ دقیقه ارائه کرده است. چنین اعدادی، سرویس جدید را در بالاترین رده‌ی قیمتی بازار در کنار مدل Gemini 3.5 Transcribe Live با قیمت ۹ دلار قرار می‌دهد.

هزینه‌ی اعلام‌شده برای استفاده‌ی بلادرنگ، بالاتر از نرخ ۶٫۵۰ دلاری مدل‌های ElevenLabs Scribe v2 Realtime و Deepgram Flux است. این مبلغ بیش از دو برابر هزینه‌ی ۴ دلاری Cartesia Ink-2 و سه‌برابر تعرفه‌ی ۳ دلاری Muse Voice Transcribe ارزیابی شده است. در سمت مقابل، نسخه‌ی MAI-Transcribe-2 با قیمت اقتصادی‌ترِ ۰٫۱۰ دلار در هر ساعت معادل ۱٫۶۷ دلار برای هر ۱٬۰۰۰ دقیقه صدا در دسترس توسعه‌دهندگان قرار دارد تا سازمان‌ها بر اساس اولویت خود میان پردازش زنده یا آفلاین دست به انتخاب بزنند.

خواندن متن کامل در زومیتبه زبان اصلی، در سایت ناشر باز می‌شودهمه‌ی اخبار فناوری