پرش به محتوای اصلی

مدل جدید گفتار v4 ElevenLabs از کنترل بیان بیشتر و 90 زبان پشتیبانی می کند

تک‌کرانچ۱۴۰۵ مهر ۶, دوشنبه، ساعت ۱۷:۳۰حدود 3 دقیقه مطالعه

ElevenLabs v4 می تواند صداها را با یک کلیپ 10 ثانیه ای شبیه سازی کند

آخرین روز برای نمایش موفقیت خود برای بیش از 10000 رهبر فناوری در 2 اکتبر است. میز نمایشگاه کتاب هم اکنون.

ElevenLabs روز دوشنبه دو مدل گفتار جدید به نام‌های ElevenLabs v4 و v4 Turbo را راه‌اندازی کرد که کنترل بیان بیشتری، تأخیر کمتر برای عوامل صوتی و پشتیبانی از بیش از 90 زبان را ارائه می‌دهد.

این شرکت سال گذشته مدل v3 خود را منتشر کرد و در اوایل سال جاری در رویدادی در ورشو این مدل را به اشتراک گذاشت. برای مدل‌های نسل v4، ElevenLabs از معماری جدیدی استفاده می‌کند که امکان کنترل بهتر و شبیه‌سازی سریع‌تر را فراهم می‌کند. این شرکت گفت که با نسخه 4، کاربران قادر خواهند بود صدا را تنها با 10 ثانیه صدا شبیه سازی کنند.

از جنبه خلاقانه، مدل هویت صدا را بهتر از تکه‌های طولانی‌تر متن کنترل می‌کند. همچنین متن متن را در هنگام خواندن با صدای بلند برای تغییر عبارات در ذهن نگه می دارد. ElevenLabs تگ های درون خطی را برای تعریف بیان با v3 معرفی کرد و در حال گسترش آن تگ ها در نسخه 4 است و به کاربران اجازه می دهد تگ های متعددی را روی هم چیده و مدل را دنباله رو دنبال کند.

نسخه قبلی از 70 زبان پشتیبانی می کرد و ElevenLabs تلاش کرده است تا این تعداد با نسخه جدید به 90 زبان برسد. این استارت آپ گفت که بیشترین جهش کیفیت را در زبان های ژاپنی، پرتغالی برزیل، ماندارین و کانتونی مشاهده کرده است.

ElevenLabs در سال گذشته به سرعت کسب و کار تماس های سازمانی خود را افزایش داده است، به طوری که بیش از 55٪ از تجارت آن از شرکت های بزرگ است. این شرکت گفت که مدل جدید برای عوامل صوتی مناسب است، زیرا نسخه جدید تاخیر کمتری دارد تا امکان مکالمه روان تر را فراهم کند. به علاوه، نسخه 4 می تواند به محض اینکه LLM پشت آن شروع به تولید پاسخ کند، شروع به تولید صدا کند. علاوه بر این، این مدل همچنین می‌تواند درگیری‌ها، تشدیدها را مدیریت کند و برای حل و فصل بهتر مسئله به شیوه‌ای متفاوت عمل کند.

رقابت در مدل‌های گفتار افزایش یافته است زیرا استارت‌آپ‌هایی مانند Cartesia، Deepgram، Fish Audio، Boson و WellSaid Labs مدل‌های گفتاری رسا ایجاد کرده‌اند. شرکت های بزرگی مانند گوگل و OpenAI نیز مدل های صوتی خود را بهبود بخشیده اند.

در مصاحبه اخیر با TechCrunch، یکی از بنیانگذاران و مدیر عامل شرکت، Mati Staniszewski گفت که این شرکت در نظر دارد "در سال های آینده" یک IPO ارائه دهد، اما به یک جدول زمانی متعهد نیست.

وقتی از طریق پیوندهای موجود در مقالات ما خرید می کنید، ممکن است کمیسیون کمی کسب کنیم. این بر استقلال تحریریه ما تأثیر نمی گذارد.

ایوان در TechCrunch تحولات جهانی فناوری مصرف کننده را پوشش می دهد. او در خارج از هند مستقر است و قبلا در نشریاتی از جمله هافینگتون پست و نکست وب کار کرده است.

می‌توانید با ایمیل im@ivanmehta.com یا از طریق پیام رمزگذاری‌شده به آدرس ivan.42 در سیگنال، با ایوان تماس بگیرید یا تأیید کنید.

آسترا و اوپوس به تازگی آزمون دیگر تورینگ تیم فرنهولز را پشت سر گذاشتند

اوراکل اخطار فورس ماژور را به مرکز داده New Mexico Stargate خود Aditya Mehta ارسال می کند

متا برای نماینده Muse AI لوکاس روپک یک پوشیدنی شبیه تاماگوچی ساخت

Vogue روبات‌هایی را به باند فرودگاه Vogue World فرستاد و مردم تحت تأثیر دومینیک-مادوری دیویس قرار نگرفتند.

آنتروپیک می گوید آزمایشگاه زیست شناسی آن قبلا چیزی بزرگ جولی بورت پیدا کرده است

اولین ربات تعویض لاستیک PitPro در شان اوکین کانادا راه اندازی شد

خواندن متن کامل در تک‌کرانچبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

ElevenLabs’ new v4 speech model supports more expression control and 90 languages

ElevenLabs v4 can clone voices with a 10 second clip

همه‌ی اخبار فناوری