مدل جدید گفتار v4 ElevenLabs از کنترل بیان بیشتر و 90 زبان پشتیبانی می کند
ElevenLabs v4 می تواند صداها را با یک کلیپ 10 ثانیه ای شبیه سازی کند
آخرین روز برای نمایش موفقیت خود برای بیش از 10000 رهبر فناوری در 2 اکتبر است. میز نمایشگاه کتاب هم اکنون.
ElevenLabs روز دوشنبه دو مدل گفتار جدید به نامهای ElevenLabs v4 و v4 Turbo را راهاندازی کرد که کنترل بیان بیشتری، تأخیر کمتر برای عوامل صوتی و پشتیبانی از بیش از 90 زبان را ارائه میدهد.
این شرکت سال گذشته مدل v3 خود را منتشر کرد و در اوایل سال جاری در رویدادی در ورشو این مدل را به اشتراک گذاشت. برای مدلهای نسل v4، ElevenLabs از معماری جدیدی استفاده میکند که امکان کنترل بهتر و شبیهسازی سریعتر را فراهم میکند. این شرکت گفت که با نسخه 4، کاربران قادر خواهند بود صدا را تنها با 10 ثانیه صدا شبیه سازی کنند.
از جنبه خلاقانه، مدل هویت صدا را بهتر از تکههای طولانیتر متن کنترل میکند. همچنین متن متن را در هنگام خواندن با صدای بلند برای تغییر عبارات در ذهن نگه می دارد. ElevenLabs تگ های درون خطی را برای تعریف بیان با v3 معرفی کرد و در حال گسترش آن تگ ها در نسخه 4 است و به کاربران اجازه می دهد تگ های متعددی را روی هم چیده و مدل را دنباله رو دنبال کند.
نسخه قبلی از 70 زبان پشتیبانی می کرد و ElevenLabs تلاش کرده است تا این تعداد با نسخه جدید به 90 زبان برسد. این استارت آپ گفت که بیشترین جهش کیفیت را در زبان های ژاپنی، پرتغالی برزیل، ماندارین و کانتونی مشاهده کرده است.
ElevenLabs در سال گذشته به سرعت کسب و کار تماس های سازمانی خود را افزایش داده است، به طوری که بیش از 55٪ از تجارت آن از شرکت های بزرگ است. این شرکت گفت که مدل جدید برای عوامل صوتی مناسب است، زیرا نسخه جدید تاخیر کمتری دارد تا امکان مکالمه روان تر را فراهم کند. به علاوه، نسخه 4 می تواند به محض اینکه LLM پشت آن شروع به تولید پاسخ کند، شروع به تولید صدا کند. علاوه بر این، این مدل همچنین میتواند درگیریها، تشدیدها را مدیریت کند و برای حل و فصل بهتر مسئله به شیوهای متفاوت عمل کند.
رقابت در مدلهای گفتار افزایش یافته است زیرا استارتآپهایی مانند Cartesia، Deepgram، Fish Audio، Boson و WellSaid Labs مدلهای گفتاری رسا ایجاد کردهاند. شرکت های بزرگی مانند گوگل و OpenAI نیز مدل های صوتی خود را بهبود بخشیده اند.
در مصاحبه اخیر با TechCrunch، یکی از بنیانگذاران و مدیر عامل شرکت، Mati Staniszewski گفت که این شرکت در نظر دارد "در سال های آینده" یک IPO ارائه دهد، اما به یک جدول زمانی متعهد نیست.
وقتی از طریق پیوندهای موجود در مقالات ما خرید می کنید، ممکن است کمیسیون کمی کسب کنیم. این بر استقلال تحریریه ما تأثیر نمی گذارد.
ایوان در TechCrunch تحولات جهانی فناوری مصرف کننده را پوشش می دهد. او در خارج از هند مستقر است و قبلا در نشریاتی از جمله هافینگتون پست و نکست وب کار کرده است.
میتوانید با ایمیل im@ivanmehta.com یا از طریق پیام رمزگذاریشده به آدرس ivan.42 در سیگنال، با ایوان تماس بگیرید یا تأیید کنید.
آسترا و اوپوس به تازگی آزمون دیگر تورینگ تیم فرنهولز را پشت سر گذاشتند
اوراکل اخطار فورس ماژور را به مرکز داده New Mexico Stargate خود Aditya Mehta ارسال می کند
متا برای نماینده Muse AI لوکاس روپک یک پوشیدنی شبیه تاماگوچی ساخت
Vogue روباتهایی را به باند فرودگاه Vogue World فرستاد و مردم تحت تأثیر دومینیک-مادوری دیویس قرار نگرفتند.
آنتروپیک می گوید آزمایشگاه زیست شناسی آن قبلا چیزی بزرگ جولی بورت پیدا کرده است
اولین ربات تعویض لاستیک PitPro در شان اوکین کانادا راه اندازی شد
متن اصلی (انگلیسی)
ElevenLabs’ new v4 speech model supports more expression control and 90 languages
ElevenLabs v4 can clone voices with a 10 second clip