Gemini 3.8 تبدیل متن به گفتار
آدرس مقاله: https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/ آدرس نظرات: https://news.ycombinator.com/item?id=49817615 امتیاز: 249 # نظر: 121
Gemini 3.8 Flash TTS و Gemini 3.8 Flash-Lite TTS رساترین مدل های تولید صوتی ما هستند. صدای شخصیتهای سفارشی و گفتگوی صحنه مستقیم را در Google AI Studio، Gemini API، Gemini Enterprise، Gemini Notebook و Google Vids ایجاد کنید.
مدیر علوم تحقیقاتی به نمایندگی از تیم صوتی جمینی
امروز، ما دو مدل جدید تبدیل متن به گفتار را به خانواده Gemini معرفی میکنیم که تولید صدا را از پیش تنظیمهای ثابت به یک استودیوی خلاقانه پویا تبدیل میکند. این مدلها سازندگان، توسعهدهندگان و شرکتها را قادر میسازند تا تجربیات صوتی غنیتر و گویاتری ایجاد کنند، در حالی که تجربههای کاربری بهبودیافتهای را در محصولاتی مانند Gemini Notebook و Google Vids امکانپذیر میکنند.
این مدلها مکمل خانواده Gemini Audio ما هستند که به سرعت در حال رشد هستند، به دنبال ترجمه زنده 3.5، 3.5 رونویسی، 3.8 زنده و 3.8 Live Extended Thinking.
از 30 صدای اصلی به یک کتابخانه بی نهایت افزایش دهید. چه به یک صدای شخصیت کاملا اصلی نیاز داشته باشید یا یک سفیر یک برند ثابت، مدل 3.8 Flash TTS ما یک استودیوی کامل آواز را تقویت می کند. این به شما امکان میدهد هر لحظه صداهای رسا و با صدای طبیعی را ایجاد و استفاده کنید، در حالی که به توسعهدهندگان و شرکتها قدرت میدهد تا به راحتی تجربههای صوتی سفارشی بسازند.
بشنوید که چگونه Gemini 3.8 Flash TTS صدای دی جی پر انرژی را از ملبورن تولید می کند.
بشنوید که چگونه Gemini 3.8 Flash TTS یک صدای ربات فوقالعاده نازک و یکنواخت تولید میکند.
بشنوید که چگونه Gemini 3.8 Flash TTS یک اژدهای ژاپنی را زنده می کند.
هنگامی که صدای خود را انتخاب کردید، هر دو مدل TTS کنترل دقیقی بر نحوه تحویل هر خط به شما می دهند.
بشنوید که چگونه Gemini 3.8 Flash TTS مکالمات طبیعی و بسیار رسا را برای عوامل صوتی تعاملی فعال می کند.
تماشا کنید و بشنوید که چگونه Gemini 3.8 Flash TTS از کنترل اسکریپت گرانول برای ایجاد یک تجربه صوتی بسیار جذاب و فراگیر استفاده می کند.
ببینید که چگونه Gemini 3.8 Flash TTS اعلانهای زبان طبیعی را از ابتدا به شخصیتهای صوتی سفارشی تبدیل میکند.
تماشا کنید که چگونه Gemini 3.8 Flash TTS سازندگان را قادر میسازد تا صحنههای سفارشی را برای زنده کردن گفتگوهای متحرک طراحی کنند.
ببینید Gemini 3.8 Flash TTS چگونه اسکریپتها را به صحنههای دیالوگ کاملا اجرا شده تبدیل میکند و به سازندگان این امکان را میدهد که پخش صدا را مستقیما و نوبتگیری طبیعی را انجام دهند.
Gemini 3.8 Flash TTS قابلیتهای سفارشیسازی صدای پیشرو را ارائه میکند، و جایگاه شماره 1 را در معیار طراحی صوتی Hume AI (71.4) و همچنین در مدلسازی تاکیدی (60.8) حفظ میکند.
Gemini 3.8 Flash TTS و Gemini 3.8 Flash-Lite TTS عملکردهای واقعا گویا را بدون به خطر انداختن قابلیت اطمینان امکان پذیر می کنند و همچنین به ترتیب رتبه های #1 و #2 را در شاخص کیفیت کلی Hume AI حفظ می کنند. این مدل در مقایسه با Gemini 3.1 Flash TTS، پیشرفتهای عمدهای را در طیف گستردهای از موارد استفاده مانند محتوای طولانی و کنترل فیلمنامه با دو بلندگو نشان میدهد.
در ارزیابیهای اولویت انسانی کور در Voice Arena، Gemini 3.8 Flash و Flash-Lite TTS موقعیتهای برتر را در میان رقبا به زبانهای کلیدی جهانی، از جمله ژاپنی، پرتغالی برزیل، ویتنامی، استاندارد عربی مدرن (MSA)، اسپانیایی مکزیکی و هندی تضمین میکنند. این مدلها با پشتیبانی از بیش از 100 زبان، سازندگان، توسعهدهندگان و شرکتها را قادر میسازد تا تجربههای صوتی با کیفیت بالا و چندزبانه را در سراسر جهان ایجاد کنند.
ما قابلیتهای ایجاد و تکثیر صدای خود را با اقدامات حفاظتی دقیق برای کمک به محافظت از استعدادهای صوتی، احترام به هویت و اطمینان از شفافیت محتوا ایجاد کردیم. برای تکرار صدا، سیستم ما از تأیید رضایت استفاده میکند: کاربران باید قبل از ایجاد صدا، یک رضایت شفاهی ضبط شده از صاحب صدا ارائه کنند که با گوینده مرجع مطابقت داشته باشد.
به طور گسترده تر، هر کلیپ صوتی تولید شده توسط مدل های صوتی Gemini ما با SynthID واترمارک شده است. این واترمارک نامحسوس مستقیما در خروجی صدا بافته میشود و این اطمینان را میدهد که گفتار تولید شده توسط هوش مصنوعی قابل تشخیص باقی میماند تا از اطلاعات نادرست جلوگیری شود. برای جزئیات بیشتر در مورد رویکرد ما به ایمنی و مسئولیت، کارت مدل را بررسی کنید.
از امروز، توسعهدهندگان میتوانند این قابلیتهای جدید تولید گفتار را در Google AI Studio تجربه کنند. که مانند یک فضای کاری طراحی صدا ساخته شده است، می توانید هویت های صوتی کاملا جدیدی را از ابتدا درخواست کنید یا صدای خود را تکرار کنید 1، سپس آنها را مستقیما در یک ویرایشگر فیلمنامه با بلندگوی دوگانه برای تحویل مستقیم خط به خط بیاورید.
با استفاده از Gemini API، پلتفرمهای توسعهدهنده مانند Agora، LiveKit، Pipecat، Vercel، توسعهدهندگان را قادر میسازند تا تجربیات تولید گفتار با کارایی بالا را به آسانی بسازند و به کار گیرند.
ما با شرکتهایی مانند Figma، HeyGen، Linguana، Wondercraft، 99.co، و Ollang همکاری میکنیم که آخرین مدلهای TTS ما را برای کمک به سرعت بخشیدن به دوبله جهانی، بومیسازی رسانهها با لهجههای منطقهای ظریف، و صداهای مکالمه قدرتمند در مقیاس یکپارچه میکنند.
Gemini 3.8 Flash TTS از امروز عرضه می شود:
Gemini 3.8 Flash-Lite TTS از امروز عرضه می شود:
صندوق ورودی خود را بررسی کنید تا اشتراک خود را تأیید کنید.
همچنین می توانید با آدرس ایمیل دیگری مشترک شوید.
متن اصلی (انگلیسی)
Gemini 3.8 text-to-speech
Article URL: https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/ Comments URL: https://news.ycombinator.com/item?id=49817615 Points: 249 # Comments: 121