پرش به محتوای اصلی

Gemini 3.8 تبدیل متن به گفتار

هکرنیوز۱۴۰۵ مهر ۱, چهارشنبه، ساعت ۱۸:۵۹حدود 4 دقیقه مطالعه

آدرس مقاله: https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/ آدرس نظرات: https://news.ycombinator.com/item?id=49817615 امتیاز: 249 # نظر: 121

Gemini 3.8 Flash TTS و Gemini 3.8 Flash-Lite TTS رساترین مدل های تولید صوتی ما هستند. صدای شخصیت‌های سفارشی و گفتگوی صحنه مستقیم را در Google AI Studio، Gemini API، Gemini Enterprise، Gemini Notebook و Google Vids ایجاد کنید.

مدیر علوم تحقیقاتی به نمایندگی از تیم صوتی جمینی

امروز، ما دو مدل جدید تبدیل متن به گفتار را به خانواده Gemini معرفی می‌کنیم که تولید صدا را از پیش تنظیم‌های ثابت به یک استودیوی خلاقانه پویا تبدیل می‌کند. این مدل‌ها سازندگان، توسعه‌دهندگان و شرکت‌ها را قادر می‌سازند تا تجربیات صوتی غنی‌تر و گویاتری ایجاد کنند، در حالی که تجربه‌های کاربری بهبودیافته‌ای را در محصولاتی مانند Gemini Notebook و Google Vids امکان‌پذیر می‌کنند.

این مدل‌ها مکمل خانواده Gemini Audio ما هستند که به سرعت در حال رشد هستند، به دنبال ترجمه زنده 3.5، 3.5 رونویسی، 3.8 زنده و 3.8 Live Extended Thinking.

از 30 صدای اصلی به یک کتابخانه بی نهایت افزایش دهید. چه به یک صدای شخصیت کاملا اصلی نیاز داشته باشید یا یک سفیر یک برند ثابت، مدل 3.8 Flash TTS ما یک استودیوی کامل آواز را تقویت می کند. این به شما امکان می‌دهد هر لحظه صداهای رسا و با صدای طبیعی را ایجاد و استفاده کنید، در حالی که به توسعه‌دهندگان و شرکت‌ها قدرت می‌دهد تا به راحتی تجربه‌های صوتی سفارشی بسازند.

بشنوید که چگونه Gemini 3.8 Flash TTS صدای دی جی پر انرژی را از ملبورن تولید می کند.

بشنوید که چگونه Gemini 3.8 Flash TTS یک صدای ربات فوق‌العاده نازک و یکنواخت تولید می‌کند.

بشنوید که چگونه Gemini 3.8 Flash TTS یک اژدهای ژاپنی را زنده می کند.

هنگامی که صدای خود را انتخاب کردید، هر دو مدل TTS کنترل دقیقی بر نحوه تحویل هر خط به شما می دهند.

بشنوید که چگونه Gemini 3.8 Flash TTS مکالمات طبیعی و بسیار رسا را ​​برای عوامل صوتی تعاملی فعال می کند.

تماشا کنید و بشنوید که چگونه Gemini 3.8 Flash TTS از کنترل اسکریپت گرانول برای ایجاد یک تجربه صوتی بسیار جذاب و فراگیر استفاده می کند.

ببینید که چگونه Gemini 3.8 Flash TTS اعلان‌های زبان طبیعی را از ابتدا به شخصیت‌های صوتی سفارشی تبدیل می‌کند.

تماشا کنید که چگونه Gemini 3.8 Flash TTS سازندگان را قادر می‌سازد تا صحنه‌های سفارشی را برای زنده کردن گفتگوهای متحرک طراحی کنند.

ببینید Gemini 3.8 Flash TTS چگونه اسکریپت‌ها را به صحنه‌های دیالوگ کاملا اجرا شده تبدیل می‌کند و به سازندگان این امکان را می‌دهد که پخش صدا را مستقیما و نوبت‌گیری طبیعی را انجام دهند.

Gemini 3.8 Flash TTS قابلیت‌های سفارشی‌سازی صدای پیشرو را ارائه می‌کند، و جایگاه شماره 1 را در معیار طراحی صوتی Hume AI (71.4) و همچنین در مدل‌سازی تاکیدی (60.8) حفظ می‌کند.

Gemini 3.8 Flash TTS و Gemini 3.8 Flash-Lite TTS عملکردهای واقعا گویا را بدون به خطر انداختن قابلیت اطمینان امکان پذیر می کنند و همچنین به ترتیب رتبه های #1 و #2 را در شاخص کیفیت کلی Hume AI حفظ می کنند. این مدل در مقایسه با Gemini 3.1 Flash TTS، پیشرفت‌های عمده‌ای را در طیف گسترده‌ای از موارد استفاده مانند محتوای طولانی و کنترل فیلمنامه با دو بلندگو نشان می‌دهد.

در ارزیابی‌های اولویت انسانی کور در Voice Arena، Gemini 3.8 Flash و Flash-Lite TTS موقعیت‌های برتر را در میان رقبا به زبان‌های کلیدی جهانی، از جمله ژاپنی، پرتغالی برزیل، ویتنامی، استاندارد عربی مدرن (MSA)، اسپانیایی مکزیکی و هندی تضمین می‌کنند. این مدل‌ها با پشتیبانی از بیش از 100 زبان، سازندگان، توسعه‌دهندگان و شرکت‌ها را قادر می‌سازد تا تجربه‌های صوتی با کیفیت بالا و چندزبانه را در سراسر جهان ایجاد کنند.

ما قابلیت‌های ایجاد و تکثیر صدای خود را با اقدامات حفاظتی دقیق برای کمک به محافظت از استعدادهای صوتی، احترام به هویت و اطمینان از شفافیت محتوا ایجاد کردیم. برای تکرار صدا، سیستم ما از تأیید رضایت استفاده می‌کند: کاربران باید قبل از ایجاد صدا، یک رضایت شفاهی ضبط شده از صاحب صدا ارائه کنند که با گوینده مرجع مطابقت داشته باشد.

به طور گسترده تر، هر کلیپ صوتی تولید شده توسط مدل های صوتی Gemini ما با SynthID واترمارک شده است. این واترمارک نامحسوس مستقیما در خروجی صدا بافته می‌شود و این اطمینان را می‌دهد که گفتار تولید شده توسط هوش مصنوعی قابل تشخیص باقی می‌ماند تا از اطلاعات نادرست جلوگیری شود. برای جزئیات بیشتر در مورد رویکرد ما به ایمنی و مسئولیت، کارت مدل را بررسی کنید.

از امروز، توسعه‌دهندگان می‌توانند این قابلیت‌های جدید تولید گفتار را در Google AI Studio تجربه کنند. که مانند یک فضای کاری طراحی صدا ساخته شده است، می توانید هویت های صوتی کاملا جدیدی را از ابتدا درخواست کنید یا صدای خود را تکرار کنید 1، سپس آنها را مستقیما در یک ویرایشگر فیلمنامه با بلندگوی دوگانه برای تحویل مستقیم خط به خط بیاورید.

با استفاده از Gemini API، پلتفرم‌های توسعه‌دهنده مانند Agora، LiveKit، Pipecat، Vercel، توسعه‌دهندگان را قادر می‌سازند تا تجربیات تولید گفتار با کارایی بالا را به آسانی بسازند و به کار گیرند.

ما با شرکت‌هایی مانند Figma، HeyGen، Linguana، Wondercraft، 99.co، و Ollang همکاری می‌کنیم که آخرین مدل‌های TTS ما را برای کمک به سرعت بخشیدن به دوبله جهانی، بومی‌سازی رسانه‌ها با لهجه‌های منطقه‌ای ظریف، و صداهای مکالمه قدرتمند در مقیاس یکپارچه می‌کنند.

Gemini 3.8 Flash TTS از امروز عرضه می شود:

Gemini 3.8 Flash-Lite TTS از امروز عرضه می شود:

صندوق ورودی خود را بررسی کنید تا اشتراک خود را تأیید کنید.

همچنین می توانید با آدرس ایمیل دیگری مشترک شوید.

خواندن متن کامل در هکرنیوزبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

Gemini 3.8 text-to-speech

Article URL: https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/ Comments URL: https://news.ycombinator.com/item?id=49817615 Points: 249 # Comments: 121

پوشش همین خبر در رسانه‌های دیگر

مقایسه‌ی پوشش ۲ رسانه ←
همه‌ی اخبار فناوری