پرش به محتوای اصلی

گوگل با معرفی دو هوش مصنوعی انقلابی، تولید صدا را وارد مرحله جدیدی کرد

زومیت۱۴۰۵ مهر ۱, چهارشنبه، ساعت ۲۱:۵۴حدود 3 دقیقه مطالعه

گوگل با رونمایی از دو مدل گفتاری «جمنای ۳٫۸» مرزهای تولید صدای طبیعی و کارگردانی دیالوگ را جابه‌جا کرد.

گوگل با رونمایی از دو مدل گفتاری «جمنای ۳٫۸» مرزهای تولید صدای طبیعی و کارگردانی دیالوگ را جابه‌جا کرد.

فناوری تولید گفتار مصنوعی از مرحله‌ی خوانش خشک متون فراتر رفته و وارد دورانی شده که در آن هوش مصنوعی توانایی ایفای نقش و صداسازی پویا را پیدا کرده است. گوگل در همین راستا با معرفی دو عضو جدید از خانواده‌ی مدل‌های زبانی خود ، بستری فراهم آورده است که سیستم تولید صوت را به یک استودیو خلاقانه و تعاملی بدل می‌سازد.

دو مدل Gemini 3.8 Flash TTS و Gemini 3.8 Flash-Lite TTS به‌منظور پاسخ‌گویی به نیازهای پیشرفته‌ی بازی‌سازان، پادکسترها و توسعه‌دهندگان تجاری عرضه شده‌اند. رونمایی از مدل‌های یادشده پس از توسعه‌ی فناوری‌هایی چون Gemini 3.5 Live Translate و Gemini 3.8 Live گامی کلیدی در تکمیل سبد محصولات صوتی گوگل به‌شمار می‌رود.

مدل Gemini 3.8 Flash TTS برای هدایت دقیق دیالوگ‌ها و خلق صداهای منحصر‌به‌فرد از پایه طراحی شده است. کاربران می‌توانند با تکیه بر پرامپت‌های متنی ساده، لحن، لهجه و ویژگی‌های شخصیتی متعددی را در بیش از ۱۰۰ زبان زنده و گویش گوناگون ایجاد کنند. کنترل جزئیاتی نظیر مکث‌ها، تغییر ناگهانی لحن و صداهای غیرکلامی مانند خنده، نفس‌نفس زدن یا تصدیق‌های کلامی سبب شده است خروجی نهایی شباهت فراوانی به اجرای یک بازیگر واقعی پیدا کند.

برخی از برجسته‌ترین ویژگی‌ها شامل موارد زیر هستند:

توسعه‌دهندگان در مدل جدید توانایی بازآفرینی پروفایل‌های صوتی را تنها با دریافت یک فایل صوتی ۳۰ ثانیه‌ای به‌دست آورده‌اند. حفظ اصالت و جلوگیری از سوءاستفاده‌های احتمالی دغدغه‌ی اصلی مهندسان در پیاده‌سازی چنین امکانی بوده است. سیستم شبیه‌سازی برای جلوگیری از جعل هویت، به تأیید کلامی رضایت صاحب صدا پیش از آغاز فرایند متکی خواهد بود.

تمامی قطعات صوتی تولیدشده توسط مدل‌های جدید به‌صورت نامحسوس با فناوری واترمارک SynthID نشانه‌گذاری می‌شوند تا شناور بودن محتوا در بستر استانداردهای C2PA قابل ردیابی باشد. اعمال این تدابیر شفافیت محتوای تولیدی را تضمین کرده است و مانع از انتشار اطلاعات نادرست در بسترهای عمومی خواهد شد.

مدل Gemini 3.8 Flash TTS در آزمون‌های تخصصی Hume AI با کسب امتیاز ۷۱٫۴ در جایگاه نخست شاخص طراحی صدا قرار گرفت و در بخش مدل‌سازی لهجه‌ها امتیاز ۶۰٫۸ را به‌ثبت رساند. در ارزیابی جامع کیفیت، دو مدل جدید گوگل رتبه‌های اول و دوم جدول را تصاحب کردند که نشان‌دهنده‌ی برتری محسوس آن‌ها در تولید صوت طولانی‌مدت در مقایسه با Gemini 3.1 Flash TTS خواهد بود.

مدل اقتصادی‌تر یعنی Gemini 3.8 Flash-Lite TTS برای پروژه‌های با حجم بالا مانند دوبله‌ی خودکار و دستیارهای هوشمند پرسرعت بهینه‌سازی شده است. پلتفرم‌های محبوبی نظیر Vercel و LiveKit و HeyGen و Figma ادغام این مدل‌ها را در ساختار ابزارهای خود آغاز کرده‌اند تا تولید محتوای صوتی چندزبانه را برای کاربرانشان سریع‌تر از گذشته پیش ببرند.

امکانات جدید هم‌اکنون در محیط آزمایشی Google AI Studio و از طریق رابط‌های برنامه‌نویسی اختصاصی در دسترس قرار دارند. کاربران سرویس‌های داخلی گوگل نیز می‌توانند از مدل‌های یادشده در Gemini Notebook و سرویس تولید ویدیوی Google Vids بهره‌مند شوند.

خواندن متن کامل در زومیتبه زبان اصلی، در سایت ناشر باز می‌شودهمه‌ی اخبار فناوری