Gemini 3.8 Live و 3.8 Live Extended Thinking
آدرس مقاله: https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/ آدرس نظرات: https://news.ycombinator.com/item?id=49715947: 27 #4 امتیاز:
Gemini 3.8 Live و Gemini 3.8 Live Extended Thinking پیشرفته ترین مدل های گفتگوی زنده ما هستند. ارتقاهای عمده در هوش و استدلال موازی آنها را برای همکاری و استفاده برای اجرای کارهای پیچیده با استفاده از صدای شما بصری تر می کند.
عضو کادر فنی، از طرف تیم صوتی جمینی
مرورگر شما از عنصر صوتی پشتیبانی نمی کند.
ما Gemini 3.8 Live و Gemini 3.8 Live Extended Thinking را راهاندازی میکنیم تا تعاملات صوتی را طبیعیتر، روانتر و هوشمندتر کنیم. این مدلها استدلال پیچیده، زمینه بصری بلادرنگ، و اجرای کار پسزمینه را بدون وقفه در مکالمه شما مدیریت میکنند. میتوانید از امروز از طریق Gemini API، Google Workspace و برنامه Gemini استفاده از این ویژگیها را شروع کنید.
گوگل به تازگی دو مدل هوش مصنوعی جدید راه اندازی کرده است که صحبت کردن با دستگاه های شما را بسیار طبیعی تر می کند. آنها می توانند وقفه ها را مدیریت کنند، بین زبان ها جابجا شوند و حتی فرآیند فکر خود را در حین کار توضیح دهند. چه در حال حل یک مشکل پیچیده باشید یا فقط چت کنید، هوش مصنوعی اکنون احساس می کند که در واقع به همراه شما گوش می دهد و فکر می کند. این یک گام بزرگ در جهت ایجاد حس یک شریک گفتگوی واقعی با هوش مصنوعی است.
امروز، ما دو مدل جدید را معرفی میکنیم که پیشرفتهایی را در استدلال تقریبا همزمان به ارمغان میآورند تا به طور مؤثرتری عوامل صوتی را فعال کنند و مکالمه با هوش مصنوعی را بصریتر و هوشمندانهتر کنند.
برای توسعه دهندگان و شرکت ها، این مدل ها بلوک های ساختمانی را برای نمایندگان صوتی قابل اعتماد و آماده ارائه می کنند. آنها همچنین صحبت کردن با Gemini را در برنامه Gemini، Google Workspace و Search روانتر و مشارکتیتر میکنند - به شما کمک میکنند کارهای پیچیده را فقط با استفاده از صدای خود انجام دهید.
Gemini 3.8 Live Extended Thinking تکمیل و هوشمندی کار در سطح سازمانی را ارائه میکند و رتبه شماره 1 را در شاخص کیفیت گفتار به گفتار تحلیل مصنوعی (82.6) به دست میآورد، و در تکمیل وظایف عاملی با 68.6 درصد در τ -Voice و 35.1٪ در τ -Voice و 35.1% τ-sbanch -Vrace پیشرو است. همچنین قابلیتهای استدلال قوی را ارائه میکند و امتیاز 97.7٪ را در Big Bench Audio به دست میآورد، در حالی که قیمت بسیار رقابتی را در مقایسه با سایر مدلهای مرزی حفظ میکند.
Gemini 3.8 Live اولویت بالایی در بین کاربران نشان داده است و جایگاه دوم را در عرصه Speech Agent Arena به دست آورده است. علاوه بر این عملکرد، بسیار مقرون به صرفه باقی می ماند - ارائه یک مدل توانمند و کارآمد برای توسعه دهندگان و شرکت ها که برای مقیاس ساخته شده است.
در EVA-Bench ServiceNow، معیاری برای ارزیابی عوامل صوتی، مدلهای ما با متعادل کردن موفقیتآمیز دقت و کیفیت مکالمه، Pareto Frontier را برای گردشهای کاری پیچیده پیش میبرند.
توجه: این بر روی Live API در پلتفرم Gemini Enterprise Agent اجرا شد.
Gemini 3.8 Live ورودیهای بصری را در زمان واقعی پردازش میکند و برای پاسخهای مفیدتر، مکالمات را با زمینه غنی میکند. در اواسط مکالمه، به طور خودکار شناسایی و بین 97 زبان پشتیبانی شده انتقال می یابد. در حین ادامه مکالمه، ابزارها و تماسهای API را در پسزمینه اجرا میکند، بنابراین مدل میتواند درخواستها را تأیید کند و تا زمانی که کارها در پسزمینه تمام میشوند، به چت کردن ادامه دهد.
Gemini 3.8 Live با استفاده از زمینه بصری برای پاسخگویی به سؤالات زنده، کارمندان را در زمان واقعی راهنمایی میکند.
بازی شطرنج Gemini 3.8 را به صورت زنده با استفاده از زمینه بصری، استدلال و جریان گفتگوی طبیعی در زمان واقعی تماشا کنید.
برای کارهایی که نیاز به استدلال عمیقتری دارند، 3.8 Live Extended Thinking به طور همزمان استدلال میکند و صحبت میکند. این کار با حفظ یک جریان مکالمه بدون وقفه، هوش بیشتری را برای گردشهای کاری پیچیده ارائه میکند - با استفاده از نشانههای کلامی اولیه مانند «اجازه دهید آن را بررسی کنم...» برای تأیید طبیعی درخواستها، و روایت پیشرفت زنده برای راهنمایی کاربران در کارهای پسزمینه چند مرحلهای در حین پیشرفت.
Gemini 3.8 Live Extended Thinking را تماشا کنید که طرحهای خام و بازخورد صوتی تقریبا همزمان را به اجزای کاربردی React تبدیل میکند.
به Gemini 3.8 Live Extended Thinking مراجعه کنید که رزروهای چند مرحلهای و تماسهای عملکرد ناهمزمان را هماهنگ میکند — همه بدون وقفه در مکالمه زنده طبیعی.
ساختن برنامههای تجاری کامل و جعبهابزارهای بازاریابی سفارشی را با گفتار طبیعی Gemini 3.8 Live تماشا کنید.
در سراسر Google Workspace و Search، مدلهای Live ما تجربههای مشارکتی و بصریتری را ارائه میکنند - بهویژه زمانی که پیچیدهترین وظایف خود را انجام میدهید.
Gemini 3.8 Live Extended Thinking را در Google Workspace با Docs Live، Gmail Live و Keep Live امتحان کنید.
با استفاده از Gemini Live API، پلتفرمهای توسعهدهنده مانند Agora، Fishjam، LangChain، LiveKit، Pipecat، Vercel، و Vision Agents توسعهدهندگان را قادر میسازند تا رابطهای صوتی با کارایی بالا را به راحتی بسازند و به کار گیرند. این پلتفرمها زیرساختهای پیچیده پخش رسانهای در زمان واقعی را در پشت صحنه مدیریت میکنند و به توسعهدهندگان این امکان را میدهند که کاملا روی ایجاد تجربه کاربر تمرکز کنند.
ما همچنین با شرکتهایی مانند Salesforce، Genspark و Lumeris همکاری میکنیم که در مورد 3.8 Live و 3.8 Live Extended Thinking هیجانزده هستند و تأخیر، سیال بودن و قابلیتهای فراخوانی ابزار را برجسته میکنند.
تمام صدای تولید شده توسط محصولات هوش مصنوعی ما با SynthID واترمارک شده است. این واترمارک نامحسوس مستقیما در خروجی صدا بافته میشود و اطمینان حاصل میکند که محتوای تولید شده توسط هوش مصنوعی قابل تشخیص باقی میماند تا از اطلاعات نادرست جلوگیری شود. برای جزئیات بیشتر در مورد رویکرد ما به ایمنی و مسئولیت، کارت مدل را بررسی کنید.
3.8 Live Extended Thinking از امروز عرضه می شود:
صندوق ورودی خود را بررسی کنید تا اشتراک خود را تأیید کنید.
همچنین می توانید با آدرس ایمیل دیگری مشترک شوید.
اطلاعات شما مطابق با خط مشی رازداری Google استفاده خواهد شد. شما می توانید در هر زمان انصراف دهید.
متن اصلی (انگلیسی)
Gemini 3.8 Live and 3.8 Live Extended Thinking
Article URL: https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/ Comments URL: https://news.ycombinator.com/item?id=49715947 Points: 251 # Comments: 174