پرش به محتوای اصلی

من یک آواتار دیجیتال تعاملی از خودم ایجاد کردم - و شما می توانید با آن صحبت کنید

تک‌کرانچ۱۴۰۵ مهر ۴, شنبه، ساعت ۱۷:۳۰حدود 6 دقیقه مطالعه

پس از به دست آوردن یک آواتار تعاملی و آموزش آن برای بحث در مورد کلاهبرداری خطرپذیر، احساسات متفاوتی در مورد ساختن شبیه سازی هوش مصنوعی از خود دارم.

هنگامی که الکساندر وویکا، رئیس امور شرکتی در استارتاپ نسل ویدیویی Synthesia، در تابستان امسال پیوندی به جدیدترین عضو تیم روابط عمومی آنها برای من فرستاد، شگفت زده شدم. این یک آواتار مجازی تعاملی از او بود که برای پاسخ دادن به سوالات رایج مطبوعات در مورد Synthesia، مانند آنچه که انجام می دهد و چگونه کار می کند، آموزش دیده بود. روز قبل، من در یک پانل بودم که در آن افراد روابط عمومی از من پرسیدند که آیا به طرح‌هایی که از متن تولید شده توسط هوش مصنوعی استفاده می‌کردند، اهمیت نمی‌دهم. اما آواتار الکساندرو فراتر از این بود - به نظر من این آخرین رئیس استفاده از هوش مصنوعی در روابط عمومی بود.

Synthesia به شرکت‌ها اجازه می‌دهد ویدیوهای آموزشی تعاملی با آواتارهای هوش مصنوعی بسازند و اخیرا محصولی به نام Roleplay Sessions راه‌اندازی کرده است که به کارمندان اجازه می‌دهد به عنوان مثال، فروش‌ها را با یک آواتار هوش مصنوعی تعاملی که پاسخ می‌دهد و به پاسخ‌های آنها امتیاز می‌دهد، تمرین کنند.

وقتی به افتتاحیه دفتر جدید رفتم و آنها از من پرسیدند که آیا آواتار هوش مصنوعی خودم را می خواهم، حتی در پاسخ به این سوال تردید نکردم. البته من دوقلو دیجیتال خودم را دوست دارم. آن روز لباس من زیبا بود و موهایم سر جایش بود.

تا زمانی که دوقلوهای دیجیتال خود را ملاقات نکردم، نسبت به آواتارها بی تفاوت بودم، اما احساس می کردم که آنها به ناچار بخشی از زندگی روزمره آنلاین خواهند شد. من از افرادی در اینستاگرام شنیدم که آنها را به شکلی شبیه خود ساخته اند تا به آنها در تولید محتوای اجتماعی کمک کنند. به نظر من همه چیز بسیار جالب است، و شاید به همین دلیل است که اکنون هیچ ابایی ندارم که دوقلوی دیجیتالم را به شما معرفی کنم. این اولین بار است که Synethsia یک آواتار دیجیتال برای یک روزنامه نگار (یا برای هر کسی، نقطه، خارج از Voica) می سازد.

این در مورد داستان من در مورد اینکه چرا استارتاپ های دارای پشتوانه سرمایه گذاری بیشتر از استارتاپ های بدون پشتوانه VC مرتکب تقلب می شوند آموزش داده شده است و فقط به سؤالات مربوط به آن داستان پاسخ می دهد.

در زیر، برای شروع به سادگی "شروع در یک پنجره جدید" را فشار دهید.

برای انجام این کار، وارد یک استودیوی مینی فیلم شدم که در داخل دفتر Synthesia قرار داشت و در آنجا عکس های زیادی از من گرفتند و یک ضبط دو دقیقه ای از صدای من گرفتند. من باید رضایت می دادم که این آواتارها ساخته شوند و خب، دیجیتال Dom متولد شد. آنها یک آواتار شخصی برای من ساختند (یکی که هر اسکریپت را که می دهم می خواند) - با و بدون عینک - و دو آواتار تعاملی برای من ساختند (آنهایی که می توانند به من صحبت کنند و به من گوش دهند)، همچنین با و بدون عینک.

ما مقاله‌ای را برای آموزش آواتار تعاملی انتخاب کردیم و سپس یکی از تیم‌ها آواتار تعاملی من را ساخت که با ترکیبی از مدل‌های تبدیل صدا به متن، ویدئو، زبان و متن به صدا ارائه می‌شود. مجموعه فناوری آواتار من شامل مدل‌های ویدیویی و صوتی خود Synthesia است، اگرچه این شرکت همچنین به مشتریان اجازه می‌دهد تا از آزمایشگاه‌های دیگر مانند Cartesia، ElevenLabs، Google یا OpenAI گزینه‌های جایگزین را انتخاب کنند. شرکت‌ها همچنین می‌توانند آواتارهای خود را در هر فضای ابری که می‌خواهند میزبانی کنند یا برای میزبانی آنها به Synthesia پرداخت کنند.

مدل صدا به متن آنچه مردم می گویند را به متن تبدیل می کند، مدل زبان عاملی متن را معنا می کند و می تواند بر اساس آن اقداماتی انجام دهد، مدل متن به صدا پاسخ را به صدا تبدیل می کند و در نهایت یک مدل ویدیویی (ساخته شده توسط Synthesia) آواتار را در حین صحبت متحرک می کند.

به طور کلی، Synthesia سه نوع محصول می‌سازد - یک پلتفرم ایجاد و توزیع ویدیو با آواتارهای کلاسیک، که در آن شخصی یک اسکریپت را تایپ می‌کند و آواتار آن را تکرار می‌کند. یک پلتفرم نمایندگی به نام Sessions که در آن افراد می توانند با آواتارها در نظرسنجی یا نقش آفرینی تعامل داشته باشند. و یک پلتفرم API که در آن افراد می‌توانند مدل‌های ویدیویی و صوتی Synthesia را بگیرند و آنها را با سایر خدمات فناوری ترکیب کنند تا آواتارهای تعاملی یا انواع دیگر محصولات بسازند.

تیم Synthesia چند روز طول کشید تا آواتارهای من را بسازند. من ابتدا با افراد شخصی بازی کردم و یک اسکریپت نسبتا عمومی را تایپ کردم تا ببینم صدای هوش مصنوعی من چگونه است. من در مورد چگونگی ورود پاییز به نیویورک، زمان مورد علاقه من از سال صحبت کردم. صدا نسبتا دقیق بود، و خوشحال بودم که هیچ یک از گرفتگی صدا را که هنگام ضبط نمونه صوتی خود داشتم، دریافت نکرد.

من آن را به برخی از دوستان غیر فنی نشان دادم که آن را هم جالب و هم ترسناک یافتند.

سپس من تعاملی خود را به آنها نشان دادم که قطعی است، به این معنی که فقط آنچه را که برای پاسخ دادن به آن آموزش دیده بود می گوید. در این مورد، این داستان کلاهبرداری سرمایه گذاری من بود. من از او سؤالاتی پرسیدم مانند اینکه قبل از TechCrunch کجا بودم و در کدام بخش از نیویورک زندگی می کردم، اما هر بار مرا به داستان هدایت می کرد.

دوستان من فکر نمی‌کردند که صدا خیلی شبیه صدای من باشد و فکر می‌کردند که شبیه به آواتار شخصی نیست، اما با این وجود آنقدر نزدیک بود که تا حدودی ترسناک باشد. مادرم آن را «شگفت‌انگیز» نامید که بسیار مورد تحسین اوست. او و پدرم سعی می‌کردند از آن سؤالاتی بپرسند «فقط آنها می‌دانند» در مورد من - اما مدل پاسخی نداد و هر بار آنها را به داستان کلاهبرداری مخاطره‌آمیز هدایت می‌کرد.

او پس از آزمایش مدل به شوخی گفت: "من به یاد ندارم که شما دو نفر را به دنیا آورده باشم."

این تجربه باعث شد به این فکر کنم که آینده روزنامه نگاری چه می تواند باشد. آیا مردم با روشن کردن اخبار و ارائه آن توسط یک آواتار موافق هستند؟ یکی از سرمایه گذاران بلافاصله به من گفت نه. مطمئنا امروزه فشارهای زیادی در زمینه هوش مصنوعی وجود دارد که در رسانه‌های اجتماعی و دیگر پلتفرم‌های اشتراک‌گذاری اخبار نفوذ کرده است. اما دیگرانی که پرسیدم چندان مطمئن نبودند. آیا آواتارها می توانند روزنامه نگاران را تقویت کنند یا حتی جایگزین کنند؟ آیا مدیران عامل می خواهند با آواتار هوش مصنوعی یک روزنامه نگار صحبت کنند تا یک انسان؟

چیزی که در مورد شغلم دوست دارم ارتباط با مردم، نوشتن داستان و تحقیق در مورد موضوعات جدید است. اما بزرگترین بخش روزنامه نگاری اعتماد است. به نظر نمی رسد که هرگز بتوان آن را به یک هوش مصنوعی برون سپاری کرد.

خارج از روزنامه نگاری، من مطمئن هستم که ایده شبیه سازی خود می تواند جذاب باشد. پس از تعطیلات یا تعطیلات دیگر نیازی به پیگیری کار نیست، زیرا نسخه ای از شما همیشه می تواند در اطراف باشد و به سوالات پاسخ دهد.

ما باید ببینیم که چگونه استفاده از آواتار در شرکت‌های آمریکا تکامل می‌یابد. اما حالا که خودم را دارم، احساسات متفاوتی دارم. بعد از اینکه به تازگی اولیه آن غلبه کردم، آواتار خود را از نزدیک بررسی کردم بعد از اینکه صحبت نکرد و منتظر ماندم - مطمئن نیستم برای چه. شاید منتظر چشمک زدنش هستم یا اینکه چیز جدیدی بگوید، یا لبخند بزند، یا فقط به من بگوید که می داند.

از آنجا که دوقلوهای دیجیتال من جبرگرا هستند، هرگز این کار را نمی کنند. اما می‌توانم ببینم که چقدر آسان است که فردی با روان‌پریشی هوش مصنوعی با روان‌پریشی غیرقطعی، به این معنی که توسط یک ربات چت که آزادانه می‌توان به عنوان پاپ می‌خواند، راه‌اندازی کرد، گرفتار شود.

به یکی از سرمایه‌گذاران گفتم که آینده دوقلوهای دیجیتال هر چه باشد، پیش‌بینی می‌کنم که نسل من، Gen Z، احتمالا به آنها عادت نخواهد کرد. آنها احساس علمی تخیلی می‌کنند: هر چیزی که تا به حال در یک فیلم دیده‌ایم اکنون اینجاست. اما من می گویم، آواتارهای دیجیتالی را کمتر از انسان نماها آزاردهنده می دانم. حداقل با یک آواتار، اگر چیزها عجیب و غریب شوند، همیشه می توانم از سیستم خارج شوم.

با این حال، تا آن زمان، اینجا آواتار شخصی من است که خلاصه ای از تمام داستان های برتر سایت ما را در این هفته به شما ارائه می دهد!

وقتی از طریق پیوندهای موجود در مقالات ما خرید می کنید، ممکن است کمیسیون کمی کسب کنیم. این بر استقلال تحریریه ما تأثیر نمی گذارد.

دومینیک-مادوری دیویس یک گزارشگر ارشد سرمایه گذاری خطرپذیر و استارتاپ در TechCrunch است. او در شهر نیویورک مستقر است.

می‌توانید با ارسال ایمیل به dominic.davis@techcrunch.com یا از طریق پیام رمزگذاری‌شده به شماره 1 646 831-7565 +1 در سیگنال، با Dominic تماس بگیرید یا آن را تأیید کنید.

خواندن متن کامل در تک‌کرانچبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

I created an interactive digital avatar of myself — and you can talk to it

After obtaining an interactive avatar and training it to discuss venture fraud, I have mixed feelings about making AI clones of ourselves.

همه‌ی اخبار فناوری