من یک آواتار دیجیتال تعاملی از خودم ایجاد کردم - و شما می توانید با آن صحبت کنید
پس از به دست آوردن یک آواتار تعاملی و آموزش آن برای بحث در مورد کلاهبرداری خطرپذیر، احساسات متفاوتی در مورد ساختن شبیه سازی هوش مصنوعی از خود دارم.
هنگامی که الکساندر وویکا، رئیس امور شرکتی در استارتاپ نسل ویدیویی Synthesia، در تابستان امسال پیوندی به جدیدترین عضو تیم روابط عمومی آنها برای من فرستاد، شگفت زده شدم. این یک آواتار مجازی تعاملی از او بود که برای پاسخ دادن به سوالات رایج مطبوعات در مورد Synthesia، مانند آنچه که انجام می دهد و چگونه کار می کند، آموزش دیده بود. روز قبل، من در یک پانل بودم که در آن افراد روابط عمومی از من پرسیدند که آیا به طرحهایی که از متن تولید شده توسط هوش مصنوعی استفاده میکردند، اهمیت نمیدهم. اما آواتار الکساندرو فراتر از این بود - به نظر من این آخرین رئیس استفاده از هوش مصنوعی در روابط عمومی بود.
Synthesia به شرکتها اجازه میدهد ویدیوهای آموزشی تعاملی با آواتارهای هوش مصنوعی بسازند و اخیرا محصولی به نام Roleplay Sessions راهاندازی کرده است که به کارمندان اجازه میدهد به عنوان مثال، فروشها را با یک آواتار هوش مصنوعی تعاملی که پاسخ میدهد و به پاسخهای آنها امتیاز میدهد، تمرین کنند.
وقتی به افتتاحیه دفتر جدید رفتم و آنها از من پرسیدند که آیا آواتار هوش مصنوعی خودم را می خواهم، حتی در پاسخ به این سوال تردید نکردم. البته من دوقلو دیجیتال خودم را دوست دارم. آن روز لباس من زیبا بود و موهایم سر جایش بود.
تا زمانی که دوقلوهای دیجیتال خود را ملاقات نکردم، نسبت به آواتارها بی تفاوت بودم، اما احساس می کردم که آنها به ناچار بخشی از زندگی روزمره آنلاین خواهند شد. من از افرادی در اینستاگرام شنیدم که آنها را به شکلی شبیه خود ساخته اند تا به آنها در تولید محتوای اجتماعی کمک کنند. به نظر من همه چیز بسیار جالب است، و شاید به همین دلیل است که اکنون هیچ ابایی ندارم که دوقلوی دیجیتالم را به شما معرفی کنم. این اولین بار است که Synethsia یک آواتار دیجیتال برای یک روزنامه نگار (یا برای هر کسی، نقطه، خارج از Voica) می سازد.
این در مورد داستان من در مورد اینکه چرا استارتاپ های دارای پشتوانه سرمایه گذاری بیشتر از استارتاپ های بدون پشتوانه VC مرتکب تقلب می شوند آموزش داده شده است و فقط به سؤالات مربوط به آن داستان پاسخ می دهد.
در زیر، برای شروع به سادگی "شروع در یک پنجره جدید" را فشار دهید.
برای انجام این کار، وارد یک استودیوی مینی فیلم شدم که در داخل دفتر Synthesia قرار داشت و در آنجا عکس های زیادی از من گرفتند و یک ضبط دو دقیقه ای از صدای من گرفتند. من باید رضایت می دادم که این آواتارها ساخته شوند و خب، دیجیتال Dom متولد شد. آنها یک آواتار شخصی برای من ساختند (یکی که هر اسکریپت را که می دهم می خواند) - با و بدون عینک - و دو آواتار تعاملی برای من ساختند (آنهایی که می توانند به من صحبت کنند و به من گوش دهند)، همچنین با و بدون عینک.
ما مقالهای را برای آموزش آواتار تعاملی انتخاب کردیم و سپس یکی از تیمها آواتار تعاملی من را ساخت که با ترکیبی از مدلهای تبدیل صدا به متن، ویدئو، زبان و متن به صدا ارائه میشود. مجموعه فناوری آواتار من شامل مدلهای ویدیویی و صوتی خود Synthesia است، اگرچه این شرکت همچنین به مشتریان اجازه میدهد تا از آزمایشگاههای دیگر مانند Cartesia، ElevenLabs، Google یا OpenAI گزینههای جایگزین را انتخاب کنند. شرکتها همچنین میتوانند آواتارهای خود را در هر فضای ابری که میخواهند میزبانی کنند یا برای میزبانی آنها به Synthesia پرداخت کنند.
مدل صدا به متن آنچه مردم می گویند را به متن تبدیل می کند، مدل زبان عاملی متن را معنا می کند و می تواند بر اساس آن اقداماتی انجام دهد، مدل متن به صدا پاسخ را به صدا تبدیل می کند و در نهایت یک مدل ویدیویی (ساخته شده توسط Synthesia) آواتار را در حین صحبت متحرک می کند.
به طور کلی، Synthesia سه نوع محصول میسازد - یک پلتفرم ایجاد و توزیع ویدیو با آواتارهای کلاسیک، که در آن شخصی یک اسکریپت را تایپ میکند و آواتار آن را تکرار میکند. یک پلتفرم نمایندگی به نام Sessions که در آن افراد می توانند با آواتارها در نظرسنجی یا نقش آفرینی تعامل داشته باشند. و یک پلتفرم API که در آن افراد میتوانند مدلهای ویدیویی و صوتی Synthesia را بگیرند و آنها را با سایر خدمات فناوری ترکیب کنند تا آواتارهای تعاملی یا انواع دیگر محصولات بسازند.
تیم Synthesia چند روز طول کشید تا آواتارهای من را بسازند. من ابتدا با افراد شخصی بازی کردم و یک اسکریپت نسبتا عمومی را تایپ کردم تا ببینم صدای هوش مصنوعی من چگونه است. من در مورد چگونگی ورود پاییز به نیویورک، زمان مورد علاقه من از سال صحبت کردم. صدا نسبتا دقیق بود، و خوشحال بودم که هیچ یک از گرفتگی صدا را که هنگام ضبط نمونه صوتی خود داشتم، دریافت نکرد.
من آن را به برخی از دوستان غیر فنی نشان دادم که آن را هم جالب و هم ترسناک یافتند.
سپس من تعاملی خود را به آنها نشان دادم که قطعی است، به این معنی که فقط آنچه را که برای پاسخ دادن به آن آموزش دیده بود می گوید. در این مورد، این داستان کلاهبرداری سرمایه گذاری من بود. من از او سؤالاتی پرسیدم مانند اینکه قبل از TechCrunch کجا بودم و در کدام بخش از نیویورک زندگی می کردم، اما هر بار مرا به داستان هدایت می کرد.
دوستان من فکر نمیکردند که صدا خیلی شبیه صدای من باشد و فکر میکردند که شبیه به آواتار شخصی نیست، اما با این وجود آنقدر نزدیک بود که تا حدودی ترسناک باشد. مادرم آن را «شگفتانگیز» نامید که بسیار مورد تحسین اوست. او و پدرم سعی میکردند از آن سؤالاتی بپرسند «فقط آنها میدانند» در مورد من - اما مدل پاسخی نداد و هر بار آنها را به داستان کلاهبرداری مخاطرهآمیز هدایت میکرد.
او پس از آزمایش مدل به شوخی گفت: "من به یاد ندارم که شما دو نفر را به دنیا آورده باشم."
این تجربه باعث شد به این فکر کنم که آینده روزنامه نگاری چه می تواند باشد. آیا مردم با روشن کردن اخبار و ارائه آن توسط یک آواتار موافق هستند؟ یکی از سرمایه گذاران بلافاصله به من گفت نه. مطمئنا امروزه فشارهای زیادی در زمینه هوش مصنوعی وجود دارد که در رسانههای اجتماعی و دیگر پلتفرمهای اشتراکگذاری اخبار نفوذ کرده است. اما دیگرانی که پرسیدم چندان مطمئن نبودند. آیا آواتارها می توانند روزنامه نگاران را تقویت کنند یا حتی جایگزین کنند؟ آیا مدیران عامل می خواهند با آواتار هوش مصنوعی یک روزنامه نگار صحبت کنند تا یک انسان؟
چیزی که در مورد شغلم دوست دارم ارتباط با مردم، نوشتن داستان و تحقیق در مورد موضوعات جدید است. اما بزرگترین بخش روزنامه نگاری اعتماد است. به نظر نمی رسد که هرگز بتوان آن را به یک هوش مصنوعی برون سپاری کرد.
خارج از روزنامه نگاری، من مطمئن هستم که ایده شبیه سازی خود می تواند جذاب باشد. پس از تعطیلات یا تعطیلات دیگر نیازی به پیگیری کار نیست، زیرا نسخه ای از شما همیشه می تواند در اطراف باشد و به سوالات پاسخ دهد.
ما باید ببینیم که چگونه استفاده از آواتار در شرکتهای آمریکا تکامل مییابد. اما حالا که خودم را دارم، احساسات متفاوتی دارم. بعد از اینکه به تازگی اولیه آن غلبه کردم، آواتار خود را از نزدیک بررسی کردم بعد از اینکه صحبت نکرد و منتظر ماندم - مطمئن نیستم برای چه. شاید منتظر چشمک زدنش هستم یا اینکه چیز جدیدی بگوید، یا لبخند بزند، یا فقط به من بگوید که می داند.
از آنجا که دوقلوهای دیجیتال من جبرگرا هستند، هرگز این کار را نمی کنند. اما میتوانم ببینم که چقدر آسان است که فردی با روانپریشی هوش مصنوعی با روانپریشی غیرقطعی، به این معنی که توسط یک ربات چت که آزادانه میتوان به عنوان پاپ میخواند، راهاندازی کرد، گرفتار شود.
به یکی از سرمایهگذاران گفتم که آینده دوقلوهای دیجیتال هر چه باشد، پیشبینی میکنم که نسل من، Gen Z، احتمالا به آنها عادت نخواهد کرد. آنها احساس علمی تخیلی میکنند: هر چیزی که تا به حال در یک فیلم دیدهایم اکنون اینجاست. اما من می گویم، آواتارهای دیجیتالی را کمتر از انسان نماها آزاردهنده می دانم. حداقل با یک آواتار، اگر چیزها عجیب و غریب شوند، همیشه می توانم از سیستم خارج شوم.
با این حال، تا آن زمان، اینجا آواتار شخصی من است که خلاصه ای از تمام داستان های برتر سایت ما را در این هفته به شما ارائه می دهد!
وقتی از طریق پیوندهای موجود در مقالات ما خرید می کنید، ممکن است کمیسیون کمی کسب کنیم. این بر استقلال تحریریه ما تأثیر نمی گذارد.
دومینیک-مادوری دیویس یک گزارشگر ارشد سرمایه گذاری خطرپذیر و استارتاپ در TechCrunch است. او در شهر نیویورک مستقر است.
میتوانید با ارسال ایمیل به dominic.davis@techcrunch.com یا از طریق پیام رمزگذاریشده به شماره 1 646 831-7565 +1 در سیگنال، با Dominic تماس بگیرید یا آن را تأیید کنید.
متن اصلی (انگلیسی)
I created an interactive digital avatar of myself — and you can talk to it
After obtaining an interactive avatar and training it to discuss venture fraud, I have mixed feelings about making AI clones of ourselves.