پرش به محتوای اصلی

تکامل بعدی هوش مصنوعی یادگیری از مهارت‌های بازی کردن شماست

وایرد۱۴۰۵ مهر ۶, دوشنبه، ساعت ۱۲:۳۰حدود 4 دقیقه مطالعه

یک استارت آپ بریتانیایی در حال شکل دادن ورودی های بازی های ویدیویی به داده های آموزشی برای مدل های هوش مصنوعی است که می توانند در دنیای فیزیکی حرکت کنند.

در گوشه و کنار صنعت هوش مصنوعی این باور رو به رشد وجود دارد که مدل‌های بزرگ زبان در نهایت به دلیل ناتوانی در جهت‌یابی در دنیای فیزیکی محدود خواهند شد. LLMهایی که فقط بر روی کلمات آموزش دیده اند، احتمالا برای هدایت وسایل نقلیه خودران، هدایت بازوهای روباتیک یا انجام هر عمل دیگری که نیاز به ظرافت و دقت دارد، مجهز نیستند.

برای رفع این نقص، گروهی از محققان مشهور از جمله Fei-Fei Li و Yann LeCun تلاش های خود را بر روی کلاس متفاوتی از هوش مصنوعی متمرکز می کنند: مدل های جهانی. برای مسلط شدن به فیزیک دنیای واقعی، مدل‌های جهان باید روی ترکیبی از داده‌های بصری و عملی آموزش ببینند. قبل از اینکه بتواند به طرز ماهرانه ای یک بازوی رباتیک را مانور دهد، ممکن است یک مدل نیاز به آموزش فیلم های ویدئویی از کف کارخانه داشته باشد، همراه با اطلاعاتی در مورد اینکه یک شی چقدر باید محکم گرفته شود، با چه گشتاوری دستکاری می شود و غیره.

اما برخلاف LLM ها که بر روی اقیانوس های متن آموزش دیده اند، هیچ مجموعه ای از مواد مشابه در دسترس آزمایشگاه های مدل جهانی وجود ندارد. Xiatian Zhu، دانشیار متخصص در هوش مصنوعی در دانشگاه Surrey می گوید: برای مدل های جهانی، شما به علت و نتیجه نیاز دارید. "در اینترنت، ما از این نوع داده ها بسیار کم داریم." Worldmodeldata، یک استارت‌آپ بریتانیایی که توسط LeCun توصیه می‌شود، در نظر دارد این مشکل را با بسته‌بندی ورودی‌های کنترلر و سایر داده‌های جمع‌آوری‌شده توسط استودیوهای بازی‌های ویدیویی (یک محصول اگزوز موجود در مقادیر انبوه) در مجموعه داده‌های آموزشی برای مدل‌های جهانی حل کند.

برخی از شرکت‌ها، مانند General Intuition و Niantic، در حال جمع‌آوری اطلاعات بازی‌های ویدیویی از پلتفرم‌های خود برای ساخت مدل‌ها هستند. اما Worldmodeldata خود را به‌عنوان واسطه‌ای معرفی می‌کند که داده‌ها را مدیریت و سازمان‌دهی می‌کند، و آزمایشگاه‌ها را از توافق‌های فردی قابل توجه با هزاران استودیو بازی نجات می‌دهد. رئا لوکاس، مدیرعامل Worldmodeldata، به WIRED می‌گوید: «میلیون‌ها بازی فوق‌العاده وجود دارد، و بیشتر و بیشتر شبیه به دنیای واقعی هستند.

چرا تجربیات گسترده، فراوان و متنوع بازی‌های ویدیویی را نمی‌گیریم و هوش مصنوعی را آموزش نمی‌دهیم؟» اگرچه این فرضیه هنوز به طور کامل آزمایش نشده است، محققان به طور گسترده با این فرض کار می کنند که عملکرد مدل های جهانی مطابق با اندازه مجموعه داده های آموزشی آنها، به روشی مشابه با LLM ها، بهبود می یابد. این بدان معناست که کمبود داده های آموزشی مناسب یکی از بزرگترین تنگناها برای پیشرفت است. برخی از آزمایشگاه ها سعی کرده اند به صورت دستی داده های خود را با اتصال حسگرها به انسان و ربات در محیط های آزمایشی تولید کنند.

اما این رویکرد تنها مقدار کمی از داده‌ها را به دست می‌دهد و سناریوهای حاشیه‌ای را که یک مدل ممکن است در طبیعت با آن مواجه شود را در نظر نمی‌گیرد. نیکول فرانکل، شریک شرکت VC Khosla Ventures که در General Intuition سرمایه‌گذاری کرده است، می‌گوید: «می‌توانید برای نشان دادن وظایف انتخابی به مردم پول بدهید. اما تکرار به تنهایی نمی‌تواند بی‌نظمی دنیایی را که از یک ماشین می‌خواهید در آن کار کند، نشان دهد. نظریه Worldmodeldata این است که داده‌های جمع‌آوری‌شده از محیط‌های بازی ویدیویی - نمایش‌های بصری یک فضای سه‌بعدی همراه با اقدامات انجام‌شده توسط بازیکن - به مقدار لازم و به مقدار لازم در دسترس هستند.

به اندازه کافی متنوع برای ثبت موارد مهم گوشه. فرانکل می‌گوید: «موارد گوشه‌ای همان مواردی هستند که واقعا درست می‌شوند. هزینه خطا با ماشین، هواپیما، پهپاد، لیفتراک کارخانه یا چهارپای خودران بسیار بالاست. Worldmodeldata می‌گوید تقریبا یک میلیون ساعت داده را از استودیوهای پشت بازی‌های ویدیویی محبوب مختلف مجوز داده است، اگرچه لوکاس از ذکر نام آنها خودداری کرد.

در آینده، این استارت‌آپ در نظر دارد راه‌هایی را برای بازیکنان تک‌تک برای جبران خسارت ایجاد کند. لوکاس معتقد است که داده‌های بازی‌های ویدیویی در نهایت اکثریت مواد آموزشی برای مدل‌های جهانی را تشکیل می‌دهند که بعدا با استفاده از داده‌های خاص برای یک محیط یا کار در دنیای واقعی بهینه می‌شوند. لوکاس ادعا می‌کند: «این به خوبی می‌تواند به لحظه GPT برای مدل‌های جهانی منجر شود و آنها را واقعا مفید کند». با این حال، همه در مورد داده‌های بازی ویدیویی خوش‌بینی یکسانی ندارند.

انویدیا، که خانواده‌ای از مدل‌های جهانی را منتشر می‌کند که برای اجرا بر روی تراشه‌های خود بهینه‌سازی شده‌اند، ترجیح می‌دهد از موتور سفارشی استفاده کند که به طور خاص برای تکرار فیزیک دنیای واقعی به عنوان ستون فقرات هوش مصنوعی خود ابداع کرده است. مینگ یو لیو، که توسعه مدل جهانی را در انویدیا رهبری می‌کند، می‌گوید که بعید است مدل‌هایی که بر روی ورودی‌های بازی‌های ویدیویی آموزش دیده‌اند، با کارهایی که نیاز به کنترل دقیق موتور دارند، مانند دستکاری دقیق اشیا، به خوبی از پس آن برآیند.

دلیلش این است که فیزیک بازی‌های ویدیویی اغلب عجیب و غریب است و توسعه‌دهندگان برای ایجاد توهم واقع‌گرایی از میان‌برهایی استفاده می‌کنند - شخصیتی دستش را فرو می‌برد تا سیبی را از روی میز جمع کند - بدون اینکه جزئیات را رمزگذاری کند: فشاری که هر انگشت برای جلوگیری از لیز خوردن سیب از چنگ آنها وارد می‌شود. لیو می‌گوید: «در استفاده از داده‌های بازی‌های ویدیویی برای دستکاری محافظه‌کارانه‌تر عمل می‌کنم.

"فیزیک برای دستکاری بسیار بیشتر درگیر است." او می‌گوید که آموزش داده‌های بازی‌های ویدیویی برای مدل‌های جهانی که برای تولید ویدیوهای فوق واقعی یا محیط‌های سه‌بعدی طراحی شده‌اند، بهتر است. ژو، آکادمیک از دانشگاه سوری، نگرانی های مشابهی دارد. او می‌گوید: «بازی‌های ویدیویی در اصل شبیه‌ساز هستند. آنها درجاتی از زمین‌بندی فیزیکی دارند. "اما آنها بسیار درشت، تقریبی هستند." اما تا زمانی که مدل‌های جهانی به لحظه ChatGPT خود برسند، انواع ایده‌ها برای رسیدن به آنجا روی میز باقی می‌مانند. فرانکل می گوید: «مسیرهای زیادی برای رسیدن به سرزمین موعود وجود دارد.

"حقیقت این است که هیئت منصفه هنوز مشخص نیست که کدام یک بهتر کار می کند."

خواندن متن کامل در وایردبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

The Next Evolution of AI Is Learning From Your Dodgy Gaming Skills

A British startup is shaping video game inputs into training data for AI models that can navigate the physical world.

همه‌ی اخبار فناوری