تکامل بعدی هوش مصنوعی یادگیری از مهارتهای بازی کردن شماست
یک استارت آپ بریتانیایی در حال شکل دادن ورودی های بازی های ویدیویی به داده های آموزشی برای مدل های هوش مصنوعی است که می توانند در دنیای فیزیکی حرکت کنند.
در گوشه و کنار صنعت هوش مصنوعی این باور رو به رشد وجود دارد که مدلهای بزرگ زبان در نهایت به دلیل ناتوانی در جهتیابی در دنیای فیزیکی محدود خواهند شد. LLMهایی که فقط بر روی کلمات آموزش دیده اند، احتمالا برای هدایت وسایل نقلیه خودران، هدایت بازوهای روباتیک یا انجام هر عمل دیگری که نیاز به ظرافت و دقت دارد، مجهز نیستند.
برای رفع این نقص، گروهی از محققان مشهور از جمله Fei-Fei Li و Yann LeCun تلاش های خود را بر روی کلاس متفاوتی از هوش مصنوعی متمرکز می کنند: مدل های جهانی. برای مسلط شدن به فیزیک دنیای واقعی، مدلهای جهان باید روی ترکیبی از دادههای بصری و عملی آموزش ببینند. قبل از اینکه بتواند به طرز ماهرانه ای یک بازوی رباتیک را مانور دهد، ممکن است یک مدل نیاز به آموزش فیلم های ویدئویی از کف کارخانه داشته باشد، همراه با اطلاعاتی در مورد اینکه یک شی چقدر باید محکم گرفته شود، با چه گشتاوری دستکاری می شود و غیره.
اما برخلاف LLM ها که بر روی اقیانوس های متن آموزش دیده اند، هیچ مجموعه ای از مواد مشابه در دسترس آزمایشگاه های مدل جهانی وجود ندارد. Xiatian Zhu، دانشیار متخصص در هوش مصنوعی در دانشگاه Surrey می گوید: برای مدل های جهانی، شما به علت و نتیجه نیاز دارید. "در اینترنت، ما از این نوع داده ها بسیار کم داریم." Worldmodeldata، یک استارتآپ بریتانیایی که توسط LeCun توصیه میشود، در نظر دارد این مشکل را با بستهبندی ورودیهای کنترلر و سایر دادههای جمعآوریشده توسط استودیوهای بازیهای ویدیویی (یک محصول اگزوز موجود در مقادیر انبوه) در مجموعه دادههای آموزشی برای مدلهای جهانی حل کند.
برخی از شرکتها، مانند General Intuition و Niantic، در حال جمعآوری اطلاعات بازیهای ویدیویی از پلتفرمهای خود برای ساخت مدلها هستند. اما Worldmodeldata خود را بهعنوان واسطهای معرفی میکند که دادهها را مدیریت و سازماندهی میکند، و آزمایشگاهها را از توافقهای فردی قابل توجه با هزاران استودیو بازی نجات میدهد. رئا لوکاس، مدیرعامل Worldmodeldata، به WIRED میگوید: «میلیونها بازی فوقالعاده وجود دارد، و بیشتر و بیشتر شبیه به دنیای واقعی هستند.
چرا تجربیات گسترده، فراوان و متنوع بازیهای ویدیویی را نمیگیریم و هوش مصنوعی را آموزش نمیدهیم؟» اگرچه این فرضیه هنوز به طور کامل آزمایش نشده است، محققان به طور گسترده با این فرض کار می کنند که عملکرد مدل های جهانی مطابق با اندازه مجموعه داده های آموزشی آنها، به روشی مشابه با LLM ها، بهبود می یابد. این بدان معناست که کمبود داده های آموزشی مناسب یکی از بزرگترین تنگناها برای پیشرفت است. برخی از آزمایشگاه ها سعی کرده اند به صورت دستی داده های خود را با اتصال حسگرها به انسان و ربات در محیط های آزمایشی تولید کنند.
اما این رویکرد تنها مقدار کمی از دادهها را به دست میدهد و سناریوهای حاشیهای را که یک مدل ممکن است در طبیعت با آن مواجه شود را در نظر نمیگیرد. نیکول فرانکل، شریک شرکت VC Khosla Ventures که در General Intuition سرمایهگذاری کرده است، میگوید: «میتوانید برای نشان دادن وظایف انتخابی به مردم پول بدهید. اما تکرار به تنهایی نمیتواند بینظمی دنیایی را که از یک ماشین میخواهید در آن کار کند، نشان دهد. نظریه Worldmodeldata این است که دادههای جمعآوریشده از محیطهای بازی ویدیویی - نمایشهای بصری یک فضای سهبعدی همراه با اقدامات انجامشده توسط بازیکن - به مقدار لازم و به مقدار لازم در دسترس هستند.
به اندازه کافی متنوع برای ثبت موارد مهم گوشه. فرانکل میگوید: «موارد گوشهای همان مواردی هستند که واقعا درست میشوند. هزینه خطا با ماشین، هواپیما، پهپاد، لیفتراک کارخانه یا چهارپای خودران بسیار بالاست. Worldmodeldata میگوید تقریبا یک میلیون ساعت داده را از استودیوهای پشت بازیهای ویدیویی محبوب مختلف مجوز داده است، اگرچه لوکاس از ذکر نام آنها خودداری کرد.
در آینده، این استارتآپ در نظر دارد راههایی را برای بازیکنان تکتک برای جبران خسارت ایجاد کند. لوکاس معتقد است که دادههای بازیهای ویدیویی در نهایت اکثریت مواد آموزشی برای مدلهای جهانی را تشکیل میدهند که بعدا با استفاده از دادههای خاص برای یک محیط یا کار در دنیای واقعی بهینه میشوند. لوکاس ادعا میکند: «این به خوبی میتواند به لحظه GPT برای مدلهای جهانی منجر شود و آنها را واقعا مفید کند». با این حال، همه در مورد دادههای بازی ویدیویی خوشبینی یکسانی ندارند.
انویدیا، که خانوادهای از مدلهای جهانی را منتشر میکند که برای اجرا بر روی تراشههای خود بهینهسازی شدهاند، ترجیح میدهد از موتور سفارشی استفاده کند که به طور خاص برای تکرار فیزیک دنیای واقعی به عنوان ستون فقرات هوش مصنوعی خود ابداع کرده است. مینگ یو لیو، که توسعه مدل جهانی را در انویدیا رهبری میکند، میگوید که بعید است مدلهایی که بر روی ورودیهای بازیهای ویدیویی آموزش دیدهاند، با کارهایی که نیاز به کنترل دقیق موتور دارند، مانند دستکاری دقیق اشیا، به خوبی از پس آن برآیند.
دلیلش این است که فیزیک بازیهای ویدیویی اغلب عجیب و غریب است و توسعهدهندگان برای ایجاد توهم واقعگرایی از میانبرهایی استفاده میکنند - شخصیتی دستش را فرو میبرد تا سیبی را از روی میز جمع کند - بدون اینکه جزئیات را رمزگذاری کند: فشاری که هر انگشت برای جلوگیری از لیز خوردن سیب از چنگ آنها وارد میشود. لیو میگوید: «در استفاده از دادههای بازیهای ویدیویی برای دستکاری محافظهکارانهتر عمل میکنم.
"فیزیک برای دستکاری بسیار بیشتر درگیر است." او میگوید که آموزش دادههای بازیهای ویدیویی برای مدلهای جهانی که برای تولید ویدیوهای فوق واقعی یا محیطهای سهبعدی طراحی شدهاند، بهتر است. ژو، آکادمیک از دانشگاه سوری، نگرانی های مشابهی دارد. او میگوید: «بازیهای ویدیویی در اصل شبیهساز هستند. آنها درجاتی از زمینبندی فیزیکی دارند. "اما آنها بسیار درشت، تقریبی هستند." اما تا زمانی که مدلهای جهانی به لحظه ChatGPT خود برسند، انواع ایدهها برای رسیدن به آنجا روی میز باقی میمانند. فرانکل می گوید: «مسیرهای زیادی برای رسیدن به سرزمین موعود وجود دارد.
"حقیقت این است که هیئت منصفه هنوز مشخص نیست که کدام یک بهتر کار می کند."
متن اصلی (انگلیسی)
The Next Evolution of AI Is Learning From Your Dodgy Gaming Skills
A British startup is shaping video game inputs into training data for AI models that can navigate the physical world.