پرش به محتوای اصلی

پیشرفت های هوش مصنوعی در رباتیک زندگی شما را به این زودی تغییر نخواهد داد

ام‌آی‌تی تک‌ریویو۱۴۰۵ مهر ۱۶, پنجشنبه، ساعت ۱۲:۳۰حدود 16 دقیقه مطالعه

این داستان همکاری بین MIT Technology Review و Aventine است، یک بنیاد تحقیقاتی غیرانتفاعی که محتوایی در مورد اینکه چگونه فناوری و علم در حال تغییر روش زندگی ما هستند، ایجاد و پشتیبانی می کند. روباتی به شکل انسان – سفید با سر و نیم تنه سیاه – در فیدهای ویدیویی ظاهر شده است. شاید رقصش را دیده باشید یا…

این داستان همکاری بین MIT Technology Review و Aventine است، یک بنیاد تحقیقاتی غیرانتفاعی که محتوایی در مورد اینکه چگونه فناوری و علم در حال تغییر روش زندگی ما هستند، ایجاد و پشتیبانی می‌کند.

روباتی به شکل انسان – سفید با سر و نیم تنه سیاه – در فیدهای ویدیویی ظاهر شده است. شاید دیده باشید که می رقصد یا پاپ کورن می گذراند، زباله ها را در سطل زباله می گذارد، جارو برقی می کشد یا دکمه مایکروویو را فشار می دهد. یا شاید در حین پخش بطری های آب یا تلاش برای اتو کردن پیراهن، سقوط آن را به عقب تماشا کرده باشید.

این می تواند Optimus تسلا، یک ربات انسان نما با هوش مصنوعی باشد که ایلان ماسک، مدیر عامل شرکت، معتقد است "نه تنها بزرگترین محصول تسلا تا به حال، بلکه احتمالا بزرگترین محصول تاریخ خواهد بود" و قرار است روی کف کارخانه ها و بعدا در خانه های ما کار کند. او در ماه ژوئیه به سهامداران گفت: در نهایت این "زارت انسانی و سپس فوق بشری خواهد داشت". ماسک استدلال می‌کند که روبات‌های Optimus می‌توانند تقریبا تمام نیروی کار انسان را خودکار کنند - از حمل ورقه‌های فلزی گرفته تا لباس‌های شسته‌شده تاشو - هر کدام با کمتر از 20000 دلار.

او در نشست سالانه مجمع جهانی اقتصاد در داووس، سوئیس، در ژانویه، پیش‌بینی کرد که آنها تا پایان سال 2027 برای عموم به فروش خواهند رسید.

ماسک در بشارت خود تنها نیست. Marc Andreessen، یکی از بنیانگذاران و شریک عمومی شرکت سرمایه گذاری خطرپذیر دره سیلیکون، Andreessen Horowitz، گفته است که رباتیک می تواند به "بزرگترین صنعت در تاریخ سیاره" تبدیل شود. در ژانویه، جنسن هوانگ، مدیرعامل انویدیا، گفت که ربات‌های انسان‌نما امسال با توانایی‌های سطح انسان برابری می‌کنند. به گفته مورگان استنلی، تعداد ربات‌هایی که «شبیه انسان‌ها هستند و مانند انسان عمل می‌کنند» احتمالا تا سال 2050 به حدود 1 میلیارد خواهد رسید و بازاری به ارزش بیش از 5 تریلیون دلار ایجاد می‌کند.

ایلان ماسک پیش بینی می کند که انسان نما Optimus تسلا می تواند یکی از پرفروش ترین محصولات جهان باشد. در حال حاضر، اغلب در رویدادهای تسلا در توزیع غذا و نوشیدنی دیده می شود. SIPA VIA AP IMAGES

چنین اعلامیه‌هایی تا حد زیادی ناشی از این ایده است که همان پیشرفت‌های هوش مصنوعی در پشت ابزارهایی مانند ChatGPT OpenAI و Anthropic's Claude نسل جدیدی از روبات‌ها را قادر می‌سازد تا از حرکت انسان تقلید کنند، همانطور که چت‌بات‌ها از زبان انسان تقلید می‌کنند. اما بسیاری از محققان رباتیک شک دارند و استدلال می‌کنند که چنین فرضیاتی چالش‌های استفاده از هوش مبتنی بر زبان و تصاویر را برای تسلط بر تنوع بی‌نهایت دنیای فیزیکی به حداقل می‌رساند.

Yann LeCun، که اغلب به عنوان یکی از پدرخوانده های هوش مصنوعی از او یاد می شود، در رویداد دیگری در کنفرانس ژانویه داووس گفت: "هیچ یک از آن شرکت ها [ساخت ربات های انسان نما] - مطلقا هیچ یک از آنها - هیچ ایده ای ندارند که چگونه آن ربات ها را به اندازه کافی هوشمند کنند تا مفید باشند."

محققان همچنین خاطرنشان می‌کنند که تمایل به ترکیب ربات‌های انسان‌نما که برای شبیه‌سازی افراد ساخته شده‌اند، با ماشین‌های به اصطلاح عمومی که قادر به یادگیری و انجام وظایف متعدد هستند، گمراه‌کننده است. جاناتان هرست، یکی از بنیانگذاران و مدیر ارشد روبات رباتیک چابکی و استاد رباتیک در دانشگاه ایالتی اورگان، توضیح می دهد: «ساخت رباتی که شبیه یک انسان است، بسیار آسان است. ساختن ماشینی که به صورت پویا یا فیزیکی مانند یک شخص حرکت می کند یا رفتار می کند بسیار دشوارتر است.

این تنش‌ها - در مورد اینکه آیا ربات‌های انسان‌نما همه‌منظوره هستند یا نه، و اینکه آیا اشکال فعلی هوش مصنوعی تمام چیزی است که برای تکمیل آنها لازم است - در آزمایشگاه‌های روباتیک در سراسر کشور رخ می‌دهد، جایی که هیاهو در مورد جدول‌های زمانی پیشرفت پرزحمت اما معنادار را پنهان می‌کند.

یک دهه یا بیشتر پیش، یک سری پیشرفت‌ها منجر به انقلابی مولد هوش مصنوعی شد که احتمال طولانی مدت هوش مصنوعی را به واقعیت تبدیل کرد. رباتیک‌ها - اگرچه در مورد زمان دقیق وقوع این اتفاق اختلاف نظر دارند - معتقدند که انقلابی به همان اندازه دگرگون‌کننده در رباتیک امکان‌پذیر است، انقلابی که به ماشین‌ها شهود فیزیکی و سیالیتی که مدت‌ها دور از دسترس بوده است، می‌بخشد. همانطور که پیشرفت در رباتیک چند سانتی متر به جلو می رود، سوال این است که آیا همان روش ها و ابزارهایی که به پیشرفت های هوش مصنوعی کمک می کنند برای رسیدن به آن کافی هستند یا اینکه مسیر کاملا جدیدی مورد نیاز است؟

ربات ها با هوش مصنوعی پیشرفته روبرو می شوند

برای دیدن یکی از باهوش‌ترین مغزهای روبات‌ها که امروزه کار می‌کند، ارزش این را دارد که Google DeepMind با تجهیزاتی به نام ALOHA 2 که مخفف «سیستم سخت‌افزار منبع باز کم‌هزینه برای دو دستی» است، انجام دهد.

رباتیک‌ها مدت‌هاست که بر سر این که آیا یک شکل انسان‌مانند برای روبات‌های عمومی ضروری است یا خیر، اختلاف نظر دارند، با طرفداران این بحث که به آن‌ها کمک می‌کند تا به دنیایی که وجود دارد وارد شوند و مخالفان می‌گویند ارزش این زحمت را ندارد. ALOHA 2 این شیوه دوم تفکر را منعکس می کند. چیز زیادی برای دیدن نیست، فقط یک جفت بازو، چند دستگیره و چند دوربین است. اما علیرغم سادگی ظاهری، این ابزار برای محققان در Google DeepMind است که از آن برای آزمایش پیشرفته‌ترین هوش مصنوعی برای سیستم روباتیک، Gemini Robotics، در آزمایشگاه‌های مختلف خود استفاده می‌کنند.

وقتی ALOHA 2 توسط Gemini Robotics کنترل می‌شود، بیشتر به یک ربات عمومی تبدیل می‌شود، به این معنا که می‌تواند هر تعداد کار را بر اساس نمونه‌هایی که روی آن‌ها آموزش دیده است انجام دهد. از او بخواهید یک جعبه ناهار بسته بندی کند و همانطور که در ویدیوی این تمرین نشان می دهد، می تواند از دو گیره گیره استفاده کند تا یک تکه نان سفید را با ظرافت داخل کیسه Ziploc قرار دهد، آن را ببندد، یک دسته انگور را در ظرف تاپرور بگذارد، درب آن را محکم کند، و سپس قبل از بستن زیپ، اقلام را به دقت داخل جعبه غذا منتقل کند.

این یک ناهار عالی نیست. اما این واقعیت که ربات می تواند آن را کنار هم قرار دهد نشان دهنده گامی عینی به جلو نسبت به آنچه که حتی سه سال پیش ممکن بود، است.

این تا حد زیادی به دلیل هوش مصنوعی و تأثیر آن بر سیاست‌های ربات است که کنترل می‌کند یک ربات همه‌منظور چگونه باید محیط اطراف خود را ارزیابی و درک کند، برنامه‌ریزی کند که چگونه درون آن حرکت کند و سپس وظایف خود را به درستی انجام دهد.

ربات ALOHA 2 خیلی بیشتر از دو بازوی مکانیکی روی یک نیمکت نیست، اما به عنوان یک بستر آزمایشی برای مدل‌های رباتیک هوش مصنوعی پیشرفته عمل می‌کند. این انیمیشن ها بر اساس عملیات دور دست انسان از بازوهای ربات است، داده هایی که برای آموزش مدل های Google DeepMind استفاده می شود. (ویدئو: Google DeepMind / دانشگاه استنفورد / Hoku Labs)

از لحاظ تاریخی، این سیاست‌ها بر اساس قوانین توسعه‌یافته توسط مهندسانی بود که آن‌ها را در نرم‌افزار ربات کدگذاری کردند – هزاران خط کد که هر میلی‌متر از حرکات ربات را در صدها کار تعیین می‌کرد. آنچه در چند سال گذشته اتفاق افتاده است - و عامل اصلی خوش‌بینی در مورد روبات‌های عمومی است - این است که سیاست‌های ربات به جای کدگذاری در نرم‌افزار ربات، به سیستم‌های پیشرفته هوش مصنوعی سپرده می‌شوند. این اولین بار با VLM ها یا مدل های زبان بینایی اتفاق افتاد.

اینها شبیه به مدل های زبان بزرگ هستند، اما روی تصاویر و همچنین کلمات آموزش داده شده اند. یک VLM تصویری از ریخته شدن قهوه را نشان دهید و از آن بخواهید ابزاری برای تمیز کردن آشغال پیدا کند و بتواند پارچه نزدیک را شناسایی کند. این نوع درک زمینه‌ای فوری چند سال پیش وجود نداشت، زمانی که خط‌مشی‌های روبات‌ها به صورت سخت کدگذاری شده بودند.

در مرحله بعد، مدل‌های بینایی-زبان-عملی قرار گرفتند که ربات‌ها را قادر می‌سازد تا محیط خود را ارزیابی کرده و در آن اقدام کنند. مدل ها این کار را با اضافه کردن یک جزء دیگر انجام می دهند: دستورات حرکت. VLA ها بر روی مجموعه ای از تصاویر یا ویدیوهای مربوط به انجام یک کار خاص همراه با داده های مرتبط در مورد نحوه حرکت بازوی ربات برای انجام آن آموزش می بینند. این داده‌های حرکتی معمولا از طریق عملیات دور جمع‌آوری می‌شوند، که در آن انسان از کنترل‌های از راه دور برای هدایت یک ربات از طریق یک عمل استفاده می‌کند. این نوع آموزش به هوش مصنوعی این امکان را می دهد که یاد بگیرد چگونه به ربات فرمان دهد تا در طول یک کار مشخص حرکت کند و کار کند.

یک ربات مجهز به VLA را جلوی میز قرار دهید و به آن بگویید «لپ‌تاپ را ببند» یا «سیم هدفون را بپیچد» و صحنه را بررسی می‌کند، شی مربوطه را شناسایی می‌کند، راهی برای اجرای درخواست برنامه‌ریزی می‌کند، و سپس بازوهای خود را به حرکت در می‌آورد – حداقل اگر قبلا این کار را انجام داده باشد.

مدل Gemini Robotics یک VLA است که بر روی ساعت‌های زیادی از تظاهرات انسانی که طیف وسیعی از اقدامات مختلف را به تصویر می‌کشد، آموزش دیده است. در نتیجه، می‌تواند کارهای نسبتا پیچیده‌ای مانند برداشتن نخود برفی با انبر آشپزخانه، انجام اوریگامی یا چیدن یک ناهار ساده را انجام دهد. قابل توجه است، اما یک محدودیت آشکار وجود دارد: در حال حاضر، اگر از یک ربات که توسط VLA کنترل می شود خواسته شود تا کاری را انجام دهد که خارج از مجموعه آموزشی آن است، به احتمال زیاد شکست می خورد.

ادوارد جانز، استاد رباتیک در امپریال کالج لندن می‌گوید: «با فکر کردن به فضای همه وظایف، یک سیاست کلی‌گرای واقعی می‌تواند همه چیز را در این طیف انجام دهد. با این حال، امروزه یک مدل Gemini Robotics فقط می‌تواند «چند کار را در اینجا و چند کار را آنجا» انجام دهد.

جستجوی کلیت واقعی

بنابراین چگونه می‌توانیم روبات‌ها را وادار کنیم تا کارهای بیشتری انجام دهند؟ پاسخ معمول احتمالا تعجب آور نیست: آنها را با داده های بیشتر آموزش دهید.

داده های بیشتر، تفکر پیش می رود، برابر با مثال های بیشتر، و مثال های بیشتر مساوی کلیت بیشتر است. به‌عنوان‌مثال، «گوگل دیپ‌مایند» می‌خواهد «تا حد امکان داده‌ها» را جمع‌آوری کند، پاناگ سانکتی، پیشرو سابق فناوری در زمینه رباتیک در این شرکت که در حال حاضر روی پروژه رباتیک هوش مصنوعی خود کار می‌کند. اما از کجا باید تهیه کرد؟ مدل‌های زبانی بزرگ از مزایای اقیانوس‌های متن موجود برای آموزش برخوردار بودند. هیچ مجموعه ای از نمایش های فیزیکی با کیفیت بالا برای آموزش روبات ها وجود ندارد. محققان چند راه برای جبران این موضوع دارند، اما همه آنها نقص هایی دارند.

یکی از آنها به کارگیری تعداد زیادی از افراد برای ایجاد و جمع آوری داده های عملیات از راه دور (پرهزینه و وقت گیر) است. مورد دیگر آموزش VLA ها بر روی ویدیوهای افرادی است که در حال انجام فعالیت هستند (کیفیت داده های حاصل ضعیف است). یکی دیگر از این موارد، استقرار ربات‌ها در دنیای واقعی و استفاده از داده‌های جمع‌آوری‌شده از این تجربیات برای اصلاح بیشتر مدل‌های هوش مصنوعی است (ربات‌ها در آزمایشگاه‌های بیرونی امن یا قابل اعتماد نیستند). سانکتی فکر می‌کند رویکرد «چند شاخه‌ای» که از داده‌های جمع‌آوری‌شده از همه این منابع استفاده می‌کند، محتمل‌ترین مسیر آینده است.

اما این باور که داده های آموزشی به تنهایی جواب می دهد، به دور از جهان شمول است. Agility’s Hurst آن را به عنوان «یک پیش‌فرض اساسا ناقص» توصیف می‌کند.

مسئله این است که وظایف در دنیای واقعی به سرعت در پیچیدگی منفجر می شوند. اگر می‌خواهید مثلا قهوه درست کنید، متغیرهای بی‌شماری وجود دارد: هیچ دو آشپزخانه‌ای شبیه هم نیستند. دستگاه های قهوه ساز به روش های مختلف کار می کنند. فنجان های مختلف نیاز به گرفتن های مختلف دارند. تفاله قهوه، آب داغ و شیر همگی باید به گونه‌ای متفاوت مدیریت شوند. حتی این کار ساده مستلزم درک فهرستی از امکانات است که همیشه در حال تغییر است.

هرست استدلال می کند که دستیابی به کلیت از طریق VLA ها مستلزم "پوشش کامل داده ها از تمام کارهایی است که [روبات] می تواند انجام دهد." یا به عبارت دیگر، یک استخر تقریبا بی نهایت از داده های آموزشی.

LeCun کل رویکرد را رد می کند. او در داووس گفت: «رویکردهای [هوش مصنوعی] که برای زبان موفق بوده‌اند برای داده‌های با ابعاد بالا، پیوسته و پر سر و صدا کار نمی‌کنند». "شما باید از چیز دیگری استفاده کنید."

رقیب اصلی «چیز دیگری» به اصطلاح مدل جهانی است - نوعی از هوش مصنوعی که کمتر بر روی متن آموزش داده شده است تا ترکیبی از ویدئو، اسکن سه بعدی، و داده های حسگر و برای پیش بینی نتایج اقدامات در دنیای واقعی ساخته شده است. هدف این است که مدل‌هایی بسازیم که بازنمایی درونی واقعیت را به اندازه کافی دقیق داشته باشند تا چگونگی عملکرد واقعی جهان فیزیکی - نحوه حرکت، برخورد، سقوط و تغییر شکل اجسام را نشان دهند.

اگر رباتیک‌ها بتوانند ماشین‌ها را در شبیه‌سازی‌هایی که به اندازه کافی به فیزیک دنیای واقعی وفادار هستند آموزش دهند، توسعه سریع‌تر، ارزان‌تر و ایمن‌تر می‌شود و نیاز به آزمایش در دنیای واقعی را کاهش می‌دهد. ربات‌هایی که به مدل‌های جهانی مجهز شده‌اند، حتی متحول‌کننده‌تر، می‌توانند به جای اینکه صرفا به آنها واکنش نشان دهند، درباره اطراف خود استدلال کنند و به آنها کمک کنند تا عواقب یک اقدام را قبل از انجام آن پیش‌بینی کنند.

آخرین مدل‌های هوش مصنوعی Google DeepMind برای ربات‌ها به طور فزاینده‌ای ماهرانه هستند، در صورتی که نسبتا کند و نامنظم هستند.

شرکت‌هایی مانند انویدیا و گوگل روی این فناوری کار می‌کنند و پول نقد سرمایه‌گذاران به سمت استارت‌آپ‌های مطرح سرازیر می‌شوند. World Labs که توسط محقق هوش مصنوعی استانفورد، Fei-Fei Li تأسیس شد، در ماه فوریه یک میلیارد دلار سرمایه جذب کرد و در پایان سپتامبر توسط AMD به مبلغ 8.2 میلیارد دلار خریداری شد. آزمایشگاه AMI، که توسط LeCun (دانشمند ارشد سابق هوش مصنوعی متا) تأسیس شد، نیز در ماه مارس یک میلیارد دلار جمع آوری کرد. با این حال، به اعتراف خودشان، هنوز روزهای اولیه است.

در اواخر سال گذشته، لی این رشته را "در حال ظهور" توصیف کرد و افزود که "رویکردهای بنیادی هنوز در حال ایجاد هستند." او در یک Substack ژوئن چالش‌های دلهره‌آور را توصیف کرد. در حال حاضر، مدل‌های جهانی به‌جای مسیری فوری به سوی روباتیک همه‌منظوره، حوزه‌ی امیدوارکننده‌ای برای تحقیقات هستند، اما ما در حال مشاهده زوزه‌هایی از دستاوردهایی هستیم که می‌توانند به دست آورند.

یکی از این نگاه ها با یک جهش کوچک اما بالقوه قابل توجه به جلو بود که در آوریل گذشته در آزمایشگاه روباتیک سانفرانسیسکو رخ داد.

یک پیشرفت؟

در قلب منطقه ماموریت سانفرانسیسکو، استارت‌آپ Physical Intelligence - یا PI (مانند π)، همانطور که دوست دارد شناخته شود - بر توسعه یک مغز جهانی متمرکز شده است که از نظر تئوری می‌تواند هر روباتی را به یک ژنرال تبدیل کند. این شرکت با استفاده از رویکرد سینک ظرفشویی همه چیز از جمله آشپزخانه برای آموزش مدل‌های هوش مصنوعی برای ربات‌ها، اخیرا اشاره‌ای به توانایی مغز رباتیک مجهز به یک مدل جهانی مشاهده کرده است.

در سال 2024، PI جزئیات اولین سیستم رباتیک عمومی خود را به نام π0 منتشر کرد، یک VLA که به ادعای آن «تواناترین و ماهرانه‌ترین سیاست روبات‌های ژنرالیست تا به امروز» است. این مدل ابتدا بر روی یک مجموعه اختصاصی 10000 ساعته از تظاهرات انسانی که از طریق عملیات از راه دور و همچنین چندین مجموعه داده ربات منبع باز جمع آوری شده بود، آموزش داده شد. نسخه‌ای که در بهار 2025 منتشر شد، π0.5، بر روی مجموعه‌های داده متنوع‌تری، از جمله تصاویر برچسب‌گذاری‌شده از وب، آموزش داده شد که به آن تطبیق پذیری بیشتری می‌دهد. به روز رسانی پاییز 2025، π0.6، یادگیری تقویتی را به مدل اضافه کرد.

هر به‌روزرسانی بهبودهای مهمی را در عملکرد مدل به همراه داشت، و منوی توانایی‌های آن را از تا کردن آهسته لباس‌ها تا کنار گذاشتن اشیا در محیط‌های جدید و تکمیل کارهایی مانند تا کردن جعبه‌ها با نرخ موفقیت بالاتر افزایش داد. سپس، در آوریل 2026، π0.7 به نظر می رسید که PI را به قلمرو جدیدی منجنیق می کند. این نسخه از یک مدل جهانی کمتر قدرتمند استفاده می کند که تصاویری از مراحل لازم برای انجام یک کار تولید می کند. همانطور که ربات کار را بر عهده می گیرد، این مدل "سبک" تصاویری فوری از کارهای بعدی به آن می دهد.

چگونه به یک ربات استفاده از چاقو را آموزش دهیم؟ در استارتاپ Physical Intelligence، با طراحی معماری درست هوش مصنوعی، که شامل اجزای اختصاص داده شده به زبان، بینایی و حرکت است، شروع می شود. این به آن کمک می کند تا دستورات را به هم مرتبط کند - "هی ربات، سبزیجاتم را خرد کن!" - به اقدامات مناسب WINNI WINTERMEYER

داده‌ها برای آموزش هوش مصنوعی می‌توانند از منابع متعددی به دست بیایند، اما یکی از مهم‌ترین آنها، نمایش‌های انسانی است. یکی از کارمندان این استارت آپ، بازوی ربات را از طریق دورکاری کنترل می کند و هوش مصنوعی را در معرض وظیفه برش دادن کدو سبز قرار می دهد. WINNI WINTERMEYER

محققان مدل هوش مصنوعی را بر روی صدها نمونه از تظاهرات انسانی، و همچنین تصاویر از وب و ویدیوی اول شخص آموزش می دهند. WINNI WINTERMEYER

هنگامی که هوش مصنوعی آموزش داده می شود، تیم کاری را به آن ارائه می دهد که قبلا ندیده است، مانند خرد کردن این اسکواش تابستانی. وقتی یک ربات قبلا کار دقیقی را ندیده باشد - ممکن است تعجب کند که یک کدو سبز زرد یا یک موز غیر معمول است - ممکن است خراب شود. اما هر گونه شکست می تواند برای کمک به اصلاح مدل استفاده شود. WINNI WINTERMEYER

این شرکت ادعا می‌کند که این مدل اولین نشانه‌های تعمیم ترکیبی را نشان می‌دهد، اصطلاحی برای توانایی سیستم‌های هوش مصنوعی برای انجام مهارت‌هایی که هرگز با ترکیب مجدد مهارت‌هایی که در داده‌های آموزشی خود آموخته‌اند، انجام نداده‌اند. یکی از آزمایش‌ها شامل درخواست از یک مدل بود که «یک سیب‌زمینی شیرین را در سرخ‌کن هوا قرار دهد» - کاری که قبلا هرگز با آن مواجه نشده بود. در یک ویدیوی نمایشی، دستگاه کمی دور می‌چرخد، چند راه‌اندازی اشتباه انجام می‌دهد، و در نهایت تلاش معقولی را مدیریت می‌کند، هرچند کار را به‌طور کامل تمام نمی‌کند.

سرگی لوین، استاد دانشگاه کالیفرنیا، برکلی، و یکی از بنیانگذاران PI، از این پتانسیل هیجان‌زده است: «در واقع اولین بار است که به طور قانع‌کننده‌ای آن نوع تعمیم ترکیبی را می‌بینیم، جایی که اساسا می‌توانیم از مدل بخواهیم کارهایی را انجام دهد که به طور خاص داده‌هایی را برای آن جمع‌آوری نکرده‌ایم و به آن آموزش دهیم، و در واقع تلاش قابل قبولی انجام خواهد داد.»

این موفقیت تیم را به این فکر واداشت که چگونه این مدل توانسته به چنین شاهکاری دست یابد. پس از مدتی حفاری، آن‌ها تکه‌هایی از داده‌های مربوط به عملیات از راه دور را یافتند که در مواد آموزشی کمین کرده بود، از جمله دو نمونه از کنترل‌کننده انسانی که از ربات برای فشار دادن یک سبد سرخ‌کن هوا به داخل سرخ‌کن استفاده می‌کرد. این تکه داده ها ممکن است برای فعال کردن π0.7 کافی باشد تا سیب زمینی شیرین را تقریبا در هوا سرخ کند.

در حال حاضر، مشخص نیست که توانایی های π0.7 برای تعمیم چقدر چشمگیر است. با این حال، با توجه به این که قرار گرفتن این مدل در معرض سرخ کن‌های هوا چقدر زودگذر بوده است، نگاهی اجمالی به این که تحقیقات پیشرفته در حال حاضر تا چه حد می‌تواند ربات‌ها را ببرد، ارائه می‌کند.

"70% موفقیت مثل این است که کار نمی کند"

ممکن است بین گام‌هایی که روبات‌ها در آزمایشگاه‌ها می‌سازند، قطع رابطه کنید - «ببینید! یک سیب‌زمینی شیرین را در سرخ‌کن هوا گذاشت!» - و چابکی خیره‌کننده و واقعی که در بسیاری از نمایش‌ها و ویدیوها دیده می‌شود، جایی که روبات‌ها در حال انجام هر کاری از رقص روی صحنه تا سرو مودبانه نوشیدنی هستند. چنین نمایش‌هایی اغلب به وضوح یک واقعیت کلیدی را آشکار نمی‌کنند: در بسیاری از موارد، انسان‌ها ربات را کنترل می‌کنند یا اقدامات آن را با دقت تنظیم کرده‌اند.

(برای مثال رباتی که با جنسن هوانگ، مدیرعامل انویدیا در مارس 2025 روی صحنه ظاهر شد، ظاهرا به دستورات او پاسخ می‌داد و او را دنبال می‌کرد، توسط چیزی که سازندگان آن «عروسک‌باز در پشت صحنه» نامیدند، از راه دور کنترل می‌شد.)

در حال حاضر، برنامه ریزی حرکت کاملا مستقل به طوری که یک ربات بداند به کجا باید برود - به خصوص در محیط های جدید و آشفته مانند یک محل ساخت و ساز یا یک خانه ناآشنا - یک چالش تا حد زیادی حل نشده باقی مانده است. چالش بزرگ‌تر هنوز – البته اغلب مرتبط – این است که روبات‌ها را وادار به انجام کارهای بزرگ‌تر و مبهم‌تر کنیم که شامل وظایف متعددی است و نیاز به تصمیم‌گیری در مورد چگونگی و ترتیب انجام آن‌ها دارد.

این تفاوت بین رباتی است که می‌تواند بشقاب را در مایکروویو بگذارد و روباتی که می‌تواند با کاوش در یخچال، خرد کردن مواد و روشن کردن اجاق، به درخواست «شام درست کن» پاسخ دهد. بهترین تلاش Google DeepMind برای چیزی شبیه به این - که شامل درخواست از ربات خود برای بررسی یک آشپزخانه و بسته بندی تمام مواد تشکیل دهنده یک ریزوتو قارچ در یک سبد بود - تاکنون به شکست منجر شده است.

علاوه بر این چالش، یک ربات عملی باید اساسا هر بار آن را به درستی انجام دهد. مارک رایبرت، بنیانگذار Boston Dynamics، می‌گوید: با VLA، «افراد زمانی بسیار هیجان‌زده می‌شوند که نتیجه آن‌ها از موفقیت 50 درصد به 70 درصد برسد». "اما 70٪ موفقیت مثل این است که کار نمی کند، درست است؟"

تظاهرات اغلب باعث می شود ربات ها مفید به نظر برسند، اما ماشین ها هنوز خیلی زیاد خراب می شوند و نمی توانند به طور قابل اعتماد در خانه ها و کارخانه ها استفاده شوند. AP IMAGES، SHUTTERSTOCK، 1X، AGILITY ROBOTICS، GOOGLE DEEPMIND

چند انسان نما که در محیط های واقعی آزمایش می شوند، وظایف بسیار محدودی را در محیط های کاملا کنترل شده انجام می دهند. آنها از کلی گرایان دور هستند. به گفته این شرکت، چابکی صدها ربات دارد که در مراحل آزمایشی در تاسیسات متعلق به GXO Logistics، Amazon و Schaeffler مستقر شده اند. اما در حال حاضر، هرست می‌گوید، ربات‌ها کارهای ساده‌ای مانند جابجایی سطل‌ها و وسایل نقلیه را هدف قرار می‌دهند. حتی در آن زمان، او اضافه می کند، سال ها طول کشید تا ربات هایی به اندازه کافی ایمن ساخته شوند تا شرکت های لجستیک حتی به فکر استفاده از آنها باشند.

به نوبه خود، ایلان ماسک در ماه می 2025 ادعا کرد که "هزاران" از ربات‌های Optimus او تا پایان سال در کارخانه‌های تسلا کار خواهند کرد، اما در ژانویه سال جاری گفت که این شرکت فقط "برخی از ربات‌های Optimus تسلا را دارد که وظایف ساده‌ای را در کارخانه انجام می‌دهند."

خواندن متن کامل در ام‌آی‌تی تک‌ریویوبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

AI breakthroughs in robotics won’t change your life any time soon

The story is a collaboration between MIT Technology Review and Aventine, a non-profit research foundation that creates and supports content about how technology and science are changing the way we live. A robot shaped like a human—white with a black head and torso—has been popping up on video feeds. Perhaps you’ve seen it dance or…

همه‌ی اخبار فناوری