پیشرفت های هوش مصنوعی در رباتیک زندگی شما را به این زودی تغییر نخواهد داد
این داستان همکاری بین MIT Technology Review و Aventine است، یک بنیاد تحقیقاتی غیرانتفاعی که محتوایی در مورد اینکه چگونه فناوری و علم در حال تغییر روش زندگی ما هستند، ایجاد و پشتیبانی می کند. روباتی به شکل انسان – سفید با سر و نیم تنه سیاه – در فیدهای ویدیویی ظاهر شده است. شاید رقصش را دیده باشید یا…
این داستان همکاری بین MIT Technology Review و Aventine است، یک بنیاد تحقیقاتی غیرانتفاعی که محتوایی در مورد اینکه چگونه فناوری و علم در حال تغییر روش زندگی ما هستند، ایجاد و پشتیبانی میکند.
روباتی به شکل انسان – سفید با سر و نیم تنه سیاه – در فیدهای ویدیویی ظاهر شده است. شاید دیده باشید که می رقصد یا پاپ کورن می گذراند، زباله ها را در سطل زباله می گذارد، جارو برقی می کشد یا دکمه مایکروویو را فشار می دهد. یا شاید در حین پخش بطری های آب یا تلاش برای اتو کردن پیراهن، سقوط آن را به عقب تماشا کرده باشید.
این می تواند Optimus تسلا، یک ربات انسان نما با هوش مصنوعی باشد که ایلان ماسک، مدیر عامل شرکت، معتقد است "نه تنها بزرگترین محصول تسلا تا به حال، بلکه احتمالا بزرگترین محصول تاریخ خواهد بود" و قرار است روی کف کارخانه ها و بعدا در خانه های ما کار کند. او در ماه ژوئیه به سهامداران گفت: در نهایت این "زارت انسانی و سپس فوق بشری خواهد داشت". ماسک استدلال میکند که روباتهای Optimus میتوانند تقریبا تمام نیروی کار انسان را خودکار کنند - از حمل ورقههای فلزی گرفته تا لباسهای شستهشده تاشو - هر کدام با کمتر از 20000 دلار.
او در نشست سالانه مجمع جهانی اقتصاد در داووس، سوئیس، در ژانویه، پیشبینی کرد که آنها تا پایان سال 2027 برای عموم به فروش خواهند رسید.
ماسک در بشارت خود تنها نیست. Marc Andreessen، یکی از بنیانگذاران و شریک عمومی شرکت سرمایه گذاری خطرپذیر دره سیلیکون، Andreessen Horowitz، گفته است که رباتیک می تواند به "بزرگترین صنعت در تاریخ سیاره" تبدیل شود. در ژانویه، جنسن هوانگ، مدیرعامل انویدیا، گفت که رباتهای انساننما امسال با تواناییهای سطح انسان برابری میکنند. به گفته مورگان استنلی، تعداد رباتهایی که «شبیه انسانها هستند و مانند انسان عمل میکنند» احتمالا تا سال 2050 به حدود 1 میلیارد خواهد رسید و بازاری به ارزش بیش از 5 تریلیون دلار ایجاد میکند.
ایلان ماسک پیش بینی می کند که انسان نما Optimus تسلا می تواند یکی از پرفروش ترین محصولات جهان باشد. در حال حاضر، اغلب در رویدادهای تسلا در توزیع غذا و نوشیدنی دیده می شود. SIPA VIA AP IMAGES
چنین اعلامیههایی تا حد زیادی ناشی از این ایده است که همان پیشرفتهای هوش مصنوعی در پشت ابزارهایی مانند ChatGPT OpenAI و Anthropic's Claude نسل جدیدی از روباتها را قادر میسازد تا از حرکت انسان تقلید کنند، همانطور که چتباتها از زبان انسان تقلید میکنند. اما بسیاری از محققان رباتیک شک دارند و استدلال میکنند که چنین فرضیاتی چالشهای استفاده از هوش مبتنی بر زبان و تصاویر را برای تسلط بر تنوع بینهایت دنیای فیزیکی به حداقل میرساند.
Yann LeCun، که اغلب به عنوان یکی از پدرخوانده های هوش مصنوعی از او یاد می شود، در رویداد دیگری در کنفرانس ژانویه داووس گفت: "هیچ یک از آن شرکت ها [ساخت ربات های انسان نما] - مطلقا هیچ یک از آنها - هیچ ایده ای ندارند که چگونه آن ربات ها را به اندازه کافی هوشمند کنند تا مفید باشند."
محققان همچنین خاطرنشان میکنند که تمایل به ترکیب رباتهای انساننما که برای شبیهسازی افراد ساخته شدهاند، با ماشینهای به اصطلاح عمومی که قادر به یادگیری و انجام وظایف متعدد هستند، گمراهکننده است. جاناتان هرست، یکی از بنیانگذاران و مدیر ارشد روبات رباتیک چابکی و استاد رباتیک در دانشگاه ایالتی اورگان، توضیح می دهد: «ساخت رباتی که شبیه یک انسان است، بسیار آسان است. ساختن ماشینی که به صورت پویا یا فیزیکی مانند یک شخص حرکت می کند یا رفتار می کند بسیار دشوارتر است.
این تنشها - در مورد اینکه آیا رباتهای انساننما همهمنظوره هستند یا نه، و اینکه آیا اشکال فعلی هوش مصنوعی تمام چیزی است که برای تکمیل آنها لازم است - در آزمایشگاههای روباتیک در سراسر کشور رخ میدهد، جایی که هیاهو در مورد جدولهای زمانی پیشرفت پرزحمت اما معنادار را پنهان میکند.
یک دهه یا بیشتر پیش، یک سری پیشرفتها منجر به انقلابی مولد هوش مصنوعی شد که احتمال طولانی مدت هوش مصنوعی را به واقعیت تبدیل کرد. رباتیکها - اگرچه در مورد زمان دقیق وقوع این اتفاق اختلاف نظر دارند - معتقدند که انقلابی به همان اندازه دگرگونکننده در رباتیک امکانپذیر است، انقلابی که به ماشینها شهود فیزیکی و سیالیتی که مدتها دور از دسترس بوده است، میبخشد. همانطور که پیشرفت در رباتیک چند سانتی متر به جلو می رود، سوال این است که آیا همان روش ها و ابزارهایی که به پیشرفت های هوش مصنوعی کمک می کنند برای رسیدن به آن کافی هستند یا اینکه مسیر کاملا جدیدی مورد نیاز است؟
ربات ها با هوش مصنوعی پیشرفته روبرو می شوند
برای دیدن یکی از باهوشترین مغزهای روباتها که امروزه کار میکند، ارزش این را دارد که Google DeepMind با تجهیزاتی به نام ALOHA 2 که مخفف «سیستم سختافزار منبع باز کمهزینه برای دو دستی» است، انجام دهد.
رباتیکها مدتهاست که بر سر این که آیا یک شکل انسانمانند برای روباتهای عمومی ضروری است یا خیر، اختلاف نظر دارند، با طرفداران این بحث که به آنها کمک میکند تا به دنیایی که وجود دارد وارد شوند و مخالفان میگویند ارزش این زحمت را ندارد. ALOHA 2 این شیوه دوم تفکر را منعکس می کند. چیز زیادی برای دیدن نیست، فقط یک جفت بازو، چند دستگیره و چند دوربین است. اما علیرغم سادگی ظاهری، این ابزار برای محققان در Google DeepMind است که از آن برای آزمایش پیشرفتهترین هوش مصنوعی برای سیستم روباتیک، Gemini Robotics، در آزمایشگاههای مختلف خود استفاده میکنند.
وقتی ALOHA 2 توسط Gemini Robotics کنترل میشود، بیشتر به یک ربات عمومی تبدیل میشود، به این معنا که میتواند هر تعداد کار را بر اساس نمونههایی که روی آنها آموزش دیده است انجام دهد. از او بخواهید یک جعبه ناهار بسته بندی کند و همانطور که در ویدیوی این تمرین نشان می دهد، می تواند از دو گیره گیره استفاده کند تا یک تکه نان سفید را با ظرافت داخل کیسه Ziploc قرار دهد، آن را ببندد، یک دسته انگور را در ظرف تاپرور بگذارد، درب آن را محکم کند، و سپس قبل از بستن زیپ، اقلام را به دقت داخل جعبه غذا منتقل کند.
این یک ناهار عالی نیست. اما این واقعیت که ربات می تواند آن را کنار هم قرار دهد نشان دهنده گامی عینی به جلو نسبت به آنچه که حتی سه سال پیش ممکن بود، است.
این تا حد زیادی به دلیل هوش مصنوعی و تأثیر آن بر سیاستهای ربات است که کنترل میکند یک ربات همهمنظور چگونه باید محیط اطراف خود را ارزیابی و درک کند، برنامهریزی کند که چگونه درون آن حرکت کند و سپس وظایف خود را به درستی انجام دهد.
ربات ALOHA 2 خیلی بیشتر از دو بازوی مکانیکی روی یک نیمکت نیست، اما به عنوان یک بستر آزمایشی برای مدلهای رباتیک هوش مصنوعی پیشرفته عمل میکند. این انیمیشن ها بر اساس عملیات دور دست انسان از بازوهای ربات است، داده هایی که برای آموزش مدل های Google DeepMind استفاده می شود. (ویدئو: Google DeepMind / دانشگاه استنفورد / Hoku Labs)
از لحاظ تاریخی، این سیاستها بر اساس قوانین توسعهیافته توسط مهندسانی بود که آنها را در نرمافزار ربات کدگذاری کردند – هزاران خط کد که هر میلیمتر از حرکات ربات را در صدها کار تعیین میکرد. آنچه در چند سال گذشته اتفاق افتاده است - و عامل اصلی خوشبینی در مورد روباتهای عمومی است - این است که سیاستهای ربات به جای کدگذاری در نرمافزار ربات، به سیستمهای پیشرفته هوش مصنوعی سپرده میشوند. این اولین بار با VLM ها یا مدل های زبان بینایی اتفاق افتاد.
اینها شبیه به مدل های زبان بزرگ هستند، اما روی تصاویر و همچنین کلمات آموزش داده شده اند. یک VLM تصویری از ریخته شدن قهوه را نشان دهید و از آن بخواهید ابزاری برای تمیز کردن آشغال پیدا کند و بتواند پارچه نزدیک را شناسایی کند. این نوع درک زمینهای فوری چند سال پیش وجود نداشت، زمانی که خطمشیهای روباتها به صورت سخت کدگذاری شده بودند.
در مرحله بعد، مدلهای بینایی-زبان-عملی قرار گرفتند که رباتها را قادر میسازد تا محیط خود را ارزیابی کرده و در آن اقدام کنند. مدل ها این کار را با اضافه کردن یک جزء دیگر انجام می دهند: دستورات حرکت. VLA ها بر روی مجموعه ای از تصاویر یا ویدیوهای مربوط به انجام یک کار خاص همراه با داده های مرتبط در مورد نحوه حرکت بازوی ربات برای انجام آن آموزش می بینند. این دادههای حرکتی معمولا از طریق عملیات دور جمعآوری میشوند، که در آن انسان از کنترلهای از راه دور برای هدایت یک ربات از طریق یک عمل استفاده میکند. این نوع آموزش به هوش مصنوعی این امکان را می دهد که یاد بگیرد چگونه به ربات فرمان دهد تا در طول یک کار مشخص حرکت کند و کار کند.
یک ربات مجهز به VLA را جلوی میز قرار دهید و به آن بگویید «لپتاپ را ببند» یا «سیم هدفون را بپیچد» و صحنه را بررسی میکند، شی مربوطه را شناسایی میکند، راهی برای اجرای درخواست برنامهریزی میکند، و سپس بازوهای خود را به حرکت در میآورد – حداقل اگر قبلا این کار را انجام داده باشد.
مدل Gemini Robotics یک VLA است که بر روی ساعتهای زیادی از تظاهرات انسانی که طیف وسیعی از اقدامات مختلف را به تصویر میکشد، آموزش دیده است. در نتیجه، میتواند کارهای نسبتا پیچیدهای مانند برداشتن نخود برفی با انبر آشپزخانه، انجام اوریگامی یا چیدن یک ناهار ساده را انجام دهد. قابل توجه است، اما یک محدودیت آشکار وجود دارد: در حال حاضر، اگر از یک ربات که توسط VLA کنترل می شود خواسته شود تا کاری را انجام دهد که خارج از مجموعه آموزشی آن است، به احتمال زیاد شکست می خورد.
ادوارد جانز، استاد رباتیک در امپریال کالج لندن میگوید: «با فکر کردن به فضای همه وظایف، یک سیاست کلیگرای واقعی میتواند همه چیز را در این طیف انجام دهد. با این حال، امروزه یک مدل Gemini Robotics فقط میتواند «چند کار را در اینجا و چند کار را آنجا» انجام دهد.
جستجوی کلیت واقعی
بنابراین چگونه میتوانیم روباتها را وادار کنیم تا کارهای بیشتری انجام دهند؟ پاسخ معمول احتمالا تعجب آور نیست: آنها را با داده های بیشتر آموزش دهید.
داده های بیشتر، تفکر پیش می رود، برابر با مثال های بیشتر، و مثال های بیشتر مساوی کلیت بیشتر است. بهعنوانمثال، «گوگل دیپمایند» میخواهد «تا حد امکان دادهها» را جمعآوری کند، پاناگ سانکتی، پیشرو سابق فناوری در زمینه رباتیک در این شرکت که در حال حاضر روی پروژه رباتیک هوش مصنوعی خود کار میکند. اما از کجا باید تهیه کرد؟ مدلهای زبانی بزرگ از مزایای اقیانوسهای متن موجود برای آموزش برخوردار بودند. هیچ مجموعه ای از نمایش های فیزیکی با کیفیت بالا برای آموزش روبات ها وجود ندارد. محققان چند راه برای جبران این موضوع دارند، اما همه آنها نقص هایی دارند.
یکی از آنها به کارگیری تعداد زیادی از افراد برای ایجاد و جمع آوری داده های عملیات از راه دور (پرهزینه و وقت گیر) است. مورد دیگر آموزش VLA ها بر روی ویدیوهای افرادی است که در حال انجام فعالیت هستند (کیفیت داده های حاصل ضعیف است). یکی دیگر از این موارد، استقرار رباتها در دنیای واقعی و استفاده از دادههای جمعآوریشده از این تجربیات برای اصلاح بیشتر مدلهای هوش مصنوعی است (رباتها در آزمایشگاههای بیرونی امن یا قابل اعتماد نیستند). سانکتی فکر میکند رویکرد «چند شاخهای» که از دادههای جمعآوریشده از همه این منابع استفاده میکند، محتملترین مسیر آینده است.
اما این باور که داده های آموزشی به تنهایی جواب می دهد، به دور از جهان شمول است. Agility’s Hurst آن را به عنوان «یک پیشفرض اساسا ناقص» توصیف میکند.
مسئله این است که وظایف در دنیای واقعی به سرعت در پیچیدگی منفجر می شوند. اگر میخواهید مثلا قهوه درست کنید، متغیرهای بیشماری وجود دارد: هیچ دو آشپزخانهای شبیه هم نیستند. دستگاه های قهوه ساز به روش های مختلف کار می کنند. فنجان های مختلف نیاز به گرفتن های مختلف دارند. تفاله قهوه، آب داغ و شیر همگی باید به گونهای متفاوت مدیریت شوند. حتی این کار ساده مستلزم درک فهرستی از امکانات است که همیشه در حال تغییر است.
هرست استدلال می کند که دستیابی به کلیت از طریق VLA ها مستلزم "پوشش کامل داده ها از تمام کارهایی است که [روبات] می تواند انجام دهد." یا به عبارت دیگر، یک استخر تقریبا بی نهایت از داده های آموزشی.
LeCun کل رویکرد را رد می کند. او در داووس گفت: «رویکردهای [هوش مصنوعی] که برای زبان موفق بودهاند برای دادههای با ابعاد بالا، پیوسته و پر سر و صدا کار نمیکنند». "شما باید از چیز دیگری استفاده کنید."
رقیب اصلی «چیز دیگری» به اصطلاح مدل جهانی است - نوعی از هوش مصنوعی که کمتر بر روی متن آموزش داده شده است تا ترکیبی از ویدئو، اسکن سه بعدی، و داده های حسگر و برای پیش بینی نتایج اقدامات در دنیای واقعی ساخته شده است. هدف این است که مدلهایی بسازیم که بازنمایی درونی واقعیت را به اندازه کافی دقیق داشته باشند تا چگونگی عملکرد واقعی جهان فیزیکی - نحوه حرکت، برخورد، سقوط و تغییر شکل اجسام را نشان دهند.
اگر رباتیکها بتوانند ماشینها را در شبیهسازیهایی که به اندازه کافی به فیزیک دنیای واقعی وفادار هستند آموزش دهند، توسعه سریعتر، ارزانتر و ایمنتر میشود و نیاز به آزمایش در دنیای واقعی را کاهش میدهد. رباتهایی که به مدلهای جهانی مجهز شدهاند، حتی متحولکنندهتر، میتوانند به جای اینکه صرفا به آنها واکنش نشان دهند، درباره اطراف خود استدلال کنند و به آنها کمک کنند تا عواقب یک اقدام را قبل از انجام آن پیشبینی کنند.
آخرین مدلهای هوش مصنوعی Google DeepMind برای رباتها به طور فزایندهای ماهرانه هستند، در صورتی که نسبتا کند و نامنظم هستند.
شرکتهایی مانند انویدیا و گوگل روی این فناوری کار میکنند و پول نقد سرمایهگذاران به سمت استارتآپهای مطرح سرازیر میشوند. World Labs که توسط محقق هوش مصنوعی استانفورد، Fei-Fei Li تأسیس شد، در ماه فوریه یک میلیارد دلار سرمایه جذب کرد و در پایان سپتامبر توسط AMD به مبلغ 8.2 میلیارد دلار خریداری شد. آزمایشگاه AMI، که توسط LeCun (دانشمند ارشد سابق هوش مصنوعی متا) تأسیس شد، نیز در ماه مارس یک میلیارد دلار جمع آوری کرد. با این حال، به اعتراف خودشان، هنوز روزهای اولیه است.
در اواخر سال گذشته، لی این رشته را "در حال ظهور" توصیف کرد و افزود که "رویکردهای بنیادی هنوز در حال ایجاد هستند." او در یک Substack ژوئن چالشهای دلهرهآور را توصیف کرد. در حال حاضر، مدلهای جهانی بهجای مسیری فوری به سوی روباتیک همهمنظوره، حوزهی امیدوارکنندهای برای تحقیقات هستند، اما ما در حال مشاهده زوزههایی از دستاوردهایی هستیم که میتوانند به دست آورند.
یکی از این نگاه ها با یک جهش کوچک اما بالقوه قابل توجه به جلو بود که در آوریل گذشته در آزمایشگاه روباتیک سانفرانسیسکو رخ داد.
یک پیشرفت؟
در قلب منطقه ماموریت سانفرانسیسکو، استارتآپ Physical Intelligence - یا PI (مانند π)، همانطور که دوست دارد شناخته شود - بر توسعه یک مغز جهانی متمرکز شده است که از نظر تئوری میتواند هر روباتی را به یک ژنرال تبدیل کند. این شرکت با استفاده از رویکرد سینک ظرفشویی همه چیز از جمله آشپزخانه برای آموزش مدلهای هوش مصنوعی برای رباتها، اخیرا اشارهای به توانایی مغز رباتیک مجهز به یک مدل جهانی مشاهده کرده است.
در سال 2024، PI جزئیات اولین سیستم رباتیک عمومی خود را به نام π0 منتشر کرد، یک VLA که به ادعای آن «تواناترین و ماهرانهترین سیاست روباتهای ژنرالیست تا به امروز» است. این مدل ابتدا بر روی یک مجموعه اختصاصی 10000 ساعته از تظاهرات انسانی که از طریق عملیات از راه دور و همچنین چندین مجموعه داده ربات منبع باز جمع آوری شده بود، آموزش داده شد. نسخهای که در بهار 2025 منتشر شد، π0.5، بر روی مجموعههای داده متنوعتری، از جمله تصاویر برچسبگذاریشده از وب، آموزش داده شد که به آن تطبیق پذیری بیشتری میدهد. به روز رسانی پاییز 2025، π0.6، یادگیری تقویتی را به مدل اضافه کرد.
هر بهروزرسانی بهبودهای مهمی را در عملکرد مدل به همراه داشت، و منوی تواناییهای آن را از تا کردن آهسته لباسها تا کنار گذاشتن اشیا در محیطهای جدید و تکمیل کارهایی مانند تا کردن جعبهها با نرخ موفقیت بالاتر افزایش داد. سپس، در آوریل 2026، π0.7 به نظر می رسید که PI را به قلمرو جدیدی منجنیق می کند. این نسخه از یک مدل جهانی کمتر قدرتمند استفاده می کند که تصاویری از مراحل لازم برای انجام یک کار تولید می کند. همانطور که ربات کار را بر عهده می گیرد، این مدل "سبک" تصاویری فوری از کارهای بعدی به آن می دهد.
چگونه به یک ربات استفاده از چاقو را آموزش دهیم؟ در استارتاپ Physical Intelligence، با طراحی معماری درست هوش مصنوعی، که شامل اجزای اختصاص داده شده به زبان، بینایی و حرکت است، شروع می شود. این به آن کمک می کند تا دستورات را به هم مرتبط کند - "هی ربات، سبزیجاتم را خرد کن!" - به اقدامات مناسب WINNI WINTERMEYER
دادهها برای آموزش هوش مصنوعی میتوانند از منابع متعددی به دست بیایند، اما یکی از مهمترین آنها، نمایشهای انسانی است. یکی از کارمندان این استارت آپ، بازوی ربات را از طریق دورکاری کنترل می کند و هوش مصنوعی را در معرض وظیفه برش دادن کدو سبز قرار می دهد. WINNI WINTERMEYER
محققان مدل هوش مصنوعی را بر روی صدها نمونه از تظاهرات انسانی، و همچنین تصاویر از وب و ویدیوی اول شخص آموزش می دهند. WINNI WINTERMEYER
هنگامی که هوش مصنوعی آموزش داده می شود، تیم کاری را به آن ارائه می دهد که قبلا ندیده است، مانند خرد کردن این اسکواش تابستانی. وقتی یک ربات قبلا کار دقیقی را ندیده باشد - ممکن است تعجب کند که یک کدو سبز زرد یا یک موز غیر معمول است - ممکن است خراب شود. اما هر گونه شکست می تواند برای کمک به اصلاح مدل استفاده شود. WINNI WINTERMEYER
این شرکت ادعا میکند که این مدل اولین نشانههای تعمیم ترکیبی را نشان میدهد، اصطلاحی برای توانایی سیستمهای هوش مصنوعی برای انجام مهارتهایی که هرگز با ترکیب مجدد مهارتهایی که در دادههای آموزشی خود آموختهاند، انجام ندادهاند. یکی از آزمایشها شامل درخواست از یک مدل بود که «یک سیبزمینی شیرین را در سرخکن هوا قرار دهد» - کاری که قبلا هرگز با آن مواجه نشده بود. در یک ویدیوی نمایشی، دستگاه کمی دور میچرخد، چند راهاندازی اشتباه انجام میدهد، و در نهایت تلاش معقولی را مدیریت میکند، هرچند کار را بهطور کامل تمام نمیکند.
سرگی لوین، استاد دانشگاه کالیفرنیا، برکلی، و یکی از بنیانگذاران PI، از این پتانسیل هیجانزده است: «در واقع اولین بار است که به طور قانعکنندهای آن نوع تعمیم ترکیبی را میبینیم، جایی که اساسا میتوانیم از مدل بخواهیم کارهایی را انجام دهد که به طور خاص دادههایی را برای آن جمعآوری نکردهایم و به آن آموزش دهیم، و در واقع تلاش قابل قبولی انجام خواهد داد.»
این موفقیت تیم را به این فکر واداشت که چگونه این مدل توانسته به چنین شاهکاری دست یابد. پس از مدتی حفاری، آنها تکههایی از دادههای مربوط به عملیات از راه دور را یافتند که در مواد آموزشی کمین کرده بود، از جمله دو نمونه از کنترلکننده انسانی که از ربات برای فشار دادن یک سبد سرخکن هوا به داخل سرخکن استفاده میکرد. این تکه داده ها ممکن است برای فعال کردن π0.7 کافی باشد تا سیب زمینی شیرین را تقریبا در هوا سرخ کند.
در حال حاضر، مشخص نیست که توانایی های π0.7 برای تعمیم چقدر چشمگیر است. با این حال، با توجه به این که قرار گرفتن این مدل در معرض سرخ کنهای هوا چقدر زودگذر بوده است، نگاهی اجمالی به این که تحقیقات پیشرفته در حال حاضر تا چه حد میتواند رباتها را ببرد، ارائه میکند.
"70% موفقیت مثل این است که کار نمی کند"
ممکن است بین گامهایی که روباتها در آزمایشگاهها میسازند، قطع رابطه کنید - «ببینید! یک سیبزمینی شیرین را در سرخکن هوا گذاشت!» - و چابکی خیرهکننده و واقعی که در بسیاری از نمایشها و ویدیوها دیده میشود، جایی که روباتها در حال انجام هر کاری از رقص روی صحنه تا سرو مودبانه نوشیدنی هستند. چنین نمایشهایی اغلب به وضوح یک واقعیت کلیدی را آشکار نمیکنند: در بسیاری از موارد، انسانها ربات را کنترل میکنند یا اقدامات آن را با دقت تنظیم کردهاند.
(برای مثال رباتی که با جنسن هوانگ، مدیرعامل انویدیا در مارس 2025 روی صحنه ظاهر شد، ظاهرا به دستورات او پاسخ میداد و او را دنبال میکرد، توسط چیزی که سازندگان آن «عروسکباز در پشت صحنه» نامیدند، از راه دور کنترل میشد.)
در حال حاضر، برنامه ریزی حرکت کاملا مستقل به طوری که یک ربات بداند به کجا باید برود - به خصوص در محیط های جدید و آشفته مانند یک محل ساخت و ساز یا یک خانه ناآشنا - یک چالش تا حد زیادی حل نشده باقی مانده است. چالش بزرگتر هنوز – البته اغلب مرتبط – این است که روباتها را وادار به انجام کارهای بزرگتر و مبهمتر کنیم که شامل وظایف متعددی است و نیاز به تصمیمگیری در مورد چگونگی و ترتیب انجام آنها دارد.
این تفاوت بین رباتی است که میتواند بشقاب را در مایکروویو بگذارد و روباتی که میتواند با کاوش در یخچال، خرد کردن مواد و روشن کردن اجاق، به درخواست «شام درست کن» پاسخ دهد. بهترین تلاش Google DeepMind برای چیزی شبیه به این - که شامل درخواست از ربات خود برای بررسی یک آشپزخانه و بسته بندی تمام مواد تشکیل دهنده یک ریزوتو قارچ در یک سبد بود - تاکنون به شکست منجر شده است.
علاوه بر این چالش، یک ربات عملی باید اساسا هر بار آن را به درستی انجام دهد. مارک رایبرت، بنیانگذار Boston Dynamics، میگوید: با VLA، «افراد زمانی بسیار هیجانزده میشوند که نتیجه آنها از موفقیت 50 درصد به 70 درصد برسد». "اما 70٪ موفقیت مثل این است که کار نمی کند، درست است؟"
تظاهرات اغلب باعث می شود ربات ها مفید به نظر برسند، اما ماشین ها هنوز خیلی زیاد خراب می شوند و نمی توانند به طور قابل اعتماد در خانه ها و کارخانه ها استفاده شوند. AP IMAGES، SHUTTERSTOCK، 1X، AGILITY ROBOTICS، GOOGLE DEEPMIND
چند انسان نما که در محیط های واقعی آزمایش می شوند، وظایف بسیار محدودی را در محیط های کاملا کنترل شده انجام می دهند. آنها از کلی گرایان دور هستند. به گفته این شرکت، چابکی صدها ربات دارد که در مراحل آزمایشی در تاسیسات متعلق به GXO Logistics، Amazon و Schaeffler مستقر شده اند. اما در حال حاضر، هرست میگوید، رباتها کارهای سادهای مانند جابجایی سطلها و وسایل نقلیه را هدف قرار میدهند. حتی در آن زمان، او اضافه می کند، سال ها طول کشید تا ربات هایی به اندازه کافی ایمن ساخته شوند تا شرکت های لجستیک حتی به فکر استفاده از آنها باشند.
به نوبه خود، ایلان ماسک در ماه می 2025 ادعا کرد که "هزاران" از رباتهای Optimus او تا پایان سال در کارخانههای تسلا کار خواهند کرد، اما در ژانویه سال جاری گفت که این شرکت فقط "برخی از رباتهای Optimus تسلا را دارد که وظایف سادهای را در کارخانه انجام میدهند."
متن اصلی (انگلیسی)
AI breakthroughs in robotics won’t change your life any time soon
The story is a collaboration between MIT Technology Review and Aventine, a non-profit research foundation that creates and supports content about how technology and science are changing the way we live. A robot shaped like a human—white with a black head and torso—has been popping up on video feeds. Perhaps you’ve seen it dance or…