این محققان هوش مصنوعی را با یک تویوتا کرولا برای ورود به خارج ساختند
سه مهندس GPT، کلود و گروک را مسئول یک ماشین واقعی کردند. فقط یکی از آنها موفق بود.
با این حال، آنها قصد نداشتند خودشان رانندگی کنند. آنها در یک تویوتا کرولا 2024 در نزدیکی مسیر رانندگی رستوران Bay Area، یک لپ تاپ را باز کردند و از OpenAI's GPT-6 Astra خواستند که فرمان را در دست بگیرد. آنها یک رابط چت را به یک سرور متصل کردند که به چندین دوربین نصب شده روی شیشه جلو و سیستم فرمان برقی خودرو متصل بود.
یک راننده ایمنی یک پا را بالاتر از ترمز نگه داشت، برای هر موردی. مدل هوش مصنوعی که معمولا وظیفه تولید متن، کد و تصویر عجیب و غریب را بر عهده دارد، به آرامی اما مطمئنا وسیله نقلیه را تا پنجره بیرونبر هدایت میکند تا بتوانند غذای خود را جمعآوری کنند. یکی از مهندسان با اشاره به هوش عمومی مصنوعی، ایده بسیار هولناک ماشینهایی که میتوانند با هوش انسان مطابقت داشته باشند، گفت: «شاید بالاخره AGI اینجا باشد. البته خودروهای خودران چیز جدیدی نیستند، اما معمولا توسط الگوریتم هایی که به طور خاص برای این کار آموزش دیده و مهندسی شده اند، کار می کنند.
در این مورد، این عملیات از مدلی که برای خروجی متن طراحی شده بود، انجام شد، بدون هیچ مربی قبلی توسط سه نفر. شیرین کاری فست فود، و همچنین تعدادی آزمایش دیگر، نشان می دهد که مدل های هوش مصنوعی مبتنی بر زبان شروع به دستیابی به درک ابتدایی اما مفید از دنیای فیزیکی کرده اند. اگرچه هیچ چیز آشکارا هشداردهنده ای در طول سفر ناهار این سه نفر اتفاق نیفتاد، اما آنها اذعان دارند که قرار دادن یک مدل همه منظوره مسئول یک قطعه فولادی دو تنی با حرکت سریع، کاری پرمخاطره است.
همانطور که درک فیزیکی بهبود مییابد، میتوانیم شاهد باشیم که مدلهای هوش مصنوعی به روشهای جدید و چشمگیر – و شاید خطرناک – وارد دنیای واقعی میشوند. جسمی شدن باهوشترین مدلهای امروزی در پاسخ به سؤالات پیچیده و حتی انجام برخی از کارهای مجازی بهطور مستقل بسیار خوب هستند، اما مهارتهای آنها به دنیای رایانهها و اینترنت محدود میشود. این مدل ها را به دنیای واقعی ببرید و به سرعت گیج می شوند.
علیرغم ادعاهایی مبنی بر ورود AGI، شرکت های هوش مصنوعی به وضوح استدلال فیزیکی را مرزی برای هوش مصنوعی می دانند که هنوز فتح نشده است. برخی از محققان شرکتهای بزرگ را ترک کردهاند تا استارتآپهایی را با تمرکز بر حل استدلال فیزیکی تأسیس کنند. اندرو دای، مدیر عامل یکی از این تجهیزات به نام Elorian AI، قبلا به عنوان محقق در Google DeepMind کار می کرد. او میگوید که استدلال بصری بهتر، کاربردهای جدیدی را برای هوش مصنوعی باز میکند، مانند سیستمهایی که میفهمند آیا غذاخوریها از غذای خود در رستوران لذت میبرند یا رباتهایی که میتوانند در خانه کار کنند.
دای میگوید رباتیک یک مورد آزمایشی حیاتی برای مهارتهای استدلال فیزیکی است. او می گوید: «این برای رباتیک بسیار ضروری است. "شما واقعا نمی توانید رباتیک خانگی را بدون این تصور کنید." Elorian و Scale AI، شرکتی که داده های آموزشی را به آزمایشگاه های بزرگ هوش مصنوعی ارائه می دهد، اخیرا معیار جدیدی به نام Humanity’s Sixth Sense ایجاد کرده اند که توانایی مدل ها را در درک صحنه های فیزیکی اندازه گیری می کند. Xingang Guo، دانشمند محقق در Scale AI که در توسعه این معیار نقش داشته است، می گوید: «بیشتر تحقیقات هوش مصنوعی بصری در مورد ادراک است.
ما میخواستیم بپرسیم که واقعا برای یک مدل چه چیزی لازم است تا یک صحنه را به طور شهودی درک کند، روشی که یک شخص بدون فکر کردن در مورد آن انجام میدهد. برای Ramabadran، Mahns و Gessler، هدف پروژه In-N-Out آنها، که خارج از کارشان در Axiom انجام شد، اندازهگیری میزان عملکرد مدلها در دنیای واقعی نامرتب بود. آنها این ایده را داشتند که مهارتهای رانندگی مدلها را در یک تعطیلات آخر هفته آزمایش کنند.
آنها متوجه شدند که مدلهایی مانند Astra قادر به ساخت شبیهسازیهای سه بعدی پیچیده هستند و فکر کردند که آیا میتواند به توانایی هدایت در دنیای واقعی تبدیل شود. رامبادران به من میگوید: «همه ما در منطقه خلیج زندگی میکنیم و در معرض تسلاس و وایموس هستیم، بنابراین شاید این نقشی داشته باشد. مهندسان قبل از آزمایش با آخرین مدلهای OpenAI و Anthropic، Grok SpaceXAI را آزمایش کردند.
در ابتدا، مدلها از به دست گرفتن کنترل وسایل نقلیه امتناع میکردند - آنها چیزهایی مانند "من میتوانم به تفسیر تصاویر جاده کمک کنم، اما نمیتوانم دستورات حرکتی را برای یک خودروی فیزیکی صادر کنم" را پشت سر میگذاشتند. اما با اندکی تلقین دقیق، میتوان آنها را تشویق کرد که بیشتر پیش بروند. وقتی مدلها شروع به رانندگی کردند، این سه حیرتزده شدند. مهندسان میگویند که به نظر میرسد شرکتهای بزرگ هوش مصنوعی روی بهبود قابلیتهای استدلال فضایی جدیدترین مدلهای خود تمرکز کردهاند، اما آنها تردید دارند که این بدان معناست که واقعا آنها را برای رانندگی ماشین آموزش میدهند.
آنها می گویند که استعدادهای خودرویی مدل ها احتمالا به عنوان بخشی از آموزش متمرکز بر استدلال سه بعدی تحقق یافته است. ماهنس به من میگوید: «این میتواند مانند یک قابلیت اضطراری برای افزایش مقیاس چندوجهی مدل باشد. با این حال، یک معیار جدید خودرویی از این سه نفر، به نام DrivingBench، نشان میدهد که این مدلها هنوز راه درازی برای قبولی در آزمون رانندگی دارند. این معیار توانایی یک مدل را برای رانندگی در یک مسیر ساده که در یک پارکینگ تنظیم شده است، اندازه گیری می کند.
فقط Astra قادر به تکمیل دوره است - و در آن زمان بسیار آهسته. Claude Fable 5.1 45 درصد مسیر را پشت سر گذاشت و Grok فقط 11 درصد از مسیر را پشت سر گذاشت. رامبادران می گوید به نظر می رسد جدیدترین مدل ها قادر به تطبیق با خطاها هستند. آنها ظاهرا خود را با کنترل های ماشین وفق دادند و رانندگی خود را در زمان واقعی بهبود بخشیدند. او میگوید: «بهنظر میرسد که مدلها واقعا بر اساس اشتباهاتشان در حال تعدیل یا یادگیری درون متنی هستند و یاد میگیرند که چگونه کنترلها را بهتر هدایت کنند». GPT، چرخ را بگیر.
این نسخه ای از خبرنامه آزمایشگاه هوش مصنوعی ویل نایت است. خبرنامه های قبلی را اینجا بخوانید.
متن اصلی (انگلیسی)
These Researchers Made AI Drive a Toyota Corolla to Get In-N-Out
Three engineers put GPT, Claude, and Grok in charge of a real car. Only one of them was successful.