گول نخورید - LLM ها استدلال نمی کنند
در یک بعدازظهر در سئول در مارس 2016، برنامهای را تماشا کردم که در ساخت آن با کمک آن، سنگی روی خط پنجم تخته Go قرار داد که شبیه هدیهای به حریف انسانی آن بود. حرکت 37 در بازی دو از مسابقه پنج بازی آنقدر پوچ به نظر می رسید که برخی از مفسران فکر می کردند که این یک…
در یک بعدازظهر در سئول در مارس 2016، برنامهای را تماشا کردم که در ساخت آن با کمک آن، سنگی روی خط پنجم تخته Go قرار داد که شبیه هدیهای به حریف انسانی آن بود. حرکت 37 در بازی دو از مسابقه پنج بازی آنقدر پوچ به نظر می رسید که برخی از مفسران فکر می کردند که این یک نقص برنامه نویسی است. این نبود. AlphaGo بازی را برد و در نهایت 4-1 بر لی سدول، یکی از بهترین بازیکنان حرفه ای Go در تمام دوران پیروز شد. لی پس از آن گفت: "من فکر می کردم AlphaGo بر اساس محاسبه احتمال است و این فقط یک ماشین است." اما وقتی این حرکت را دیدم، نظرم تغییر کرد.
مطمئنا، AlphaGo خلاق است.
هنگامی که دیپ بلو در سال 1997، گری کاسپاروف، قهرمان وقت شطرنج جهان را شکست داد، این کار را با نگاه کردن به 6 تا 8 حرکت جلوتر برای هر بازیکن و ارزیابی 200 میلیون موقعیت شطرنج در ثانیه، با استفاده از قوانینی که توسط انسان ها کدگذاری شده بود، انجام داد. Go یک بازی بسیار پیچیده تر است. ارزش یک سنگ بستگی به این دارد که چگونه گروه ها و قلمروهای دور در ده ها حرکت آشکار می شوند. محاسبه حتی کسری از نتایج ممکن برای یک ابر رایانه میلیاردها سال طول می کشد. برای برنده شدن، AlphaGo باید در یک نگاه حس می کرد که چه کسی جلوتر است و حتی حرکاتی را که هیچ انسانی فکرش را نمی کرد اختراع کند.
به همین دلیل است که بسیاری از گزارشهای بازی AlphaGo در برابر لی، حرکت 37 را به عنوان درخششی از شهود ماشینی خالص به تصویر میکشند. اما این یک سوء تفاهم است. در واقع قدرت استدلال AlphaGo بود که این انتخاب خلاقانه را انجام داد - و اینها قدرت هایی هستند که هوش مصنوعی امروزی فاقد آن است. اگر میخواهیم سیستمهای هوش مصنوعی آینده نتایج قابل اعتماد و بینشهای واقعا جدیدی در زمینههایی مانند علم و پزشکی تولید کنند، باید آنها را به قابلیتهای استدلال واقعی از این نوع مجهز کنیم.
AlphaGo از دو سیستم تشکیل شده است. اولین شبکه، شبکه خط مشی آن، برای حدس زدن اینکه یک انسان قوی چه حرکتی را انجام می دهد آموزش دیده بود. این بخش "شهودی" حرکت 37 را به عنوان چیز خاصی در نظر نمی گرفت - نمایشنامه ای که تقریبا یک در 10000 شانس داشت که توسط یک بازیکن انسانی متخصص ساخته شود. چیزی که AlphaGo را وادار کرد آن را انتخاب کند، ماشین جستجوی برنامه بود که فراتر از قابل قبول بودن آنی بود و پیامدهای آتی حرکت های پیشنهادی را سنجید. به صراحت درخت بازی با هزاران شاخه را ساخت و جستجو کرد که هر کدام آینده ممکن متفاوتی را نشان میدهند.
یک نظریه معروف در علوم رفتاری، که توسط دانیل کانمن رواج یافته است، بین دو شیوه تفکر انسان تمایز قائل می شود: سیستم 1 سریع، در سطح روده، بدون زحمت است. سیستم 2، آهسته، گام به گام، و مشورتی. AlphaGo یک آنالوگ ماشینی قابل توجه از آن تقسیم را ارائه کرد. شبکههای آن قوزها را فراهم کردند - این حرکت امیدوارکننده به نظر میرسد، به نظر میرسد این موقعیت برنده به نظر میرسد - و جستوجوی آن بحث را فراهم کرد، و این قوزها را در برابر حرکات و حرکات متقابلی که در پی خواهد آمد آزمایش کرد. همانطور که در شناخت انسان، هیچ یک از نیمی از آنها به تنهایی کار نمی کند.
شهود به تنهایی هرگز حرکت 37 را انتخاب نمیکرد، و جستجوی brute-force به سختی میتوانست تمام حرکات ممکن را از بین ببرد.
این به طرز چشمگیری با روشی که مدل های هوش مصنوعی امروزی کار می کنند متفاوت است. یک مدل زبان بزرگ، رمز بعدی را بارها و بارها انتخاب می کند. این معادل سیستم 1 در عمل است - تکمیل الگوی سریع، تداعی کننده و شگفت آور خوب در تقریبا هر موضوعی که مردم درباره آن می نویسند.
اندکی پس از شروع ChatGPT، این حوزه متوجه شد که تسلط زبان به تنهایی از فایده واقعی کم است. راه حل ظاهری این بود که مدل هایی بسازید که عمدی باشند: به جای پاسخ فوری، اکنون می توانند مراحل میانی ایجاد کنند که یک مشکل را تجزیه می کند، نتایج جزئی را به پیش می برد و بر استدلال بعدی تأثیر می گذارد - فرآیندی که به عنوان زنجیره فکر شناخته می شود. دستاوردها بالاتر از همه در ریاضیات و کدنویسی واقعی بوده است.
اما بر خلاف جستجوی AlphaGo، این یک مکانیسم استدلال واقعا مجزا معرفی نمیکند: استدلال میانی همچنان توسط همان فرآیند پیشبینی نشانه بعدی تولید میشود، و قبل از اینکه مدل متعهد به پاسخ باشد، برای مدت طولانیتری تکرار میشود.
سه کاستی مانع از آن می شود که چت بات ها به عنوان استدلال (به طریقی که یک دانشمند تشخیص دهد) واجد شرایط باشد. اولا، این مدلها معمولا هیچ حالت معرفتی صریح، پایدار و قابل بازرسی ندارند. هیچ دفترکلی وجود ندارد که فرضیههایی را که یک مدل در نظر میگیرد، اطمینانی که به توضیحات مختلف دارد، شواهدی که در حال سنجش است و سؤالات حلنشدهای که روی آنها نگه داشته باشد، ارائه دهد - همه چیزهایی که باید بهطور سیستماتیک با رسیدن اطلاعات جدید بازنگری شوند. ثانیا، آنها فاقد یک تفکیک تمیز بین آنچه سیستم می داند و نحوه دستکاری آن دانش است.
دانش و استدلال به طور جدانشدنی در وزن شبکه عصبی در هم تنیده شده اند - هیچ مجموعه ای از باورهای مستقل و به صراحت وجود ندارد. سوم، در حالی که زنجیرهای از رباتهای گفتگوی فکری تولید میکنند، تحقیقات نشان دادهاند که رباتها اغلب آنها را پس از واقعیت میسازند و از یک مسیر به پاسخ میرسند اما مسیری دیگر را گزارش میدهند.
این یک مشکل است زیرا در برنامههای پرمخاطره مانند پزشکی، مهندسی و تحقیقات علمی، نه تنها مهم است که یک سیستم چه نتیجهگیری میکند، بلکه چگونه به نتیجه میرسد. هنگامی که اشتباهاتی رخ می دهد - به عنوان مثال، در تشخیص و درمان پزشکی - باید بتوانیم دقیقا تشخیص دهیم که چه چیزی اشتباه رخ داده است: آیا استدلال سیستم مقصر بوده است، آیا از شواهد نامعتبر استفاده می کند یا فرضیات نادرست داشته است؟
به همین دلیل است که من اخیرا موقعیت خود را در Google DeepMind ترک کردم. من معتقدم که ما به یک رویکرد جدید برای استدلال ماشینی نیاز داریم - رویکردی که از معماری AlphaGo استفاده می کند. AlphaGo رکوردی از آنچه در مورد یک موقعیت معین می داند حفظ می کند: درخت بازی. این ساختار داده شامل تمام تغییرات، آینده های احتمالی است که AlphaGo در نظر گرفته است، هر حرکت و موقعیت با قضاوت های انجام شده توسط شبکه های عصبی آن حاشیه نویسی می شود. با پیشرفت استدلال خود، AlphaGo درخت بازی را به روز می کند و در نهایت اطلاعات موجود در آن را ترکیب می کند تا تصمیم بگیرد کدام حرکت را انجام دهد.
به طور مشابه، برای استدلال عمومی، یک سیستم باید یک حالت معرفتی را حفظ کند که نشان دهد نظام چه چیزی را ثابت نگه می دارد، در چه مواردی شک دارد، چه چیزی را رد کرده است، و چه سؤالاتی باز می ماند. پس استدلال را میتوان بهعنوان دنبالهای از حرکات درک کرد که وضعیت معرفتی را برای پیشرفت دانش و کاهش عدم قطعیت تغییر میدهد: استنتاج پیامدها، تقسیم کردن مسائل به بخشها، و - به طور مهم - تصمیمگیری درباره اینکه چه سؤالی بپرسیم، محاسبه انجام شود، یا آزمایش بعدی.
البته، استدلال جهان باز سخت تر از انجام یک بازی رومیزی مانند Go یا شطرنج است. در دنیای واقعی وضعیت فعلی امور فقط تا حدی شناخته شده است، مجموعه اقدامات موجود بزرگ و متغیر است و پیامدهای اعمال تصادفی یا ناشناخته است.
اما پیشرفتهای اخیر در LLM و سایر مدلهای عصبی اکنون به ما این توانایی را میدهد که چنین مشکلات استدلالی کلی را بپذیریم. به عنوان مثال، LLM ها می توانند راه هایی را برای مقابله با یک مشکل بر اساس آنچه شناخته شده است و منابع موجود پیشنهاد کنند. آنها می توانند از طریق API یا کد با ابزارها تعامل داشته باشند و به ارزیابی اینکه آیا یک ادعا توسط شواهد موجود پشتیبانی می شود یا خیر کمک کنند.
مهمتر از همه، برای صادق نگه داشتن سیستم، یک بخش مستقل از سیستم باید هر حرکت را بر اساس میزان رفع عدم قطعیت ارزیابی کند، و تنها زمانی باورها را به روز کند که تغییر با شواهدی پشتیبانی شود. هنگامی که این قوانین اجرا می شوند، مدل می تواند دانش تایید شده را جمع آوری کند و خط مشی استدلال خود را با یادگیری از تجربیات استدلال گذشته بهبود بخشد. شما می توانید چنین سیستمی را به عنوان روش علمی در مورد استروئیدها در نظر بگیرید، با هدف تولید دانشی که بتواند در برابر بررسی دقیق مقاومت کند.
فکر نمیکنم با بزرگتر کردن سیستم 1 به هوش ماشینی قابل اعتمادی برسیم. ترازو شهود را تیز می کند، اما شهود را تامل برانگیزتر نمی کند. حرکت 37 اهمیت داشت زیرا یک ماشین موقعیتی را داشت، آیندههای احتمالی را سنجید و حرکتی را انتخاب کرد که غرایز مصنوعی آن احتمالا رد میکردند. جامعه به چنین حرکتهای خلاقانهای در کشف دارو، مواد، آب و هوا، تشخیص نیاز دارد - زمینههایی که هیئت مدیره به هیچ وجه شبیه تابلوهای Go نیست و هیچکس قوانین را به ما نمیدهد.
ما چنین بینشهایی را فقط از سیستمهایی به دست خواهیم آورد که استدلال میکنند - سیستمهایی که نتیجهگیریهای آنها از یک توالی قابل ممیزی از شواهد، استنتاج و بازنگری باورها ناشی میشود نه از یک داستان قانعکننده که پس از واقعیت گفته میشود.
Thore Graepel رئیس یادگیری ماشین در دانشگاه کالج لندن است. او یکی از اعضای اصلی تیم AlphaGo در DeepMind بود و تلاش می کند تا اطمینان حاصل کند که هوش مصنوعی برای شکوفایی انسان مفید است.
متن اصلی (انگلیسی)
Don’t be fooled—LLMs don’t reason
On an afternoon in Seoul in March 2016, I watched a program I helped build put a stone on the fifth line of a Go board in what looked like a gift to its human opponent. Move 37 in game two of the five-game match looked so absurd that some commentators thought it was a…