پرش به محتوای اصلی

گول نخورید - LLM ها استدلال نمی کنند

ام‌آی‌تی تک‌ریویو۱۴۰۵ مهر ۱۰, جمعه، ساعت ۱۱:۳۰حدود 7 دقیقه مطالعه

در یک بعدازظهر در سئول در مارس 2016، برنامه‌ای را تماشا کردم که در ساخت آن با کمک آن، سنگی روی خط پنجم تخته Go قرار داد که شبیه هدیه‌ای به حریف انسانی آن بود. حرکت 37 در بازی دو از مسابقه پنج بازی آنقدر پوچ به نظر می رسید که برخی از مفسران فکر می کردند که این یک…

در یک بعدازظهر در سئول در مارس 2016، برنامه‌ای را تماشا کردم که در ساخت آن با کمک آن، سنگی روی خط پنجم تخته Go قرار داد که شبیه هدیه‌ای به حریف انسانی آن بود. حرکت 37 در بازی دو از مسابقه پنج بازی آنقدر پوچ به نظر می رسید که برخی از مفسران فکر می کردند که این یک نقص برنامه نویسی است. این نبود. AlphaGo بازی را برد و در نهایت 4-1 بر لی سدول، یکی از بهترین بازیکنان حرفه ای Go در تمام دوران پیروز شد. لی پس از آن گفت: "من فکر می کردم AlphaGo بر اساس محاسبه احتمال است و این فقط یک ماشین است." اما وقتی این حرکت را دیدم، نظرم تغییر کرد.

مطمئنا، AlphaGo خلاق است.

هنگامی که دیپ بلو در سال 1997، گری کاسپاروف، قهرمان وقت شطرنج جهان را شکست داد، این کار را با نگاه کردن به 6 تا 8 حرکت جلوتر برای هر بازیکن و ارزیابی 200 میلیون موقعیت شطرنج در ثانیه، با استفاده از قوانینی که توسط انسان ها کدگذاری شده بود، انجام داد. Go یک بازی بسیار پیچیده تر است. ارزش یک سنگ بستگی به این دارد که چگونه گروه ها و قلمروهای دور در ده ها حرکت آشکار می شوند. محاسبه حتی کسری از نتایج ممکن برای یک ابر رایانه میلیاردها سال طول می کشد. برای برنده شدن، AlphaGo باید در یک نگاه حس می کرد که چه کسی جلوتر است و حتی حرکاتی را که هیچ انسانی فکرش را نمی کرد اختراع کند.

به همین دلیل است که بسیاری از گزارش‌های بازی AlphaGo در برابر لی، حرکت 37 را به عنوان درخششی از شهود ماشینی خالص به تصویر می‌کشند. اما این یک سوء تفاهم است. در واقع قدرت استدلال AlphaGo بود که این انتخاب خلاقانه را انجام داد - و اینها قدرت هایی هستند که هوش مصنوعی امروزی فاقد آن است. اگر می‌خواهیم سیستم‌های هوش مصنوعی آینده نتایج قابل اعتماد و بینش‌های واقعا جدیدی در زمینه‌هایی مانند علم و پزشکی تولید کنند، باید آن‌ها را به قابلیت‌های استدلال واقعی از این نوع مجهز کنیم.

AlphaGo از دو سیستم تشکیل شده است. اولین شبکه، شبکه خط مشی آن، برای حدس زدن اینکه یک انسان قوی چه حرکتی را انجام می دهد آموزش دیده بود. این بخش "شهودی" حرکت 37 را به عنوان چیز خاصی در نظر نمی گرفت - نمایشنامه ای که تقریبا یک در 10000 شانس داشت که توسط یک بازیکن انسانی متخصص ساخته شود. چیزی که AlphaGo را وادار کرد آن را انتخاب کند، ماشین جستجوی برنامه بود که فراتر از قابل قبول بودن آنی بود و پیامدهای آتی حرکت های پیشنهادی را سنجید. به صراحت درخت بازی با هزاران شاخه را ساخت و جستجو کرد که هر کدام آینده ممکن متفاوتی را نشان می‌دهند.

یک نظریه معروف در علوم رفتاری، که توسط دانیل کانمن رواج یافته است، بین دو شیوه تفکر انسان تمایز قائل می شود: سیستم 1 سریع، در سطح روده، بدون زحمت است. سیستم 2، آهسته، گام به گام، و مشورتی. AlphaGo یک آنالوگ ماشینی قابل توجه از آن تقسیم را ارائه کرد. شبکه‌های آن قوزها را فراهم کردند - این حرکت امیدوارکننده به نظر می‌رسد، به نظر می‌رسد این موقعیت برنده به نظر می‌رسد - و جست‌وجوی آن بحث را فراهم کرد، و این قوزها را در برابر حرکات و حرکات متقابلی که در پی خواهد آمد آزمایش کرد. همانطور که در شناخت انسان، هیچ یک از نیمی از آنها به تنهایی کار نمی کند.

شهود به تنهایی هرگز حرکت 37 را انتخاب نمی‌کرد، و جستجوی brute-force به سختی می‌توانست تمام حرکات ممکن را از بین ببرد.

این به طرز چشمگیری با روشی که مدل های هوش مصنوعی امروزی کار می کنند متفاوت است. یک مدل زبان بزرگ، رمز بعدی را بارها و بارها انتخاب می کند. این معادل سیستم 1 در عمل است - تکمیل الگوی سریع، تداعی کننده و شگفت آور خوب در تقریبا هر موضوعی که مردم درباره آن می نویسند.

اندکی پس از شروع ChatGPT، این حوزه متوجه شد که تسلط زبان به تنهایی از فایده واقعی کم است. راه حل ظاهری این بود که مدل هایی بسازید که عمدی باشند: به جای پاسخ فوری، اکنون می توانند مراحل میانی ایجاد کنند که یک مشکل را تجزیه می کند، نتایج جزئی را به پیش می برد و بر استدلال بعدی تأثیر می گذارد - فرآیندی که به عنوان زنجیره فکر شناخته می شود. دستاوردها بالاتر از همه در ریاضیات و کدنویسی واقعی بوده است.

اما بر خلاف جستجوی AlphaGo، این یک مکانیسم استدلال واقعا مجزا معرفی نمی‌کند: استدلال میانی همچنان توسط همان فرآیند پیش‌بینی نشانه بعدی تولید می‌شود، و قبل از اینکه مدل متعهد به پاسخ باشد، برای مدت طولانی‌تری تکرار می‌شود.

سه کاستی مانع از آن می شود که چت بات ها به عنوان استدلال (به طریقی که یک دانشمند تشخیص دهد) واجد شرایط باشد. اولا، این مدل‌ها معمولا هیچ حالت معرفتی صریح، پایدار و قابل بازرسی ندارند. هیچ دفترکلی وجود ندارد که فرضیه‌هایی را که یک مدل در نظر می‌گیرد، اطمینانی که به توضیحات مختلف دارد، شواهدی که در حال سنجش است و سؤالات حل‌نشده‌ای که روی آن‌ها نگه داشته باشد، ارائه دهد - همه چیزهایی که باید به‌طور سیستماتیک با رسیدن اطلاعات جدید بازنگری شوند. ثانیا، آنها فاقد یک تفکیک تمیز بین آنچه سیستم می داند و نحوه دستکاری آن دانش است.

دانش و استدلال به طور جدانشدنی در وزن شبکه عصبی در هم تنیده شده اند - هیچ مجموعه ای از باورهای مستقل و به صراحت وجود ندارد. سوم، در حالی که زنجیره‌ای از ربات‌های گفتگوی فکری تولید می‌کنند، تحقیقات نشان داده‌اند که ربات‌ها اغلب آنها را پس از واقعیت می‌سازند و از یک مسیر به پاسخ می‌رسند اما مسیری دیگر را گزارش می‌دهند.

این یک مشکل است زیرا در برنامه‌های پرمخاطره مانند پزشکی، مهندسی و تحقیقات علمی، نه تنها مهم است که یک سیستم چه نتیجه‌گیری می‌کند، بلکه چگونه به نتیجه می‌رسد. هنگامی که اشتباهاتی رخ می دهد - به عنوان مثال، در تشخیص و درمان پزشکی - باید بتوانیم دقیقا تشخیص دهیم که چه چیزی اشتباه رخ داده است: آیا استدلال سیستم مقصر بوده است، آیا از شواهد نامعتبر استفاده می کند یا فرضیات نادرست داشته است؟

به همین دلیل است که من اخیرا موقعیت خود را در Google DeepMind ترک کردم. من معتقدم که ما به یک رویکرد جدید برای استدلال ماشینی نیاز داریم - رویکردی که از معماری AlphaGo استفاده می کند. AlphaGo رکوردی از آنچه در مورد یک موقعیت معین می داند حفظ می کند: درخت بازی. این ساختار داده شامل تمام تغییرات، آینده های احتمالی است که AlphaGo در نظر گرفته است، هر حرکت و موقعیت با قضاوت های انجام شده توسط شبکه های عصبی آن حاشیه نویسی می شود. با پیشرفت استدلال خود، AlphaGo درخت بازی را به روز می کند و در نهایت اطلاعات موجود در آن را ترکیب می کند تا تصمیم بگیرد کدام حرکت را انجام دهد.

به طور مشابه، برای استدلال عمومی، یک سیستم باید یک حالت معرفتی را حفظ کند که نشان دهد نظام چه چیزی را ثابت نگه می دارد، در چه مواردی شک دارد، چه چیزی را رد کرده است، و چه سؤالاتی باز می ماند. پس استدلال را می‌توان به‌عنوان دنباله‌ای از حرکات درک کرد که وضعیت معرفتی را برای پیشرفت دانش و کاهش عدم قطعیت تغییر می‌دهد: استنتاج پیامدها، تقسیم کردن مسائل به بخش‌ها، و - به طور مهم - تصمیم‌گیری درباره اینکه چه سؤالی بپرسیم، محاسبه انجام شود، یا آزمایش بعدی.

البته، استدلال جهان باز سخت تر از انجام یک بازی رومیزی مانند Go یا شطرنج است. در دنیای واقعی وضعیت فعلی امور فقط تا حدی شناخته شده است، مجموعه اقدامات موجود بزرگ و متغیر است و پیامدهای اعمال تصادفی یا ناشناخته است.

اما پیشرفت‌های اخیر در LLM و سایر مدل‌های عصبی اکنون به ما این توانایی را می‌دهد که چنین مشکلات استدلالی کلی را بپذیریم. به عنوان مثال، LLM ها می توانند راه هایی را برای مقابله با یک مشکل بر اساس آنچه شناخته شده است و منابع موجود پیشنهاد کنند. آنها می توانند از طریق API یا کد با ابزارها تعامل داشته باشند و به ارزیابی اینکه آیا یک ادعا توسط شواهد موجود پشتیبانی می شود یا خیر کمک کنند.

مهمتر از همه، برای صادق نگه داشتن سیستم، یک بخش مستقل از سیستم باید هر حرکت را بر اساس میزان رفع عدم قطعیت ارزیابی کند، و تنها زمانی باورها را به روز کند که تغییر با شواهدی پشتیبانی شود. هنگامی که این قوانین اجرا می شوند، مدل می تواند دانش تایید شده را جمع آوری کند و خط مشی استدلال خود را با یادگیری از تجربیات استدلال گذشته بهبود بخشد. شما می توانید چنین سیستمی را به عنوان روش علمی در مورد استروئیدها در نظر بگیرید، با هدف تولید دانشی که بتواند در برابر بررسی دقیق مقاومت کند.

فکر نمی‌کنم با بزرگ‌تر کردن سیستم 1 به هوش ماشینی قابل اعتمادی برسیم. ترازو شهود را تیز می کند، اما شهود را تامل برانگیزتر نمی کند. حرکت 37 اهمیت داشت زیرا یک ماشین موقعیتی را داشت، آینده‌های احتمالی را سنجید و حرکتی را انتخاب کرد که غرایز مصنوعی آن احتمالا رد می‌کردند. جامعه به چنین حرکت‌های خلاقانه‌ای در کشف دارو، مواد، آب و هوا، تشخیص نیاز دارد - زمینه‌هایی که هیئت مدیره به هیچ وجه شبیه تابلوهای Go نیست و هیچ‌کس قوانین را به ما نمی‌دهد.

ما چنین بینش‌هایی را فقط از سیستم‌هایی به دست خواهیم آورد که استدلال می‌کنند - سیستم‌هایی که نتیجه‌گیری‌های آنها از یک توالی قابل ممیزی از شواهد، استنتاج و بازنگری باورها ناشی می‌شود نه از یک داستان قانع‌کننده که پس از واقعیت گفته می‌شود.

Thore Graepel رئیس یادگیری ماشین در دانشگاه کالج لندن است. او یکی از اعضای اصلی تیم AlphaGo در DeepMind بود و تلاش می کند تا اطمینان حاصل کند که هوش مصنوعی برای شکوفایی انسان مفید است.

خواندن متن کامل در ام‌آی‌تی تک‌ریویوبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

Don’t be fooled—LLMs don’t reason

On an afternoon in Seoul in March 2016, I watched a program I helped build put a stone on the fifth line of a Go board in what looked like a gift to its human opponent. Move 37 in game two of the five-game match looked so absurd that some commentators thought it was a…

همه‌ی اخبار فناوری