OpenAI 722 مقاله ریاضی را دور ریخته است - اکنون باید آشفتگی را پاک کند
جاکوب آرون می گوید که OpenAI از ریاضیات به عنوان یک سایت آزمایشی برای توانمندترین مدل های هوش مصنوعی خود استفاده می کند و این بدان معناست که مسئولیت مقابله با پیامدها را دارد، نه اینکه آن را به ریاضیدانان بسپارد.
سام آلتمن، رئیس OpenAI
هفته گذشته، من پرسیدم که آیا ریاضیدانان می توانند هوش مصنوعی را نادیده بگیرند؟ دیروز، OpenAI در قالب 722 مقاله ریاضی که در وب سایت اشتراک کد GitHub ریخته شد، یک رگبار شلیک کرد، که خروجی یک کمپین انبوه علیه 4000 مسئله باز در طیف وسیعی از ریاضیات بود. ریاضیدانان هنوز در حال هضم انتشار هستند و احتمالا برای مدتی این کار را انجام خواهند داد. به راحتی می توان فکر کرد که این وضعیت ناشناخته ای است، اما در واقع فکر می کنم برخی پیشینه های تاریخی وجود دارد که می تواند در بازگشایی آنچه که اخیرا اتفاق افتاده و آنچه باید بعدا اتفاق بیفتد مفید باشد.
قبل از اینکه به آن بپردازم، در اینجا باید به دو سوال بزرگ پاسخ داد: این تورنت ریاضی برای هوش مصنوعی چه معنایی دارد، و چه معنایی برای ریاضیات دارد؟ در مورد سوال اول، ما اکنون تأیید بیشتری داریم که مدلهای پیشرو هوش مصنوعی اساسا میتوانند ریاضیات ظاهرا در سطح تحقیقاتی را با فشار دادن یک دکمه تولید کنند. OpenAI از یک مدل داخلی بی نام استفاده می کند و می گوید که هر نتیجه معادل میانگین «سه ساعت محاسبه تفکر ChatGPT Pro» است – Pro بالاترین محصول آن است که با 100 تا 500 دلار در ماه ارائه می شود.
البته، «متوسط» در اینجا کار زیادی انجام میدهد، و خدمات اشتراک OpenAI به شدت یارانه میشود، بنابراین ارائه رقم واقعی هزینه برای هر یک از این نتایج دشوار است، و OpenAI یکی را ارائه نکرده است. با این حال، بعید به نظر می رسد که میانگین مشکل تقریبا به تلاشی که در ماه گذشته برای نتیجه شرکت Navier-Stokes انجام شد، که OpenAI می گوید حدود 88 ساعت با هزینه گزارش شده 15 میلیون دلار طول کشید، نیاز داشته باشد.
این شرکت این کار را انجام می دهد نه به این دلیل که یک ماشین ریاضی می خواهد، بلکه به این دلیل است که به مشکلاتی دست می یابد که مدل های خود را گسترش می دهد - ریاضیات تنها یکی از بسیاری از سایت های آزمایشی است. آیا این مهارت ظاهری در ریاضیات به این معنی است که OpenAI به عملکرد مشابه در سایر علوم یا هدف اعلام شده آن یعنی هوش عمومی مصنوعی نزدیک است، یک مدل هوش مصنوعی که می تواند هر کاری را که انسان می تواند انجام دهد؟ من اینطور فکر نمی کنم.
ریاضیات دارای یک جزء حیاتی است که برای موفقیت هوش مصنوعی ضروری بوده است: تأییدپذیری. هیچ معیار عینی برای تأیید اینکه آیا یک هوش مصنوعی میتواند مثلا نمایشنامههایی را که رقیب ویلیام شکسپیر است بنویسد وجود ندارد، اما چنین معیاری در ریاضیات وجود دارد زیرا اثبات یا درست است یا درست نیست. با رسمی کردن یک اثبات – تبدیل مراحل منطقی آن به کد رایانهای به نام Lean که میتواند توسط رایانه به صورت مکانیکی بررسی شود – شرکتهای هوش مصنوعی میتوانند نشان دهند که واقعا به آنچه ادعا میکنند دست یافتهاند.
این یک حلقه مفید برای بهبود توانایی ریاضی هوش مصنوعی فراهم می کند: از آن بخواهید یک اثبات ارائه کند، آن را رسمی کند و به مدل برای دقت پاداش دهد. به نظر می رسد فقدان چنین حلقه ای در سایر زمینه ها، پیشرفت مدل های هوش مصنوعی را دشوارتر می کند.
آنچه در آخرین نسخه OpenAI جالب است این است که رسمی سازی آن ناقص است. تعیین کمیت این کمی دشوار است: فهرست شواهد ناب آن تنها 162 مقاله از 722 مقاله را فهرست می کند که نتایج اصلی آنها به این شکل رسمی شده است، اما فهرستی از آخرین نتایج که با هر کد ناب همراه است به 235 "خانواده" از مجموع 372 خانواده در 722 مقاله می رسد. به هر حال که آن را برش دهید، کار تمام نشده است.
بازی تایید
این ما را به این سوال می رساند که این برای ریاضیات چه معنایی دارد. حداقل با اثبات رسمی، ریاضیدانان می توانند به طور منطقی مطمئن شوند که مقالات دقیق هستند. (هنوز این احتمال وجود دارد که نسخه Lean به طور دقیق با نسخه نوشته شده نگاشت نشده باشد، و برای این نتایج OpenAI، هنوز بررسی نشده است.) برای سایر مقالات، OpenAI این کار سخت را به ریاضیدانان واگذار کرده است، وضعیتی که ترنس تائو در دانشگاه کالیفرنیا، لس آنجلس، قبلا آن را با «ریختن لاشه گوشت خام روی میز غذای ما بر روی میز غذا» مقایسه کرده بود.
پس چرا OpenAI کار رسمیسازی را تمام نکرده است؟ چند دلیل احتمالی وجود دارد. اولین مورد این است که شاید برای انتشار این نتایج به جای ادامه دادن به آنها، فشار را احساس می کرد. OpenAI میگوید از دستورالعملهای گروه مشاوره مستقل ریاضیات و هوش مصنوعی (AGMAI) استفاده کرده است، که بیان میکند نتایج ریاضی قابل توجهی باید «در اسرع وقت» منتشر شود. با این حال، AGMAI از انتشار فاصله گرفته است و گفته است که نقش مشاوره آن نباید به عنوان یک تایید تلقی شود.
برداشت من این است که اکنون دکمه ریاضیات وجود دارد، کسی قرار است آن را فشار دهد، و OpenAI که این کار را با یک مدل داخلی فعلی انجام میدهد، حداقل کنترل کمی نسبت به یک کاملا رایگان برای همه توسط هر کسی که به مدلهای عمومی دسترسی دارد، ارائه میدهد. این بدان معنا نیست که OpenAI از قلاب خارج شده است - همانطور که AGMAI می گوید، شرکت های هوش مصنوعی که این کار را انجام می دهند مسئولیت دارند به درک انسان از نتایج خود کمک کنند.
جالبتر اینکه، این احتمال وجود دارد که OpenAI هنوز نمیتواند بسیاری از نتایج خود را به طور معناداری رسمی کند، زیرا کار آن از وضعیت فعلی هنر رسمیسازی جلوتر بوده است. بیشتر رسمیسازیهای ناب به مخزنی به نام mathlib متکی هستند که توسط جامعه ریاضیدانان و دانشمندان رایانه ساخته شده است. ایده این است که این کتابخانه ای از نتایج رسمی است که همه می توانند به طور منطقی در مورد آن مطمئن باشند، که سایر تلاش های رسمی سازی می توانند از آن بسازند - آن را کمی شبیه به مجموعه ای از آجرهای لگو در نظر بگیرید که ریاضیدانان می توانند از آن اثبات های رسمی ایجاد کنند.
برخی از نتایج OpenAI اساسا به آجرهای جدیدی نیاز دارند که در حال حاضر در استخر نیستند، و در برخی موارد، ایجاد آن آجرها میتواند بسیار سختتر از نوشتن اثبات غیررسمی در وهله اول باشد. نتایجی که رسمیسازی میشوند به طور یکنواخت در سراسر طیف ریاضیات توزیع نمیشوند، که نشان میدهد این میتواند یک محدودیت واقعی با ماشین رسمیسازی برای برخی زیرشاخهها باشد. با این اوصاف، به احتمال زیاد رسمیسازی بیشتر در زمان انجام خواهد شد، و OpenAI در بیانیهای مطبوعاتی گفت که این شرکت با بهدستآوردن آنها، مخزن را با رسمیسازیهای بیشتری بهروزرسانی خواهد کرد.
کوین بازارد از امپریال کالج لندن میگوید: "موانع اصلی این است که به سادگی رسمیسازی زمان میبرد. و به یاد داشته باشید که رسمیسازی کامل یک مقاله ریاضی فقط به رسمیت بخشیدن به مقاله، بلکه باید تمام مراجع را نیز رسمی کند." "هوش مصنوعی می تواند تمام ماشین آلات را پر کند - این فقط یک سوال است که چقدر باید پر شود."
اینجاست که فکر می کنم برخی مقایسه ها مفید هستند. ما صدها مقاله ریاضی غیررسمی داریم که هنوز توسط کسی خارج از OpenAI بررسی نشده است، و با توجه به اینکه نتایج در کل ریاضیات گسترده است، نمیدانیم این بررسیهای داخلی چقدر معنادار هستند. مجموعه کامل نتایج تقریبا با تعداد مقالات ریاضی منتشر شده در سرور پیشچاپ arXiv در هر روز قابل مقایسه است، اگرچه این مقایسه کاملا منصفانه نیست - پیشچاپهای arXiv به ندرت مشکلات بزرگ باز را حل میکنند.
مقایسه دیگر ممکن است با تعداد مقالات در Annals of Mathematics باشد، مجله ریاضی بسیار درجه یک، که حدود 35 مقاله در سال منتشر می کند، و آخرین نسخه OpenAI را معادل حدود یک دهه از خروجی مجله می کند. باز هم، این مقایسه کاملی نیست - همه چیز از OpenAI شایسته Annals نیست، و برخی از مقالاتی که با همان مشکل سروکار دارند برای انتشار در مجلات در یک مقاله جمع می شوند - اما این دو رقم به ما یک حد بالا و پایین را در مورد آنچه ریاضیدانان با آن سر و کار دارند می دهد.
دریچه های سیل باز شده است
ما می توانیم به تاریخ نگاه کنیم تا بفهمیم که چگونه ریاضیدانان قبلا با ورود ریاضیات نامطمئن برخورد کرده اند. سه مثال وجود دارد که می تواند نقشه راه آینده را به ما ارائه دهد. اولین کسی که به ذهن می رسد، سرینیواسا رامانوجان، ریاضیدان خودآموخته ای است که بدون آموزش رسمی، هزاران نتیجه را در اوایل قرن بیستم به دست آورد که اغلب از اثبات های دقیق طفره می رفت. رامانوجان بخشی از کارهای خود را برای ریاضیدان G. H.
هاردی، یکی از رهبران حوزه در آن زمان، که در ابتدا حروف را رد کرد - تا اینکه متوجه شد آنها حاوی بینش واقعی ریاضی هستند. این زوج شروع به همکاری کردند، اما رامانوجان بیمار شد و در سن 32 سالگی درگذشت.
مورد دیگری نشان می دهد که چگونه رسمی کردن می تواند کمک کند. در سال 1998، توماس هیلز که در آن زمان در دانشگاه میشیگان مشغول به کار بود، راه حلی برای حدس کپلر منتشر کرد، مسئله ای 400 ساله درباره بهترین راه برای چیدن کره ها. این اثبات آنقدر پیچیده بود که داوران Annals of Mathematics چهار سال طول کشید تا آن را ارزیابی کنند، و حتی در آن زمان فقط میگفتند که «99 درصد مطمئن هستند» این اثبات درست است - یک اعلامیه فوقالعاده. هیلز بیش از یک دهه را صرف رسمیت بخشیدن به اثبات خود کرد.
در نهایت، چیزی وجود دارد که من دوست دارم آن را اثباتی بنامم که فقط در ژاپن صادق است. اولین بار در سال 2012 توسط شینیچی موچیزوکی در دانشگاه کیوتو، ژاپن منتشر شد، این مقالات ریاضی متراکم در مورد مسئله ای به نام حدس ABC توسط معاصران موچیزوکی "ریاضیات بیگانه" لقب گرفتند و صحت آنها تا به امروز مورد مناقشه است. تلاشهای رسمیسازی در حال انجام است و تاکنون پیشرفت چندانی نداشته است.
موقعیتی که امروزه ریاضیدانان در آن قرار دارند را می توان با صدها رامانوجان، هالس یا موچیزوکی که به یکباره وارد می شوند مقایسه کرد. سوال این است: OpenAI و مدل های آن بیشتر با کدام قابل مقایسه هستند؟ رامانوجان که در جوانی در حال مرگ بود، قادر به انجام کار کمک به ریاضیدانان دیگر برای درک او نبود، در حالی که موچیزوکی اغلب تمایلی به انجام این کار ندارد.
بنابراین، امید این است که هیلز به مدلی تبدیل شود که باید از آن پیروی کرد و تلاشی اختصاصی برای رسمی کردن و پرورش تفاهم را رهبری کرد. این درخواست AGMAI است و توپ بسیار در زمین OpenAI است. اینکه آیا این کار ادامه پیدا میکند یا نه، باید دید: داستانی از Wired در این هفته گزارش میدهد که کارمندان OpenAI ناشناس معتقدند که هوش مصنوعی ریاضیات را مرده جلوه داده است، توصیفی که بعید است به ریاضیدانان اطمینان دهد که آینده رشته آنها در دستان امنی است.
مطالعه بیشتر هوش مصنوعی:
سام آلتمن، مدیر عامل OpenAI، در مصاحبه ای با Politico که قبل از انتشار ریاضیات انجام شد، گفت که "جهان باید اتفاقات بدی را بپذیرد" تا از مزایای هوش مصنوعی بهره مند شود. این موضوع عناوین و خشم ایجاد کرده است، اما من فکر نمیکنم که این یک موضع غیرمنطقی باشد – همین امر در مورد بسیاری از فناوریهای دیگر، از جمله اینترنت و تلفنهای هوشمند، که دنیا نمیخواهد بدون آنها انجام دهد، صادق است.
یک توسعهدهنده نرمافزار از هوش مصنوعی برای حل مشکل مربوط به نمودارهای ون استفاده کرده است، نمونهای دیگر از ریاضیدانان آماتور که به لطف این ابزارهای جدید پیشرفتهای واقعی داشتند.
شرکت های بیمه مسئولیت خود را در مورد هک کردن سایر شرکت ها توسط عوامل هوش مصنوعی می سنجند. ظاهرا به دلیل سؤال از قصد، عدم اطمینان واقعی در مورد اینکه چه کسی از نظر قانونی درگیر این حوادث است وجود دارد، اما به نظر من برای روشن شدن سریع این موضوع به پرونده های قضایی نیاز داریم.
زنی در فلوریدا به دلیل تهدید علیه کلانتری در چت با کلود دستگیر شده است که می گوید از آن به عنوان دفتر خاطرات استفاده می کرد. سیستمهای خودکار Anthropic این تهدید را به عنوان یک نگرانی علامتگذاری کردند، و توسط بازبینیکنندگان انسانی که با پلیس تماس گرفتند، بررسی شد - یادآوری این که پلتفرمهای هوش مصنوعی آنقدرها هم که فکر میکنید خصوصی نیستند.
پاپ لئو چهاردهم روی مسئله هنر هوش مصنوعی سنجیده است و طرفدار آن نیست. او در X نوشت: «حتی قبل از زیباییشناختی، تفاوت هستیشناختی بین هنر و آنچه که یک ماشین میتواند از طریق محاسبه آماری بر اساس میلیونها تصویر خلقشده توسط دیگران ایجاد کند، وجود دارد. الگوریتمها فاقد جرقه انسانیت هستند». سال 2023 یکی از اولین موارد اطلاعات غلط مبتنی بر هوش مصنوعی است
متن اصلی (انگلیسی)
OpenAI has dumped 722 maths papers – now it must clean up the mess
OpenAI is using mathematics as a test site for its most capable AI models, and that means it has a responsibility to deal with the fallout, rather than just leaving it to mathematicians, says Jacob Aron