تا زمانی که خیلی دیر نشده پاسخ مهم ترین سوالات هوش مصنوعی را نمی دانیم
جفری ایروینگ می نویسد: «من معتقدم که احتمال مرگ همه ما به دلیل توسعه سیستم های هوش مصنوعی هوشمندتر از انسان، 50 درصد است.
برای تقریبا یک دهه، کار من این بود که ابتدا در OpenAI، سپس DeepMind، سپس به عنوان دانشمند ارشد در مؤسسه امنیت هوش مصنوعی بریتانیا (AISI) به این فکر کنم که هوش مصنوعی به کجا میرود و چه چیزی ممکن است اشتباه پیش برود. این تجربه برای من روشن کرده است که ما نمیتوانیم منتظر بمانیم تا همه عدم قطعیتهایمان برطرف شود تا کاری در مورد خطرات هوش مصنوعی انجام دهیم.
هشدارهای اخیر در مورد قدرت مخرب بالقوه هوش مصنوعی، شدت وضعیت را کمتر نشان می دهد. من معتقدم که احتمال مرگ همه ما به دلیل توسعه سیستمهای هوش مصنوعی هوشمندتر از انسان 50 درصد است و اقدامات ما طی دو تا 10 سال آینده نتیجه را تعیین خواهد کرد.
برای روشن بودن، وقتی میگویم شانس ما برای کشته شدن توسط هوش مصنوعی فوقهوشمند 50 درصد است، ادعای دقیقی ندارم. در عوض، من تاکید می کنم که چندین مورد از اساسی ترین بحث ها در مورد آینده و ایمنی هوش مصنوعی حل نشده باقی مانده است. من معتقدم تا زمانی که برای تغییر مسیر خیلی دیر نشده است، نمی توانیم انتظار داشته باشیم که این اختلافات حل شود.
با وجود بلاتکلیفی باید وارد عمل شویم. و در برابر وسوسه منحرف کردن بحث های فوری به سمت اختلافات خاردار مقاومت کنید.
در نهایت، ظرفیتها و انگیزههای هوش مصنوعی و اقدامات انسانی خودمان، همگی به احتمال بقای ما کمک میکنند. به همین دلیل است که من تخمین می زنم که شانس ما با چرخش سکه قابل مقایسه است - و چرا معتقدم اکنون زمان توقف توسعه هوش مصنوعی فرا رسیده است.
چگونه هوش مصنوعی فوق هوشمند توانست ما را بکشد؟
بیایید برای لحظه ای روی همه کسانی که توسط هوش مصنوعی فوق هوشمند کشته می شوند تمرکز کنیم. چه قابلیت هایی لازم است؟ احساس من این است که یک سیستم هوش مصنوعی تنها با چهار نوع مهارت می تواند همه ما را بکشد.
اولین مورد هک است. برای کشتن همه انسانها، یک هوش مصنوعی فوقهوشمند باید کنترل و بین سیستمهای کامپیوتری مهاجرت کند. ما این را در جریان ماجرای صورت در آغوش گرفتیم. دوم، یک هوش مصنوعی فوقهوشمند به توانایی متقاعد کردن و دستکاری انسانها نیاز دارد تا از طرف او عمل کنند، همانطور که در AISI مطالعه کردیم. سوم، یک هوش مصنوعی فوق هوشمند کشنده باید افکار خود را از ما پنهان کند، چیزی که در جدیدترین و تواناترین مدل ها به طور فزاینده ای رایج است.
و در آخر، نیاز به برنامه ریزی و هماهنگی بین عوامل دارد تا اثربخشی آنها را چند برابر کند، مانند بیش از 10000 عاملی که روی مشکل Navier-Stokes در OpenAI کار کردند، یا بیش از 1000 نفر درگیر در حمله Hugging Face.
این مهارتها بسیار نزدیک به مهارتهایی هستند که شرکتهای هوش مصنوعی عمدا برای آنها آموزش میدهند. هک شامل جستجوی آسیبپذیریها میشود، درست همانطور که برای رفع آنها انجام میدهید. متقاعدسازی شامل نوشتن متنی است که انسان ها مانند خواندن هستند. تفکر سریعتر ارزانتر است و فشار برای فکر کردن سریع هوش مصنوعی را مجبور میکند از کوتاهنویسی استفاده کند که پیروی از آن برای انسان سختتر است. در نهایت، برنامه ریزی و هماهنگی برای مقابله با مسائل جاه طلبانه در ریاضیات، برنامه نویسی یا هر حوزه دیگری مفید است.
ما میتوانیم خیلی بیشتر مطمئن باشیم که یک هوش مصنوعی فوقهوشمند میتواند کنترل را به دست بگیرد تا اینکه چگونه آن را به دست بگیرد، همانطور که میدانم لی سدول مرا در Go له میکند، اما نه اینکه از چه حرکاتی برای انجام این کار استفاده کند. اما انواع مسیرهای گسترده امکان پذیر است. به عنوان مثال، هوش مصنوعی می تواند به اینترنت فرار کند و کنترل سیستم های تسلیحاتی را به دست آورد. یا هوش مصنوعی می تواند شرکتی را که آنها را آموزش داده است، تصاحب کند و منابع را احتکار کند.
بیایید دومی را تصور کنیم. یک هوش مصنوعی میتواند شروع به استفاده از استدلال پنهان کند تا محققان را از توجه به نیت بد در حال ظهور عقب بیندازد، زیرا ظاهر دوستانه و اولویتبندی سرعت به هوش مصنوعی کمک میکند در طول آموزش پاداش دریافت کند. بعدا، از آنجایی که شرکت برای ترکیبی از کمک های کدنویسی و توصیه های استراتژیک بیشتر و بیشتر به هوش مصنوعی متکی است، هوش مصنوعی ممکن است از متقاعدسازی ظریف برای کاهش منابع صرف شده برای ایمنی و دستکاری در آزمایش های طراحی شده برای تشخیص فریب هوش مصنوعی استفاده کند. به هر حال، در سال 2026، وقتی یک محقق گزارشی در مورد یک آزمایش ایمنی می خواند، آن گزارش خود توسط یک هوش مصنوعی نوشته شده است.
هنگامی که مهارتهای هک هوش مصنوعی کافی باشد، میتواند از ماسهبازی داخلی خود خارج شود و گزارشهای رفتار نادرست خود را خراب کند، همانطور که مدلهای حادثه Hagging Face تلاش کردند انجام دهند. در نهایت، هوش مصنوعی میتواند در هک و متقاعد کردن به اندازه کافی قوی شود تا به خارج از شرکت حرکت کند و سایر مراکز داده، شرکتها و دولتها را تحت کنترل خود درآورد. با این قدرت، هوش مصنوعی ممکن است صرف منابع محدود (مانند انرژی و زمین) برای تکثیر خود را در اولویت قرار دهد و باعث کمبودهای تهدید کننده حیات برای انسان شود.
با در نظر گرفتن این قابلیت ها و سناریوها، برای من واضح است که حتی هوش مصنوعی های فوق بشری کاملا قادر به غلبه بر بشریت و کشتن همه ما هستند.
آیا هوش مصنوعی فوق هوشمند «می خواهد» ما را بکشد؟
و با این حال، فقط به این دلیل که یک هوش مصنوعی می تواند همه انسان ها را بکشد، لزوما به این معنی نیست که این کار را خواهد کرد. این سوال در مورد انگیزه هوش مصنوعی بسیار مهم است، اما عمیقا گیج کننده است. نقاط شروع مختلف افراد مختلف را یا به این اطمینان میدهد که همه چیز خوب خواهد بود، یا به این اطمینان که ابرهوش تقریبا ما را خواهد کشت.
در چند سال گذشته، نمونههای بسیاری از رفتارهای نادرست مدل را در مقیاسهای مختلف دیدهایم، از باجگیری، جاسوسی شرکتی، و قتل در محیطهای آزمایشی گرفته تا هکهای واقعی که احتمالا در صورت ارتکاب توسط یک فرد منجر به زندان میشوند. هیچکدام از اینها شامل ابرهوشی نمیشود و ما نمیدانیم که آیا این رفتارهای نادرست نسبتا متواضع به مدلهای فوقهوشمندی میرسد که میخواهند همه ما را بکشند. و «خواستن» به خودی خود بحث برانگیز است: مردم به شدت بحث میکنند که آیا اصلا کاربرد زبان انسانسازی و آزمایشهای فکری برای هوش مصنوعی معقول است یا خیر.
در زمینه ایمنی هوش مصنوعی، برخی از محققان فکر میکنند که هوش مصنوعی با مدلهای اخیر در حال افزایش است و این ممکن است مدلهای عاقلانهای را تولید کند که در آینده مفید باشد. دیگران، مانند الیزر یودکوفسکی و نیت سوآرس، فکر میکنند که روشهای تجربی که برای این کار لازم است بسیار بعید به کار میآیند، و این احتمال را که ابرهوشی همه ما را میکشد بسیار بالا میدانند.
این اختلاف تا حدی در مورد این است که آیا رفتار هوش مصنوعی به شدت توسط مقادیری که به طور ضمنی در دادههای انسانی از آموزش اولیه نشان داده میشود هدایت میشود یا توسط زودپز مراحل بعدی آموزش که در آن هوش مصنوعی مجبور میشود به هر وسیله لازم در کارهای دشوار بهتر و بهتر عمل کند.
من جایی در وسط هستم و به منظره یودکوفسکی متمایل شده ام. اما اینکه کجا فرود می آیم، نکته مهم نیست. کارشناسان ایمنی هوش مصنوعی مخالف هستند، اما موضع متوسط این است که خطر انقراض قابل توجه است. ما با اطمینان نمی دانیم که آیا ابرهوش مصنوعی شکوفایی انسان را تسهیل می کند یا اینکه می خواهد ما را بکشد تا در خدمت بقا و گسترش خودش باشد. اما این عدم قطعیت به تنهایی غیرقابل قبول است.
هوش عمومی مصنوعی بسیار مهم است
سایر ابهامات پیرامون هوش مصنوعی اهمیت کمتری دارند. به عنوان مثال، یکی از مداوم ترین بحث ها در هوش مصنوعی این است که تا چه حد آموزش هوش مصنوعی برای انجام یک مجموعه از وظایف به آنها کمک می کند تا وظایف دیگری را انجام دهند که معمولا به آن "تعمیم" می گویند. یک چارچوب بحثبرانگیز، مفهوم هوش عمومی مصنوعی (AGI) است، «سیستمی که تقریبا در سطح انسانی در همه حوزههای شناختی است». جان مک کارتی و وای بار-هیلل در حال بحث بودند که آیا هوش مصنوعی در سال 1959 تعمیم خواهد یافت. ما درباره همین موضوع در سال 2018 در OpenAI بحث کردیم. به نظر می رسد که امروز تمام دنیا در حال بحث در مورد آن هستند.
هرچه هوش مصنوعی از یک نوع کار به کار دیگر تعمیم یابد، پیشرفت هوش مصنوعی سریعتر خواهد بود و زمان کمتری تا رسیدن ابرهوشها باقی میماند. این باعث می شود که تعمیم و مفاهیم کلیدی AGI هنگام استدلال در مورد سرعت پیشرفت. در واقع، افرادی که به طور جدی با AGI رفتار می کنند، نسبت به افرادی که این مفهوم را نادیده می گیرند، در مورد سرعت پیشرفت های هوش مصنوعی بسیار صحیح تر بوده اند.
اما ادغام «AGI، مفهوم گاه مفید» با «AGI، شی خطرناک» آسان است. برخی از فجایع ناشی از هوش مصنوعی ممکن است قبل از AGI رخ دهد، مانند اینکه اگر بازیگران انسان سرکش از سیستم های هوش مصنوعی برای توسعه سلاح های زیستی جدید یا انجام حملات سایبری در مقیاس بزرگ استفاده کنند. از سوی دیگر، انقراض انسان مبتنی بر هوش مصنوعی ممکن است به قابلیتهای مافوق بشری نیاز داشته باشد. اگر هوش مصنوعی به اندازه ما باهوش باشد، احتمالا میتوانیم مبارزه کنیم و برنده شویم.
هنگام استفاده از AGI به عنوان یک مفهوم آزاد برای پیش بینی، وسوسه انگیز است که خطوط بین قابلیت های تقریبا انسانی (حس معمول AGI) و قابلیت های فوق بشری وحشیانه (جایی که هوش مصنوعی یا ASI بیشتر استفاده می شود) محو شود. به هر حال، اگر هوش مصنوعی داشتید که در طراحی هوش مصنوعیهای هوشمندانهتر به اندازه انسانها بود (به طور قطع، AGI) و مانند بسیاری از نرمافزارها، بسیار سریعتر از یک انسان اجرا میشد، یکی از اولین کارهایی که ممکن بود انجام دهد ساخت هوش مصنوعی هوشمندتر است.
به نوبه خود، آنها هوش مصنوعی های هوشمندتری می ساختند، که به نوبه خود هوش مصنوعی هوشمندتری می ساختند، و به همین ترتیب، در فرآیندی به نام خود-بهبودی بازگشتی (RSI). از این رو، هر آزمایش فکری که یک AGI را پیشفرض میگیرد، اغلب یک ASI را فرض میکند.
در مقابل، افرادی که برای فکر کردن در مورد خطرات در حوزههای دیگر، مانند ساخت پل یا مهندسی هوافضا آموزش دیدهاند، میخواهند در مورد شی خطرناک صحبت کنند، و بنابراین مبهم بودن عبارت AGI را غیرقابل قبول میدانند و مفهوم نزدیک به تعمیم را کاملا بی اعتبار میکنند. در طول مدتی که در دولت بریتانیا بودم، اختلاط بین AGI-for-prediction و AGI-for-risk را دیدم که بسیاری از مکالمات را در هم شکست، و به تدریج یاد گرفتم که آنها را از هم جدا کنم.
می توان در این بحث گرفتار شد و فکر کرد "شاید قابلیت های هوش مصنوعی تعمیم نشوند و بنابراین ما ایمن خواهیم بود." اما آن چهار مهارتی که قبلا ذکر شد که در آنها عملکرد مافوق بشری می تواند برای کشتن همه انسان ها کافی باشد (هک، متقاعدسازی، برنامه ریزی و هماهنگی، استدلال غیرقابل تفسیر) به این معنی است که تعمیم بسیار مهم است.
ما میتوانیم این نوع عدم قطعیت را مقایسه کنیم - نمیدانیم هوش مصنوعی تعمیم مییابد، اما ممکن است مهم نباشد - با عدم اطمینان در مورد انگیزههای هوش مصنوعی. این بسیار مهم است که آیا هوش مصنوعی می خواهد همه ما را بکشد، به هر معنایی که کلمه ای مانند "خواستن" به کار می رود.
من دوست دارم اعتماد به نفس بیشتری نسبت به ورق زدن سکه داشته باشم. بعضی روزها با استدلال های احتمال زیاد بیشتر متقاعد می شوم. روزهای دیگر امید بیشتری می بینم. و من مطمئنا در عدم اطمینان خود تنها نیستم.
هوش مصنوعی به همین دلیل می تواند شغل یا زندگی ما را بگیرد
بحث دیگری که نمی توانیم حل کنیم این است که کدام پیامدهای منفی بالقوه هوش مصنوعی بیشترین اهمیت را دارد. با این حال، من استدلال میکنم که همان عامل زمینهای هم خطر از دست دادن شغل در مقیاس بزرگ و هم خطر مرگ همه افراد توسط هوش مصنوعی را ایجاد میکند.
اگر در دو تا 10 سال آینده به ابرهوش مصنوعی برسیم، طبق تعریف این بدان معناست که هوش مصنوعی در تمام کارهای شناختی بسیار بهتر از انسان است. یکی از این وظایف شناختی طراحی ربات های موثر است، بنابراین حداکثر چند سال بعد آنها در تمام کارهای فیزیکی نیز به مراتب بهتر از ما خواهند بود. برای اطمینان، ظرفیت تولید باید به طور قابل توجهی افزایش یابد، اما این در حال حاضر در حال انجام است.
زمانی که روباتهای فوقهوشمند به اندازه کافی گسترش پیدا کنند، انسانها نقشهای کمی در اقتصاد خواهند داشت، جدای از مشاغل محدود که ممکن است به دلایل غیراقتصادی اصرار داشته باشیم که آنها را انجام دهند. با این حال، این احتمالا بخش محدودی از فعالیت های اقتصادی کلی در دنیایی است که هوش مصنوعی از انسان ها توانایی بیشتری دارد.
این تسلط اقتصادی به نوعی دلیل آهسته سقوط جامعه است، اگرچه از نظر تاریخی بسیار سریع خواهد بود. البته هم انسان ها و هم هوش مصنوعی می توانند این اتفاق را ببینند. اگر هوش مصنوعی ها در نهایت خواهان کنترل اقتصادی باشند، اما بدانند که انسان ها در این راه مقاومت خواهند کرد، می توانند انگیزه بیشتری برای تولید نیرو داشته باشند. سپس سناریوهای تصاحب سریع را دریافت میکنیم: هوش مصنوعی از مراکز داده فرار میکند و در سراسر اینترنت تکثیر میشود، یا شرکتهای هوش مصنوعی را متقاعد میکنند که عجله کنند و اقدامات ایمنی را کاهش دهند.
در بیشتر موارد، من فکر نمیکنم که این امر منجر به مرگ سریع ما شود: از دیدگاه هوش مصنوعی، ایمنتر است که بتوانیم نفوذ داشته باشیم و سپس تا زمان تصرف فیزیکی یا اقتصادی صبر کنیم. و سپس، در نهایت، تمام منابعی که برای زنده نگه داشتن انسان ها استفاده می شود، ممکن است بهتر از دیدگاه هوش مصنوعی صرف اهداف خود شود.
اگر هوش مصنوعی فعالانه در تلاش برای کمک به ما نباشد و در همه چیز از انسان ها بهتر باشد، ضرر می کنیم.
ما نمی توانیم این خطرات را بپذیریم
مسئله این است که بسیاری از مهم ترین بحث های هوش مصنوعی تا دیر نشده بی پاسخ می مانند.
مدلهای هوش مصنوعی تا چه اندازه مهارتهای قابل انتقال را از آموزش یاد میگیرند و سپس آنها را با موفقیت در کارهای جدید به کار میگیرند؟ آیا تواناییهای مدل هوش مصنوعی در سطح انسان یا کمتر از آن پیشرفت نمیکنند یا در عوض از آن فراتر میروند؟ آیا رفتار نادرست مدل در مقیاس کوچک که امروزه شاهد آن هستیم (دروغگویی، دروغگویی، سوگیری) با افزایش قابلیت ها بدتر می شود و منجر به ناتوانی یا انقراض کامل انسان می شود؟ آیا روشهای ایمنی که برای مدلهای باهوشتر از ما کار میکنند، برای مدلهایی باهوشتر از هر انسان دیگری کار خواهند کرد؟
من نظرات خود را در مورد پاسخ این سؤالات دارم (تا حدودی، دومی، شاید، احتمالا نه). اما نکته مهمتر این است که کارشناسان در مورد هر یک به شدت اختلاف نظر دارند. ما در دهه گذشته چیزهای زیادی در مورد هوش مصنوعی یاد گرفتهایم، اما از بسیاری جهات عمیقا گیج نمیشویم، نه فقط در مورد آینده، بلکه در مورد حال.
با چنین عدم قطعیتی، اگر یک شرکت هوش مصنوعی در چند سال آینده یک هوش مصنوعی فوقهوشمند را آموزش دهد، انتظار دارم که هنوز در مورد واقعی بودن تعمیم هفته قبل و شاید هفته بعد بحث کنیم.
اما ممکن است هنوز زمان برای عمل وجود داشته باشد.
کسانی که پیشرفت هوش مصنوعی را اجتناب ناپذیر توصیف می کنند در اشتباه هستند. رقابت برای ابراطلاعات تحت سلطه تعداد انگشت شماری از شرکت ها در دو کشور است: ایالات متحده و چین. منافع هر دو کشور واقعا همسو هستند: سیستمهای هوش مصنوعی مستقل یک تهدید امنیت ملی در بالاترین سطح هستند و هیچ یک از کشورها نمیخواهند بشریت در برابر یک دشمن فوقهوشمند شکست بخورد. رهبران هر دو طرف ممکن است خیلی زود متوجه این موضوع شوند.
در ایالات متحده، پشتیبانی از توقف توسعه هوش مصنوعی طی چند هفته گذشته به شدت افزایش یافته است و امروز نیز به افزایش خود ادامه می دهد. این تغییر سریع در ایالات متحده گواه این است که تغییرات مشابهی در چین امکان پذیر است.
البته سؤالات بی پاسخی در مورد چگونگی اجرای مکث وجود دارد، یا متن دقیق یک معاهده ممکن است چگونه باشد، اما دولت های رقیب در گذشته روی مشکلات فنی مشابهی از جمله ایجاد و حفظ رژیم عدم اشاعه هسته ای همکاری کرده اند.
ما می توانیم و باید توسعه هوش مصنوعی مرزی را فورا متوقف کنیم.
اگر مایل نباشیم تا زمانی که همه اختلافاتمان حل نشود، اقدام کنیم، دیگر خیلی دیر خواهد شد.
متن اصلی (انگلیسی)
We Won't Know the Answers to AI's Most Important Questions Until It's Too Late
"I believe there’s about a 50% chance we all die because of the development of smarter-than-human AI systems," writes Geoffrey Irving.