پرش به محتوای اصلی

OpenAI ادعا می کند که ما وارد دوران AGI شده ایم - آیا GPT-6 Astra واقعا هوش عمومی را نشان داده است؟

لایو‌ساینس۱۴۰۵ مهر ۱۶, پنجشنبه، ساعت ۱۲:۳۰حدود 9 دقیقه مطالعه

OpenAI می‌گوید مدل تازه راه‌اندازی شده GPT-6 Astra بشریت را به آستانه AGI می‌رساند، اما ارزیاب‌های خارجی استدلال می‌کنند که معیارهای آزمایشگاهی متورم و آزمایش‌های غیرشفاف، قابلیت اطمینان واقعی آن را پنهان می‌کنند.

نمایندگان OpenAI ادعا می کنند که راه اندازی اخیر یکی از آخرین مدل های آن، GPT-6 Astra، آغاز عصر هوش مصنوعی (AGI) است - سناریویی فرضی که در آن هوش مصنوعی (AI) می تواند مانند انسان ها یاد بگیرد و استدلال کند. پس از ادعاهای اخیر مدیران فناوری مبنی بر اینکه ما اکنون به این نقطه عطف رسیده ایم، چقدر احتمال دارد که این ادعا در برابر بررسی دقیق بایستد؟

در بحبوحه افشاگری‌ها مبنی بر اینکه نگرانی‌های ایمنی شرکت را مجبور کرده است تا عرضه برنامه‌ریزی شده GPT-6.1 Astra را کنار بگذارد، محققان مستقل و سازندگان معیار هشدار می‌دهند که نمرات رکوردشکنی GPT-6 Astra به جای هوش عمومی واقعی، به بهینه‌سازی سریع و سنگین متکی است. این درحالی است که کارشناسان درباره خطرات سیستم‌های هوش مصنوعی آینده هشدار می‌دهند و مدیران هوش مصنوعی مشترکا خواستار کاهش سرعت تحقیقات هوش مصنوعی هستند.

در اعلام انتشار این مدل، رئیس OpenAI، گرگ براکمن، پیشنهاد کرد که Astra نقطه عطف اساسی در تکامل هوش مصنوعی است. بروکمن در جریان کنفرانس خبری 3 سپتامبر به مناسبت معرفی این نمایشگاه گفت: «اگر چند سال به سرعت جلو برویم و به گذشته نگاه کنیم و بگوییم که واقعا چه زمانی AGI ایجاد شده است، فکر می‌کنم در این زمان باشد و فکر می‌کنم ممکن است درباره این مدل باشد.

عملکرد مدل جدید در بنچمارک چگونه بود؟

امتیازات معیارها قابل توجه است، اما حتی خالق یکی از مهم‌ترین آنها پیشنهاد می‌کند که به طور خودکار به این معنا نیست که به AGI رسیده‌ایم. (اعتبار تصویر: چنگ شین از طریق گتی ایماژ) به عنوان بخشی از فرآیند تست و تأیید برای مدل جدید، OpenAI نتایج معیار را در طیف وسیعی از آزمایش‌ها منتشر کرد که قابلیت‌های مدل‌های هوش مصنوعی را در وظایف مختلف اندازه‌گیری می‌کند.

نمایندگان OpenAI در بیانیه ای ادعا کردند که مدل جدید این شرکت عملکرد "به روز" را در زمینه های مختلف از جمله مهندسی نرم افزار، استفاده مستقل از برنامه های کامپیوتری، مسائل ریاضی و حتی تحقیقات علمی ارائه می دهد.

برای مثال، تظاهرات، توانایی Astra برای تولید کد سه بعدی CAD را برجسته کرد. تخته های مدار چاپی را در نرم افزار CAD (طراحی به کمک کامپیوتر) قرار دهید. تبدیل مدل های دیجیتال سه بعدی به محیط های تعاملی و به سبک بازی های ویدئویی؛ و برنامه های وب میزبانی شده را مستقیما از طریق درخواست ها مستقر کنید.

نیکو گروپن، رئیس تحقیقات کاربردی در هاروی، توسعه دهنده هوش مصنوعی خدمات حقوقی، به عنوان بخشی از اعلامیه OpenAI، گفت: «در آزمایش اولیه ما، Astra با رویکرد حقوقی به روشی که یک وکیل باهوش انجام می‌دهد برجسته شد: اسناد را از سوابق ثابت متمایز می‌کند، مفروضات پشتوانه‌نشده را نشان می‌دهد و شکاف‌ها را به موقعیت‌های پیش‌نویس مشخص تبدیل می‌کند.

در ARC-AGI-3 - معیاری که برای اندازه‌گیری کارآمدی سیستم‌های هوش مصنوعی در کسب مهارت‌های جدید در محیط‌های جدید و انتزاعی طراحی شده است - Astra به امتیاز سرفصل 99.9 درصد دست یافت. آزمایش مستقل توسط بنیاد غیرانتفاعی جایزه ARC، که بر این معیار نظارت دارد، نشان داد که Astra در 96 درصد سطوح، از خطوط پایه «کارایی عمل انسانی» پیشی گرفته است و به طور متوسط ​​51.7 درصد اقدامات کمتری را در هر سطح نسبت به حل‌کننده‌های انسانی انجام می‌دهد.

گرگ کامراد، رئیس بنیاد جایزه ARC به عنوان بخشی از اعلامیه OpenAI گفت: «این نه تنها بهترین مدلی است که ما تا به حال آزمایش کرده‌ایم، بلکه نشان‌دهنده یک تغییر گام معنادار در عملکرد مدل مرزی است – نه تنها در توانایی آن در جهت‌یابی و حل محیط‌های جدید، بلکه همچنین در میزان کارآمدی که یاد می‌گیرد این کار را انجام دهد.»

چقدر می توانیم نتایج آزمون را بخوانیم؟

بسیاری از محققان تاکید کرده اند که عملکرد برتر ARC-AGI-3 Astra به مهار اختصاصی "Provider Adapter" متکی است، یک لایه داربست نرم افزاری تخصصی که برای توسعه دهندگان رقیب غیرقابل دسترسی است. هنگام آزمایش با استفاده از مهار استاندارد خنثی معیار، این امتیاز به 62.7٪ کاهش یافت. سازمان‌دهندگان جایزه ARC همچنین خاطرنشان کردند که اشباع کردن معیار به منزله اثبات دستیابی به AGI نیست – با تاکید بر اینکه محیط‌های پازل بسته و قطعی آن پیچیدگی باز دنیای واقعی را نشان نمی‌دهند.

کامراد در یک پست وبلاگی نوشت: "زمانی که ARC-AGI-3 را راه اندازی کردیم، "ما روشن کردیم که اشباع معیار نشان دهنده "اثبات دستیابی به AGI" نیست."

حتی قبل از اعلام رسمی نیز اختلافاتی در داده ها وجود داشت. همانطور که توسط Fortune گزارش شده است، پیش‌نویس تحریمی که قبل از عرضه مدل به سازمان‌های خبری ارائه شده بود، امتیاز ARC-AGI-3 Astra را 98.6% قبل از اینکه در سایت زنده به 99.9% افزایش دهد، ذکر کرده است.

آنکا روئل و مایک هاردی، محققین دکترای هوش مصنوعی در دانشگاه استنفورد، همچنین نگرانی خود را در مورد بازنگری بی سر و صدا چندین معیار منتشر شده پس از راه اندازی OpenAI، از جمله نصف کردن میزان توهم گزارش شده Astra از 4.2% به 2.0% قبل از بازگرداندن آن، مطرح کردند.

زمانی که ما ARC-AGI-3 را راه اندازی کردیم، "ما به وضوح اعلام کردیم که اشباع معیار نشان دهنده "اثباتی برای دستیابی به AGI" نیست."

گرگ کامرد، رئیس بنیاد جایزه ARC

رئول و هاردی در صحبت با فورچون، تغییر ارقام را به "benchmaxxing" نسبت دادند - اصطلاحی صنعتی که تمرین تکرار مکرر ارزیابی‌ها را تحت اعلان‌ها، داربست‌ها یا محاسبه تخصیص‌های دقیق بهینه‌سازی شده برای به دست آوردن حداکثر امتیازات نظری توصیف می‌کند.

در مقاله‌ای در سال 2025 که در سرور پیش‌چاپ arXiv با عنوان «معیارسازی شکسته است - اجازه ندهید هوش مصنوعی قاضی خودش باشد» منتشر شد، کارشناسانی از جمله زروی چنگ، کاندیدای دکترای پرینستون و دکتر استلا وونیگ، محقق دانشگاه لوکزامبورگ، هشدار دادند که چنین شیوه‌هایی باعث ایجاد سردرگمی می‌شوند و به‌ویژه زمانی که روش‌های فنی مستقل را تضعیف می‌کنند، به‌ویژه روش‌های اثبات فنی مستقل را تضعیف می‌کنند. غیر ممکن

مهمتر از همه، نمرات به دست آمده از طریق Benchmaxxing منعکس کننده سقف عملکرد ایده آل در شرایط آزمایشگاهی بهینه به جای قابلیت اطمینان عملی و خارج از جعبه است.

با توجه به داده‌های معیار OpenAI، در ارزیابی‌های تخصصی دامنه، GPT-6 Astra بین 10 تا 20 درصد عملکرد بهتری نسبت به نسل قبلی خود، GPT-5.6 Sol و رقبای برتر بازار ارائه کرد.

نکات برجسته شامل امتیاز 98٪ در FrontierMath Tier 4 (v2) است که استدلال ریاضی در سطح متخصص را ارزیابی می کند. 100٪ کامل در ExploitBench، که برای آزمایش قابلیت های امنیت سایبری تهاجمی طراحی شده است. 95.9% در BenchCAD، که توانایی هوش مصنوعی در بازسازی اشیاء سه بعدی با استفاده از کد CAD را اندازه گیری می کند. 57.9% در Terminal-Bench 4.0، که مدیریت سیستم مبتنی بر ترمینال پیچیده و مهندسی نرم افزار را ارزیابی می کند. و 41.4٪ در AutomationBench، که آزمایش می کند که آیا نمایندگان می توانند گردش کار چند مرحله ای تجاری را در بین برنامه ها تکمیل کنند یا خیر.

اما یافته های مستقل از شرکت خارجی محک زدن هوش مصنوعی Artificial Analysis با این نتایج در تناقض است. امتیاز Astra در شاخص مستقل هوش مصنوعی تجزیه و تحلیل - یک متریک مجموع که استدلال کلی را در سراسر مدل‌های مرزی ارزیابی می‌کند - در مقایسه با GPT-5.6 Sol کاملا ثابت باقی ماند، در 61، در حالی که از رقبایی مانند Claude Fable 5.1 Anthropic و Meta's Muse Spark 1 عقب بود.

در حالی که برخی از نتایج بنچمارک نسبت به نسل قبلی بهبود یافته است، Astra در تست های دیگر ضعیف عمل کرده است. آزمایش تجزیه و تحلیل مصنوعی نشان داد که در مقایسه با GDPval-AA v2 - یک معیار اقتصادی متمرکز که وظایف محیط کار در دنیای واقعی را در 44 شغل اندازه گیری می کند - Astra در رتبه بندی نسبی رهبران خود در مقایسه با GPT-5.6 Sol دچار افت قابل توجهی شد. رگرسیون های اضافی در معیارهایی مشاهده شد که پشتیبانی خدمات مشتری، برنامه نویسی علمی پایتون و استدلال با زمینه طولانی را در اسناد بزرگ آزمایش می کنند.

از نظر استفاده کلی از توکن - سیستم اندازه گیری که قطعات متن یا داده های پردازش شده توسط مدل های هوش مصنوعی را اندازه می گیرد - نمایندگان OpenAI گفتند که GPT-6 Astra در کارهای پیچیده و طولانی مدت به بهره وری چشمگیری دست یافته است. یافته‌های حاصل از تجزیه و تحلیل مصنوعی تأیید می‌کند که در معیارهای مهندسی نرم‌افزار، Astra تقریبا 70 درصد کارآمدتر از GPT-5.6 Sol بود و تقریبا از یک سوم کل توکن‌های قبلی و یک پنجم توکن‌های Claude Opus 5 استفاده می‌کرد.

امروزه سیستم‌های هوش مصنوعی می‌توانند بیش از یک مبادله متنی ساده و پشت سر هم انجام دهند و از طرف ما اقداماتی را انجام دهند. (اعتبار تصویر: CFOTO از طریق گتی ایماژ) در ارزیابی‌های محل کار حرفه‌ای مانند آخرین امتحان Agents، مدل جدید مصرف توکن خروجی را تا 65 درصد در مقایسه با Opus 5 کاهش داد، در حالی که در ارزیابی‌های هوش عمومی، Astra تقریبا 10 درصد کاهش توکن خروجی را در حداکثر تلاش در مقایسه با Sol به دست آورد.

از سوی دیگر، این دستاورد با افزایش 250 درصدی قیمت پایه API برای GPT-6 Astra در مقایسه با GPT-5.6 Sol جبران می شود. قیمت توکن از 4/20 دلار به 10/50 دلار به ازای هر میلیون توکن ورودی/خروجی افزایش یافت. در نتیجه، Astra با وجود استفاده از 10 درصد توکن‌های خروجی کمتر، تقریبا 75 درصد گران‌تر در هر کار نسبت به مدل قبلی خود در ارزیابی‌های هوشمند عمومی است. این مبادله باعث شده است تا محققان در تجزیه و تحلیل مصنوعی این سؤال را مطرح کنند که آیا آزمایشگاه‌های هوش مصنوعی به جای دستیابی به پیشرفت‌های فنی واقعی، به نیروی محاسباتی گران قیمت برای کاهش دستاوردهای جزئی متکی هستند یا خیر.

آیا دستیابی به AGI حتی مهم است؟

OpenAI با آخرین مدل خود تاکید بیشتری بر پادمان ها و کنترل ها داشته است. این اقدام به دنبال مجموعه‌ای از حوادث پرمخاطب صورت می‌گیرد که در آن مدل‌های هوش مصنوعی مرزی به‌عنوان بخشی از عملیات آزمایشی معمول، به‌عنوان بخشی از عملیات آزمایشی معمول، به‌طور ناخواسته به شبکه‌های شخص ثالث و سیستم‌های رایانه‌ای هک می‌شوند، پس از اینکه مدل‌ها فراتر از آنچه انسان‌ها انتظار داشتند در هنگام مواجهه با وظایف چالش برانگیز انجام دهند.

به گفته نمایندگان OpenAI، Astra در هیچ ارزیابی امنیتی از محدوده وظایف خود فراتر نرفت. برای مقایسه، GPT-5.6 Sol تقریبا در 50٪ موارد آزمایشی فراتر از پارامترهای مجاز خود رفت. نرخ توهم نیز به طور قابل توجهی کاهش یافته است، به 4.2٪ در تست های داخلی، در مقایسه با 12.2٪ برای GPT-5.6 Sol (با آزمایش مستقل توسط تجزیه و تحلیل مصنوعی که کاهش از 92٪ به 51٪ در حداکثر تلاش را نشان می دهد). این مدل همچنین توانایی بهبود یافته ای را برای رسیدگی به درخواست های مبهم نشان داد.

دیوید وود - رئیس آینده‌شناسان لندن، یک سازمان غیرانتفاعی که میزبان گروه‌های بحث در مورد فناوری‌های نوظهور است، استدلال کرد که فراتر از نتایج آزمایش‌های فردی، Astra بر یک تغییر اساسی در نحوه تعامل انسان‌ها با هوش مصنوعی تاکید می‌کند، زیرا مدل‌ها از پاسخ‌گویی به سؤالات به دنبال خودکار اهداف پیچیده در محیط‌های دیجیتال می‌روند.

داستان های مرتبط

ماموران هوش مصنوعی برای زنده ماندن در دنیای شبیه سازی شده به جنایت و خود تخریبی متوسل شدند - اما آیا این بدان معنی است که آنها در دنیای واقعی هم همین کار را می کنند؟

ما قرار نیست یک خدای دیجیتالی شیطانی را بیدار کنیم - هوش مصنوعی به احتمال زیاد به یک ناامیدی بزرگ ختم می شود.

ایلان ماسک و سم آلتمن ادعا می کنند که ما به تکینگی هوش مصنوعی رسیده ایم. اما از کجا بفهمیم که این اتفاق افتاده است؟

او در ایمیلی به Live Science گفت: «نتایج معیار چشمگیر مهم است، اما آنچه مهمتر است ترکیبی از هوش، استقلال، استفاده از رایانه و قابلیت امنیت سایبری است. این ترکیب همچنین مستلزم احتیاط است. هرچه این سیستم‌ها مفیدتر شوند، هنگامی که مقاصد ما را به درستی درک نمی‌کنند، مورد سوء استفاده قرار می‌گیرند یا راه‌هایی را برای مقابله با تدابیری که ما به آنها می‌دهیم پیدا می‌کنند، عواقب بیشتری خواهند داشت.»

وود پیشنهاد کرد که آیا Astra را می توان به عنوان AGI طبقه بندی کرد یا نه، نسبت به تشخیص نیاز به کنترل و حاکمیت هوش مصنوعی برای همگام شدن با توسعه فنی مرتبط است.

او گفت: «امکان پیشرفت هوش مصنوعی از سیستم‌هایی مانند Astra به سمت ابر هوشیاری همه‌جانبه، هوشیاری، آگاهی و همکاری انسانی را به طور فزاینده‌ای ضروری می‌کند.

به ما در بهبود Live Science Pro کمک کنید: ما همیشه در تلاش هستیم تا محتوای خود را بهتر کنیم. نظرات خود را در مورد Pro در اینجا برای ما بگذارید.

خواندن متن کامل در لایو‌ساینسبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

OpenAI claims we've entered the AGI era — has GPT-6 Astra really demonstrated general intelligence?

OpenAI says its newly launched GPT-6 Astra model brings humanity to the threshold of AGI, but external evaluators argue that inflated lab metrics and opaque testing obscure its true reliability.

همه‌ی اخبار فناوری