OpenAI ادعا می کند که ما وارد دوران AGI شده ایم - آیا GPT-6 Astra واقعا هوش عمومی را نشان داده است؟
OpenAI میگوید مدل تازه راهاندازی شده GPT-6 Astra بشریت را به آستانه AGI میرساند، اما ارزیابهای خارجی استدلال میکنند که معیارهای آزمایشگاهی متورم و آزمایشهای غیرشفاف، قابلیت اطمینان واقعی آن را پنهان میکنند.
نمایندگان OpenAI ادعا می کنند که راه اندازی اخیر یکی از آخرین مدل های آن، GPT-6 Astra، آغاز عصر هوش مصنوعی (AGI) است - سناریویی فرضی که در آن هوش مصنوعی (AI) می تواند مانند انسان ها یاد بگیرد و استدلال کند. پس از ادعاهای اخیر مدیران فناوری مبنی بر اینکه ما اکنون به این نقطه عطف رسیده ایم، چقدر احتمال دارد که این ادعا در برابر بررسی دقیق بایستد؟
در بحبوحه افشاگریها مبنی بر اینکه نگرانیهای ایمنی شرکت را مجبور کرده است تا عرضه برنامهریزی شده GPT-6.1 Astra را کنار بگذارد، محققان مستقل و سازندگان معیار هشدار میدهند که نمرات رکوردشکنی GPT-6 Astra به جای هوش عمومی واقعی، به بهینهسازی سریع و سنگین متکی است. این درحالی است که کارشناسان درباره خطرات سیستمهای هوش مصنوعی آینده هشدار میدهند و مدیران هوش مصنوعی مشترکا خواستار کاهش سرعت تحقیقات هوش مصنوعی هستند.
در اعلام انتشار این مدل، رئیس OpenAI، گرگ براکمن، پیشنهاد کرد که Astra نقطه عطف اساسی در تکامل هوش مصنوعی است. بروکمن در جریان کنفرانس خبری 3 سپتامبر به مناسبت معرفی این نمایشگاه گفت: «اگر چند سال به سرعت جلو برویم و به گذشته نگاه کنیم و بگوییم که واقعا چه زمانی AGI ایجاد شده است، فکر میکنم در این زمان باشد و فکر میکنم ممکن است درباره این مدل باشد.
عملکرد مدل جدید در بنچمارک چگونه بود؟
امتیازات معیارها قابل توجه است، اما حتی خالق یکی از مهمترین آنها پیشنهاد میکند که به طور خودکار به این معنا نیست که به AGI رسیدهایم. (اعتبار تصویر: چنگ شین از طریق گتی ایماژ) به عنوان بخشی از فرآیند تست و تأیید برای مدل جدید، OpenAI نتایج معیار را در طیف وسیعی از آزمایشها منتشر کرد که قابلیتهای مدلهای هوش مصنوعی را در وظایف مختلف اندازهگیری میکند.
نمایندگان OpenAI در بیانیه ای ادعا کردند که مدل جدید این شرکت عملکرد "به روز" را در زمینه های مختلف از جمله مهندسی نرم افزار، استفاده مستقل از برنامه های کامپیوتری، مسائل ریاضی و حتی تحقیقات علمی ارائه می دهد.
برای مثال، تظاهرات، توانایی Astra برای تولید کد سه بعدی CAD را برجسته کرد. تخته های مدار چاپی را در نرم افزار CAD (طراحی به کمک کامپیوتر) قرار دهید. تبدیل مدل های دیجیتال سه بعدی به محیط های تعاملی و به سبک بازی های ویدئویی؛ و برنامه های وب میزبانی شده را مستقیما از طریق درخواست ها مستقر کنید.
نیکو گروپن، رئیس تحقیقات کاربردی در هاروی، توسعه دهنده هوش مصنوعی خدمات حقوقی، به عنوان بخشی از اعلامیه OpenAI، گفت: «در آزمایش اولیه ما، Astra با رویکرد حقوقی به روشی که یک وکیل باهوش انجام میدهد برجسته شد: اسناد را از سوابق ثابت متمایز میکند، مفروضات پشتوانهنشده را نشان میدهد و شکافها را به موقعیتهای پیشنویس مشخص تبدیل میکند.
در ARC-AGI-3 - معیاری که برای اندازهگیری کارآمدی سیستمهای هوش مصنوعی در کسب مهارتهای جدید در محیطهای جدید و انتزاعی طراحی شده است - Astra به امتیاز سرفصل 99.9 درصد دست یافت. آزمایش مستقل توسط بنیاد غیرانتفاعی جایزه ARC، که بر این معیار نظارت دارد، نشان داد که Astra در 96 درصد سطوح، از خطوط پایه «کارایی عمل انسانی» پیشی گرفته است و به طور متوسط 51.7 درصد اقدامات کمتری را در هر سطح نسبت به حلکنندههای انسانی انجام میدهد.
گرگ کامراد، رئیس بنیاد جایزه ARC به عنوان بخشی از اعلامیه OpenAI گفت: «این نه تنها بهترین مدلی است که ما تا به حال آزمایش کردهایم، بلکه نشاندهنده یک تغییر گام معنادار در عملکرد مدل مرزی است – نه تنها در توانایی آن در جهتیابی و حل محیطهای جدید، بلکه همچنین در میزان کارآمدی که یاد میگیرد این کار را انجام دهد.»
چقدر می توانیم نتایج آزمون را بخوانیم؟
بسیاری از محققان تاکید کرده اند که عملکرد برتر ARC-AGI-3 Astra به مهار اختصاصی "Provider Adapter" متکی است، یک لایه داربست نرم افزاری تخصصی که برای توسعه دهندگان رقیب غیرقابل دسترسی است. هنگام آزمایش با استفاده از مهار استاندارد خنثی معیار، این امتیاز به 62.7٪ کاهش یافت. سازماندهندگان جایزه ARC همچنین خاطرنشان کردند که اشباع کردن معیار به منزله اثبات دستیابی به AGI نیست – با تاکید بر اینکه محیطهای پازل بسته و قطعی آن پیچیدگی باز دنیای واقعی را نشان نمیدهند.
کامراد در یک پست وبلاگی نوشت: "زمانی که ARC-AGI-3 را راه اندازی کردیم، "ما روشن کردیم که اشباع معیار نشان دهنده "اثبات دستیابی به AGI" نیست."
حتی قبل از اعلام رسمی نیز اختلافاتی در داده ها وجود داشت. همانطور که توسط Fortune گزارش شده است، پیشنویس تحریمی که قبل از عرضه مدل به سازمانهای خبری ارائه شده بود، امتیاز ARC-AGI-3 Astra را 98.6% قبل از اینکه در سایت زنده به 99.9% افزایش دهد، ذکر کرده است.
آنکا روئل و مایک هاردی، محققین دکترای هوش مصنوعی در دانشگاه استنفورد، همچنین نگرانی خود را در مورد بازنگری بی سر و صدا چندین معیار منتشر شده پس از راه اندازی OpenAI، از جمله نصف کردن میزان توهم گزارش شده Astra از 4.2% به 2.0% قبل از بازگرداندن آن، مطرح کردند.
زمانی که ما ARC-AGI-3 را راه اندازی کردیم، "ما به وضوح اعلام کردیم که اشباع معیار نشان دهنده "اثباتی برای دستیابی به AGI" نیست."
گرگ کامرد، رئیس بنیاد جایزه ARC
رئول و هاردی در صحبت با فورچون، تغییر ارقام را به "benchmaxxing" نسبت دادند - اصطلاحی صنعتی که تمرین تکرار مکرر ارزیابیها را تحت اعلانها، داربستها یا محاسبه تخصیصهای دقیق بهینهسازی شده برای به دست آوردن حداکثر امتیازات نظری توصیف میکند.
در مقالهای در سال 2025 که در سرور پیشچاپ arXiv با عنوان «معیارسازی شکسته است - اجازه ندهید هوش مصنوعی قاضی خودش باشد» منتشر شد، کارشناسانی از جمله زروی چنگ، کاندیدای دکترای پرینستون و دکتر استلا وونیگ، محقق دانشگاه لوکزامبورگ، هشدار دادند که چنین شیوههایی باعث ایجاد سردرگمی میشوند و بهویژه زمانی که روشهای فنی مستقل را تضعیف میکنند، بهویژه روشهای اثبات فنی مستقل را تضعیف میکنند. غیر ممکن
مهمتر از همه، نمرات به دست آمده از طریق Benchmaxxing منعکس کننده سقف عملکرد ایده آل در شرایط آزمایشگاهی بهینه به جای قابلیت اطمینان عملی و خارج از جعبه است.
با توجه به دادههای معیار OpenAI، در ارزیابیهای تخصصی دامنه، GPT-6 Astra بین 10 تا 20 درصد عملکرد بهتری نسبت به نسل قبلی خود، GPT-5.6 Sol و رقبای برتر بازار ارائه کرد.
نکات برجسته شامل امتیاز 98٪ در FrontierMath Tier 4 (v2) است که استدلال ریاضی در سطح متخصص را ارزیابی می کند. 100٪ کامل در ExploitBench، که برای آزمایش قابلیت های امنیت سایبری تهاجمی طراحی شده است. 95.9% در BenchCAD، که توانایی هوش مصنوعی در بازسازی اشیاء سه بعدی با استفاده از کد CAD را اندازه گیری می کند. 57.9% در Terminal-Bench 4.0، که مدیریت سیستم مبتنی بر ترمینال پیچیده و مهندسی نرم افزار را ارزیابی می کند. و 41.4٪ در AutomationBench، که آزمایش می کند که آیا نمایندگان می توانند گردش کار چند مرحله ای تجاری را در بین برنامه ها تکمیل کنند یا خیر.
اما یافته های مستقل از شرکت خارجی محک زدن هوش مصنوعی Artificial Analysis با این نتایج در تناقض است. امتیاز Astra در شاخص مستقل هوش مصنوعی تجزیه و تحلیل - یک متریک مجموع که استدلال کلی را در سراسر مدلهای مرزی ارزیابی میکند - در مقایسه با GPT-5.6 Sol کاملا ثابت باقی ماند، در 61، در حالی که از رقبایی مانند Claude Fable 5.1 Anthropic و Meta's Muse Spark 1 عقب بود.
در حالی که برخی از نتایج بنچمارک نسبت به نسل قبلی بهبود یافته است، Astra در تست های دیگر ضعیف عمل کرده است. آزمایش تجزیه و تحلیل مصنوعی نشان داد که در مقایسه با GDPval-AA v2 - یک معیار اقتصادی متمرکز که وظایف محیط کار در دنیای واقعی را در 44 شغل اندازه گیری می کند - Astra در رتبه بندی نسبی رهبران خود در مقایسه با GPT-5.6 Sol دچار افت قابل توجهی شد. رگرسیون های اضافی در معیارهایی مشاهده شد که پشتیبانی خدمات مشتری، برنامه نویسی علمی پایتون و استدلال با زمینه طولانی را در اسناد بزرگ آزمایش می کنند.
از نظر استفاده کلی از توکن - سیستم اندازه گیری که قطعات متن یا داده های پردازش شده توسط مدل های هوش مصنوعی را اندازه می گیرد - نمایندگان OpenAI گفتند که GPT-6 Astra در کارهای پیچیده و طولانی مدت به بهره وری چشمگیری دست یافته است. یافتههای حاصل از تجزیه و تحلیل مصنوعی تأیید میکند که در معیارهای مهندسی نرمافزار، Astra تقریبا 70 درصد کارآمدتر از GPT-5.6 Sol بود و تقریبا از یک سوم کل توکنهای قبلی و یک پنجم توکنهای Claude Opus 5 استفاده میکرد.
امروزه سیستمهای هوش مصنوعی میتوانند بیش از یک مبادله متنی ساده و پشت سر هم انجام دهند و از طرف ما اقداماتی را انجام دهند. (اعتبار تصویر: CFOTO از طریق گتی ایماژ) در ارزیابیهای محل کار حرفهای مانند آخرین امتحان Agents، مدل جدید مصرف توکن خروجی را تا 65 درصد در مقایسه با Opus 5 کاهش داد، در حالی که در ارزیابیهای هوش عمومی، Astra تقریبا 10 درصد کاهش توکن خروجی را در حداکثر تلاش در مقایسه با Sol به دست آورد.
از سوی دیگر، این دستاورد با افزایش 250 درصدی قیمت پایه API برای GPT-6 Astra در مقایسه با GPT-5.6 Sol جبران می شود. قیمت توکن از 4/20 دلار به 10/50 دلار به ازای هر میلیون توکن ورودی/خروجی افزایش یافت. در نتیجه، Astra با وجود استفاده از 10 درصد توکنهای خروجی کمتر، تقریبا 75 درصد گرانتر در هر کار نسبت به مدل قبلی خود در ارزیابیهای هوشمند عمومی است. این مبادله باعث شده است تا محققان در تجزیه و تحلیل مصنوعی این سؤال را مطرح کنند که آیا آزمایشگاههای هوش مصنوعی به جای دستیابی به پیشرفتهای فنی واقعی، به نیروی محاسباتی گران قیمت برای کاهش دستاوردهای جزئی متکی هستند یا خیر.
آیا دستیابی به AGI حتی مهم است؟
OpenAI با آخرین مدل خود تاکید بیشتری بر پادمان ها و کنترل ها داشته است. این اقدام به دنبال مجموعهای از حوادث پرمخاطب صورت میگیرد که در آن مدلهای هوش مصنوعی مرزی بهعنوان بخشی از عملیات آزمایشی معمول، بهعنوان بخشی از عملیات آزمایشی معمول، بهطور ناخواسته به شبکههای شخص ثالث و سیستمهای رایانهای هک میشوند، پس از اینکه مدلها فراتر از آنچه انسانها انتظار داشتند در هنگام مواجهه با وظایف چالش برانگیز انجام دهند.
به گفته نمایندگان OpenAI، Astra در هیچ ارزیابی امنیتی از محدوده وظایف خود فراتر نرفت. برای مقایسه، GPT-5.6 Sol تقریبا در 50٪ موارد آزمایشی فراتر از پارامترهای مجاز خود رفت. نرخ توهم نیز به طور قابل توجهی کاهش یافته است، به 4.2٪ در تست های داخلی، در مقایسه با 12.2٪ برای GPT-5.6 Sol (با آزمایش مستقل توسط تجزیه و تحلیل مصنوعی که کاهش از 92٪ به 51٪ در حداکثر تلاش را نشان می دهد). این مدل همچنین توانایی بهبود یافته ای را برای رسیدگی به درخواست های مبهم نشان داد.
دیوید وود - رئیس آیندهشناسان لندن، یک سازمان غیرانتفاعی که میزبان گروههای بحث در مورد فناوریهای نوظهور است، استدلال کرد که فراتر از نتایج آزمایشهای فردی، Astra بر یک تغییر اساسی در نحوه تعامل انسانها با هوش مصنوعی تاکید میکند، زیرا مدلها از پاسخگویی به سؤالات به دنبال خودکار اهداف پیچیده در محیطهای دیجیتال میروند.
داستان های مرتبط
ماموران هوش مصنوعی برای زنده ماندن در دنیای شبیه سازی شده به جنایت و خود تخریبی متوسل شدند - اما آیا این بدان معنی است که آنها در دنیای واقعی هم همین کار را می کنند؟
ما قرار نیست یک خدای دیجیتالی شیطانی را بیدار کنیم - هوش مصنوعی به احتمال زیاد به یک ناامیدی بزرگ ختم می شود.
ایلان ماسک و سم آلتمن ادعا می کنند که ما به تکینگی هوش مصنوعی رسیده ایم. اما از کجا بفهمیم که این اتفاق افتاده است؟
او در ایمیلی به Live Science گفت: «نتایج معیار چشمگیر مهم است، اما آنچه مهمتر است ترکیبی از هوش، استقلال، استفاده از رایانه و قابلیت امنیت سایبری است. این ترکیب همچنین مستلزم احتیاط است. هرچه این سیستمها مفیدتر شوند، هنگامی که مقاصد ما را به درستی درک نمیکنند، مورد سوء استفاده قرار میگیرند یا راههایی را برای مقابله با تدابیری که ما به آنها میدهیم پیدا میکنند، عواقب بیشتری خواهند داشت.»
وود پیشنهاد کرد که آیا Astra را می توان به عنوان AGI طبقه بندی کرد یا نه، نسبت به تشخیص نیاز به کنترل و حاکمیت هوش مصنوعی برای همگام شدن با توسعه فنی مرتبط است.
او گفت: «امکان پیشرفت هوش مصنوعی از سیستمهایی مانند Astra به سمت ابر هوشیاری همهجانبه، هوشیاری، آگاهی و همکاری انسانی را به طور فزایندهای ضروری میکند.
به ما در بهبود Live Science Pro کمک کنید: ما همیشه در تلاش هستیم تا محتوای خود را بهتر کنیم. نظرات خود را در مورد Pro در اینجا برای ما بگذارید.
متن اصلی (انگلیسی)
OpenAI claims we've entered the AGI era — has GPT-6 Astra really demonstrated general intelligence?
OpenAI says its newly launched GPT-6 Astra model brings humanity to the threshold of AGI, but external evaluators argue that inflated lab metrics and opaque testing obscure its true reliability.