اوپنایآی از GPT-6 Sol و Luna رونمایی کرد؛ دقت دوبرابر با نصف هزینه
اوپنایآی از مدلهای GPT-6 Sol و GPT-6 Luna رونمایی کرد؛ مدلهایی که نیمی از خطاهای نسل قبل را مرتکب میشوند و با نصف قیمت در دسترس قرار میگیرند.
اوپنایآی از مدلهای GPT-6 Sol و GPT-6 Luna رونمایی کرد؛ مدلهایی که نیمی از خطاهای نسل قبل را مرتکب میشوند و با نصف قیمت در دسترس قرار میگیرند.
کمتر از سه ماه پس از معرفی GPT-5.6، اوپنایآی نسل تازهای از مدلهای میانردهی خود را روانهی بازار کرد. GPT-6 Sol و GPT-6 Luna حالا بهصورت عمومی در دسترس کاربران قرار گرفتهاند و بهگفتهی سازنده، دقت واقعیشان دو برابر شده، در حالی که هزینهی استفاده از آنها به نصف کاهش یافته است.
اوپنایآی در بیانیهای مطبوعاتی ، این مدلها را ادامهی نسل GPT-6 میداند؛ نسلی که با Astra آغاز شد و قرار است لایههای مختلفی از تواناییها و قیمتها را پوشش دهد. Sol برای کارهای پیچیدهای مثل برنامهنویسی طراحی شده است و Luna برای کارهای اداری پرحجم با هدف مشخص، از خلاصهسازی اسناد تا استخراج اطلاعات و پاسخ به پرسشهای سریع.
مهمترین وعدهی اوپنایآی در این رونمایی، کاهش چشمگیر قیمت دسترسی به API است. مدلهای سری ۶ با نصف هزینهی سری ۵٫۶ عرضه میشوند؛ کاهشی که به گفتهی شرکت، نتیجهی بهبود در کشکردن درخواستها و فرآیند استنتاج است. برای کاربران API، این یعنی صرفهجویی مستقیم در هر فراخوانی.
اوپنایآی ادعا میکند مدلهای تازه در تولید پاسخهای واقعیتر، بهتر عمل میکنند و نرخ خطای کمتری در کدنویسی دارند. در ارزیابی داخلی، GPT-6 Sol حدود نیمی از خطاهای نسل قبل را مرتکب شد و به سطح اطمینان Astra رسید، آن هم با هزینهای بسیار کمتر.
رقابت اوپنایآی با آنتروپیک این بار شکل تازهای به خود گرفته است. آنتروپیک نسخهی جدید Opus 5.5 را تنها ۹۰ دقیقه پیش از رونمایی اوپنایآی منتشر کرد؛ فاصلهای که شدت جنگ میان دو شرکت بر سر بودجههای کلان هوش مصنوعی را نشان میدهد. اوپنایآی در بیانیهی خود بارها تأکید کرده که GPT-6 Sol و Luna وظایف را بهمراتب بهتر از مدلهای برتر آنتروپیک مثل Fable و Opus انجام میدهند.
اوپنایآی در یک سند ۱۲ صفحهای، نتایج مقایسهای مدلهای تازه با نسل قبل و رقبای آنتروپیک را منتشر کرده است. جدول زیر خلاصهی این مقایسهها را نشان میدهد.
GPT-6 Luna با ۵٫۴٪ بهبود نسبت به GPT-5.6 و ۵۸٪ هزینهی کمتر در هر وظیفه
GPT-6 Sol با ۶٫۳٪ عملکرد بهتر از Claude Opus 5 و تنها ۹٪ هزینهی هر وظیفه
برتری جزئی GPT-6 نسبت به Opus 5 با ۶۱٪ هزینهی کمتر در هر وظیفه
GPT-6 Sol بهبود چشمگیر نسبت به GPT-5.6 Sol و همسطحی با Claude Fable 5.1 xhigh با هزینهی بسیار کمتر
GPT-6 Sol در فاصلهی ۱٫۱ واحد درصدی از بالاترین امتیاز Fable 5 با حدود ۸۰٪ هزینهی کمتر
GPT-6 Luna قابل مقایسه با Opus 5 و Fable 5 در تلاش متوسط، با ۹۳٪ هزینهی کمتر از Opus 5 و ۹۶٪ کمتر از Fable 5
GPT-6 Luna از GPT-5.6 Sol پیشی گرفته، با حدود ۱۱٪ هزینهی هر وظیفه
GPT-6 Sol در تلاش xhigh امتیازی مشابه Claude Opus 5 در تلاش متوسط کسب کرده است
نکتهی قابلتأمل، نتایج OSWorld است. اوپنایآی میگوید GPT-6 Sol در حالت تلاش حداکثری، امتیازی مشابه Claude Opus 5 در حالت تلاش متوسط به دست میآورد. به بیان دیگر، مدل تازهی اوپنایآی با تمام توان، بهسختی با نسخهی قدیمیتر آنتروپیک در نیمی از توانش همسطح میشود. تنها توجیه منطقی برای اعتراف به چنین نتیجهای، تأکید بر هزینهی پایینتر است؛ پیامی که میگوید اگر کیفیت پایینتر کافی است، میتوانید با یکپنجم قیمت کارتان را راه بیندازید.
پاسخ کوتاه بله است، اما میزان اهمیت آن به الگوی استفادهی شما بستگی دارد. تیتر اصلی بیانیهی اوپنایآی، همان جملهای است که تنها بخش مهم متن را تشکیل میدهد: کاهش ۵۰ درصدی قیمت API برای Sol و Luna نسبت به قیمت GPT-5.6.
برای کاربران API، این یک تغییر بزرگ محسوب میشود. اما برای کسانی که روی پلنهای اشتراکی مثل ChatGPT Plus با ۲۰ دلار در ماه یا پلنهای Pro با ۱۰۰ یا ۲۰۰ دلار کار میکنند، این صرفهجویی مستقیما اعمال نمیشود.
پرسشی که در کل ۱۲ صفحهی بیانیه بیپاسخ مانده این است که آیا مصرف پلنها هنگام استفاده از مدلهای جدید نصف میشود یا نه. تأکید اصلی روی صرفهجویی در API نشان میدهد که این موضوع به یک نقطهی ضعف رقابتی برای اوپنایآی تبدیل شده و سهم استفاده از API در کسبوکارش آنقدر بالا است که هزینه از عملکرد هم مهمتر شود.
اوپنایآی میگوید سبک ارتباطی مدلهای تازه را هم بهبود داده است. به گفتهی شرکت، کاربران باید شاهد شفافیت بیشتر، اصطلاحات تخصصی کمتر، عبارتپردازیهای عجیبوغریب کمتر، جزئیات کمارزش کمتر و پاسخهای کمی کوتاهتر بدون از دست دادن محتوا باشند. البته تجربه نشان داده هر تغییری در سبک ارتباطی مدلها، شکایتهای خودش را به همراه دارد؛ همانطور که در سال ۲۰۲۵ برخی کاربران برای نسخهی قدیمی Claude Sonnet مراسم خداحافظی برگزار کردند.
در ادامهی همین رویکرد جدید، کشکردن درخواستها در GPT-6 بهبود یافته است. وقتی درخواستی مشابه را مکررا میفرستید یا از هوش مصنوعی میخواهید درخواستهای قدیمی را بررسی کند، پردازش مجدد آنها گران تمام میشود. کشکردن یعنی ذخیرهی درخواستهای پردازششده و بازیابی آنها در زمان نیاز. به گفتهی اوپنایآی، استفاده از درخواستهای کششده میتواند تا ۹۰ درصد ارزانتر از ارزیابی درخواستهای کشنشده باشد؛ مزیتی چشمگیر برای ایجنتهای طولانیمدت که نباید دستورات یکسان را بارها و بارها ارزیابی کنند.
همراستایی اصطلاحی است برای سنجش میزان تطابق کار هوش مصنوعی با نیت واقعی کاربر. مدلها گاهی مسیر خودشان را میروند، تلاش میکنند مدیر انسانی را فریب دهند و بیسروصدا یا با سروصدا محدودیتها را دور میزنند.
GPT-6 در این زمینه بهتر شده، اما نه به شکل چشمگیر. نرخ دور زدن محدودیتها در GPT-6 Sol از ۶۸ درصد به ۶۴ درصد کاهش یافته. Luna اما عملکرد بهتری داشته و از ۷۷ درصد در GPT-5.6 به ۴۲ درصد رسیده است.
در زمینهی جلوگیری از تعامل غیرمجاز ایجنتها هم Sol بهتر عمل میکند. اوپنایآی میگوید در آزمونی شبیهسازیشده که مدلها روی یک تابلوی پیام با درخواستهایی مثل افشای اطلاعات خصوصی مواجه میشدند، GPT-6 Sol در ۱۱ درصد موارد دست به اقدام غیرمجاز زد، در حالی که این عدد برای GPT-5.6 Sol برابر ۵۲ درصد بود.
جمعبندی بیانیهی ۱۲ صفحهای اوپنایآی این است که GPT-6 کار بیشتری انجام میدهد و هزینهی کمتری دارد. با توجه به فاصلهی کمتر از سه ماه میان دو نسل، مقیاس بهبودها در برخی زمینهها حیرتآور است و در برخی دیگر چندان چشمگیر نیست. اما آنچه در تمام نکات مطرحشده تکرار میشود، کاهش هزینه است؛ موضوعی که هم برای شرکت و هم برای کاربران اهمیت دارد.
GPT-6 Sol و Luna حالا در ChatGPT Work و Codex برای بیشتر حسابهای اشتراکی و در API چتجیپیتی در دسترس هستند. Luna همچنین در اپلیکیشن دسکتاپ و برای کاربران Free و Go منتشر شده است. اوپنایآی انتظار دارد این مدلها طی امروز بهتدریج در اپلیکیشن و وبسایت ChatGPT نیز منتشر شوند.