معرفی System One Models و Jev
آدرس مقاله: https://typesafe.ai/blog/introducing-system-one-models-and-jev آدرس نظرات: https://news.ycombinator.com/item?id=49717558 امتیاز: 276 # نظرات: 95
مدلها سالهاست که در چت مافوق بشر بودهاند، پس این همه اتوماسیون کجاست؟
این سوال رانندگی من در چهار سال گذشته بوده است. در OpenAI، من به ساخت روشهایی کمک کردم که مدلهای زبان را در پیروی از دستورالعملها و صحبت با مردم مفید میکردند. آن کار به عنوان تحقیق پشت ChatGPT به پایان رسید. در آن زمان، فکر میکردم شاید مدلهای چت به AGI منتهی شوند، اما علیرغم تبلیغات تبلیغاتی، برایم آشکار شد که چیزی واقعا بزرگ گم شده است.
پس از دو سال مخفی کاری، چالشهای فنی بیشمار و پیشرفتهای تحقیقاتی... من بسیار هیجانزده هستم که اعلام کنم امروز، TypeSafe AI اولین مدل System One ما را منتشر میکند: کلاس جدیدی از مدلهای مرزی که برای تصمیمگیری سریع و ساختار یافته ساخته شدهاند که نرمافزار میتواند مستقیما از آن استفاده کند.
ما یک پشته جدید کاملا متمرکز بر اتوماسیون ساختیم: با معماری مدل جدید، نمونهگر موازی برای حداکثر کارایی، و روش آموزشی که آن را یادگیری تقویتی برای تصمیمات کالیبره شده (RLCD) مینامیم.
اولین مدل عمومی ما Jev است که امروز در دسترسی اولیه در دسترس است. Jev به سطوح مشابهی از هوش در وظایف سیستم یک در مقایسه با LLM های موجود دست می یابد، در حالی که دو مرتبه سریعتر و کارآمدتر است. در حالی که Jev تولید رشته را رها می کند، برای خروجی های ساختاریافته بهینه شده است و نمی تواند توهم داشته باشد.
Jev را به عنوان یک فراخوان تابع هوش مرزی در نظر بگیرید: حالت بدون ساختار، تصمیمات احتمالی تایپ شده خارج شده است.
ادعاهای فوقالعاده به شواهد فوقالعاده نیاز دارند، بنابراین برای دریافت رسید به زیر مراجعه کنید. 💅
یادگیری تقویتی با بازخورد انسانی (RLHF) / یادگیری تقویتی با پاداش های قابل تأیید (RLVR)
یادگیری تقویتی برای تصمیمات کالیبره شده (RLCD)
ترجیحات انسانی: نوشتهها و پاسخهای چت که ارزیابیکنندگان انسانی ترجیح میدهند.
پاداشهای قابل تأیید: خروجیهایی که میتوانند بهصورت برنامهریزی تأیید شوند.
تصمیمات کالیبره شده: پاسخ هایی با احتمالات معرفتی صادقانه در مورد وظایف سیستم یک.
داده های بدون ساختار (مانند متن) با تاکید بر پیام های متوالی.
داده های بدون ساختار (به عنوان مثال متن) با تاکید بر وضعیت برنامه ساخت یافته .
رشته ها / متن تولید شده رشتهها انعطافپذیر هستند و میتوانند هر چیزی باشند: پاسخهای چت، کد، توهم، امتناع، یا حتی مقادیر ساختاری ایمن. برای استفاده توسط نرم افزار، پاسخ ها باید تجزیه و تایید شوند. همچنین همیشه خطری وجود دارد که هوش مصنوعی از ریل خارج شود.
مقادیر ساختاری ایمن نوع. خروجی ها و ساختار ممکن از قبل تعریف شده است. این مدل هرگز اشتباهات تایپ نمی کند. همه پاسخ ها با احتمالات کالیبره شده و نمرات اطمینان همراه هستند.
متوالی. یک توکن را در یک زمان تولید می کند که هر کدام مشروط به آخرین.
موازی. تمام خروجی ها را در یک پرس و جو ایجاد می کند. فوق العاده کارآمد و سخت افزاری.
توکنهای خروجی: 5 برابر گرانتر از توکنهای ورودی.
توکن های ورودی: 0.042 دلار / MTok (42 دلار در هر میلیارد توکن).
زمان پاسخگویی انتها به انتها برای مدل های مرزی بین 3 تا 329 ثانیه است. برای ارتباط با انسان ها به اندازه کافی سریع است، اما وقتی در کد یکپارچه می شود، یک گلوگاه بزرگ است.
زمان پاسخ انتها به انتها برای TypeSafe 70ms-500ms است. این می تواند از 40x200x سریعتر برای همان سطوح هوش مرزی برای پرس و جوهای شکل سیستم یک متغیر باشد.
حتی اگر برای برآورد اطمینان از آنها خواسته شود، مدلها بیش از حد مطمئن و ناسازگار هستند. اگر مدلی بتواند در 95 درصد مواقع یک کار را انجام دهد اما نگوید که چه زمانی در 5 درصد است، نمیتواند آن کار را خودکار کند.
همیشه با هر خروجی با اطمینان و عدم اطمینان ارتباط برقرار می کند. کالیبره شده: اطمینان بیشتر به معنای دقت بالاتر است. سازگارتر: پاسخهای مشابه را برای ورودیهای مشابه برمیگرداند.
وظایف انسان در حلقه (چت ربات، کمک خلبان، عوامل کدنویسی). عمومی و قدرتمند، اما مستلزم نظارت انسانی است زیرا آزادی آنها همچنین به این معنی است که ممکن است از ریل خارج شوند.
مسائل قابل تایید (برهان های ریاضی، بهینه سازی هسته). هنگامی که صحت می تواند به صورت ارزان و خودکار بررسی شود، LLM ها می توانند تولید، آزمایش و تکرار کنند تا زمانی که چیزی را پیدا کنند که کار می کند.
دموها انعطافپذیری رشتهها باعث میشود که برای ساخت سریع نمونههای اولیه که فقط گاهی اوقات کار میکنند، باورنکردنی باشد.
گردش کار با هوش مصنوعی / بیانیه های هوشمند اگر. خروجیهای ساختاریافته به عنوان قوانین تصمیمگیری فازی در نرمافزار معمولی جای میگیرند: طبقهبندی، مسیر، امتیاز، استخراج، یا شاخهای که منطق دستنویس خیلی شکننده است. کدهای اطراف آزادی آنها را محدود میکند و ترکیب آنها را در سیستمهای قابل اعتماد آسانتر میکند.
کاهش نقشه بر روی داده های بزرگ. پتابایت داده را به ویژگی ها و بینش تبدیل کنید. برنامه های بلادرنگ سرعت 100 میلیثانیه به این معنی است که میتوانید از هوش مصنوعی در برنامههای خود در جایی که UX حیاتی است استفاده کنید. همه چیز را تأیید کنید. امتیاز دهید، قضاوت کنید، تأیید کنید، حفاظ کنید، و جیلبریکهای درخواستهای LLM، ردپای استدلال و/یا خروجیها را شناسایی کنید.
ما شکاکان را دوست داریم و خودمان هم شک داریم.
سرعت در هر تماس: ما واقعا به این سرعت هستیم، اگرچه ارزیابیهای منتشر شده ما معمولا از لپتاپهای ما در ساحل غربی اجرا میشوند (این جایی است که سرویس ما در حال حاضر مستقر است).
هزینه هر تماس: ما قیمت گذاری خود را شفاف می کنیم. ما نمی توانیم ثابت کنیم که یارانه نیست. ما برای اثبات پایداری قیمت گذاری خود (که انتظار داریم کاهش یابد، نه افزایش) به دراز مدت نیاز داریم.
بدون خطای نوع: جعل کردن این امر با یک مثال ساده ساده است، اما از نظر ریاضی غیرممکن است.
برای ادعاهای جسورانهتر خود، میخواهیم تا جایی که میتوانیم تفاوتهای ظریف را ارائه دهیم.
نسخه ی نمایشی جانبی ما یک تفاوت کلیدی بین مدل های ما و LLM ها را نشان می دهد: Jev به جای اینکه به صورت خودکار توسط توکن تولید کند، همه احتمالات را به صورت موازی خروجی می دهد. رشته ها بسیار قدرتمند و عمومی هستند، اما هزینه بر هستند. "تسلیم شدن" تارها در واقع به ما قدرت های فوق العاده زیادی می دهد!
برای افرادی که دسترسی اولیه به TypeSafe دارند، در اینجا درخواست واقعی وجود دارد.
پرس و جو بسیار ساده شده است و سوالات به گونه ای انتخاب شدند که دارای کلیدهای توصیفی و قابل خواندن توسط انسان باشند تا خروجی روی صفحه قابل درک باشد.
حالت همچنین پاراگراف کوتاه، متراکم و مفصلی است تا بر تفاوت در روش نمونهگیری تأکید کند. ورودی نسبتا کوتاهتر، مدل ما را در نور مناسبی رنگ میکند.
برای افراد مشتاق، برای اجرای ضبط شده، تنها اختلاف نظر با GPT-5.6 Terra در "سطح احتمال ریزش" است. پاسخ واقعی به نظر ما واقعا مبهم است.
ما از GPT-5.6 Terra با استدلال پیشفرض برای این مثال استفاده کردیم، زیرا دریافتیم که به طور متوسط از نظر هوش با Jev قابل مقایسه است.
واقعیت جالب: یک نسخه ی نمایشی مشابه همان چیزی بود که ما را متقاعد کرد که در مسیر System One Models به صورت همه جانبه برویم!
ما نوع جدیدی از ارزیابی را برای سنجش میزان عملکرد هوش مصنوعی در کد ایجاد کردیم. ما برای طبقهبندی حقیقت زمینی بهینهسازی نمیکنیم و اجازه نمیدهیم مهار و مدل تغییر کنند (به طور بالقوه امکان نصب بیش از حد از طریق مهندسی مهار). در عوض، فرض میکنیم که یک نمودار محاسباتی درست وجود دارد (یک «جریان کاری» که در کد نشان داده شده است) و از پیشبینیهای بزرگترین، هوشمندانهترین و گرانترین مدلهای خارجی به عنوان احتمالات مرجع استفاده میکنیم.
Rephrased: هر مدل گردش کار یکسانی دارد. ما آزمایش می کنیم که چگونه آنها را با میانگین هوشمندترین مدل ها (در این مورد، Astra و Fable) مقایسه می کنند.
Jev خارج از نمودار است - مالک مرز پارتو برای تقریبا 2 مرتبه بزرگی. ما همچنین با مدلهایی مقایسه میکنیم که یک اعلان تولید شده تمام منطق زنجیره فکرشان را انجام میدهند، اما این کار به طور قابلتوجهی بدتر از استفاده از خود گردش کار است.
توجه داشته باشید که تماسهای اینجا بسیار پیچیدهتر از نمایش کنار هم در بالا هستند. به این دلیل که آنها بیشتر نماینده انواع بارهای کاری تولیدی هستند که برای اتوماسیون واقعی کسب و کار مورد نیاز است. در زیر سادهترین مورد از 4 گردش کاری که منتشر میکنیم آمده است:
مطمئنترین جریانهای کاری دنیای واقعی دارای سؤالات مستقل و تجزیهشده زیادی هستند، با رفتاری دقیق که به جای تصمیمگیریهای گسسته، به احتمالات وابسته است. نتیجه نهایی، انشعاب گسسته است، اما نحوه رسیدن به پاسخ نهایی شامل بسیاری از مهندسی های خاص دامنه است که باید به طور مداوم انجام شود.
برای همه جزئیات به سایت ارزیابی گردش کار ما مراجعه کنید: مثال ها، اختلاف نظرها، پرس و جوهای کامل و هر گردش کار.
این جایی است که ادعاهای 193.6 برابر سریعتر، 444.6 برابر ارزانتر در صفحه اصلی ما از اینجا سرچشمه می گیرد، و ما انتظار داریم که این موارد در سطح بالاتری از دستاوردهای دنیای واقعی باشد.
این محتوای این گردشهای کاری عمدا انتخاب یا ساخته نشدهاند تا مدل ما خوب به نظر برسد، و در توزیع آموزشی ما نیستند. با این حال، آنها توسط افرادی در تیم قابلیتهای مدل ما ساخته شدهاند، بنابراین ممکن است برخی سوگیریها وجود داشته باشد.
ما از میانگین GPT-6 Astra و Fable 5.1 به عنوان پاسخ مرجع استفاده می کنیم که پاسخ ها را نسبت به مدل های OpenAI و Anthropic سوگیری می کند. ما احتمالا عملکرد نسبی مدل خود و مدل های DeepSeek را دست کم می گیریم.
LLM ها از پوشش LLM System One ما استفاده می کنند، که LLM ها را محدود می کند تا تصمیمات ساختاریافته سازگار با API ما را تولید کنند. ما متوجه شدهایم که این دقیقترین راه برای تصمیمگیری از LLM است، اما این روش کندتر و گرانتر از تصمیمگیری بدون احتمال است.
توهم و ایمنی نوع ذاتا به هم مرتبط هستند، و ما فکر میکنیم که دومی میز برای اتوماسیون است. داشتن یک فراخوانی توهمآمیز ابزار در یک عامل ناخوشایند است، اما اگر بخشی از یک سیستم با تضمین تأخیر باشد یا چندین لایه در اعماق یک زنجیره وابستگی مدفون شده باشد، یک معامله شکن مطلق است. مدلهای موجود، هر چقدر هم هوشمند باشند، همچنان توهم دارند و دارای خطاهای نوع هستند.
اعداد LLM از OpenRouter هستند، یعنی تقریبا به طور قطع در اینجا تعصب وجود دارد: پرس و جوهای پیچیده تر ممکن است به مدل های بهتر هدایت شوند.
تعداد ما تجربی نیست. تطابق طرحواره تضمین شده است، بنابراین می توانیم با اطمینان 0٪ را به نمودارها اضافه کنیم.
شاید هیجان انگیزترین بخش کار ما فعال کردن موارد استفاده جدید باشد. ما چیزهای بیشتری برای نشان دادن به شما داریم، اما در اینجا چند مورد مورد علاقه این تیم وجود دارد:
ما دوست داریم که چگونه این doomo doomo هوش بیدرنگ را نشان میدهد و چه کارهایی را میتوان با کد + AI انجام داد. مهندس پشت آن نگران انجام 10 پرس و جو در ثانیه بود (که در نهایت حدود 7 دلار در ساعت هزینه دارد)، اما بقیه ما قبول کردیم که کمتر از حد انتظار بود! این بسیار سرگرم کننده است که ما قصد داریم نه تنها یک بررسی عمیق منتشر کنیم، بلکه برخی رویدادها را برای هک کردن در این مورد میزبانی کنیم.
نسخه آزمایشی در حالت ساختار یافته به عنوان یک ساختار داده با متن است، نه روی تصاویر (هنوز…)
یک ربات Doom بدون هوش مصنوعی میتوانست بهتر بازی کند، اما ما رباتی میخواستیم که به نمایشهای مختلف وضعیت بازی واکنش نشان دهد و مهمتر از همه… دنبال کردن دستورالعملها بسیار جالب بود!
هدف بازی این است که از یک صفحه ویکیپدیا شروع شود و تنها با استفاده از پیوندهایی که در حین عبور با آنها مواجه میشوید، به یک صفحه خاص دیگر ویکیپدیا برسید. هر مرحله می تواند به معنای انتخاب بین صدها تا هزاران پیوند باشد! این یک زمین بازی عالی برای نشان دادن نه تنها هوش در ثانیه، بلکه همچنین مزایای ترکیبی عدم توهم با انتخابهای با کاردینالیته بالا است.
تا آنجا که ما می دانیم، هر دو چالش دوم و سوم با "اردک لاستیکی" شروع شدند. نویسنده تنها زمانی متوجه شد که تیم به آن اشاره کرد.
افزایش سرعت ما در اینجا نسبت به دموهای قبلی بسیار کمتر است. به این دلیل که این برخلاف حالتهای غیر استدلالی مدلها است (به جز Astra که روی پایینترین تنظیم استدلال تنظیم شده بود). به همین دلیل است که Jev تمایل داشت در مراحل کمتری به پایان برسد (نشانه ای از هوش بیشتر). این برای این بود که دمو برای تماشای قابل تحملتر شود. LLM ها در این کار بسیار بدتر از استدلال فعال به نظر می رسند.
Jev از یک کاردینالیتی تا 255 پشتیبانی میکند. برای انتخابهای با کاردینالیته بالاتر، ما یک سیستم 2 مرحلهای برای امتیازدهی بهطور مستقل انجام میدهیم و سپس یک انتخاب صریح انجام میدهیم، بنابراین کاهش سرعت گاه به گاه انجام میشود.
ما هنوز در روزهای اولیه Jev هستیم. ما چیزهای بیشتری در راه داریم و بسیار هیجان زده هستیم که به حمل و نقل ادامه دهیم 🔥.
امروز، ما دسترسی زودهنگام را باز می کنیم و توسعه دهندگان را تا جایی که می توانیم از لیست انتظار خارج می کنیم. ما میخواهیم بشنویم که کدام تصمیمها را باید خودکار کنید، Jev کجا کار میکند و کجا کوتاه میآید. به ما بگویید چه علمی تخیلی می خواهید بسازید!!
ما TypeSafe را راه اندازی کردیم زیرا معتقدیم که هوش مصنوعی به یک نرم افزار رابط نیاز دارد که می تواند به آن بستگی داشته باشد. ما نمی توانیم منتظر باشیم تا موارد استفاده جدید به طور مداوم در جامعه و اقتصاد منتشر شود.
نام های «System One Models» و «Jev» از کجا آمده اند؟
ما از دانیل کانمن، تفکر، سریع و آهسته الهام گرفتیم. نام کلاس مدل بر اساس تمایز بین تفکر سریع و شهودی سیستم 1 و استدلال آهسته و عمدی سیستم 2 است.
"تفکر سیستم 1" نیز مستلزم خطا است. به دلایلی که در آینده به آنها خواهیم پرداخت، ما معتقدیم که System One Models را می توان قابل اعتمادتر از جایگزین های آن ساخت.
ما Jev را به افتخار ویلیام استنلی جوونز نامگذاری کردیم. ما انتظار داریم که هوش ماشینی مسیری مشابه زغال سنگ را دنبال کند، زیرا راندمان موتور بخار منجر به افزایش تقاضا شد. هر مرتبه کاهش در هزینه اطلاعات، موارد استفاده بیشتری را باز می کند.
Jev چگونه در برابر معیارهای عمومی عمل می کند؟
اینها نتایج به نوعی دیوانه کننده هستند - چگونه ممکن است؟
متن اصلی (انگلیسی)
Introducing System One Models and Jev
Article URL: https://typesafe.ai/blog/introducing-system-one-models-and-jev Comments URL: https://news.ycombinator.com/item?id=49717558 Points: 276 # Comments: 95