پرش به محتوای اصلی

معرفی System One Models و Jev

هکرنیوز۱۴۰۵ شهریور ۲۴, سه‌شنبه، ساعت ۲۲:۵۵حدود 10 دقیقه مطالعه

آدرس مقاله: https://typesafe.ai/blog/introducing-system-one-models-and-jev آدرس نظرات: https://news.ycombinator.com/item?id=49717558 امتیاز: 276 # نظرات: 95

مدل‌ها سال‌هاست که در چت مافوق بشر بوده‌اند، پس این همه اتوماسیون کجاست؟

این سوال رانندگی من در چهار سال گذشته بوده است. در OpenAI، من به ساخت روش‌هایی کمک کردم که مدل‌های زبان را در پیروی از دستورالعمل‌ها و صحبت با مردم مفید می‌کردند. آن کار به عنوان تحقیق پشت ChatGPT به پایان رسید. در آن زمان، فکر می‌کردم شاید مدل‌های چت به AGI منتهی شوند، اما علیرغم تبلیغات تبلیغاتی، برایم آشکار شد که چیزی واقعا بزرگ گم شده است.

پس از دو سال مخفی کاری، چالش‌های فنی بی‌شمار و پیشرفت‌های تحقیقاتی... من بسیار هیجان‌زده هستم که اعلام کنم امروز، TypeSafe AI اولین مدل System One ما را منتشر می‌کند: کلاس جدیدی از مدل‌های مرزی که برای تصمیم‌گیری سریع و ساختار یافته ساخته شده‌اند که نرم‌افزار می‌تواند مستقیما از آن استفاده کند.

ما یک پشته جدید کاملا متمرکز بر اتوماسیون ساختیم: با معماری مدل جدید، نمونه‌گر موازی برای حداکثر کارایی، و روش آموزشی که آن را یادگیری تقویتی برای تصمیمات کالیبره شده (RLCD) می‌نامیم.

اولین مدل عمومی ما Jev است که امروز در دسترسی اولیه در دسترس است. Jev به سطوح مشابهی از هوش در وظایف سیستم یک در مقایسه با LLM های موجود دست می یابد، در حالی که دو مرتبه سریعتر و کارآمدتر است. در حالی که Jev تولید رشته را رها می کند، برای خروجی های ساختاریافته بهینه شده است و نمی تواند توهم داشته باشد.

Jev را به عنوان یک فراخوان تابع هوش مرزی در نظر بگیرید: حالت بدون ساختار، تصمیمات احتمالی تایپ شده خارج شده است.

ادعاهای فوق‌العاده به شواهد فوق‌العاده نیاز دارند، بنابراین برای دریافت رسید به زیر مراجعه کنید. 💅

یادگیری تقویتی با بازخورد انسانی (RLHF) / یادگیری تقویتی با پاداش های قابل تأیید (RLVR)

یادگیری تقویتی برای تصمیمات کالیبره شده (RLCD)

ترجیحات انسانی: نوشته‌ها و پاسخ‌های چت که ارزیابی‌کنندگان انسانی ترجیح می‌دهند.

پاداش‌های قابل تأیید: خروجی‌هایی که می‌توانند به‌صورت برنامه‌ریزی تأیید شوند.

تصمیمات کالیبره شده: پاسخ هایی با احتمالات معرفتی صادقانه در مورد وظایف سیستم یک.

داده های بدون ساختار (مانند متن) با تاکید بر پیام های متوالی.

داده های بدون ساختار (به عنوان مثال متن) با تاکید بر وضعیت برنامه ساخت یافته .

رشته ها / متن تولید شده رشته‌ها انعطاف‌پذیر هستند و می‌توانند هر چیزی باشند: پاسخ‌های چت، کد، توهم، امتناع، یا حتی مقادیر ساختاری ایمن. برای استفاده توسط نرم افزار، پاسخ ها باید تجزیه و تایید شوند. همچنین همیشه خطری وجود دارد که هوش مصنوعی از ریل خارج شود.

مقادیر ساختاری ایمن نوع. خروجی ها و ساختار ممکن از قبل تعریف شده است. این مدل هرگز اشتباهات تایپ نمی کند. همه پاسخ ها با احتمالات کالیبره شده و نمرات اطمینان همراه هستند.

متوالی. یک توکن را در یک زمان تولید می کند که هر کدام مشروط به آخرین.

موازی. تمام خروجی ها را در یک پرس و جو ایجاد می کند. فوق العاده کارآمد و سخت افزاری.

توکن‌های خروجی: 5 برابر گران‌تر از توکن‌های ورودی.

توکن های ورودی: 0.042 دلار / MTok (42 دلار در هر میلیارد توکن).

زمان پاسخگویی انتها به انتها برای مدل های مرزی بین 3 تا 329 ثانیه است. برای ارتباط با انسان ها به اندازه کافی سریع است، اما وقتی در کد یکپارچه می شود، یک گلوگاه بزرگ است.

زمان پاسخ انتها به انتها برای TypeSafe 70ms-500ms است. این می تواند از 40x200x سریعتر برای همان سطوح هوش مرزی برای پرس و جوهای شکل سیستم یک متغیر باشد.

حتی اگر برای برآورد اطمینان از آنها خواسته شود، مدل‌ها بیش از حد مطمئن و ناسازگار هستند. اگر مدلی بتواند در 95 درصد مواقع یک کار را انجام دهد اما نگوید که چه زمانی در 5 درصد است، نمی‌تواند آن کار را خودکار کند.

همیشه با هر خروجی با اطمینان و عدم اطمینان ارتباط برقرار می کند. کالیبره شده: اطمینان بیشتر به معنای دقت بالاتر است. سازگارتر: پاسخ‌های مشابه را برای ورودی‌های مشابه برمی‌گرداند.

وظایف انسان در حلقه (چت ربات، کمک خلبان، عوامل کدنویسی). عمومی و قدرتمند، اما مستلزم نظارت انسانی است زیرا آزادی آنها همچنین به این معنی است که ممکن است از ریل خارج شوند.

مسائل قابل تایید (برهان های ریاضی، بهینه سازی هسته). هنگامی که صحت می تواند به صورت ارزان و خودکار بررسی شود، LLM ها می توانند تولید، آزمایش و تکرار کنند تا زمانی که چیزی را پیدا کنند که کار می کند.

دموها انعطاف‌پذیری رشته‌ها باعث می‌شود که برای ساخت سریع نمونه‌های اولیه که فقط گاهی اوقات کار می‌کنند، باورنکردنی باشد.

گردش کار با هوش مصنوعی / بیانیه های هوشمند اگر. خروجی‌های ساختاریافته به عنوان قوانین تصمیم‌گیری فازی در نرم‌افزار معمولی جای می‌گیرند: طبقه‌بندی، مسیر، امتیاز، استخراج، یا شاخه‌ای که منطق دست‌نویس خیلی شکننده است. کدهای اطراف آزادی آن‌ها را محدود می‌کند و ترکیب آن‌ها را در سیستم‌های قابل اعتماد آسان‌تر می‌کند.

کاهش نقشه بر روی داده های بزرگ. پتابایت داده را به ویژگی ها و بینش تبدیل کنید. برنامه های بلادرنگ سرعت 100 میلی‌ثانیه به این معنی است که می‌توانید از هوش مصنوعی در برنامه‌های خود در جایی که UX حیاتی است استفاده کنید. همه چیز را تأیید کنید. امتیاز دهید، قضاوت کنید، تأیید کنید، حفاظ کنید، و جیلبریک‌های درخواست‌های LLM، ردپای استدلال و/یا خروجی‌ها را شناسایی کنید.

ما شکاکان را دوست داریم و خودمان هم شک داریم.

سرعت در هر تماس: ما واقعا به این سرعت هستیم، اگرچه ارزیابی‌های منتشر شده ما معمولا از لپ‌تاپ‌های ما در ساحل غربی اجرا می‌شوند (این جایی است که سرویس ما در حال حاضر مستقر است).

هزینه هر تماس: ما قیمت گذاری خود را شفاف می کنیم. ما نمی توانیم ثابت کنیم که یارانه نیست. ما برای اثبات پایداری قیمت گذاری خود (که انتظار داریم کاهش یابد، نه افزایش) به دراز مدت نیاز داریم.

بدون خطای نوع: جعل کردن این امر با یک مثال ساده ساده است، اما از نظر ریاضی غیرممکن است.

برای ادعاهای جسورانه‌تر خود، می‌خواهیم تا جایی که می‌توانیم تفاوت‌های ظریف را ارائه دهیم.

نسخه ی نمایشی جانبی ما یک تفاوت کلیدی بین مدل های ما و LLM ها را نشان می دهد: Jev به جای اینکه به صورت خودکار توسط توکن تولید کند، همه احتمالات را به صورت موازی خروجی می دهد. رشته ها بسیار قدرتمند و عمومی هستند، اما هزینه بر هستند. "تسلیم شدن" تارها در واقع به ما قدرت های فوق العاده زیادی می دهد!

برای افرادی که دسترسی اولیه به TypeSafe دارند، در اینجا درخواست واقعی وجود دارد.

پرس و جو بسیار ساده شده است و سوالات به گونه ای انتخاب شدند که دارای کلیدهای توصیفی و قابل خواندن توسط انسان باشند تا خروجی روی صفحه قابل درک باشد.

حالت همچنین پاراگراف کوتاه، متراکم و مفصلی است تا بر تفاوت در روش نمونه‌گیری تأکید کند. ورودی نسبتا کوتاه‌تر، مدل ما را در نور مناسبی رنگ می‌کند.

برای افراد مشتاق، برای اجرای ضبط شده، تنها اختلاف نظر با GPT-5.6 Terra در "سطح احتمال ریزش" است. پاسخ واقعی به نظر ما واقعا مبهم است.

ما از GPT-5.6 Terra با استدلال پیش‌فرض برای این مثال استفاده کردیم، زیرا دریافتیم که به طور متوسط ​​از نظر هوش با Jev قابل مقایسه است.

واقعیت جالب: یک نسخه ی نمایشی مشابه همان چیزی بود که ما را متقاعد کرد که در مسیر System One Models به صورت همه جانبه برویم!

ما نوع جدیدی از ارزیابی را برای سنجش میزان عملکرد هوش مصنوعی در کد ایجاد کردیم. ما برای طبقه‌بندی حقیقت زمینی بهینه‌سازی نمی‌کنیم و اجازه نمی‌دهیم مهار و مدل تغییر کنند (به طور بالقوه امکان نصب بیش از حد از طریق مهندسی مهار). در عوض، فرض می‌کنیم که یک نمودار محاسباتی درست وجود دارد (یک «جریان کاری» که در کد نشان داده شده است) و از پیش‌بینی‌های بزرگ‌ترین، هوشمندانه‌ترین و گران‌ترین مدل‌های خارجی به عنوان احتمالات مرجع استفاده می‌کنیم.

Rephrased: هر مدل گردش کار یکسانی دارد. ما آزمایش می کنیم که چگونه آنها را با میانگین هوشمندترین مدل ها (در این مورد، Astra و Fable) مقایسه می کنند.

Jev خارج از نمودار است - مالک مرز پارتو برای تقریبا 2 مرتبه بزرگی. ما همچنین با مدل‌هایی مقایسه می‌کنیم که یک اعلان تولید شده تمام منطق زنجیره فکرشان را انجام می‌دهند، اما این کار به طور قابل‌توجهی بدتر از استفاده از خود گردش کار است.

توجه داشته باشید که تماس‌های اینجا بسیار پیچیده‌تر از نمایش کنار هم در بالا هستند. به این دلیل که آنها بیشتر نماینده انواع بارهای کاری تولیدی هستند که برای اتوماسیون واقعی کسب و کار مورد نیاز است. در زیر ساده‌ترین مورد از 4 گردش کاری که منتشر می‌کنیم آمده است:

مطمئن‌ترین جریان‌های کاری دنیای واقعی دارای سؤالات مستقل و تجزیه‌شده زیادی هستند، با رفتاری دقیق که به جای تصمیم‌گیری‌های گسسته، به احتمالات وابسته است. نتیجه نهایی، انشعاب گسسته است، اما نحوه رسیدن به پاسخ نهایی شامل بسیاری از مهندسی های خاص دامنه است که باید به طور مداوم انجام شود.

برای همه جزئیات به سایت ارزیابی گردش کار ما مراجعه کنید: مثال ها، اختلاف نظرها، پرس و جوهای کامل و هر گردش کار.

این جایی است که ادعاهای 193.6 برابر سریعتر، 444.6 برابر ارزانتر در صفحه اصلی ما از اینجا سرچشمه می گیرد، و ما انتظار داریم که این موارد در سطح بالاتری از دستاوردهای دنیای واقعی باشد.

این محتوای این گردش‌های کاری عمدا انتخاب یا ساخته نشده‌اند تا مدل ما خوب به نظر برسد، و در توزیع آموزشی ما نیستند. با این حال، آن‌ها توسط افرادی در تیم قابلیت‌های مدل ما ساخته شده‌اند، بنابراین ممکن است برخی سوگیری‌ها وجود داشته باشد.

ما از میانگین GPT-6 Astra و Fable 5.1 به عنوان پاسخ مرجع استفاده می کنیم که پاسخ ها را نسبت به مدل های OpenAI و Anthropic سوگیری می کند. ما احتمالا عملکرد نسبی مدل خود و مدل های DeepSeek را دست کم می گیریم.

LLM ها از پوشش LLM System One ما استفاده می کنند، که LLM ها را محدود می کند تا تصمیمات ساختاریافته سازگار با API ما را تولید کنند. ما متوجه شده‌ایم که این دقیق‌ترین راه برای تصمیم‌گیری از LLM است، اما این روش کندتر و گران‌تر از تصمیم‌گیری بدون احتمال است.

توهم و ایمنی نوع ذاتا به هم مرتبط هستند، و ما فکر می‌کنیم که دومی میز برای اتوماسیون است. داشتن یک فراخوانی توهم‌آمیز ابزار در یک عامل ناخوشایند است، اما اگر بخشی از یک سیستم با تضمین تأخیر باشد یا چندین لایه در اعماق یک زنجیره وابستگی مدفون شده باشد، یک معامله شکن مطلق است. مدل‌های موجود، هر چقدر هم هوشمند باشند، همچنان توهم دارند و دارای خطاهای نوع هستند.

اعداد LLM از OpenRouter هستند، یعنی تقریبا به طور قطع در اینجا تعصب وجود دارد: پرس و جوهای پیچیده تر ممکن است به مدل های بهتر هدایت شوند.

تعداد ما تجربی نیست. تطابق طرحواره تضمین شده است، بنابراین می توانیم با اطمینان 0٪ را به نمودارها اضافه کنیم.

شاید هیجان انگیزترین بخش کار ما فعال کردن موارد استفاده جدید باشد. ما چیزهای بیشتری برای نشان دادن به شما داریم، اما در اینجا چند مورد مورد علاقه این تیم وجود دارد:

ما دوست داریم که چگونه این doomo doomo هوش بی‌درنگ را نشان می‌دهد و چه کارهایی را می‌توان با کد + AI انجام داد. مهندس پشت آن نگران انجام 10 پرس و جو در ثانیه بود (که در نهایت حدود 7 دلار در ساعت هزینه دارد)، اما بقیه ما قبول کردیم که کمتر از حد انتظار بود! این بسیار سرگرم کننده است که ما قصد داریم نه تنها یک بررسی عمیق منتشر کنیم، بلکه برخی رویدادها را برای هک کردن در این مورد میزبانی کنیم.

نسخه آزمایشی در حالت ساختار یافته به عنوان یک ساختار داده با متن است، نه روی تصاویر (هنوز…)

یک ربات Doom بدون هوش مصنوعی می‌توانست بهتر بازی کند، اما ما رباتی می‌خواستیم که به نمایش‌های مختلف وضعیت بازی واکنش نشان دهد و مهم‌تر از همه… دنبال کردن دستورالعمل‌ها بسیار جالب بود!

هدف بازی این است که از یک صفحه ویکی‌پدیا شروع شود و تنها با استفاده از پیوندهایی که در حین عبور با آن‌ها مواجه می‌شوید، به یک صفحه خاص دیگر ویکی‌پدیا برسید. هر مرحله می تواند به معنای انتخاب بین صدها تا هزاران پیوند باشد! این یک زمین بازی عالی برای نشان دادن نه تنها هوش در ثانیه، بلکه همچنین مزایای ترکیبی عدم توهم با انتخاب‌های با کاردینالیته بالا است.

تا آنجا که ما می دانیم، هر دو چالش دوم و سوم با "اردک لاستیکی" شروع شدند. نویسنده تنها زمانی متوجه شد که تیم به آن اشاره کرد.

افزایش سرعت ما در اینجا نسبت به دموهای قبلی بسیار کمتر است. به این دلیل که این برخلاف حالت‌های غیر استدلالی مدل‌ها است (به جز Astra که روی پایین‌ترین تنظیم استدلال تنظیم شده بود). به همین دلیل است که Jev تمایل داشت در مراحل کمتری به پایان برسد (نشانه ای از هوش بیشتر). این برای این بود که دمو برای تماشای قابل تحمل‌تر شود. LLM ها در این کار بسیار بدتر از استدلال فعال به نظر می رسند.

Jev از یک کاردینالیتی تا 255 پشتیبانی می‌کند. برای انتخاب‌های با کاردینالیته بالاتر، ما یک سیستم 2 مرحله‌ای برای امتیازدهی به‌طور مستقل انجام می‌دهیم و سپس یک انتخاب صریح انجام می‌دهیم، بنابراین کاهش سرعت گاه به گاه انجام می‌شود.

ما هنوز در روزهای اولیه Jev هستیم. ما چیزهای بیشتری در راه داریم و بسیار هیجان زده هستیم که به حمل و نقل ادامه دهیم 🔥.

امروز، ما دسترسی زودهنگام را باز می کنیم و توسعه دهندگان را تا جایی که می توانیم از لیست انتظار خارج می کنیم. ما می‌خواهیم بشنویم که کدام تصمیم‌ها را باید خودکار کنید، Jev کجا کار می‌کند و کجا کوتاه می‌آید. به ما بگویید چه علمی تخیلی می خواهید بسازید!!

ما TypeSafe را راه اندازی کردیم زیرا معتقدیم که هوش مصنوعی به یک نرم افزار رابط نیاز دارد که می تواند به آن بستگی داشته باشد. ما نمی توانیم منتظر باشیم تا موارد استفاده جدید به طور مداوم در جامعه و اقتصاد منتشر شود.

نام های «System One Models» و «Jev» از کجا آمده اند؟

ما از دانیل کانمن، تفکر، سریع و آهسته الهام گرفتیم. نام کلاس مدل بر اساس تمایز بین تفکر سریع و شهودی سیستم 1 و استدلال آهسته و عمدی سیستم 2 است.

"تفکر سیستم 1" نیز مستلزم خطا است. به دلایلی که در آینده به آنها خواهیم پرداخت، ما معتقدیم که System One Models را می توان قابل اعتمادتر از جایگزین های آن ساخت.

ما Jev را به افتخار ویلیام استنلی جوونز نامگذاری کردیم. ما انتظار داریم که هوش ماشینی مسیری مشابه زغال سنگ را دنبال کند، زیرا راندمان موتور بخار منجر به افزایش تقاضا شد. هر مرتبه کاهش در هزینه اطلاعات، موارد استفاده بیشتری را باز می کند.

Jev چگونه در برابر معیارهای عمومی عمل می کند؟

اینها نتایج به نوعی دیوانه کننده هستند - چگونه ممکن است؟

خواندن متن کامل در هکرنیوزبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

Introducing System One Models and Jev

Article URL: https://typesafe.ai/blog/introducing-system-one-models-and-jev Comments URL: https://news.ycombinator.com/item?id=49717558 Points: 276 # Comments: 95

همه‌ی اخبار فناوری