پرش به محتوای اصلی

Vals با پشتیبانی آندرسن هوروویتز به دنبال تبدیل شدن به استاندارد طلایی برای محک زدن هوش مصنوعی است.

تک‌کرانچ۱۴۰۵ شهریور ۲۸, شنبه، ساعت ۱۶:۳۰حدود 5 دقیقه مطالعه

Vals AI امیدوار است در دنیایی که به طور فزاینده ای توسط مدل های هوش مصنوعی غرق شده است، معیارهای هوش مصنوعی را به منبعی خنثی تر و قابل اعتمادتر تبدیل کند.

بنچمارک کردن به یک استاندارد صنعتی تبدیل شده است که چگونه شرکت‌های هوش مصنوعی قابلیت‌های مدل‌های خود را اعتبار می‌دهند و وقتی معیارها به نفع آنها تغییر می‌کند، از رقبا متمایز می‌شوند و برتری خود را تبلیغ می‌کنند. به عبارت دیگر، معیارهای خوب تقریبا همیشه به معنای روابط عمومی خوب هستند.

متأسفانه، شرکت‌ها همچنین متوجه شده‌اند که چگونه از سیستم‌های بنچمارک قدیمی غلبه کنند - که بسیاری از آنها قدیمی‌تر هستند و برای اندازه‌گیری قابلیت‌های مدل‌های مدرن ساخته نشده‌اند.

رایان کریشنان، بنیانگذار 25 ساله این شرکت، قبلا در Palantir کارآموزی کرده بود و به عنوان دانشجوی کارشناسی در استنفورد، برای مایکروسافت و آزمایشگاه هوش مصنوعی بسیار تحسین شده مدرسه کار می کرد. کریشنان می‌گوید که والس از مشاهدات خودش در مورد اینکه چگونه معیارسازی از پیشرفت‌های صنعتی که برای اندازه‌گیری طراحی شده بود عقب می‌ماند، متولد شد.

کریشنان به اشتراک می‌گذارد: «ما شاهد آمدن یک سری مدل‌های جدید و بسیار توانا بودیم که به سرعت به بازار آمدند، و معیارهای آکادمیک [با آن پیشرفت مرزی مطابقت نداشتند». کریشن گفت: با ادغام هوش مصنوعی در هر بخش از جامعه، معیارهایی باید واقعا وجود داشته باشد تا تأیید کند که مدل‌ها می‌توانند کاری را که شرکت‌ها تبلیغ می‌کنند انجام دهند.

هفته گذشته، بنیانگذار جوان دفتر دو طبقه شرکتش را در خیابان فولسوم سانفرانسیسکو به من نشان داد - یک ساختمان آجری قدیمی که یک قرن پیش، محل یک آبجوسازی بزرگ بود. این ساختار تاریخی به جای تولید آبجو صنعتی، اکنون میزبان تعدادی استارتاپ مختلف است که به دنبال عرضه آینده صنعت فناوری هستند.

کریشن به من می گوید: «از لحاظ تاریخی، فکر می کنم ارزیابی برای ارزیابی هوش به روشی بسیار انتزاعی انجام شده است. "مثلا، آیا مدل ها اطلاعات کافی برای شرکت در آزمون نوع آزمون وکالت را می دانند؟"

در اینجا، والس به دنبال متمایز ساختن خود است. در حالی که بسیاری از سیستم‌های بنچمارک تست‌هایی را ارائه می‌کنند که به صورت عمومی در دسترس هستند (این می‌تواند به شرکت اجازه دهد تا مدل خود را در برابر آن تست‌ها آموزش دهد، بنابراین احتمالا در امتحان خود تقلب می‌کند)، Vals مواد آزمایشی خاص خود را به‌طور عمومی افشا نمی‌کند. به جای اندازه‌گیری دانش عمومی یک مدل هوش مصنوعی، Vals همچنین مدل‌ها را بر اساس توانایی آنها در تکمیل وظایف پیچیده مرتبط با صنایع خاص مانند قانون، امور مالی و کدنویسی ارزیابی می‌کند.

کریشنان گفت: «کاری که ما انجام می‌دهیم در واقع بررسی تأثیرات واقعی مدل‌ها است. "آیا آنها می توانند کاری انجام دهند که محصولی با کیفیتی مشابه انسان در هر حوزه ای تولید کند؟"

او می گوید، ایده این است که نه تنها نتایج مثبت، بلکه برای نتایج منفی نیز بررسی شود. امید این است که تجزیه و تحلیل شود که «اگر این مدل‌ها در جهان بی‌حرمت باشند، پیامدهای منفی آن چه خواهد بود».

قابلیت هایی که Vals در حال اندازه گیری است در حال رشد است. علاوه بر صنایع سنتی تر، این استارتاپ همچنان به سمت زمین های منحصر به فرد تر حرکت می کند. کریشن به اشتراک می‌گذارد: "ما معیاری برای بهبود خود بازگشتی داریم. ما در حال انجام برخی کارها در زمینه سلامت روان، امنیت سایبری، امنیت زیستی و حتی قانون درگیری‌های مسلحانه به مدل‌ها برای درک نحوه اعمال کنوانسیون ژنو هستیم."

شرکت‌ها برای آزمایش مدل‌هایشان به Vals پول می‌دهند، که می‌تواند یک مفهوم عجیب و غریب باشد. چرا یک شرکت باید هزینه کند تا بفهمد مدلش خوب عمل نمی کند؟ اما داشتن یک اندازه گیری موثر به شرکت ها کمک می کند تا در طول زمان عیب یابی و بهبود پیدا کنند. کریشنان مدل درآمدی خود را با نحوه پرداخت هزینه یک دانشجو به هیئت کالج برای شرکت در SAT مقایسه می کند.

به نوبه خود، این ارزیابی ها به عوامل کلیدی تصمیم گیری برای شرکت هایی تبدیل می شوند که به دنبال دستیابی به مدل های جدید هوش مصنوعی هستند.

این استارت آپ اخیرا فاش کرده است که درآمد آن در حال حاضر هشت برابر سال گذشته است. کارکنان آن نیز در حال افزایش است. Vals که سال را تنها با هشت نفر آغاز کرد، در حال حاضر سه برابر شده و به یک تیم 25 نفره رسیده است. کریشنان گفت که با رشد استارتاپ، برنامه این است که به یک دفتر بسیار بزرگتر منتقل شود و همچنین 10 تا 15 نفر دیگر نیز استخدام شوند. این شرکت همچنین اخیرا برنامه ای را با محوریت ارائه ارزیابی مدل به آژانس های فدرال راه اندازی کرده است.

کریشنان سیستم بنچمارک شرکتش را آینده نحوه تفکر شرکت های هوش مصنوعی در مورد رشد کسب و کار خود و ایجاد اعتماد عمومی می داند.

شرکت‌های هوش مصنوعی شروع به عمومی شدن کرده‌اند. SpaceX عمومی شد. Anthropic برای اواخر امسال برنامه ریزی شده است. من گمان می‌کنم که OpenAI به زودی عمومی شود. فکر می‌کنم با تبدیل شدن مدل‌های هوش مصنوعی به بخش اصلی اقتصاد و انتشار گسترده‌تر، انواع معیارها و ارزیابی‌هایی که ما انجام می‌دهیم، استفاده از آن‌ها را هدایت می‌کنند و بخش مهمی از صحبت‌های این شرکت‌ها برای ارائه اطلاعات عمومی در مورد این شرکت‌ها خواهد بود. هوش مصنوعی،» او گفت.

وقتی از طریق پیوندهای موجود در مقالات ما خرید می کنید، ممکن است کمیسیون کمی کسب کنیم. این بر استقلال تحریریه ما تأثیر نمی گذارد.

آخرین روز برای رزرو میز نمایشگاه، 18 سپتامبر است. سرنخ های پر تاثیر، دسترسی سرمایه گذاران، و کانون توجه برند در سالن نمایشگاه Disrupt را از دست ندهید.

نوع جدیدی از مدل هوش مصنوعی از مخترع ChatGPT توسعه دهندگان تیم فرنهولز را هیجان زده کرده است.

OpenAI مدل های خود را گرفتار کرد که برای جانشینان یادداشت می گذاشتند تا رفتار بد ربکا بلان را پنهان کنند

ربکا بلان نشان می دهد که مدیر مایکروسافت خراشیدن با هوش مصنوعی را «بزرگترین سرقت نیروی کار در تاریخ بشر» می داند.

استارت آپ فناوری پاک Fluxnium راهی برای بهره برداری از سوخت هسته ای 50000 ساله تیم دی چانت پیدا کرد.

مدل استدلال جدید Salesforce و Nvidia همه چیزهایی است که آزمایشگاه‌های هوش مصنوعی باید از جولی بورت بترسند.

جنسن هوانگ با ترامپ تماس گرفت و چیز دیگری را نیز به نمایش گذاشت، کانی لویزوس

9 استارت‌آپ پرطرفدار از آخرین روز نمایشی Y Combinator، به گفته VCs Marina Temkin Dominic-Madori Davis

خواندن متن کامل در تک‌کرانچبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

Vals, backed by Andreessen Horowitz, is looking to become the gold standard for AI benchmarking

Vals AI is hoping to make AI benchmarking a more neutral and trustworthy resource in a world increasingly inundated by AI models.

همه‌ی اخبار فناوری