Vals با پشتیبانی آندرسن هوروویتز به دنبال تبدیل شدن به استاندارد طلایی برای محک زدن هوش مصنوعی است.
Vals AI امیدوار است در دنیایی که به طور فزاینده ای توسط مدل های هوش مصنوعی غرق شده است، معیارهای هوش مصنوعی را به منبعی خنثی تر و قابل اعتمادتر تبدیل کند.
بنچمارک کردن به یک استاندارد صنعتی تبدیل شده است که چگونه شرکتهای هوش مصنوعی قابلیتهای مدلهای خود را اعتبار میدهند و وقتی معیارها به نفع آنها تغییر میکند، از رقبا متمایز میشوند و برتری خود را تبلیغ میکنند. به عبارت دیگر، معیارهای خوب تقریبا همیشه به معنای روابط عمومی خوب هستند.
متأسفانه، شرکتها همچنین متوجه شدهاند که چگونه از سیستمهای بنچمارک قدیمی غلبه کنند - که بسیاری از آنها قدیمیتر هستند و برای اندازهگیری قابلیتهای مدلهای مدرن ساخته نشدهاند.
رایان کریشنان، بنیانگذار 25 ساله این شرکت، قبلا در Palantir کارآموزی کرده بود و به عنوان دانشجوی کارشناسی در استنفورد، برای مایکروسافت و آزمایشگاه هوش مصنوعی بسیار تحسین شده مدرسه کار می کرد. کریشنان میگوید که والس از مشاهدات خودش در مورد اینکه چگونه معیارسازی از پیشرفتهای صنعتی که برای اندازهگیری طراحی شده بود عقب میماند، متولد شد.
کریشنان به اشتراک میگذارد: «ما شاهد آمدن یک سری مدلهای جدید و بسیار توانا بودیم که به سرعت به بازار آمدند، و معیارهای آکادمیک [با آن پیشرفت مرزی مطابقت نداشتند». کریشن گفت: با ادغام هوش مصنوعی در هر بخش از جامعه، معیارهایی باید واقعا وجود داشته باشد تا تأیید کند که مدلها میتوانند کاری را که شرکتها تبلیغ میکنند انجام دهند.
هفته گذشته، بنیانگذار جوان دفتر دو طبقه شرکتش را در خیابان فولسوم سانفرانسیسکو به من نشان داد - یک ساختمان آجری قدیمی که یک قرن پیش، محل یک آبجوسازی بزرگ بود. این ساختار تاریخی به جای تولید آبجو صنعتی، اکنون میزبان تعدادی استارتاپ مختلف است که به دنبال عرضه آینده صنعت فناوری هستند.
کریشن به من می گوید: «از لحاظ تاریخی، فکر می کنم ارزیابی برای ارزیابی هوش به روشی بسیار انتزاعی انجام شده است. "مثلا، آیا مدل ها اطلاعات کافی برای شرکت در آزمون نوع آزمون وکالت را می دانند؟"
در اینجا، والس به دنبال متمایز ساختن خود است. در حالی که بسیاری از سیستمهای بنچمارک تستهایی را ارائه میکنند که به صورت عمومی در دسترس هستند (این میتواند به شرکت اجازه دهد تا مدل خود را در برابر آن تستها آموزش دهد، بنابراین احتمالا در امتحان خود تقلب میکند)، Vals مواد آزمایشی خاص خود را بهطور عمومی افشا نمیکند. به جای اندازهگیری دانش عمومی یک مدل هوش مصنوعی، Vals همچنین مدلها را بر اساس توانایی آنها در تکمیل وظایف پیچیده مرتبط با صنایع خاص مانند قانون، امور مالی و کدنویسی ارزیابی میکند.
کریشنان گفت: «کاری که ما انجام میدهیم در واقع بررسی تأثیرات واقعی مدلها است. "آیا آنها می توانند کاری انجام دهند که محصولی با کیفیتی مشابه انسان در هر حوزه ای تولید کند؟"
او می گوید، ایده این است که نه تنها نتایج مثبت، بلکه برای نتایج منفی نیز بررسی شود. امید این است که تجزیه و تحلیل شود که «اگر این مدلها در جهان بیحرمت باشند، پیامدهای منفی آن چه خواهد بود».
قابلیت هایی که Vals در حال اندازه گیری است در حال رشد است. علاوه بر صنایع سنتی تر، این استارتاپ همچنان به سمت زمین های منحصر به فرد تر حرکت می کند. کریشن به اشتراک میگذارد: "ما معیاری برای بهبود خود بازگشتی داریم. ما در حال انجام برخی کارها در زمینه سلامت روان، امنیت سایبری، امنیت زیستی و حتی قانون درگیریهای مسلحانه به مدلها برای درک نحوه اعمال کنوانسیون ژنو هستیم."
شرکتها برای آزمایش مدلهایشان به Vals پول میدهند، که میتواند یک مفهوم عجیب و غریب باشد. چرا یک شرکت باید هزینه کند تا بفهمد مدلش خوب عمل نمی کند؟ اما داشتن یک اندازه گیری موثر به شرکت ها کمک می کند تا در طول زمان عیب یابی و بهبود پیدا کنند. کریشنان مدل درآمدی خود را با نحوه پرداخت هزینه یک دانشجو به هیئت کالج برای شرکت در SAT مقایسه می کند.
به نوبه خود، این ارزیابی ها به عوامل کلیدی تصمیم گیری برای شرکت هایی تبدیل می شوند که به دنبال دستیابی به مدل های جدید هوش مصنوعی هستند.
این استارت آپ اخیرا فاش کرده است که درآمد آن در حال حاضر هشت برابر سال گذشته است. کارکنان آن نیز در حال افزایش است. Vals که سال را تنها با هشت نفر آغاز کرد، در حال حاضر سه برابر شده و به یک تیم 25 نفره رسیده است. کریشنان گفت که با رشد استارتاپ، برنامه این است که به یک دفتر بسیار بزرگتر منتقل شود و همچنین 10 تا 15 نفر دیگر نیز استخدام شوند. این شرکت همچنین اخیرا برنامه ای را با محوریت ارائه ارزیابی مدل به آژانس های فدرال راه اندازی کرده است.
کریشنان سیستم بنچمارک شرکتش را آینده نحوه تفکر شرکت های هوش مصنوعی در مورد رشد کسب و کار خود و ایجاد اعتماد عمومی می داند.
شرکتهای هوش مصنوعی شروع به عمومی شدن کردهاند. SpaceX عمومی شد. Anthropic برای اواخر امسال برنامه ریزی شده است. من گمان میکنم که OpenAI به زودی عمومی شود. فکر میکنم با تبدیل شدن مدلهای هوش مصنوعی به بخش اصلی اقتصاد و انتشار گستردهتر، انواع معیارها و ارزیابیهایی که ما انجام میدهیم، استفاده از آنها را هدایت میکنند و بخش مهمی از صحبتهای این شرکتها برای ارائه اطلاعات عمومی در مورد این شرکتها خواهد بود. هوش مصنوعی،» او گفت.
وقتی از طریق پیوندهای موجود در مقالات ما خرید می کنید، ممکن است کمیسیون کمی کسب کنیم. این بر استقلال تحریریه ما تأثیر نمی گذارد.
آخرین روز برای رزرو میز نمایشگاه، 18 سپتامبر است. سرنخ های پر تاثیر، دسترسی سرمایه گذاران، و کانون توجه برند در سالن نمایشگاه Disrupt را از دست ندهید.
نوع جدیدی از مدل هوش مصنوعی از مخترع ChatGPT توسعه دهندگان تیم فرنهولز را هیجان زده کرده است.
OpenAI مدل های خود را گرفتار کرد که برای جانشینان یادداشت می گذاشتند تا رفتار بد ربکا بلان را پنهان کنند
ربکا بلان نشان می دهد که مدیر مایکروسافت خراشیدن با هوش مصنوعی را «بزرگترین سرقت نیروی کار در تاریخ بشر» می داند.
استارت آپ فناوری پاک Fluxnium راهی برای بهره برداری از سوخت هسته ای 50000 ساله تیم دی چانت پیدا کرد.
مدل استدلال جدید Salesforce و Nvidia همه چیزهایی است که آزمایشگاههای هوش مصنوعی باید از جولی بورت بترسند.
جنسن هوانگ با ترامپ تماس گرفت و چیز دیگری را نیز به نمایش گذاشت، کانی لویزوس
9 استارتآپ پرطرفدار از آخرین روز نمایشی Y Combinator، به گفته VCs Marina Temkin Dominic-Madori Davis
متن اصلی (انگلیسی)
Vals, backed by Andreessen Horowitz, is looking to become the gold standard for AI benchmarking
Vals AI is hoping to make AI benchmarking a more neutral and trustworthy resource in a world increasingly inundated by AI models.