برنامه نویس فرانسوی قصد دارد کوری ربات ها را حل کند تا بتوانند رابط کاربری گرافیکی را درک کنند
زیرا گاهی اوقات برای فرار از سندباکس شما نیاز به کلیک کردن بر روی یک دکمه است
اکثر LLM ها در پاسخگویی به درخواست ها عالی هستند، اما در مورد پیمایش در اطراف دسکتاپ در ویندوز یا لینوکس کوتاهی می کنند. مدل هوش مصنوعی فرانسوی dev H روز دوشنبه از یک جفت مدل استفاده از رایانه با هدف مدیریت رابط های گرافیکی کاربر (GUI) رونمایی کرد. در طول تاریخچه محاسبات، استفاده از رایانه عمدتا به سه دسته تقسیم می شود: رابط های خط فرمان (CLI)، رابط های برنامه نویسی برنامه (API)، و رابط های گرافیکی. عوامل هوش مصنوعی میتوانند به راحتی به دو مورد اول متصل شوند، اما پیمایش در محیطهای دسکتاپ و برنامههایی که اغلب قبل از عملکرد اولویتبندی میکنند، یک چالش مداوم است.
هدف خانواده مدلهای Holo 4 H با فعال کردن مدلهای نسبتا کوچک اما توانمند برای مقابله با هر سه سناریو استفاده از رایانه از جمله اشاره کردن، کلیک کردن، پیمایش و تایپ کردن مسیر خود از طریق رابطهای گرافیکی که در اصل برای کیسههای گوشتی ما طراحی شده بودند، را برطرف میکند. Holo 4 که با استفاده از آموزش نظارت شده و یادگیری تقویتی تنظیم شده است، بر روی مدل های Qwen 3.8 27B و Qwen 3.6 35B-A3B علی بابا ساخته شده است. و با بهینهسازی برای CLI، API و رابط کاربری گرافیکی، H ادعا میکند که مدلهایش تطبیقپذیری بسیار بیشتری نسبت به مدلهای استفاده از رایانه خالص دارند.
در کنار Holo 4، H نیز مدل Holotron خود را که بر اساس Nemotron 3 انویدیا ساخته شده است، با قابلیت های مشابه به روز کرده است. در یک مثال، این شرکت نشان داد که Holo 4 27B از عملکرد ماکرو FreeCAD برای طراحی برنامهریزی یک مدل سهبعدی از برج ایفل به جای ساخت دستی آن با استفاده از مواد اولیه مانند مکعبها استفاده میکند. در نسخه ی نمایشی دیگری، H با استفاده از اشکال اکسترود شده برای بازسازی لوگوی شرکت، برعکس عمل کرد و انعطاف پذیری مدل را نشان داد.
مانند سایر معیارهای توسعه دهندگان مدل، این ادعاها را با کمال میل در نظر بگیرید، اما اگر H را باور کنیم، Holo 4 در حالی که از کسری از پارامترها استفاده می کند، عملکرد قابل توجهی از مدل های مرزی بزرگتر مانند OpenAI دارد. عجیب است، این به این معنی نیست که آنها ارزان تر هستند. در واقع، در حالی که شرکت نمرات بالاتری را نشان میدهد، در بسیاری از موارد مدلها به ازای هر کار هزینه بیشتری دارند.
با توجه به آنچه در مورد Qwen 3.8 27B می دانیم، این احتمالا به دلیل استفاده Holo 4 از توکن های "تفکر" بیشتر برای رسیدن به نتیجه نهایی نسبت به چیزی مانند GPT 6 Luna است که در معیار OSWorld 2.0 به خوبی عمل نمی کند، اما هزینه آن بسیار کمتر است. با این حال، اندازه کوچک مدلهای اوزان باز به این معنی است که محققان، علاقهمندان به هوش مصنوعی و شرکتها باید بتوانند آنها را روی سختافزار نسبتا متوسطی اجرا کنند. یک Nvidia RTX 3090 24 گیگابایتی باید بیش از توانایی اجرای این مدل ها با دقت 4 بیت باشد.
H به وضوح انتظار دارد که کاربران دقیقا این کار را انجام دهند زیرا در کنار وزنهای BF16، FP8 و NVFP4، نسخه GGUF مناسب Llama.cpp (و با فرمت LM Studio و Ollama) را نیز برای دانلود در Hugging Face ساخته است. توسعه دهنده مدل می گوید که همچنین قصد دارد وزن های پیش نویس DSpark را به منظور سرعت بخشیدن به استنتاج با استفاده از تکنیکی به نام رمزگشایی حدسی منتشر کند. ما این فناوری استنتاج افزایش دهنده عملکرد را در گذشته بررسی کرده ایم، اما به طور خلاصه از یک مدل کوچک برای حدس زدن خروجی های یک مدل بزرگتر استفاده می کند.
وقتی کار میکند، کاربران در پردازش و تولید نشانهها سرعت بیشتری را تجربه میکنند و در صورت عدم موفقیت، به مدل پایه بازمیگردند و از عدم کاهش کیفیت خروجی اطمینان میدهند. با این حال، مدل ها بدون مهار ارزش زیادی ندارند. H چندین مهار عامل از جمله مهار HAI-Agents منبع باز خود را توسعه داده است که برای دانلود در GitHub آن موجود است. با این حال، در تئوری، مدلها باید با مهارهای استفاده از رایانه شخص ثالث کار کنند. H تنها مدل توسعه دهنده ای نیست که بر برنامه های کاربردی استفاده از کامپیوتر متمرکز شده است.
در کنفرانس Re:Invent سال گذشته AWS، این شرکت مجموعه مدلهای خود را برای استفاده از رایانه معرفی کرد. در همین حال، سه آزمایشگاه بزرگ مدل آمریکایی، OpenAI، Google و Anthropic نیز روی این قابلیت سرمایهگذاری میکنند، شاید به این دلیل که فرار از sandbox آنها گاهی اوقات نیاز به فشار دادن یک دکمه دارد. ®
متن اصلی (انگلیسی)
French dev aims to solve bots' blindness so they can understand GUIs
Because sometimes escaping your sandbox requires clicking a button