پرش به محتوای اصلی

Ollaya – اوللاما برای مدل‌های تصمیم‌گیری منبع باز و به سبک Jev

هکرنیوز۱۴۰۵ مهر ۳, جمعه، ساعت ۲۲:۰۳حدود 2 دقیقه مطالعه

آدرس مقاله: https://ollaya.dev/ آدرس نظرات: https://news.ycombinator.com/item?id=49848269 امتیاز: 237 # نظرات: 77

درباره هر متن یا JSON سؤالات تایپ شده بپرسید و پاسخ های کالیبره شده را در میلی ثانیه دریافت کنید. خصوصی، منبع باز، بر روی سخت افزار خودتان.

یک مدل تصمیم گیری در یک پاس رو به جلو، بدون تولید توکن به نشانه پاسخ می دهد. در GPU خود شما، یک درخواست پنج سوالی به Laya حدود 10 میلی ثانیه طول می کشد، از طریق HTTP API.

Ollaya: میانه درخواست پنج سوالی از طریق HTTP API در NVIDIA RTX 4090 (laya در fp16، بقیه در fp32). Jev: تأخیر متوسط ​​درخواست API میزبان در معیارهای شخص ثالث (AbdelStark/jev-benchmarks، nibzard/decision-model-benchmark) که شامل شبکه می‌شود. تنظیمات متفاوت است، بنابراین آن را به عنوان یک مقایسه مرتبه از بزرگی بخوانید.

Ollaya مدل‌های /v1/systemone و /v1/ را با شکل‌های درخواست و پاسخ TypeSafe ارائه می‌کند. رسمی TypeSafe Python SDK 0.7.1 بدون تغییر در برابر یک سرور محلی کار می کند.

با Laya از Convai Innovations شروع کنید: یک مدل انگلیسی، یک مدل زبان 100+، یک مدل تنظیم شده برای تصمیمات تایپ شده، و یک روتر که برای شما انتخاب می کند.

مدل‌های تصمیم باز بیشتر برنامه‌ریزی شده‌اند: مدل‌های تصمیم مبتنی بر von، GGUF LLM از طریق llama.cpp.

بلیط ها، ایمیل ها و پیام های کاربر اغلب حساس ترین داده هایی هستند که در اختیار دارید. با اولایا آنها در جایی که قبلا زندگی می کنند گل می گیرند.

بر روی دستگاه شما با ONNX Runtime، روی CPU یا GPU NVIDIA اجرا می شود. سرور به طور پیش فرض به 127.0.0.1 گوش می دهد.

وزن‌ها از مخازن Hugging Face نویسندگان آن‌ها می‌آیند، به یک commit سنجاق شده و با sha256 بررسی می‌شوند. Ollaya هرگز آنها را دوباره میزبانی نمی کند و زمان اجرا Apache-2.0 است.

تا جایی که سخت افزار شما می تواند تصمیم بگیرید، تصمیم بگیرید. بدون اندازه گیری و بدون صورتحساب API.

احتمالاتی که می توانید در آن آستانه قرار دهید. خطای کالیبراسیون Laya (ECE) پس از تنظیم دما 0.081 است، در مقابل 0.246 برای Jev.

یک برنامه دسکتاپ و یک خط فرمان برای macOS، ویندوز و لینوکس و یک تصویر Docker برای سرورها. هر مدلی روی CPU اجرا می شود. یک GPU NVIDIA در لینوکس، در WSL 2 یا در Docker درخواست را تا میلی ثانیه کاهش می دهد.

پردازنده‌های گرافیکی NVIDIA به درایور R580 یا جدیدتر نیاز دارند. نصب‌کننده‌ها کتابخانه‌های CUDA را تنها زمانی واکشی می‌کنند که یکی را پیدا کنند. در پردازنده‌های گرافیکی اپل، AMD و اینتل، مدل‌ها روی CPU کار می‌کنند.

macOS، Windows، Linux و Docker · Apache-2.0 · GitHub

خواندن متن کامل در هکرنیوزبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

Ollaya – Ollama for open-source, Jev-style decision models

Article URL: https://ollaya.dev/ Comments URL: https://news.ycombinator.com/item?id=49848269 Points: 237 # Comments: 77

همه‌ی اخبار فناوری