Ollaya – اوللاما برای مدلهای تصمیمگیری منبع باز و به سبک Jev
آدرس مقاله: https://ollaya.dev/ آدرس نظرات: https://news.ycombinator.com/item?id=49848269 امتیاز: 237 # نظرات: 77
درباره هر متن یا JSON سؤالات تایپ شده بپرسید و پاسخ های کالیبره شده را در میلی ثانیه دریافت کنید. خصوصی، منبع باز، بر روی سخت افزار خودتان.
یک مدل تصمیم گیری در یک پاس رو به جلو، بدون تولید توکن به نشانه پاسخ می دهد. در GPU خود شما، یک درخواست پنج سوالی به Laya حدود 10 میلی ثانیه طول می کشد، از طریق HTTP API.
Ollaya: میانه درخواست پنج سوالی از طریق HTTP API در NVIDIA RTX 4090 (laya در fp16، بقیه در fp32). Jev: تأخیر متوسط درخواست API میزبان در معیارهای شخص ثالث (AbdelStark/jev-benchmarks، nibzard/decision-model-benchmark) که شامل شبکه میشود. تنظیمات متفاوت است، بنابراین آن را به عنوان یک مقایسه مرتبه از بزرگی بخوانید.
Ollaya مدلهای /v1/systemone و /v1/ را با شکلهای درخواست و پاسخ TypeSafe ارائه میکند. رسمی TypeSafe Python SDK 0.7.1 بدون تغییر در برابر یک سرور محلی کار می کند.
با Laya از Convai Innovations شروع کنید: یک مدل انگلیسی، یک مدل زبان 100+، یک مدل تنظیم شده برای تصمیمات تایپ شده، و یک روتر که برای شما انتخاب می کند.
مدلهای تصمیم باز بیشتر برنامهریزی شدهاند: مدلهای تصمیم مبتنی بر von، GGUF LLM از طریق llama.cpp.
بلیط ها، ایمیل ها و پیام های کاربر اغلب حساس ترین داده هایی هستند که در اختیار دارید. با اولایا آنها در جایی که قبلا زندگی می کنند گل می گیرند.
بر روی دستگاه شما با ONNX Runtime، روی CPU یا GPU NVIDIA اجرا می شود. سرور به طور پیش فرض به 127.0.0.1 گوش می دهد.
وزنها از مخازن Hugging Face نویسندگان آنها میآیند، به یک commit سنجاق شده و با sha256 بررسی میشوند. Ollaya هرگز آنها را دوباره میزبانی نمی کند و زمان اجرا Apache-2.0 است.
تا جایی که سخت افزار شما می تواند تصمیم بگیرید، تصمیم بگیرید. بدون اندازه گیری و بدون صورتحساب API.
احتمالاتی که می توانید در آن آستانه قرار دهید. خطای کالیبراسیون Laya (ECE) پس از تنظیم دما 0.081 است، در مقابل 0.246 برای Jev.
یک برنامه دسکتاپ و یک خط فرمان برای macOS، ویندوز و لینوکس و یک تصویر Docker برای سرورها. هر مدلی روی CPU اجرا می شود. یک GPU NVIDIA در لینوکس، در WSL 2 یا در Docker درخواست را تا میلی ثانیه کاهش می دهد.
پردازندههای گرافیکی NVIDIA به درایور R580 یا جدیدتر نیاز دارند. نصبکنندهها کتابخانههای CUDA را تنها زمانی واکشی میکنند که یکی را پیدا کنند. در پردازندههای گرافیکی اپل، AMD و اینتل، مدلها روی CPU کار میکنند.
macOS، Windows، Linux و Docker · Apache-2.0 · GitHub
متن اصلی (انگلیسی)
Ollaya – Ollama for open-source, Jev-style decision models
Article URL: https://ollaya.dev/ Comments URL: https://news.ycombinator.com/item?id=49848269 Points: 237 # Comments: 77