پرش به محتوای اصلی

EmbeddingGemma 2: یک مدل تعبیه چندوجهی باز و سبک وزن

هکرنیوز۱۴۰۵ مهر ۱۴, سه‌شنبه، ساعت ۱۹:۳۳حدود 3 دقیقه مطالعه

آدرس مقاله: https://blog.google/innovation-and-ai/technology/developers-tools/embeddinggemma-2/ آدرس نظرات: https://news.ycombinator.com/item?id=49980487 امتیاز: 232 # نظرات: 30

EmbeddingGemma 2 توانمندترین مدل برای تعبیه‌های چندوجهی بر روی دستگاه است که ترکیبی از متن، تصاویر، صدا و ویدئو را به صورت بومی در یک فضای جاسازی یکپارچه نگاشت می‌کند.

مرورگر شما از عنصر صوتی پشتیبانی نمی کند.

EmbeddingGemma را سال گذشته معرفی کردیم تا گزینه‌ای سبک برای جاسازی‌های متنی با کیفیت بالا ارائه کنیم تا به برنامه‌های شما در سازماندهی، جستجو و اتصال مستقیم اطلاعات به سخت‌افزار مصرف‌کننده کمک کند. پاسخ جامعه توسعه دهندگان فراتر از انتظارات ما بود. با بیش از 20 میلیون بارگیری، سازندگان از آن برای نیرو بخشیدن به ابزارهای جستجوی هوشمندتر روی دستگاه و خطوط لوله نسل افزوده (RAG) برای اولین بار بازیابی حریم خصوصی استفاده کرده اند.

امروز، EmbeddingGemma 2 را راه‌اندازی می‌کنیم که فراتر از متن گسترش می‌یابد تا کد، تصاویر، ویدیو و صدا را در یک فضای جاسازی مشترک یکپارچه کند. EmbeddingGemma 2 که بر اساس معماری Gemma 4 ساخته شده و تحت مجوز تجاری مجاز Apache 2.0 منتشر شده است، دارای 740 میلیون پارامتر است که آن را برای استنتاج روی دستگاه بهینه می کند. می‌تواند به یافتن یک کلیپ ویدیویی خاص از یک یادداشت صوتی کمک کند، یا ساعت‌ها ضبط صدا را بر اساس یک درخواست متنی جستجو کند، که همه توسط یک مدل تک و چندوجهی پردازش شده است.

EmbeddingGemma 2 که از فناوری مشابه مدل‌های Gemini Embedding ساخته شده است:

EmbeddingGemma 2 با عملکرد متنی چندزبانه قوی EmbeddingGemma مطابقت دارد و در عین حال بهبود قابل توجه 9.92 امتیازی را در عملکرد کد (در کد MTEB، از 68.76 تا 78.68) ارائه می‌کند و آن را برای نمایه‌سازی پایگاه کد محلی، جستجوی کد معنایی و بازیابی عامل کدنویسی مناسب می‌سازد. در سراسر تصویر، ویدئو، اسناد و صدا، استاندارد جدیدی را در کیفیت به ازای هر پارامتر برای مدل‌های زیر 1B تعیین می‌کند و حتی از برخی مدل‌های تخصصی بیش از دو برابر اندازه خود بهتر عمل می‌کند.

معیارهای ارزیابی کامل و اطلاعات مدل را در کارت مدل EmbeddingGemma 2 بیابید.

EmbeddingGemma 2 قابلیت های قوی را مستقیما به سخت افزار لبه می آورد. ایجاد جاسازی‌ها به صورت محلی به اطمینان از حریم خصوصی داده‌ها کمک می‌کند، تأخیر خط لوله را کاهش می‌دهد و توسعه‌دهندگان را قادر می‌سازد تا جستجو و بازیابی چندوجهی را ایجاد کنند که کاملا آفلاین کار می‌کند.

وقتی EmbeddingGemma 2 با مدل‌های تولیدی مانند Gemma 4 جفت شود، خطوط لوله RAG روی دستگاه را فعال می‌کند که داده‌های چندوجهی پیچیده را درک می‌کنند. از آنجایی که EmbeddingGemma 2 بر روی Gemma 4 ساخته شده است و توکنایزر متن و رمزگذار صوتی خود را به اشتراک می گذارد، توسعه دهندگان می توانند هر دو مدل را با هم در یک خط لوله یکپارچه با ردپای کل حافظه ترکیبی کمتر اجرا کنند.

از متن یا تصویر برای یافتن موارد منطبق در کتابخانه رسانه خود بر اساس شباهت معنایی استفاده کنید. آن را در جستجوی رسانه فوری Google AI Edge Gallery امتحان کنید.

مکان‌یابی لحظات خاص در ویدیو با استفاده از عبارت‌های متنی یا صوتی. آن را در جستجوگر لحظات ویدیویی گالری هوش مصنوعی Google AI Edge امتحان کنید.

EmbeddingGemma 2 را برای بازیابی فایل محلی با Gemma 4 برای استدلال متنی جفت کنید. آن را در برنامه Google AI Edge Foresight امتحان کنید.

از طریق MediaPipe Decision Task API، موتورهای تصمیم گیری بلادرنگ را با استفاده از زمینه چندوجهی برای طبقه بندی، مسیریابی و قابلیت های پیش بینی ایجاد کنید.

برای یادگیری نحوه ساخت سیستم‌های جستجو و RAG روی دستگاه با LiteRT، پست وبلاگ Google AI Edge را بخوانید.

ما از نزدیک با شرکای زیر کار کردیم تا اطمینان حاصل کنیم که EmbeddingGemma 2 بلافاصله در جایی که شما می‌سازید کار می‌کند:

راهنمای برنامه‌نویس، اسناد و راهنماهای ما را برای استنتاج و تنظیم دقیق کاوش کنید.

خواندن متن کامل در هکرنیوزبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

EmbeddingGemma 2: An open, lightweight multimodal embedding model

Article URL: https://blog.google/innovation-and-ai/technology/developers-tools/embeddinggemma-2/ Comments URL: https://news.ycombinator.com/item?id=49980487 Points: 232 # Comments: 30

پوشش همین خبر در رسانه‌های دیگر

مقایسه‌ی پوشش ۲ رسانه ←
همه‌ی اخبار فناوری