EmbeddingGemma 2: یک مدل تعبیه چندوجهی باز و سبک وزن
آدرس مقاله: https://blog.google/innovation-and-ai/technology/developers-tools/embeddinggemma-2/ آدرس نظرات: https://news.ycombinator.com/item?id=49980487 امتیاز: 232 # نظرات: 30
EmbeddingGemma 2 توانمندترین مدل برای تعبیههای چندوجهی بر روی دستگاه است که ترکیبی از متن، تصاویر، صدا و ویدئو را به صورت بومی در یک فضای جاسازی یکپارچه نگاشت میکند.
مرورگر شما از عنصر صوتی پشتیبانی نمی کند.
EmbeddingGemma را سال گذشته معرفی کردیم تا گزینهای سبک برای جاسازیهای متنی با کیفیت بالا ارائه کنیم تا به برنامههای شما در سازماندهی، جستجو و اتصال مستقیم اطلاعات به سختافزار مصرفکننده کمک کند. پاسخ جامعه توسعه دهندگان فراتر از انتظارات ما بود. با بیش از 20 میلیون بارگیری، سازندگان از آن برای نیرو بخشیدن به ابزارهای جستجوی هوشمندتر روی دستگاه و خطوط لوله نسل افزوده (RAG) برای اولین بار بازیابی حریم خصوصی استفاده کرده اند.
امروز، EmbeddingGemma 2 را راهاندازی میکنیم که فراتر از متن گسترش مییابد تا کد، تصاویر، ویدیو و صدا را در یک فضای جاسازی مشترک یکپارچه کند. EmbeddingGemma 2 که بر اساس معماری Gemma 4 ساخته شده و تحت مجوز تجاری مجاز Apache 2.0 منتشر شده است، دارای 740 میلیون پارامتر است که آن را برای استنتاج روی دستگاه بهینه می کند. میتواند به یافتن یک کلیپ ویدیویی خاص از یک یادداشت صوتی کمک کند، یا ساعتها ضبط صدا را بر اساس یک درخواست متنی جستجو کند، که همه توسط یک مدل تک و چندوجهی پردازش شده است.
EmbeddingGemma 2 که از فناوری مشابه مدلهای Gemini Embedding ساخته شده است:
EmbeddingGemma 2 با عملکرد متنی چندزبانه قوی EmbeddingGemma مطابقت دارد و در عین حال بهبود قابل توجه 9.92 امتیازی را در عملکرد کد (در کد MTEB، از 68.76 تا 78.68) ارائه میکند و آن را برای نمایهسازی پایگاه کد محلی، جستجوی کد معنایی و بازیابی عامل کدنویسی مناسب میسازد. در سراسر تصویر، ویدئو، اسناد و صدا، استاندارد جدیدی را در کیفیت به ازای هر پارامتر برای مدلهای زیر 1B تعیین میکند و حتی از برخی مدلهای تخصصی بیش از دو برابر اندازه خود بهتر عمل میکند.
معیارهای ارزیابی کامل و اطلاعات مدل را در کارت مدل EmbeddingGemma 2 بیابید.
EmbeddingGemma 2 قابلیت های قوی را مستقیما به سخت افزار لبه می آورد. ایجاد جاسازیها به صورت محلی به اطمینان از حریم خصوصی دادهها کمک میکند، تأخیر خط لوله را کاهش میدهد و توسعهدهندگان را قادر میسازد تا جستجو و بازیابی چندوجهی را ایجاد کنند که کاملا آفلاین کار میکند.
وقتی EmbeddingGemma 2 با مدلهای تولیدی مانند Gemma 4 جفت شود، خطوط لوله RAG روی دستگاه را فعال میکند که دادههای چندوجهی پیچیده را درک میکنند. از آنجایی که EmbeddingGemma 2 بر روی Gemma 4 ساخته شده است و توکنایزر متن و رمزگذار صوتی خود را به اشتراک می گذارد، توسعه دهندگان می توانند هر دو مدل را با هم در یک خط لوله یکپارچه با ردپای کل حافظه ترکیبی کمتر اجرا کنند.
از متن یا تصویر برای یافتن موارد منطبق در کتابخانه رسانه خود بر اساس شباهت معنایی استفاده کنید. آن را در جستجوی رسانه فوری Google AI Edge Gallery امتحان کنید.
مکانیابی لحظات خاص در ویدیو با استفاده از عبارتهای متنی یا صوتی. آن را در جستجوگر لحظات ویدیویی گالری هوش مصنوعی Google AI Edge امتحان کنید.
EmbeddingGemma 2 را برای بازیابی فایل محلی با Gemma 4 برای استدلال متنی جفت کنید. آن را در برنامه Google AI Edge Foresight امتحان کنید.
از طریق MediaPipe Decision Task API، موتورهای تصمیم گیری بلادرنگ را با استفاده از زمینه چندوجهی برای طبقه بندی، مسیریابی و قابلیت های پیش بینی ایجاد کنید.
برای یادگیری نحوه ساخت سیستمهای جستجو و RAG روی دستگاه با LiteRT، پست وبلاگ Google AI Edge را بخوانید.
ما از نزدیک با شرکای زیر کار کردیم تا اطمینان حاصل کنیم که EmbeddingGemma 2 بلافاصله در جایی که شما میسازید کار میکند:
راهنمای برنامهنویس، اسناد و راهنماهای ما را برای استنتاج و تنظیم دقیق کاوش کنید.
متن اصلی (انگلیسی)
EmbeddingGemma 2: An open, lightweight multimodal embedding model
Article URL: https://blog.google/innovation-and-ai/technology/developers-tools/embeddinggemma-2/ Comments URL: https://news.ycombinator.com/item?id=49980487 Points: 232 # Comments: 30