EmbeddingGemma 2:740M 多模态嵌入模型开源
先了解这件事
2026年10月6日23:41,AGI Hunt 报道 Google DeepMind 发布开源多模态嵌入模型 EmbeddingGemma 2,740M 参数,已上架 Hugging Face,unsloth 提供 GGUF 版。10月7日00:25 报道称其为模块化设计:文本 270M、视觉 170M、音频 300M,可用 configkwargs 关闭用不到的编码器,纯文本仅加载 270M;支持 100+ 语言,MTEB 多语言 v2 得分 61.36(一代 61.15),代码检索提升 14%。00:26 报道称所有模态共享 8,192 token 上下文,默认图像 280 token、视频帧 140 token、音频每秒 25 token,可用标记在文本中插入多媒体,把图文视频商品 listing 嵌入同一向量。00:33 确认 Hugging Face 开源;00:49 llama.cpp 作者 Georgi Gerganov 宣布 Day-0 支持。00:58 Google Developers Blog 一篇一手报道称其为开放权重模型,纯文本权重运行时内存约 191MB;同日另一篇一手报道称基于 Gemma 4、以 Apache 2.0 许可开源、参数量 1B 以下,把文本、代码、图像、视频和音频映射到同一 768 维向量空间——早先报道列举的模态为文本、图像、音频与视频帧,未含代码。
AI 根据报道生成 · 32 分钟前更新
事件进展
- 10月7日 00:49 · 1 篇报道llama.cpp 首日支持 EmbeddingGemma 2AGI Hunt:llama.cpp 首日支持 EmbeddingGemma 2,作者 Georgi Gerganov 亲自宣布
- 10月7日 00:26 · 1 篇报道Google发布多模态嵌入模型AGI Hunt:Google 多模态嵌入模型:一个向量装下图文视频商品页
- 10月6日 23:41 · 5 篇报道Google 发布 EmbeddingGemma 2 多模态嵌入模型Google Developers Blog:Google DeepMind 发布 EmbeddingGemma 2 多模态嵌入模型
报道时间线
沿着报道,了解事件的不同侧面。
- Google Developers Blog精选Google 发布 EmbeddingGemma 2,768 维统一多模态嵌入模型
Google 发布 EmbeddingGemma 2,一款基于 Gemma 4、以 Apache 2.0 许可开源的 1B 以下多模态嵌入模型,把文本、代码、图像、视频和音频映射到同一个 768 维向量空间。
- Google Developers Blog精选Google DeepMind 发布 EmbeddingGemma 2 多模态嵌入模型
Google DeepMind 发布开放权重多模态嵌入模型 EmbeddingGemma 2,将文本、图像、视频帧和音频原生映射到同一向量空间,参数量 740M,纯文本权重运行时内存约 191MB。
- AGI Huntllama.cpp 首日支持 EmbeddingGemma 2,作者 Georgi Gerganov 亲自宣布
llama.cpp 作者 Georgi Gerganov 宣布为 Google 的 EmbeddingGemma 2 提供 Day-0 支持,模型发布当天即可在 llama.cpp 中直接使用该嵌入模型。该支持面向本地部署与向量检索场景。
- AGI HuntGoogle 在 Hugging Face 上发布 Embedding Gemma 2 嵌入模型
Google 在 Hugging Face 上开源发布 Embedding Gemma 2 嵌入模型,开发者可直接下载使用。该模型面向检索、RAG 与语义搜索场景。更多规格细节见 Hugging Face 页面。
- AGI HuntGoogle 多模态嵌入模型:一个向量装下图文视频商品页
Google 新多模态嵌入模型可将文字描述、多张照片加演示视频的完整商品 listing 嵌入同一个向量,通过标记在文本中插入多媒体,实现图文视频混合检索。所有模态共享 8,192 token 上下文窗口,默认开销为图像 280 token、视频帧 140 token、音频每秒 25 token。
- AGI HuntEmbeddingGemma 2 发布:模块化 740M,代码检索提升 14%
Google 发布 EmbeddingGemma 2,支持 100+ 语言,MTEB 多语言 v2 得分 61.36,较一代 61.15 小幅提升,代码检索提升 14%。该模型采用 740M 模块化设计,文本 270M、视觉 170M、音频 300M,可通过 configkwargs 按需关闭用不到的编码器。纯文本场景仅加载 270M 参数。
- AGI HuntGoogle 发布 EmbeddingGemma 2 多模态嵌入模型,740M 参数统一文本图像音视频向量空间
Google DeepMind 发布开源多模态嵌入模型 EmbeddingGemma 2,已上架 Hugging Face,unsloth 提供 GGUF 版。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。