资讯1 分钟阅读·
谷歌开源端侧多模态嵌入模型
谷歌发布EmbeddingGemma 2,以Apache 2.0开源,支持在手机上处理文本、图像、音频和视频的统一嵌入。
重要性实质性证据E3 可检验写法快讯
谷歌DeepMind于10月6日发布EmbeddingGemma 2,这是一款开源的多模态嵌入模型,能将文本、代码、图像、音频和视频映射到统一的向量空间。
该模型基于Gemma 4架构,拥有7.4亿参数,采用商业友好的Apache 2.0许可证。相比去年仅支持文本的前代产品,新版实现了原生多模态支持,专为设备端推理优化。
官方数据显示,经过量化后,纯文本模式在Pixel 11 Pro上仅需约191MB内存,完整多模态模式约需567MB。它支持8K token上下文窗口,可处理长达5.5分钟的音频或29张图像。
在MTEB Code等基准测试中,谷歌称其在10亿参数以下模型中取得领先分数,但此结果属厂商自测,尚待独立验证。模型权重已在Hugging Face和Kaggle上线。