跳到正文
原文
AGI Hunt· tomaarsen·· 2 小时前AI 评分50

Google 多模态嵌入模型:一个向量装下图文视频商品页

Google 多模态嵌入:一个向量装下图文视频商品页

AI 导读

Google 新多模态嵌入模型可将文字描述、多张照片加演示视频的完整商品 listing 嵌入同一个向量,通过标记在文本中插入多媒体,实现图文视频混合检索。所有模态共享 8,192 token 上下文窗口,默认开销为图像 280 token、视频帧 140 token、音频每秒 25 token。

来源:AGI Hunt · agihunt.info