AGI Hunt· tomaarsen·· 3 小时前AI 评分49
Google 多模态嵌入模型发布,推理须弃用 FP16
AI 导读
Google 发布多模态嵌入模型,视频默认每秒采样 1 帧,音频需为 16 kHz 单声道,每个图像或帧的视觉 soft token 预算可在 70 至 1120 之间配置。运行该模型时应弃用 FP16,改用 BF16 或 FP32,因模型激活值范围超出 FP16 动态范围。模型卡警告会出现 NaN 或嵌入向量静默退化。
来源:AGI Hunt · agihunt.info