AGI Hunt· giffmana·· 2 小时前AI 评分33
giffmana 设想多模态 Jev:不到 1B 参数给任意图文打校准分
AI 导读
视觉编码器研究者 giffmana 提出多模态模型构想 Jev:输入任意图像和一组自由文本,为每条文本返回其与图像的匹配程度,还可在适当位置用 sigmoid 实现一组分数可校准的 yes/no 判断。他认为这一构想可以做到,可能需要融资 xxxM。更激进的目标是开源且参数量少于 1B(约 400M)。
来源:AGI Hunt · agihunt.info