跳到正文
原文
AGI Hunt· jessyjli·· 2 小时前AI 评分38

COLM 2026 论文:SOTA 视觉模型言行不一,无法预测自己何时说苹果是红的

COLM 2026 论文:SOTA 视觉模型言行不一,无法预测自己何时说苹果是红的

AI 导读

William Rudman 等人在 COLM 2026 发表海报论文,发现即便是 SOTA 视觉语言模型(VLM)也会违背自己声明的内省规则——模型明确说出「何时把苹果称为红色」的判断标准,实际判断时却不遵守。这说明模型的「自我解释」与实际行为存在系统性脱节,对模型可解释性与内省能力研究有参考价值。论文今天 16:30 进行海报展示。

来源:AGI Hunt · agihunt.info