跳到正文
原文
arXiv cs.CL· Yihuai Hong, Shauli Ravfogel, Chen Zhao, Eunsol Choi·· 8 小时前AI 评分50

让 LLM 说出真实想法:测量并改进 CoT-Interpretability Alignment

Making LLMs Say What They Think: Measuring and Improving CoT-Interpretability Alignment

AI 导读

新指标 CIA(CoT-Interpretability Alignment)用于衡量 LLM 的 CoT 轨迹与可解释性工具检测出的内部推理策略是否一致。在 two-hop 问答、hint intervention 和整数乘法三项任务、三个 LLM 上,该对齐度仅为 44.8-75.9%。以任务准确率和参数化忠实度为奖励做后训练,可显著提升 CoT 参数化忠实度,同时保持或提高任务准确率。

来源:arXiv cs.CL · arxiv.org