跳到正文
原文
AGI Hunt· hunarbatra·· 6 小时前AI 评分37

COLM 2026 论文:推理微调会在 LLM 潜空间中留下持久策略状态

COLM 2026 论文:推理微调会在 LLM 潜空间中留下持久策略状态

AI 导读

COLM 2026 论文《Reasoning Fine-Tuning Induces Persistent Latent Policy States》发现,推理微调会在 LLM 的潜表示中诱导出持久的「策略状态」。作者通过追踪推理模型的内部动力学得出结论:微调不只是教模型输出推理步骤,而是实质性地重塑了其内部行为策略。

来源:AGI Hunt · agihunt.info