AGI Hunt· hunarbatra·· 6 小时前AI 评分37
COLM 2026 论文:推理微调会在 LLM 潜空间中留下持久策略状态
COLM 2026 论文:推理微调会在 LLM 潜空间中留下持久策略状态
AI 导读
COLM 2026 论文《Reasoning Fine-Tuning Induces Persistent Latent Policy States》发现,推理微调会在 LLM 的潜表示中诱导出持久的「策略状态」。作者通过追踪推理模型的内部动力学得出结论:微调不只是教模型输出推理步骤,而是实质性地重塑了其内部行为策略。
来源:AGI Hunt · agihunt.info