跳到正文
原文
AGI Hunt· SharonYixuanLi·· 3 小时前AI 评分46

Meta 研究者提出「锐化税」:后训练磨利旧技能而非教新能力

研究提出「锐化税」:后训练磨利旧技能而非教新能力

AI 导读

Changdae Oh 等研究者(涉及 Meta)提出「锐化税」(Sharpening Tax),探讨后训练是让 LLM 学会新的智能体能力,还是仅强化已有技能。在智能体任务上,预训练模型配上轻量推理 harness 后 pass@1 远低于 RL 后训练版本,但在足够大的 K 下 pass@K 覆盖更高。RL 后训练以牺牲覆盖多样性为代价,换取单次准确率提升。

来源:AGI Hunt · agihunt.info