热点事件持续更新
研究提出「锐化税」量化后训练隐性成本
2 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026年10月2日,AGI Hunt 报道,研究者 Changdae Oh 等人提出「锐化税」(Sharpening Tax)概念,试图量化大模型后训练的隐性成本,核心问题是:后训练究竟是让 LLM 学会新的 agentic 智能体能力,还是仅把已有技能磨得更尖。同日后续报道补充,该研究涉及 Meta 研究者,并给出了智能体任务上的对比结果:预训练模型配上轻量推理 harness 后,pass@1 远低于 RL 后训练版本,但在足够大的 K 下,pass@K 覆盖更高;RL 后训练以牺牲覆盖多样性为代价,换取单次准确率提升。早先报道称,该工作详细的数据与实验结果在作者发布的 11 条线程原帖中展开。
AI 根据报道生成 · 46 分钟前更新
最新进展10月2日 10:49
新报道补充:研究涉及 Meta 研究者,智能体任务上 RL 后训练以牺牲覆盖多样性换取 pass@1 提升。报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- AGI HuntSharpening Tax:后训练或只是磨利旧技能,而非教会 LLM 新智能体能力
研究者 Changdae Oh 等提出「Sharpening Tax」概念,试图量化后训练的隐性成本:后训练可能只是把 LLM 已有能力磨得更尖,而非让它学会新的 agentic 技能。该工作关注模型在提升既有能力的同时,可能牺牲或未能扩展真正的新技能,详细数据与实验结果在其 11 条线程的原帖中展开。
- AGI HuntMeta 研究者提出「锐化税」:后训练磨利旧技能而非教新能力
Changdae Oh 等研究者(涉及 Meta)提出「锐化税」(Sharpening Tax),探讨后训练是让 LLM 学会新的智能体能力,还是仅强化已有技能。在智能体任务上,预训练模型配上轻量推理 harness 后 pass@1 远低于 RL 后训练版本,但在足够大的 K 下 pass@K 覆盖更高。RL 后训练以牺牲覆盖多样性为代价,换取单次准确率提升。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。