热点事件持续更新
PG-SFT:离线Agent微调中平衡能力获取与保持
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
2026年10月2日,arXiv cs.AI 刊出一篇报道,介绍 PG-SFT(Privilege-Guided SFT)方法,目标是在离线智能体微调中平衡能力获取与能力保持。该方法利用离线智能体轨迹的 turn-level 信息增益来调节监督强度,即按轮次的信息增益调整监督信号的强弱。报道指出,在这一离线微调设置下,标准 SFT 虽能提升目标任务 benchmark 的表现,却会同时拉低多个非目标 benchmark 的分数;而 KL 惩罚或限制更新幅度这两类做法都未能避免这一能力回退趋势。报道未提供更多实验细节或后续验证结果,事件目前仍处于该方法被提出的阶段。
AI 根据报道生成 · 1 小时前更新
最新进展10月2日 12:00
arXiv 报道提出 PG-SFT,用 turn-level 信息增益调节监督强度,以缓解离线微调中的能力回退。报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- arXiv cs.AIPG-SFT:在离线智能体微调中平衡能力获取与保持
PG-SFT(Privilege-Guided SFT)利用离线智能体轨迹的 turn-level 信息增益调节监督强度,以平衡微调中的能力获取与保持。在该设置下,标准 SFT 提升目标任务 benchmark 的同时会拉低多个非目标 benchmark 分数,而 KL 惩罚或限制更新幅度都未能避免这一回退趋势。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。