跳到正文
原文
arXiv cs.AI· Ronghua Li, Zi Liang, Zhishan Li, Shinan Liu·· 4 小时前AI 评分37

PG-SFT:在离线智能体微调中平衡能力获取与保持

PG-SFT: Balancing Capability Acquisition and Retention in Offline Agent Fine-Tuning

AI 导读

PG-SFT(Privilege-Guided SFT)利用离线智能体轨迹的 turn-level 信息增益调节监督强度,以平衡微调中的能力获取与保持。在该设置下,标准 SFT 提升目标任务 benchmark 的同时会拉低多个非目标 benchmark 分数,而 KL 惩罚或限制更新幅度都未能避免这一回退趋势。

来源:arXiv cs.AI · arxiv.org