arXiv cs.AI· Ronghua Li, Zi Liang, Zhishan Li, Shinan Liu·· 4 小时前AI 评分37
PG-SFT:在离线智能体微调中平衡能力获取与保持
PG-SFT: Balancing Capability Acquisition and Retention in Offline Agent Fine-Tuning
AI 导读
PG-SFT(Privilege-Guided SFT)利用离线智能体轨迹的 turn-level 信息增益调节监督强度,以平衡微调中的能力获取与保持。在该设置下,标准 SFT 提升目标任务 benchmark 的同时会拉低多个非目标 benchmark 分数,而 KL 惩罚或限制更新幅度都未能避免这一回退趋势。
来源:arXiv cs.AI · arxiv.org