跳到正文
热点事件持续更新

PG-SFT:离线Agent微调中平衡能力获取与保持

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026年10月2日,arXiv cs.AI 刊出一篇报道,介绍 PG-SFT(Privilege-Guided SFT)方法,目标是在离线智能体微调中平衡能力获取与能力保持。该方法利用离线智能体轨迹的 turn-level 信息增益来调节监督强度,即按轮次的信息增益调整监督信号的强弱。报道指出,在这一离线微调设置下,标准 SFT 虽能提升目标任务 benchmark 的表现,却会同时拉低多个非目标 benchmark 的分数;而 KL 惩罚或限制更新幅度这两类做法都未能避免这一能力回退趋势。报道未提供更多实验细节或后续验证结果,事件目前仍处于该方法被提出的阶段。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. arXiv cs.AI
    PG-SFT:在离线智能体微调中平衡能力获取与保持

    PG-SFT(Privilege-Guided SFT)利用离线智能体轨迹的 turn-level 信息增益调节监督强度,以平衡微调中的能力获取与保持。在该设置下,标准 SFT 提升目标任务 benchmark 的同时会拉低多个非目标 benchmark 分数,而 KL 惩罚或限制更新幅度都未能避免这一回退趋势。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。