跳到正文
原文
AGI Hunt· kaist-ai·· 11 小时前AI 评分42

KAIST 提出 Pivot-SD:只蒸馏关键去噪决策,200 题超越强化学习基线

AI 导读

KAIST AI 团队提出 Pivot-SD 框架,仅用 200 道题、每题 4 次采样,就让 LLaDA-8B-Instruct 在数学与代码基准上超过全序列 SFT 和算力对齐的扩散 RL 基线。该方法用信息增益度量识别掩码扩散语言模型并行去噪中的高影响力 pivot,只监督这些关键去噪决策。成功轨迹用交叉熵、失败轨迹用针对性 unlikelihood 监督,其余位置不动。

来源:AGI Hunt · agihunt.info