AGI Hunt· morganstanley·· 2 小时前AI 评分45
摩根士丹利提出并行回火采样 PPT,推理期替代 RL 后训练追平前沿模型
摩根士丹利提出并行回火采样 PPT,推理期替代 RL 后训练追平前沿模型
AI 导读
摩根士丹利团队提出 Parallel Power Tempering(PPT),用无需参数更新与外部奖励的推理期采样替代 RL 后训练来增强 LLM 推理。PPT 并行运行多个不同锐化强度的副本,低强度副本探索多样推理路径,高强度链进一步利用高似然回答,并修正了以往 power 采样器的截断偏差。它显著优于单链 power 采样并超过 RL 后训练模型,性能可比肩前沿模型。
来源:AGI Hunt · agihunt.info