跳到正文
原文
AGI Hunt· morganstanley·· 2 小时前AI 评分45

摩根士丹利提出并行回火采样 PPT,推理期替代 RL 后训练追平前沿模型

摩根士丹利提出并行回火采样 PPT,推理期替代 RL 后训练追平前沿模型

AI 导读

摩根士丹利团队提出 Parallel Power Tempering(PPT),用无需参数更新与外部奖励的推理期采样替代 RL 后训练来增强 LLM 推理。PPT 并行运行多个不同锐化强度的副本,低强度副本探索多样推理路径,高强度链进一步利用高似然回答,并修正了以往 power 采样器的截断偏差。它显著优于单链 power 采样并超过 RL 后训练模型,性能可比肩前沿模型。

来源:AGI Hunt · agihunt.info