跳到正文
原文
arXiv cs.AI· Jinfeng Xu, Zheyu Chen, Ziyue Peng, Zheng Lin, Shuo Yang, Jinze Li, Zheng Xing, Mengran Li, Victor C. M. Leung·· 1 天前AI 评分36

LW2S:面向高效多智能体 LLM 工作流的反事实信用分配与跳过学习

Learning What to Skip: Counterfactual Credit Assignment for Efficient Multi-Agent LLM Workflows

AI 导读

LW2S 将多智能体 LLM 工作流中的组件省略建模为反事实信用分配,用受控跳过干预学习动作级安全模型,并结合留出集校准与领域内建护栏选择跳过步骤。在数学推理、选择题问答与代码生成、两个指令模型家族上,它降低了记录 token 成本,整体工作流准确率持平或提升。早期跳过被拒时,控制器仍可继续执行并重新考虑后续组件。

来源:arXiv cs.AI · arxiv.org