跳到正文
原文
AGI Hunt· thisguyknowsai·· 5 小时前AI 评分34

ROME 提出 IPA:按块而非按 token 分配 RL 信用

AI 导读

ROME 团队提出 IPA(Interaction-Perceptive Agentic Policy Optimization),在 chunk 级而非 token 级分配 RL 信用,理由是 token 粒度太细、整条轨迹太粗,chunk 与实际工具调用语义对齐。

来源:AGI Hunt · agihunt.info