AGI Hunt· thisguyknowsai·2026-10-06 16:00· 5 小时前AI 评分34ROME 提出 IPA:按块而非按 token 分配 RL 信用AI 导读ROME 团队提出 IPA(Interaction-Perceptive Agentic Policy Optimization),在 chunk 级而非 token 级分配 RL 信用,理由是 token 粒度太细、整条轨迹太粗,chunk 与实际工具调用语义对齐。来源:AGI Hunt · agihunt.info#论文/研究#Agent#数据/训练查看事件全部后续