跳到正文
原文
arXiv cs.AI· Arip Asadulaev, Aladin Djuhera, Karim Salta, Holger Boche, Fakhri Karray, Martin Takac·· 2 天前AI 评分42

Tropical Reinforcement Learning:用热带半环代数提升 LLM 组合推理

Tropical Reinforcement Learning

AI 导读

Tropical Reinforcement Learning 将对备选解概率的求和改为取最大值(热带半环),使状态价值成为最可能被验证解的对数概率并附带可重放路径,从而能把不同 rollout 的最优前缀与后缀在共享状态处拼接。

来源:arXiv cs.AI · arxiv.org