arXiv cs.AI· Ankur Samanta, Yonathan Efroni, Paul Sajda, Kaveh Hassani, Anirudh Goyal·· 2 天前AI 评分42
MIRA:为长时程研究智能体学习"下一步该调查什么"的元推理架构
Learning What to Investigate Next: Meta-Reasoning for Long-Horizon Research Agents
AI 导读
MIRA 是一种分层元推理架构,把研究分配与执行分离:外循环元推理器从持久研究记录中整理上下文并生成下一项调查的工作指令,内循环执行器每次全新执行该指令。无需策略训练,它就在定理证明与开放式神经网络架构研究中提升长时程推理并更有效分配额外算力。跨环境预训练先验用于初始化生成式 actor-critic 模型 MIRA-AC,在 4 个 autoresearch 环境中提升 gold 表现。
来源:arXiv cs.AI · arxiv.org