Meta AI 的 MIRA:长周期研究智能体元推理分层架构
先了解这件事
2026年10月5日,arXiv cs.AI 刊出 MIRA,一种面向长时程研究智能体的分层元推理架构:外循环元推理器从持久研究记录中整理上下文,生成下一项调查的工作指令,内循环执行器每次全新执行该指令,从而学习“下一步该调查什么”。早先报道称,MIRA 无需策略训练即可在定理证明与开放式神经网络架构研究中提升长时程推理,并更有效分配额外算力;跨环境预训练先验被用于初始化生成式 actor-critic 模型 MIRA-AC,在 4 个 autoresearch 环境中提升 gold 表现。10月6日,AGI Hunt 报道称该工作由 Meta AI 提出,并补充说明:决策只发生在工单边界,作者在这些点上训练 critic 预测剩余回报,得到单一 actor-critic(MIRA-AC)——早先报道称“无需策略训练”,后续报道则称作者在工单边界训练 critic 预测剩余回报。
AI 根据报道生成 · 3 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
- AGI HuntMeta AI 发 MIRA:拆分元推理器解决长程研究代理决策难题
Meta AI 提出 MIRA,把长程自主研究代理拆为外层元推理器与执行器:元推理器读取持久研究记录并写下下一次调查的工单,执行器逐份执行。决策只发生在工单边界,作者在这些点上训练 critic 预测剩余回报,得到单一 actor-critic(MIRA-AC)。
- arXiv cs.AIMIRA:为长时程研究智能体学习"下一步该调查什么"的元推理架构
MIRA 是一种分层元推理架构,把研究分配与执行分离:外循环元推理器从持久研究记录中整理上下文并生成下一项调查的工作指令,内循环执行器每次全新执行该指令。无需策略训练,它就在定理证明与开放式神经网络架构研究中提升长时程推理并更有效分配额外算力。跨环境预训练先验用于初始化生成式 actor-critic 模型 MIRA-AC,在 4 个 autoresearch 环境中提升 gold 表现。
本事件热度走势
当前热度 13·可比范围峰值 14(10月6日 23:00)·近 24 小时可比范围变化 +86%
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。