跳到正文
原文
AGI Hunt· pliang279·· 3 小时前AI 评分50

Guidance-TTT:测试时只训 8B 小模型,科学发现任务刷新 4 项最佳

Guidance-TTT:测试时只训 8B 小模型,科学发现任务刷新 4 项最佳

AI 导读

MIT 等团队提出 Guidance-TTT:测试时只在线训练 8B 小模型提出高层策略,冻结的大模型把策略转成可执行代码,再用自适应组相对 RL 目标更新小模型。该方法避开大模型测试时训练的高昂成本,仅用开源权重、无联网检索,在 4 个科学发现任务上超过已报道最佳结果,论文与代码均已开源。

来源:AGI Hunt · agihunt.info