AGI Hunt· pliang279·· 3 小时前AI 评分50
Guidance-TTT:测试时只训 8B 小模型,科学发现任务刷新 4 项最佳
Guidance-TTT:测试时只训 8B 小模型,科学发现任务刷新 4 项最佳
AI 导读
MIT 等团队提出 Guidance-TTT:测试时只在线训练 8B 小模型提出高层策略,冻结的大模型把策略转成可执行代码,再用自适应组相对 RL 目标更新小模型。该方法避开大模型测试时训练的高昂成本,仅用开源权重、无联网检索,在 4 个科学发现任务上超过已报道最佳结果,论文与代码均已开源。
来源:AGI Hunt · agihunt.info