AGI Hunt· Yuhan Guo·· 5 小时前AI 评分39
EVOKE 用多目标压力逼出 LLM Agent 内置世界知识,提升跨环境迁移能力
AI 导读
Yuhan Guo 等发布 EVOKE,一种面向可迁移决策的后训练方法:固定环境状态与交互历史,让模型在多样目标下对同一批候选动作排序,从而逼出预训练已内化的世界知识,而非依赖表面情境习惯。在 3 个骨干模型的多任务上,EVOKE 提升了任务表现、陌生环境泛化与数据效率,并通过受控分析解释增益来源。
来源:AGI Hunt · agihunt.info