跳到正文
原文
AGI Hunt· Yuhan Guo·· 5 小时前AI 评分39

EVOKE 用多目标压力逼出 LLM Agent 内置世界知识,提升跨环境迁移能力

AI 导读

Yuhan Guo 等发布 EVOKE,一种面向可迁移决策的后训练方法:固定环境状态与交互历史,让模型在多样目标下对同一批候选动作排序,从而逼出预训练已内化的世界知识,而非依赖表面情境习惯。在 3 个骨干模型的多任务上,EVOKE 提升了任务表现、陌生环境泛化与数据效率,并通过受控分析解释增益来源。

来源:AGI Hunt · agihunt.info