跳到正文
原文
arXiv cs.AI· Wenxuan Wang, Zekai Liu, Weinan Zhang, Yu Cheng, Yang Yang·· 4 小时前AI 评分43

D-OPCD:用在线策略上下文蒸馏把智能体经验内化进扩散模型权重

Internalizing Agent Experience into Diffusion Model Weights via On-Policy Context Distillation

AI 导读

D-OPCD 把智能体改进后的提示词当作特权上下文,通过在线策略上下文蒸馏将智能体框架的能力写入扩散模型权重,使其仅凭原始查询也能保留部分收益。搭配 Auto Skill Evolver(ASE)的 Text-to-Image 智能体,四个 benchmark 上平均直接生成分数从 60.52 升至 65.09。

来源:arXiv cs.AI · arxiv.org