跳到正文
原文
AGI Hunt· ChengleiSi·· 3 小时前AI 评分44

Dataset Policy Gradients:仅靠训练数据就能在 GPT-2 权重里嵌入二维码

Dataset Policy Gradients:仅靠训练数据就能在 GPT-2 权重里嵌入二维码

AI 导读

Tristan Thrush 等人在 COLM 发表论文 Dataset Policy Gradients,把训练数据的选择当作可优化对象,用策略梯度直接优化数据集,以命中任意可微分的训练或后训练指标。

来源:AGI Hunt · agihunt.info