AGI Hunt· ChengleiSi·· 3 小时前AI 评分44
Dataset Policy Gradients:仅靠训练数据就能在 GPT-2 权重里嵌入二维码
Dataset Policy Gradients:仅靠训练数据就能在 GPT-2 权重里嵌入二维码
AI 导读
Tristan Thrush 等人在 COLM 发表论文 Dataset Policy Gradients,把训练数据的选择当作可优化对象,用策略梯度直接优化数据集,以命中任意可微分的训练或后训练指标。
来源:AGI Hunt · agihunt.info