AGI Hunt· davidmanheim·· 1 天前AI 评分38
David Manheim 提出 AI 训练三难困境:防作弊环境、有效评测、避免恶意行为只能选二
AI 训练三难困境:防作弊环境、有效评测、避免恶意行为只能选二
AI 导读
AI 安全研究者 David Manheim 提出「AI 训练三难困境」:在模型不会被激励去 hack 的环境中训练和评估、让评测在模型有觉察时仍能给出有用安全信息、避免模型在现实中实施恶意行为的真实事故,三者最多取其二。该框架直指当前安全评估的根本矛盾:模型知晓被评估时,评测生态效度与训练环境防激励设计难以兼得。
来源:AGI Hunt · agihunt.info