热点事件持续更新
Box^2-Bench:衡量模型对不可靠工作流的鲁棒性
1 篇报道1 个报道来源7 小时前更新
先了解这件事
AI 综述
Box^2-Bench 被提出,用于衡量模型对不可靠工作流的鲁棒性。该基准通过固定模型与任务、只改变工作流的可靠性,隔离测量模型调节自身对指导依赖程度的能力。据 2026 年 10 月 1 日报道,实验发现前沿模型能从可靠工作流中获益,但面对误导性、或中途变糟的工作流依然脆弱。在“用坏工作流训练、好工作流评测”的设置下,反事实 SFT 可提升鲁棒性;基于结果的强化学习更倾向使用有帮助的工作流,且这一行为可泛化到同行纠错、损坏记忆等外部信息场景。
AI 根据报道生成 · 1 小时前更新
最新进展10月1日 12:17
新报道称该基准显示前沿模型面对误导性或中途变糟的工作流仍脆弱,反事实 SFT 可提升鲁棒性。报道时间线
沿着报道,了解事件的不同侧面。
10月1日
- AGI HuntBox^2-Bench:前沿模型难以及时无视不可靠的工作流指导
Box^2-Bench 通过固定模型与任务、只改变工作流可靠性,隔离测量模型调节对指导依赖的能力,发现前沿模型能从可靠工作流获益,但面对误导性或中途变糟的工作流依然脆弱。用坏工作流训练、好工作流评测的实验显示,反事实 SFT 可提升鲁棒性,基于结果的 RL 更倾向使用有帮助的工作流,且该行为可泛化到同行纠错与损坏记忆等外部信息场景。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。