热点事件持续更新
人大提出 STAIR:仅训 1.2 万参数提升多轮推理
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026 年 10 月 5 日,AGI Hunt 报道中国人民大学团队提出 STAIR(Stale-Token Attention for Inter-query Reuse),用于多轮推理中的历史上下文复用:把早期响应生成的 key/value 存入固定 bank,在冻结基座模型的前提下仅训练 12,288 个参数。实验覆盖三个 Qwen 模型和四个 benchmark,带历史的后续轮次平均准确率最高提升 11.67 个百分点。目前该报道仅披露方法与上述实验结果,尚无其他来源的独立复现或后续更新。
AI 根据报道生成 · 2 小时前更新
最新进展10月5日 21:17
AGI Hunt 报道人大 STAIR:冻结基座仅训 1.2 万参数,多轮推理最高提升 11.67 点。报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- AGI HuntRUC 提出 STAIR:仅训 1.2 万参数,历史上下文让多轮推理准确率提升 11.67 点
中国人民大学团队提出 STAIR(Stale-Token Attention for Inter-query Reuse),把早期响应生成的 key/value 存入固定 bank,冻结基座模型、仅训练 12,288 个参数,在三个 Qwen 模型和四个 benchmark 上使带历史的后续轮次平均准确率最高提升 11.67 个百分点。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。