热点事件持续更新
闭式权重手术:把 Qwen 3.5 的 4B 能力移植进 0.8B
2 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026 年 10 月 6 日 16:15,AGI Hunt 报道了一种被称为“闭式权重手术”的方法:作者在少量校准 prompt 上提取层间隐状态轨迹,据此直接求解学生模型中 SwiGLU MLP 块的权重更新,从而把 Qwen 3.5 的 4B 模型能力移植到 0.8B 模型上。报道称,这一做法跳过了标准蒸馏流程,而标准蒸馏通常耗时数周、需要数十亿 token;当时报道只介绍了方法思路与目标模型,未披露校准样本数量、评测结果或代码等细节。同日 17:41,AGI Hunt 的后续报道补充了更多技术细节与评测数据:更新改用 SVD delta 闭式求解学生模型 SwiGLU MLP 的权重更新,全程零反向传播;并称移植后的 0.8B 模型在 ARC-Challenge 上达到 42.15%,跑赢 2B 模型。早先报道称尚未有评测结果,后续报道则给出了具体基准分数。目前仍未见第三方复现或代码发布信息。
AI 根据报道生成 · 2 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
10月6日
- AGI Hunt闭式权重手术:0.8B 模型 ARC-Challenge 达 42.15%,跑赢 2B 模型
研究者提出"闭式权重手术",仅用少量校准 prompt 提取教师模型层间隐状态轨迹,以 SVD delta 闭式求解学生模型 SwiGLU MLP 权重更新,全程零反向传播,把 4B 能力移植进 0.8B 模型。
- AGI Hunt闭式权重手术:少量校准样本把 Qwen 3.5 的 4B 能力移植进 0.8B 模型
作者提出闭式权重手术,在少量校准 prompt 上提取层间隐状态轨迹,直接求解学生模型 SwiGLU MLP 块的权重更新,把 Qwen 3.5 的 4B 能力移植到 0.8B,跳过耗时数周、需数十亿 token 的标准蒸馏。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。