热点事件持续更新
开发者微调 Qwen3.8-27B 修复推理力度乱序
2 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
2026 年 10 月 1 日,AGI Hunt 报道独立开发者 bytkim 发布 Qwen3.8-27B-pi,一个针对 Pi 编码 agent 场景微调的 Qwen3.8-27B 模型。起因是基座模型的 effort(推理强度)分级乱序:low 档的推理 token 常比 medium 档更多,在 Terminal-Bench 2.1 上 medium 档通过率甚至低于 low 档。同日的后续报道补充,该模型经 SFT 加 GRPO 训练后,力度排序在 Terminal-Bench 2.1、GPQA Diamond、SciCode 上均成立,并称可节省 41% token。早先报道未披露训练方法与评测成绩,后续报道给出了训练方式和三项评测的定性结论,但未给出具体分数;目前仍无第三方复现或验证的报道。
AI 根据报道生成 · 2 小时前更新
最新进展10月1日 04:36
后续报道称该模型经 SFT 加 GRPO 训练,力度排序在三项评测上均成立,可省 41% token。报道时间线
沿着报道,了解事件的不同侧面。
10月1日
- AGI Hunt个人微调 Qwen3.8-27B-pi:修复推理力度乱序,省 41% token
独立开发者微调出 Qwen3.8-27B-pi,修复基座模型 reasoning 力度乱序,专攻 Pi 编码 agent 场景。经 SFT 加 GRPO 训练后,力度排序在 Terminal-Bench 2.1、GPQA Diamond、SciCode 上均成立。
- AGI Hunt开发者发布 Qwen3.8-27B-pi 微调模型,修复推理强度分级乱序
开发者 bytkim 发布 Qwen3.8-27B-pi,一个针对 Pi 编码 agent 场景微调的 Qwen3.8-27B 模型,起因是基座模型的 effort 分级失效,low 档推理 token 常比 medium 多,Terminal-Bench 2.1 上 medium 通过率甚至低于 low。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。