跳到正文
原文
AGI Hunt· victormustar·· 3 小时前AI 评分45

个人微调 Qwen3.8-27B-pi:修复推理力度乱序,省 41% token

个人微调 Qwen3.8-27B-pi:修复推理力度乱序,省 41% token

AI 导读

独立开发者微调出 Qwen3.8-27B-pi,修复基座模型 reasoning 力度乱序,专攻 Pi 编码 agent 场景。经 SFT 加 GRPO 训练后,力度排序在 Terminal-Bench 2.1、GPQA Diamond、SciCode 上均成立。

来源:AGI Hunt · agihunt.info