AGI Hunt· CUHKSZ·· 2 小时前AI 评分56
HuatuoGPT-3 仅 27B 在 HealthBench 达 70.1,超越 GPT-6 Astra
AI 导读
港中深团队发布 HuatuoGPT-3,探索从基座模型出发的纯 RL 领域适配,绕开主流的 SFT+RL 流水线。团队指出纯 on-policy RL 存在冷启动问题,混合策略 RL 则有梯度饥饿与教师分布锚定两种失效模式,为此提出 OnePO 自适应目标演化,并在策略超过教师后通过 Teacher Retirement 丢弃教师输出。
来源:AGI Hunt · agihunt.info