热点事件持续更新
港中深发布HuatuoGPT-3医疗模型
1 篇报道1 个报道来源1 小时前更新
先了解这件事
AI 综述
港中深团队发布医疗大模型 HuatuoGPT-3,探索从基座模型出发的纯强化学习领域适配,绕开主流的 SFT+RL 流水线。团队指出,纯 on-policy RL 存在冷启动问题,混合策略 RL 则会出现梯度饥饿与教师分布锚定两种失效模式。为此,团队提出 OnePO 自适应目标演化方法,并在策略表现超过教师后通过 Teacher Retirement 丢弃教师输出。据 2026 年 10 月 7 日报道,该模型仅 27B 参数,在 HealthBench 上达到 70.1 分,报道称其超过 GPT-6 Astra。
AI 根据报道生成 · 1 小时前更新
最新进展10月7日 11:17
港中深发布HuatuoGPT-3,27B模型HealthBench达70.1分,称超越GPT-6 Astra。报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- AGI HuntHuatuoGPT-3 仅 27B 在 HealthBench 达 70.1,超越 GPT-6 Astra
港中深团队发布 HuatuoGPT-3,探索从基座模型出发的纯 RL 领域适配,绕开主流的 SFT+RL 流水线。团队指出纯 on-policy RL 存在冷启动问题,混合策略 RL 则有梯度饥饿与教师分布锚定两种失效模式,为此提出 OnePO 自适应目标演化,并在策略超过教师后通过 Teacher Retirement 丢弃教师输出。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。