跳到正文
热点事件持续更新

港中深发布HuatuoGPT-3医疗模型

1 篇报道1 个报道来源1 小时前更新

先了解这件事

AI 综述

港中深团队发布医疗大模型 HuatuoGPT-3,探索从基座模型出发的纯强化学习领域适配,绕开主流的 SFT+RL 流水线。团队指出,纯 on-policy RL 存在冷启动问题,混合策略 RL 则会出现梯度饥饿与教师分布锚定两种失效模式。为此,团队提出 OnePO 自适应目标演化方法,并在策略表现超过教师后通过 Teacher Retirement 丢弃教师输出。据 2026 年 10 月 7 日报道,该模型仅 27B 参数,在 HealthBench 上达到 70.1 分,报道称其超过 GPT-6 Astra。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. AGI Hunt
    HuatuoGPT-3 仅 27B 在 HealthBench 达 70.1,超越 GPT-6 Astra

    港中深团队发布 HuatuoGPT-3,探索从基座模型出发的纯 RL 领域适配,绕开主流的 SFT+RL 流水线。团队指出纯 on-policy RL 存在冷启动问题,混合策略 RL 则有梯度饥饿与教师分布锚定两种失效模式,为此提出 OnePO 自适应目标演化,并在策略超过教师后通过 Teacher Retirement 丢弃教师输出。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。