热点事件持续更新
OpenJev-RLCD:推理模型校准决策RL实现
1 篇报道1 个报道来源7 小时前更新
先了解这件事
AI 综述
2026年10月1日,arXiv cs.AI 报道了 OpenJev-RLCD,给出了面向推理模型的校准决策强化学习(RLCD)实现。其做法是:模型先采样 rationale,再用严格适当评分规则为最终答案分布打分,训练采用“先校准、再强化”的两阶段配方。在 Qwen3-1.7B 的两个推理任务上,以 3 个种子进行配对检验,RLCD 的准确率匹配或超过 SFT、RFT/STaR 与 GRPO 三种基线,并在选择性预测上全面胜出。报道未提及该实现与其他 RLCD 版本的具体差异,也未给出其他模型规模或任务上的验证结果。
AI 根据报道生成 · 2 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
10月1日
- arXiv cs.AIOpenJev-RLCD:一个可用的 RLCD 实现
OpenJev-RLCD 给出了面向推理模型的校准决策强化学习(RLCD)实现:模型先采样 rationale,再用严格适当评分规则为其最终答案分布打分,并采用先校准、再强化的两阶段配方。在 Qwen3-1.7B 的两个推理任务上(3 个种子、配对检验),RLCD 准确率匹配或超过 SFT、RFT/STaR 与 GRPO,并在选择性预测上全面胜出。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。