arXiv cs.CL· Yida Cai, Xin Dai, Bingxiang He, Huiyuan Xie, Yuxiao Ye, Zhenghao Liu, Yang Bai, Zhiyuan Liu·· 8 小时前AI 评分35
LexReward:面向法律语言模型的分类体系驱动奖励框架
LexReward: A Taxonomy-Driven Reward Framework for Legal Language Models
AI 导读
LexReward 是面向法律语言模型的分类体系驱动奖励框架,从 Style、Element、Chain 三个维度评估法律回答质量并配套评分细则。其奖励用于构建成对偏好数据以训练 DPO 和奖励模型 LexRM,实验显示细则能可靠区分回答质量,DPO 在三个维度上均有提升。各维度专用奖励模型可通过强化学习提升对应维度表现,奖励阶段无需参考答案。
来源:arXiv cs.CL · arxiv.org