AGI Hunt· HamelHusain·· 5 小时前AI 评分50
Hamel Husain:通用评测指标大多弊大于利,应基于错误分析自建评估器
Hamel Husain:通用评测指标大多弊大于利,应基于错误分析自建评估器
AI 导读
Hamel Husain 称大多数情况下不该用现成通用评测指标,helpfulness、coherence 等抽象分数与具体用例无关,高分只会制造虚假信心、浪费时间。他建议先做错误分析理解失败模式,基于真实问题定义二元失败类别并创建自定义评估器,再用人工判断校验。有经验的从业者仍可把通用指标当作探索信号,筛出值得人工审查的 trace。
来源:AGI Hunt · agihunt.info