跳到正文
原文
AGI Hunt· investigatormaker·· 3 小时前AI 评分64

用 Reddit 真实提问测 LLM:能否守住「不可上传数据」这类硬约束

AI 导读

一位做 Reddit 阅读工具的开发者分享了一套无需搭 agent 的 LLM 答案评测练习:从 Reddit 挑三个关于同一实际任务的公开帖子,先自行列出隐藏硬约束做成不交给模型的答案 key,再让模型基于材料提方案、逐条引用原文支撑约束判断、缺失信息标为 unknown,最后对照答案 key 判分,文风再有说服力但违反约束即算失败。

来源:AGI Hunt · agihunt.info