跳到正文
原文
AGI Hunt· StephanSturges·· 4 小时前AI 评分41

LLM 缺乏「幂等性」:让 Claude/GPT 复查自己写的大代码库会自相矛盾

LLM 缺乏「幂等性」:复查自己的大代码库会自相矛盾

AI 导读

AradhyeAgarwal 指出,让 Claude/GPT 编写或审计一个大型代码库后再让其复查,模型几乎必然会得出与之前矛盾的结论。他认为根源在于 LLM 缺乏「幂等性」——同样的输入在多轮对话中无法得到一致的输出,并建议把这一现象做成 benchmark,用于系统衡量模型的自洽性。

来源:AGI Hunt · agihunt.info