arXiv cs.CL· Tianzhu Zhang·· 4 小时前AI 评分45
LLM 何时该信任自己的修订?内在自纠正的风险感知研究
When Should LLMs Trust Their Own Revisions? A Risk-Aware Study of Intrinsic Self-Correction
AI 导读
一项研究追踪 29 个开源权重 LLM 在 BoolQ、GSM8K 和 Corr2Cause 上初始答案到修订答案的正确性转变,Llama-3.1-8B 在 GSM8K 上提升 25.5 个百分点,但 19.1% 原本正确的答案被改错。
来源:arXiv cs.CL · arxiv.org