arXiv cs.AI· Timoth\'ee Lesort, Alejandra L\'opez de Aberasturi G\'omez, Tristan Karch, Tom Veniat, Philippe Modard, Karl Tuyls, Ludovic Denoyer·· 4 小时前AI 评分36
以国际象棋为基准评测大语言模型的提示词优化(APO)
Benchmarking Prompt Optimization of Large Language Models With Chess
AI 导读
一项新基准用 1,118 个 Lichess 谜题评测冻结 LLM 的自动提示词优化(APO)。该基准采用精确匹配打分并借助引擎评估替代走法,题目可再生、难度可调,在 8 个目标模型上对比 6 种 APO 算法,并把解题增益与同领域短对局表现关联。
来源:arXiv cs.AI · arxiv.org