跳到正文
热点事件持续更新

国际象棋基准用于LLM提示词优化评测

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026年10月2日,arXiv cs.AI 发布一项新基准,改用国际象棋评测大语言模型的自动提示词优化(APO)。该基准选取 1,118 个 Lichess 谜题作为题目,评测对象为冻结的 LLM,采用精确匹配打分,并借助引擎评估替代走法;题目可再生、难度可调。研究在 8 个目标模型上对比 6 种 APO 算法,并把解题增益与同领域短对局的表现相关联。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. arXiv cs.AI
    以国际象棋为基准评测大语言模型的提示词优化(APO)

    一项新基准用 1,118 个 Lichess 谜题评测冻结 LLM 的自动提示词优化(APO)。该基准采用精确匹配打分并借助引擎评估替代走法,题目可再生、难度可调,在 8 个目标模型上对比 6 种 APO 算法,并把解题增益与同领域短对局表现关联。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。