跳到正文
原文
arXiv cs.AI· Ramin Pishehvar, Andrea Morandi, Mahesh Viswanathan·· 4 小时前AI 评分50

评估 LLM 路由的升级信号:目标、对照与五种自欺方式

Evaluating Escalation Signals for LLM Routing: Targets, Controls, and Five Ways to Fool Yourself

AI 导读

语义熵可作 LLM 路由的升级信号:在 GSM8K 上,规模相差约 12 倍的小/大模型对中,其 AUROC 0.871,匹配成本下路由准确率比随机升级最多高 9 个点。但论文在三个基准、两个模型族上评估时发现,合成基准上的亮眼结果具有误导性——只用问题难度的规则几乎完全追平语义熵。论文由此给出一套检查方法,并提前预测出复用缓存结果更便宜的方案 AUROC 会从 0.908 跌至 0.518。

来源:arXiv cs.AI · arxiv.org