跳到正文
原文
arXiv cs.CL· Vaishnav Negi, Lev Sorokin, Soroosh Tayebi Arasteh, Andrea Stocco·· 5 小时前AI 评分36

车载对话助手(ICA)多轮对话的自动化评估框架

Automated Evaluation of Multi-Turn Dialogues in In-Car Conversational Assistants

AI 导读

车载对话助手(ICA)的多轮对话能力评估有了自动化框架:闭环仿真结合策略引导的用户模拟器与对抗式策略管理器,由两级 LLM 评判器评估单轮失败和整段对话质量。在一款工业级 ICA 上用 6 个 LLM 后端和 12 名人工标注者验证,自动评判与人类一致性较高;策略引导比无引导仿真每段对话多发现 2.96 倍独特失败类型,独特失败对话数翻倍以上。

来源:arXiv cs.CL · arxiv.org