跳到正文
原文
arXiv cs.CL· Manato Yaguchi, Yotaro Kubo, Hikaru Asano, So Kuroki·· 2 天前AI 评分32

KAME:用随机引导在串联语音到语音模型中学习自然对话行为

Learning Natural Conversational Behavior in Tandem Speech-to-Speech Models with Randomized Guidance

AI 导读

KAME 提出随机中间引导(randomized intermediate guidance),直接从对话语料提取引导信号,省去模拟 LLM 生成缺失引导的数据准备开销。在合成对话上,其回复质量与 LLM 生成引导、相似度基线相当。用 3.8k 小时真实对话训练后,轮次切换更顺畅、audio-judge 自然度优于合成数据版 KAME,并保持对 Moshi 的回复质量优势。

来源:arXiv cs.CL · arxiv.org