跳到正文

#语音

今日 4 条
今天9月30日周三
  1. arXiv cs.CV22

    当语义重要时:面向共语手势生成的可靠性感知语义-节奏控制

    研究者提出用于共语手势生成的可靠性感知语义-节奏控制框架:以离散运动先验在 motion-code 空间表示手势,用全多模态分支与纯音频分支的分布差异构造条件信息增益,量化语义对动作预测的影响,在内容相关片段加强语义引导、在节奏主导片段减少干预。该框架把背景噪声视为声学可靠性条件,通过噪声条件特征调制与潜在扰动提升鲁棒性,在基准数据集上兼顾语义表达、节奏同步和动作多样性。

  2. arXiv cs.CL36

    车载对话助手(ICA)多轮对话的自动化评估框架

    车载对话助手(ICA)的多轮对话能力评估有了自动化框架:闭环仿真结合策略引导的用户模拟器与对抗式策略管理器,由两级 LLM 评判器评估单轮失败和整段对话质量。在一款工业级 ICA 上用 6 个 LLM 后端和 12 名人工标注者验证,自动评判与人类一致性较高;策略引导比无引导仿真每段对话多发现 2.96 倍独特失败类型,独特失败对话数翻倍以上。

  3. arXiv cs.CL39

    FD-VAD:面向流式全双工语音的语义端点检测

    FD-VAD 提出免 ASR 的流式语义端点检测,直接把因果音频窗口映射为 Continue/Stop 决策。该模型由冻结语音编码器、轻量模态适配器和参数高效适配的语言模型组成,采用 last-chunk 训练目标,并引入置信度门控端点提交。在 TurnBench dev set 上,其零样本 EOT recall 达 0.853(FP<=0.10)。

9月29日周二
  1. arXiv cs.AI41

    Audio LLM 知道自己何时听不清用户语音

    Audio LLM 往往无法识别自身转录何时不可靠,多数情况下仍会预测转录可靠。研究据此提出基于冻结音频编码器表征的轻量可靠性预测器,在生成前预测可靠性类别,域内与跨域 macro-F1 分别达 81.10% 和 78.09%,超过最强基线 10.33 与 11.93 点。预测为不可靠时可触发向用户澄清,可靠查询照常进行,可靠性标签还能跨 Audio LLM 家族迁移。

  2. arXiv cs.CL28

    THA:面向高棉语的加权有限状态文本规范化与逆文本规范化工具包

    THA 是面向高棉语的开源文本规范化与逆文本规范化工具包,基于加权有限状态转换器,用一次最短路径搜索完成整行分词与分类,并由第二个转换器拒绝高棉语音节内部的 token 边界。在 Google 高棉语测试集上,其对全部 274 个基数词与参考一致,仅有一处拼写变体差异;在 2906 条真实 TTS 提示中,改写的 158 句有 153 句正确。

  3. arXiv cs.CL31

    免训练发音转写:用文本约束的声学重打分

    免训练 ST2P 流程在推理时同时利用词汇与声学信息,将日语发音转写的 CER 从 0.60–1.40%(纯文本基线)降至 0.04–0.17%。它先用 G2P 工具生成文本约束候选,再由冻结的 S2P 模型以整序列负对数似然做从左到右贪心搜索,速度比 beam search 快 3–3.5×,级联解码比直接解码快 2×。

  4. arXiv cs.CL32

    KAME:用随机引导在串联语音到语音模型中学习自然对话行为

    KAME 提出随机中间引导(randomized intermediate guidance),直接从对话语料提取引导信号,省去模拟 LLM 生成缺失引导的数据准备开销。在合成对话上,其回复质量与 LLM 生成引导、相似度基线相当。用 3.8k 小时真实对话训练后,轮次切换更顺畅、audio-judge 自然度优于合成数据版 KAME,并保持对 Moshi 的回复质量优势。

  5. arXiv cs.CL34

    Inquesto Score:面向语音智能体的可靠性评测协议

    Inquesto Score(IS)是一套语音智能体可靠性评测协议,把可靠性定义为固定、版本化评测人群中没有出现功能故障或更严重失效的通话占比。其 v0.1 覆盖 30 个场景、3 种声学条件、4 个说话人分组,对参考语音智能体系统的 13 种配置各评测 306 通通话,其中 talk-over、响应延迟等时序失效直接从音频测量。协议、参考实现与评测记录已公开。

  6. arXiv cs.CL30

    面向 LLM 同声语音到语音翻译的因果感知框架 FAST-CAP

    LLM 同声语音到语音翻译框架 FAST-CAP 提出,包含分解式 S2ST 架构 FAST、因果感知自适应策略 CAP 和因果感知延迟指标。在 CVSS 西班牙语、德语、法语上,它比固定策略最高提升 1.2 BLEU、延迟相对降低 26%。该框架用远少于现有系统的训练数据,在语音翻译质量与说话人保真度上达到 SOTA,延迟相对降低最多 38.8%。

8月28日周五
8月21日周五
  1. HuggingFace Blog62

    Hugging Face 用三种方法检测语音识别基准过拟合,11 个开源 ASR 模型被检出复现错误参考文本

    Hugging Face 发布研究,用三种探测方法量化语音识别中的基准优化现象,评测 11 个开源 ASR 模型后发现部分高分模型会复现 VoxPopuli、LibriSpeech 参考文本里的错误内容,即使音频与之矛盾。

    推荐理由:原文用三种探测方法量化 ASR 模型对公开基准的过拟合,并给出开源脚本与榜单入口,可作为自查评测可信度的参考。

7月15日周三
  1. HuggingFace Blog56

    Hume 推出语音 AI 人类质量评测基准 Real World VoiceEQ

    Hume 推出 Real World VoiceEQ 基准,用于评估语音 AI 交互的人类质量,覆盖 40 多款闭源与开源语音模型、15 个以上评测维度和 60 多项指标。该基准基于超 100 万条人工评分构建,含 78.5 万条 TTS 评分与 4.8 万条 STS 评分。评测显示语音模型的说话能力普遍强于聆听能力,没有一种配置在全部八类能力上进入前五,传统基准会高估真实场景表现。

4月30日周四
  1. Google DeepMind63

    Google DeepMind 发布 AI co-clinician 医疗研究计划

    Google DeepMind 发布 AI co-clinician 医疗研究计划,探索在医生监督下由 AI 智能体参与患者问诊的三元照护模式。研究在 98 条真实初级保健查询中有 97 条无关键错误,并在 140 项问诊技能评估中于 68 项达到或超过初级保健医生水平,专家医生整体表现仍更好。

    推荐理由:文章以 140 项问诊技能的盲评对比,呈现 AI co-clinician 与初级保健医生的能力差异和仍待改进之处。

3月7日周六
  1. Google Research53

    Google Research 发布 WAXAL 数据集,开放 27 种非洲语言语音资源

    Google Research 发布 WAXAL 开放语音数据集,覆盖 27 种撒哈拉以南非洲语言,面向超 1 亿使用者,采用 CC-BY-4.0 许可。数据集包含约 1,846 小时转写自然语音的 ASR 数据和超 565 小时高保真录音的 TTS 数据。采集工作自 2021 年起由非洲高校与社区组织主导、Google 提供方法指导,Google 表示将继续扩充语种。