跳到正文

#语音

今日 15 条
9月25日周五
9月24日周四
9月23日周三
9月16日周三
9月10日周四
  1. OpenAI:官网动态68

    OpenAI 在 API 中上线 GPT-Live-1,支持全双工语音对话

    OpenAI 将 GPT-Live-1 引入 API,为开发者带来自然的全双工语音对话能力。该模型具备更强的指令遵循能力,支持自定义音色,并提供电话(telephony)支持。

    推荐理由:原文给出 GPT-Live-1 在 API 中的全双工语音、自定义音色与电话接入能力,可据此判断语音应用的接入变化。

9月2日周三
8月28日周五
8月27日周四
8月21日周五
  1. HuggingFace Blog62

    Hugging Face 用三种方法检测语音识别基准过拟合,11 个开源 ASR 模型被检出复现错误参考文本

    Hugging Face 发布研究,用三种探测方法量化语音识别中的基准优化现象,评测 11 个开源 ASR 模型后发现部分高分模型会复现 VoxPopuli、LibriSpeech 参考文本里的错误内容,即使音频与之矛盾。

    推荐理由:原文用三种探测方法量化 ASR 模型对公开基准的过拟合,并给出开源脚本与榜单入口,可作为自查评测可信度的参考。

8月16日周日
  1. Google AI:DEV 作者专属32

    Fetch:扫描狗狗照片,即可聊天、生成护理计划并听它的故事

    Fetch 是一款 AI 狗狗伴侣应用:上传一张照片即可识别最可能的品种,并给出性格、体型、能量水平和护理建议。同一只狗的资料贯穿聊天助手、一键护理计划(可应用内阅读、下载 PDF 或打印)和有声故事书三处;Gemini 承担视觉品种识别、品种相关聊天、结构化护理计划和故事生成,ElevenLabs 提供故事旁白。

8月14日周五
  1. Google AI:DEV 作者专属31

    我做了 Dog Mind:用 Google Gemini 和 ElevenLabs 把狗的照片翻译成情绪与内心独白

    Dog Mind 是一个 AI 网页应用,上传狗照片即可生成品种猜测、情绪评分、肢体语言观察和虚构内心独白。它用 Google Gemini 做多模态分析、ElevenLabs 合成配音,提供六种声音人格和最多三个追问,对话记录 24 小时后过期。代码已在 GitHub 开源,应用部署在 Vercel,定位为娱乐用途。

8月11日周二
  1. HuggingFace Blog54

    NVIDIA 发布 Magpie TTS 多语言模型,扩展至 12 种语言

    NVIDIA 发布 Magpie TTS Multilingual,一款 364M 参数的开放权重语音合成模型,支持 12 种语言,新增现代标准阿拉伯语、韩语和巴西葡萄牙语。官方数据显示 B200 单流首音频延迟 32ms,64 并发流下 TTFA 239ms、吞吐约 320 倍实时。模型提供 Hugging Face 开放权重与 NVIDIA NIM 生产部署,并可用 NeMo 微调发音和音色。

7月15日周三
  1. HuggingFace Blog56

    Hume 推出语音 AI 人类质量评测基准 Real World VoiceEQ

    Hume 推出 Real World VoiceEQ 基准,用于评估语音 AI 交互的人类质量,覆盖 40 多款闭源与开源语音模型、15 个以上评测维度和 60 多项指标。该基准基于超 100 万条人工评分构建,含 78.5 万条 TTS 评分与 4.8 万条 STS 评分。评测显示语音模型的说话能力普遍强于聆听能力,没有一种配置在全部八类能力上进入前五,传统基准会高估真实场景表现。

7月1日周三
6月9日周二
4月30日周四
  1. Google DeepMind63

    Google DeepMind 发布 AI co-clinician 医疗研究计划

    Google DeepMind 发布 AI co-clinician 医疗研究计划,探索在医生监督下由 AI 智能体参与患者问诊的三元照护模式。研究在 98 条真实初级保健查询中有 97 条无关键错误,并在 140 项问诊技能评估中于 68 项达到或超过初级保健医生水平,专家医生整体表现仍更好。

    推荐理由:文章以 140 项问诊技能的盲评对比,呈现 AI co-clinician 与初级保健医生的能力差异和仍待改进之处。

4月16日周四
3月24日周二
  1. Mistral AI66

    Mistral AI 发布首个文本转语音模型 Voxtral TTS,4B 参数支持 9 种语言

    Mistral AI 发布首个文本转语音模型 Voxtral TTS,4B 参数,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,已通过 API 提供,定价 $0.016 / 1k 字符。

    推荐理由:官方给出了 4B 模型在 9 种语言上的延迟、单价以及和 ElevenLabs 的人评对比口径,便于判断语音 Agent 的选型与成本。

3月7日周六
  1. Google Research53

    Google Research 发布 WAXAL 数据集,开放 27 种非洲语言语音资源

    Google Research 发布 WAXAL 开放语音数据集,覆盖 27 种撒哈拉以南非洲语言,面向超 1 亿使用者,采用 CC-BY-4.0 许可。数据集包含约 1,846 小时转写自然语音的 ASR 数据和超 565 小时高保真录音的 TTS 数据。采集工作自 2021 年起由非洲高校与社区组织主导、Google 提供方法指导,Google 表示将继续扩充语种。

2月5日周四
  1. Mistral AI63

    Mistral 发布 Voxtral Transcribe 2,推出实时与批处理两款语音转写模型

    Mistral 发布 Voxtral Transcribe 2 系列两款语音转写模型,包括用于批处理的 Voxtral Mini Transcribe V2 和面向实时场景的 Voxtral Realtime,后者以 Apache 2.0 权重在 Hugging Face 开源。

    推荐理由:Realtime 以 sub-200ms 延迟和 Apache 2.0 权重开源,读者可据此比较实时语音应用的端侧落地成本。

7月17日周四
7月15日周二
  1. Mistral AI65

    Mistral AI 发布语音理解模型 Voxtral,含 24B 和 3B 两个版本

    Mistral AI 发布语音理解模型 Voxtral,提供 24B 和 3B 两个尺寸,均以 Apache 2.0 许可开源,并已上线其 API。模型支持 32k token 上下文,可处理最长 30 分钟的音频转写或 40 分钟的音频理解,还能根据语音意图直接触发函数调用。

    推荐理由:原文对比了开源 ASR 与闭源 API 在成本、部署上的取舍,并给出两档尺寸和 API 定价,可作为语音方案选型参考。