跳到正文

#语音

今日 2 条
今天9月30日周三
  1. AGI Hunt41

    Audio8 ASR Infinite 发布:流式语音识别以滚动 KV Cache 实现 7×24 常数延迟

    Audio8 ASR Infinite 发布,采用原生流式架构与滚动 KV Cache,使内存与延迟保持恒定,可支持 7×24 小时不间断运行。该模型每秒解码 12.5 次,每个时钟步输出一个文本 token,在 12.5/8.3/6.25 次决策每秒之间权衡感知粒度与资源开销。模型已发布,HuggingChat 的 ML 实习生搭建了 Gradio 工作流,可直接在线试用。

9月29日周二
9月24日周四
9月16日周三
9月10日周四
  1. OpenAI:官网动态68

    OpenAI 在 API 中上线 GPT-Live-1,支持全双工语音对话

    OpenAI 将 GPT-Live-1 引入 API,为开发者带来自然的全双工语音对话能力。该模型具备更强的指令遵循能力,支持自定义音色,并提供电话(telephony)支持。

    推荐理由:原文给出 GPT-Live-1 在 API 中的全双工语音、自定义音色与电话接入能力,可据此判断语音应用的接入变化。

8月27日周四
8月11日周二
  1. HuggingFace Blog54

    NVIDIA 发布 Magpie TTS 多语言模型,扩展至 12 种语言

    NVIDIA 发布 Magpie TTS Multilingual,一款 364M 参数的开放权重语音合成模型,支持 12 种语言,新增现代标准阿拉伯语、韩语和巴西葡萄牙语。官方数据显示 B200 单流首音频延迟 32ms,64 并发流下 TTFA 239ms、吞吐约 320 倍实时。模型提供 Hugging Face 开放权重与 NVIDIA NIM 生产部署,并可用 NeMo 微调发音和音色。

6月9日周二
4月16日周四
3月24日周二
  1. Mistral AI66

    Mistral AI 发布首个文本转语音模型 Voxtral TTS,4B 参数支持 9 种语言

    Mistral AI 发布首个文本转语音模型 Voxtral TTS,4B 参数,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,已通过 API 提供,定价 $0.016 / 1k 字符。

    推荐理由:官方给出了 4B 模型在 9 种语言上的延迟、单价以及和 ElevenLabs 的人评对比口径,便于判断语音 Agent 的选型与成本。

2月5日周四
  1. Mistral AI63

    Mistral 发布 Voxtral Transcribe 2,推出实时与批处理两款语音转写模型

    Mistral 发布 Voxtral Transcribe 2 系列两款语音转写模型,包括用于批处理的 Voxtral Mini Transcribe V2 和面向实时场景的 Voxtral Realtime,后者以 Apache 2.0 权重在 Hugging Face 开源。

    推荐理由:Realtime 以 sub-200ms 延迟和 Apache 2.0 权重开源,读者可据此比较实时语音应用的端侧落地成本。

7月15日周二
  1. Mistral AI65

    Mistral AI 发布语音理解模型 Voxtral,含 24B 和 3B 两个版本

    Mistral AI 发布语音理解模型 Voxtral,提供 24B 和 3B 两个尺寸,均以 Apache 2.0 许可开源,并已上线其 API。模型支持 32k token 上下文,可处理最长 30 分钟的音频转写或 40 分钟的音频理解,还能根据语音意图直接触发函数调用。

    推荐理由:原文对比了开源 ASR 与闭源 API 在成本、部署上的取舍,并给出两档尺寸和 API 定价,可作为语音方案选型参考。