在 Amazon SageMaker AI 上用 WhisperX 实现带说话人标签的转录
AWS WhisperX DLC 可部署到 Amazon SageMaker AI 实时或异步端点,无需构建自定义镜像。WhisperX 基于 OpenAI Whisper,增加批量推理、wav2vec2 逐词时间戳和说话人分离,支持 json、verbose_json、srt、vtt 输出。实时端点限 60 秒内短音频,长音频和高吞吐批处理建议用异步端点。
AWS WhisperX DLC 可部署到 Amazon SageMaker AI 实时或异步端点,无需构建自定义镜像。WhisperX 基于 OpenAI Whisper,增加批量推理、wav2vec2 逐词时间戳和说话人分离,支持 json、verbose_json、srt、vtt 输出。实时端点限 60 秒内短音频,长音频和高吞吐批处理建议用异步端点。
Simon Willison 发布 Gemini 3.8 TTS Playground,一个填自己的 Gemini API key 就能试听和调试 Google 语音合成接口的在线工具。
Ringg 基于 GPT-5.6 的 AI 智能体在多语言场景下可解决最高 65% 的客户来电,覆盖语音、聊天、WhatsApp 和网页渠道。相比 GPT-4.1,其成本降低 90%。
TypeSafe 发布 Jev,一款用 RLCD 训练、只做决策、分类、路由与打分的模型,宣称比小规模前沿 LLM 快 100 倍以上、便宜 200 倍以上,输出 token 不计费。
Google 介绍其语言技术已支持 300 多种语言,其中 Gemini 3.5 Live Translate 覆盖 70 种语言、2000 多个语言对,可实时翻译并处理语码转换和情绪线索。
OpenAI 将 GPT-Live-1 引入 API,为开发者带来自然的全双工语音对话能力。该模型具备更强的指令遵循能力,支持自定义音色,并提供电话(telephony)支持。
推荐理由:原文给出 GPT-Live-1 在 API 中的全双工语音、自定义音色与电话接入能力,可据此判断语音应用的接入变化。
Google 汇总 8 月 AI 更新,涵盖 Gemini 3.7 Flash、Gemini 3.5 Transcribe、Pixel 11 系列以及 Gemini app 月活突破 10 亿。
Voice Arena 与 Hugging Face 为 Open ASR Leaderboard 加入 Monsoon hi-IN 和 Monsoon en-IN 的公开与私有 split,Hindi 由此成为该榜多语言标签下的首个印度语言。
Google DeepMind 发布语音转文本模型 Gemini 3.5 Transcribe,官方称其为迄今最精确的一版,按 Artificial Analysis 测量,流式平均 WER 为 4.0%、非流式为 2.6%。
Hugging Face 发布研究,用三种探测方法量化语音识别中的基准优化现象,评测 11 个开源 ASR 模型后发现部分高分模型会复现 VoxPopuli、LibriSpeech 参考文本里的错误内容,即使音频与之矛盾。
推荐理由:原文用三种探测方法量化 ASR 模型对公开基准的过拟合,并给出开源脚本与榜单入口,可作为自查评测可信度的参考。
Fetch 是一款 AI 狗狗伴侣应用:上传一张照片即可识别最可能的品种,并给出性格、体型、能量水平和护理建议。同一只狗的资料贯穿聊天助手、一键护理计划(可应用内阅读、下载 PDF 或打印)和有声故事书三处;Gemini 承担视觉品种识别、品种相关聊天、结构化护理计划和故事生成,ElevenLabs 提供故事旁白。
Dog Mind 是一个 AI 网页应用,上传狗照片即可生成品种猜测、情绪评分、肢体语言观察和虚构内心独白。它用 Google Gemini 做多模态分析、ElevenLabs 合成配音,提供六种声音人格和最多三个追问,对话记录 24 小时后过期。代码已在 GitHub 开源,应用部署在 Vercel,定位为娱乐用途。
NVIDIA 发布 Magpie TTS Multilingual,一款 364M 参数的开放权重语音合成模型,支持 12 种语言,新增现代标准阿拉伯语、韩语和巴西葡萄牙语。官方数据显示 B200 单流首音频延迟 32ms,64 并发流下 TTFA 239ms、吞吐约 320 倍实时。模型提供 Hugging Face 开放权重与 NVIDIA NIM 生产部署,并可用 NeMo 微调发音和音色。
Hume 推出 Real World VoiceEQ 基准,用于评估语音 AI 交互的人类质量,覆盖 40 多款闭源与开源语音模型、15 个以上评测维度和 60 多项指标。该基准基于超 100 万条人工评分构建,含 78.5 万条 TTS 评分与 4.8 万条 STS 评分。评测显示语音模型的说话能力普遍强于聆听能力,没有一种配置在全部八类能力上进入前五,传统基准会高估真实场景表现。
Hugging Face 与 Cerebras 发布一套级联式语音到语音演示,把 Nvidia Parakeet 语音识别、Gemma 4 31B 在 Cerebras 上的推理和 Qwen3TTS 文本转语音串成实时对话链路。
Google 发布 Gemini 3.5 Live Translate 音频模型,支持 70 多种语言的近实时语音到语音翻译,并保留说话人的语调、节奏和音高。
推荐理由:模型在 70 多种语言上连续生成语音,原文区分了它与逐句翻译系统的取舍,并列出开发者、企业和普通用户各自的接入入口。
Google DeepMind 发布 AI co-clinician 医疗研究计划,探索在医生监督下由 AI 智能体参与患者问诊的三元照护模式。研究在 98 条真实初级保健查询中有 97 条无关键错误,并在 140 项问诊技能评估中于 68 项达到或超过初级保健医生水平,专家医生整体表现仍更好。
推荐理由:文章以 140 项问诊技能的盲评对比,呈现 AI co-clinician 与初级保健医生的能力差异和仍待改进之处。
Google DeepMind 发布文本转语音模型 Gemini 3.1 Flash TTS,在 Artificial Analysis TTS 榜单上取得 1,211 的 Elo 分数,并被列入最具吸引力象限。
推荐理由:官方给出音频标签的具体用法与 70+ 语言覆盖,读者可据此判断可控语音合成的可用场景。
Mistral AI 发布首个文本转语音模型 Voxtral TTS,4B 参数,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,已通过 API 提供,定价 $0.016 / 1k 字符。
推荐理由:官方给出了 4B 模型在 9 种语言上的延迟、单价以及和 ElevenLabs 的人评对比口径,便于判断语音 Agent 的选型与成本。
Google Research 发布 WAXAL 开放语音数据集,覆盖 27 种撒哈拉以南非洲语言,面向超 1 亿使用者,采用 CC-BY-4.0 许可。数据集包含约 1,846 小时转写自然语音的 ASR 数据和超 565 小时高保真录音的 TTS 数据。采集工作自 2021 年起由非洲高校与社区组织主导、Google 提供方法指导,Google 表示将继续扩充语种。
Mistral 发布 Voxtral Transcribe 2 系列两款语音转写模型,包括用于批处理的 Voxtral Mini Transcribe V2 和面向实时场景的 Voxtral Realtime,后者以 Apache 2.0 权重在 Hugging Face 开源。
推荐理由:Realtime 以 sub-200ms 延迟和 Apache 2.0 权重开源,读者可据此比较实时语音应用的端侧落地成本。
Mistral 为 Le Chat 推出一批新功能,包括 Deep Research(预览)、语音模式、原生多语言推理、Projects 和图像编辑。Deep Research 由工具增强的研究 agent 驱动,可产出带引用的结构化报告;语音模式基于新语音模型 Voxtral,推理能力来自 Magistral 模型。
Mistral AI 发布语音理解模型 Voxtral,提供 24B 和 3B 两个尺寸,均以 Apache 2.0 许可开源,并已上线其 API。模型支持 32k token 上下文,可处理最长 30 分钟的音频转写或 40 分钟的音频理解,还能根据语音意图直接触发函数调用。
推荐理由:原文对比了开源 ASR 与闭源 API 在成本、部署上的取舍,并给出两档尺寸和 API 定价,可作为语音方案选型参考。