网友花式测试 MiniMax-H3 发音:连「cameltoes」都念不出,怀疑故意留缺陷
一位 Reddit 用户实测 MiniMax-H3 的发音能力,用「camel toes」「cameltoes」以及 toze、tohz、tows 等多种拼写组合测试,模型都念不对。该用户开玩笑称,怀疑模型内置了刻意加缺陷的机制,好让用户为「完整版」付费。
一位 Reddit 用户实测 MiniMax-H3 的发音能力,用「camel toes」「cameltoes」以及 toze、tohz、tows 等多种拼写组合测试,模型都念不对。该用户开玩笑称,怀疑模型内置了刻意加缺陷的机制,好让用户为「完整版」付费。
Audio8 ASR Infinite 发布,采用原生流式架构与滚动 KV Cache,使内存与延迟保持恒定,可支持 7×24 小时不间断运行。该模型每秒解码 12.5 次,每个时钟步输出一个文本 token,在 12.5/8.3/6.25 次决策每秒之间权衡感知粒度与资源开销。模型已发布,HuggingChat 的 ML 实习生搭建了 Gradio 工作流,可直接在线试用。
ElevenLabs 发布语音模型 Eleven v4,并推出面向实时语音智能体的 Turbo 版本,官方称 Turbo 在测试中约 150 毫秒开始输出语音。
Simon Willison 发布 Gemini 3.8 TTS Playground,一个填自己的 Gemini API key 就能试听和调试 Google 语音合成接口的在线工具。
TypeSafe 发布 Jev,一款用 RLCD 训练、只做决策、分类、路由与打分的模型,宣称比小规模前沿 LLM 快 100 倍以上、便宜 200 倍以上,输出 token 不计费。
OpenAI 将 GPT-Live-1 引入 API,为开发者带来自然的全双工语音对话能力。该模型具备更强的指令遵循能力,支持自定义音色,并提供电话(telephony)支持。
推荐理由:原文给出 GPT-Live-1 在 API 中的全双工语音、自定义音色与电话接入能力,可据此判断语音应用的接入变化。
Google DeepMind 发布语音转文本模型 Gemini 3.5 Transcribe,官方称其为迄今最精确的一版,按 Artificial Analysis 测量,流式平均 WER 为 4.0%、非流式为 2.6%。
NVIDIA 发布 Magpie TTS Multilingual,一款 364M 参数的开放权重语音合成模型,支持 12 种语言,新增现代标准阿拉伯语、韩语和巴西葡萄牙语。官方数据显示 B200 单流首音频延迟 32ms,64 并发流下 TTFA 239ms、吞吐约 320 倍实时。模型提供 Hugging Face 开放权重与 NVIDIA NIM 生产部署,并可用 NeMo 微调发音和音色。
Google 发布 Gemini 3.5 Live Translate 音频模型,支持 70 多种语言的近实时语音到语音翻译,并保留说话人的语调、节奏和音高。
推荐理由:模型在 70 多种语言上连续生成语音,原文区分了它与逐句翻译系统的取舍,并列出开发者、企业和普通用户各自的接入入口。
Google DeepMind 发布文本转语音模型 Gemini 3.1 Flash TTS,在 Artificial Analysis TTS 榜单上取得 1,211 的 Elo 分数,并被列入最具吸引力象限。
推荐理由:官方给出音频标签的具体用法与 70+ 语言覆盖,读者可据此判断可控语音合成的可用场景。
Mistral AI 发布首个文本转语音模型 Voxtral TTS,4B 参数,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,已通过 API 提供,定价 $0.016 / 1k 字符。
推荐理由:官方给出了 4B 模型在 9 种语言上的延迟、单价以及和 ElevenLabs 的人评对比口径,便于判断语音 Agent 的选型与成本。
Mistral 发布 Voxtral Transcribe 2 系列两款语音转写模型,包括用于批处理的 Voxtral Mini Transcribe V2 和面向实时场景的 Voxtral Realtime,后者以 Apache 2.0 权重在 Hugging Face 开源。
推荐理由:Realtime 以 sub-200ms 延迟和 Apache 2.0 权重开源,读者可据此比较实时语音应用的端侧落地成本。
Mistral AI 发布语音理解模型 Voxtral,提供 24B 和 3B 两个尺寸,均以 Apache 2.0 许可开源,并已上线其 API。模型支持 32k token 上下文,可处理最长 30 分钟的音频转写或 40 分钟的音频理解,还能根据语音意图直接触发函数调用。
推荐理由:原文对比了开源 ASR 与闭源 API 在成本、部署上的取舍,并给出两档尺寸和 API 定价,可作为语音方案选型参考。