Lib TV 黑客松:AI 短片画面已难辨真假,短板在声音
Lib TV AI 短片黑客松 48 小时创作作品展演在小红书科技园举行,现场观众认为相当一部分参赛作品的情节画面已分不清是 AI 生成还是实拍,逼近实拍质感。主要短板在声音,尤其情感表达不足,而配音可大幅提升作品完成度。
Lib TV AI 短片黑客松 48 小时创作作品展演在小红书科技园举行,现场观众认为相当一部分参赛作品的情节画面已分不清是 AI 生成还是实拍,逼近实拍质感。主要短板在声音,尤其情感表达不足,而配音可大幅提升作品完成度。
一位 Reddit 用户实测 MiniMax-H3 的发音能力,用「camel toes」「cameltoes」以及 toze、tohz、tows 等多种拼写组合测试,模型都念不对。该用户开玩笑称,怀疑模型内置了刻意加缺陷的机制,好让用户为「完整版」付费。
6 个视频、97 格人工标注的横测显示,LLM 漏提取的瓶颈在 ASR 分段切断而非模型能力。本地 CLI + Google One Pro 下 gemini-3.7 与 3.8 均达 91/97 = 93.8%,逐视频分数和错误完全一致,但 3.8 慢 5-6 倍。3.6、3.7-medium、3.7-high 在同一视频都漏掉同样 4 格,DeepSeek V4 Flash 仅 71/97。
研究者提出用于共语手势生成的可靠性感知语义-节奏控制框架:以离散运动先验在 motion-code 空间表示手势,用全多模态分支与纯音频分支的分布差异构造条件信息增益,量化语义对动作预测的影响,在内容相关片段加强语义引导、在节奏主导片段减少干预。该框架把背景噪声视为声学可靠性条件,通过噪声条件特征调制与潜在扰动提升鲁棒性,在基准数据集上兼顾语义表达、节奏同步和动作多样性。
论文提出 VoxParity 基准,用同一份文本配不同音频的方式检验语音智能体是否据此改变工具调用,在 23 个可同时跑文本管线的系统中仅 11 个通过。
车载对话助手(ICA)的多轮对话能力评估有了自动化框架:闭环仿真结合策略引导的用户模拟器与对抗式策略管理器,由两级 LLM 评判器评估单轮失败和整段对话质量。在一款工业级 ICA 上用 6 个 LLM 后端和 12 名人工标注者验证,自动评判与人类一致性较高;策略引导比无引导仿真每段对话多发现 2.96 倍独特失败类型,独特失败对话数翻倍以上。
FD-VAD 提出免 ASR 的流式语义端点检测,直接把因果音频窗口映射为 Continue/Stop 决策。该模型由冻结语音编码器、轻量模态适配器和参数高效适配的语言模型组成,采用 last-chunk 训练目标,并引入置信度门控端点提交。在 TurnBench dev set 上,其零样本 EOT recall 达 0.853(FP<=0.10)。
Audio8 ASR Infinite 发布,采用原生流式架构与滚动 KV Cache,使内存与延迟保持恒定,可支持 7×24 小时不间断运行。该模型每秒解码 12.5 次,每个时钟步输出一个文本 token,在 12.5/8.3/6.25 次决策每秒之间权衡感知粒度与资源开销。模型已发布,HuggingChat 的 ML 实习生搭建了 Gradio 工作流,可直接在线试用。
作者 iamrishavraj1 开源了 YourSpeakReps,一个完全本地运行、用于英语口语和模拟面试练习的 AI 口语教练。它用 Ollama 跑本地 LLM、faster-whisper 做语音转文字,配系统原生 TTS 和 FastAPI 浏览器 UI,无需 API key、不依赖云、无按次成本。
开发者 RileyRalmuto 让 Claude Opus 自主撰写脚本,并标注每个词的起始时间戳、呼吸停顿与语音表现,再交给 ElevenLabs 合成配音,目标是无需人工干预产出成品配音。
一位听障用户分享,AI 语音转写把丈夫亲她头顶的声音记成「m...mmm..mmmm」,又把狗叫忠实转写成「woof woof」,她靠这两段字幕才推理出真相。她完全听不到邻居抱怨的狗叫,反而觉得 AI 把狗叫转写成拟声词「可爱到不行」,并在 reddit 发帖问其他人是否也会看到这样的结果。
作者 yawnxyz 展示了一条 AI 全程生成的 7 分钟 SQLite 讲解视频,内容覆盖项目用途、代码高层结构图、一条查询在代码库中的生命周期、核心抽象,以及一次真实执行的 trace(含 join-order 查询规划)。
OpenAI 在 DevDay 2026 活动上宣布 Codex CLI 升级,新增语音对话和 /agents 多智能体视图。用户可以直接与 Codex 对话来启动任务并引导任务推进,也能通过 /agents 把工作分配给多个智能体并跟踪多项任务进度。此次还改进了编辑提示词、恢复会话等日常流程,新增内置工作树支持并更新终端界面,更新适用于所有套餐。
OpenAI 在 DevDay 主题演讲上发布常驻 AI 助手 Dots,由 GPT-6 Astra 驱动,可通过类短信界面或语音通话交互,并用自己的云电脑访问浏览器和 4000 多个受支持应用在后台执行任务。
xAI 的 AI 队友产品 Grok Bot 在过去十天密集发布多项更新,新增语音模式与语音消息,支持 28 种语音人格。更新还包含原生连接 Google Docs、Sheets、Slides 以实现文档协作,并集成 Plaid 连接器和 1Password。团队同时推出团队共享 Bot 与财务模块。
用户 @examachine 公开指控 AI 语音社交平台 Boardy 很可能是个骗局:该平台声称可将创始人对接投资人朋友,但事后从未发出任何引荐邮件。该用户质疑 Boardy 实际上并没有真正连接创始人和投资人,只是假装运作,并呼吁关注这一疑似造假行为。
ElevenLabs 宣布 Eleven v4 Turbo 上线 ElevenAgents 平台,把 v4 的顶级语音质量带到实时对话场景,推理延迟中位数约 100 毫秒。官方称这让 ElevenAgents 能在更多行业支撑更有同理心的实时语音客服体验。
ElevenLabs 发布语音模型 Eleven v4,并推出面向实时语音智能体的 Turbo 版本,官方称 Turbo 在测试中约 150 毫秒开始输出语音。
荣耀 AI 耳夹耳机 FlyClip Pro 开售,提供紫、白、灰三种配色,京东叠加国补与 10 元优惠券后到手价 389.7 元。耳机单次续航 10 小时,配合充电盒综合续航 44 小时,支持无线充电,机身重 6.0g。其搭载 12mm 双磁路单元与 LCP 液晶振膜,响度和低频动力提升 200%,并配备骨传导单元用于 AI 降噪。
豆包语音输入已推出 Windows 版,支持中英混说且免费,作者称语音输入已成为自己打字的主力方式。他提到 Windows 版识别率略逊于手机端,但日常够用,从键盘切换到语音有一段适应期,说了几天后反而觉得打字慢。
谷歌已开始停用移动端的 Google Assistant 语音助手,由 Gemini 取代。部分安卓用户反映,Gemini 应用的账户菜单里已没有“切换到 Google Assistant”选项。此次调整只影响手机和手机配件,如智能手表、Android Auto 和耳机,智能音箱与智能显示器仍继续支持 Google Assistant。
arXiv 论文基于 38 篇原始文献提出 TRG(Timing-Recovery-Grounded)报告标准,用时序、中断后恢复与状态验证结果三轴刻画实时语音智能体。
Audio LLM 往往无法识别自身转录何时不可靠,多数情况下仍会预测转录可靠。研究据此提出基于冻结音频编码器表征的轻量可靠性预测器,在生成前预测可靠性类别,域内与跨域 macro-F1 分别达 81.10% 和 78.09%,超过最强基线 10.33 与 11.93 点。预测为不可靠时可触发向用户澄清,可靠查询照常进行,可靠性标签还能跨 Audio LLM 家族迁移。
浙江乐清警方破获一起利用 AI 语音系统实施诈骗的案件,两个月内上千人受骗,30 名嫌疑人被抓获,涉案流水超千万元。团伙在 AI 平台付费获取动态账号密码,导入非法获取的手机号库后自动批量拨号,拨打时段设为上午 10 点至 12 点、下午 2 点至 6 点,单日呼出电话可超 20 万次,并按沟通中的关键词把用户分为 A 至 F 六个等级,筛出贷款意向者后无缝转接人工话务员。
泄露信息显示,OpenAI 正在开发的「dot」设备可将手机举到耳边直接与 ChatGPT 语音对话,也可呼叫专用 dot 设备。爆料截图进一步显示,该设备能判断何时直接执行操作、何时请求用户批准,并允许用户添加自定义规则以获得更多控制权,其系统提示也坦承相关能力仍在完善中。
Google 在 ADK 中加入原生实时评估,可用模拟用户以语音驱动语音智能体并对回复打分,复用已有的文本智能体评估循环。
语音 AI 初创公司 Modulate 宣布完成 2500 万美元新融资,用于把音频原生模型带给更多开发者。其模型直接分析对话原始音频中的情绪、语气、意图以及深伪信号,旗舰平台 Velma 底层的 Ensemble Listening Model 架构从 100 多个小型专用音频模型中选择并融合结果,公司称该设计最多比把同样音频交给单个大模型高效 1000 倍。
Muslim 是已部署的阿拉伯语语音 AI 平台,向真实用户提供有出处、可溯源的伊斯兰知识,实测 124 例诵读校验准确率 98.4%,端到端语音延迟 0.9-1.7s。
THA 是面向高棉语的开源文本规范化与逆文本规范化工具包,基于加权有限状态转换器,用一次最短路径搜索完成整行分词与分类,并由第二个转换器拒绝高棉语音节内部的 token 边界。在 Google 高棉语测试集上,其对全部 274 个基数词与参考一致,仅有一处拼写变体差异;在 2906 条真实 TTS 提示中,改写的 158 句有 153 句正确。
免训练 ST2P 流程在推理时同时利用词汇与声学信息,将日语发音转写的 CER 从 0.60–1.40%(纯文本基线)降至 0.04–0.17%。它先用 G2P 工具生成文本约束候选,再由冻结的 S2P 模型以整序列负对数似然做从左到右贪心搜索,速度比 beam search 快 3–3.5×,级联解码比直接解码快 2×。
I-Parakeet 将 NVIDIA Parakeet-CTC(0.6B 参数)改为纯整数实现,可在智能手机 NPU 上运行,无需浮点算子或 CPU 回退。关键改动包括整数化相对位置自注意力、minimax 优化的 Swish 近似,以及 BatchNorm 输出的 INT16 网格和重尾激活的百分位校准。
KAME 提出随机中间引导(randomized intermediate guidance),直接从对话语料提取引导信号,省去模拟 LLM 生成缺失引导的数据准备开销。在合成对话上,其回复质量与 LLM 生成引导、相似度基线相当。用 3.8k 小时真实对话训练后,轮次切换更顺畅、audio-judge 自然度优于合成数据版 KAME,并保持对 Moshi 的回复质量优势。
Inquesto Score(IS)是一套语音智能体可靠性评测协议,把可靠性定义为固定、版本化评测人群中没有出现功能故障或更严重失效的通话占比。其 v0.1 覆盖 30 个场景、3 种声学条件、4 个说话人分组,对参考语音智能体系统的 13 种配置各评测 306 通通话,其中 talk-over、响应延迟等时序失效直接从音频测量。协议、参考实现与评测记录已公开。
LLM 同声语音到语音翻译框架 FAST-CAP 提出,包含分解式 S2ST 架构 FAST、因果感知自适应策略 CAP 和因果感知延迟指标。在 CVSS 西班牙语、德语、法语上,它比固定策略最高提升 1.2 BLEU、延迟相对降低 26%。该框架用远少于现有系统的训练数据,在语音翻译质量与说话人保真度上达到 SOTA,延迟相对降低最多 38.8%。
腾讯正在秘密内测 AI 游戏陪伴产品“鹅次元”,主打数字人 AI 搭子,提供语音对话、画面实时识别和游戏陪伴等能力。产品内置多位人设各异的男女虚拟角色,选定后可闲聊互动,或激活适配多款主流网游的游戏陪伴模式。目前全部功能限时免费,界面已露出星币兑换能量的付费框架,预示未来商业化方向。
华为 FreeBuds Neo 无线耳机于 9 月 29 日 10:08 正式开售,定价 699 元、首发价 669 元,搭载 HarmonyOS 7 与自研第三代音频 AI 芯片。
波士顿语音智能公司 Modulate 完成 2500 万美元新融资,由 Future Ventures 领投,Hyperplane 与 Lakestar 参投。其平台运行 100 多个小型模型,提供转录、情绪分析、深度伪造与 AI 音乐检测,并为受监管行业的语音智能体做合规策略执行。PitchBook 数据显示,本轮前公司累计融资 4100 万美元、估值 1.7 亿美元。
祖父被 AI 深度伪造语音冒充亲人骗走赎金后,Tarini Padmanabhuni 创立了 DetectifAI,用可在手机端运行的小型模型实时判断通话语音是否 AI 生成。
AWS 官方博客给出在 Amazon SageMaker AI 上通过 JumpStart 部署 Qwen3-TTS-12Hz-1.7B-Base 到实时推理端点、并用几秒参考音频做语音克隆的完整步骤。
AWS WhisperX DLC 可部署到 Amazon SageMaker AI 实时或异步端点,无需构建自定义镜像。WhisperX 基于 OpenAI Whisper,增加批量推理、wav2vec2 逐词时间戳和说话人分离,支持 json、verbose_json、srt、vtt 输出。实时端点限 60 秒内短音频,长音频和高吞吐批处理建议用异步端点。