Audio8 ASR Infinite 发布:流式语音识别以滚动 KV Cache 实现 7×24 常数延迟
Audio8 ASR Infinite 发布,采用原生流式架构与滚动 KV Cache,使内存与延迟保持恒定,可支持 7×24 小时不间断运行。该模型每秒解码 12.5 次,每个时钟步输出一个文本 token,在 12.5/8.3/6.25 次决策每秒之间权衡感知粒度与资源开销。模型已发布,HuggingChat 的 ML 实习生搭建了 Gradio 工作流,可直接在线试用。
Audio8 ASR Infinite 发布,采用原生流式架构与滚动 KV Cache,使内存与延迟保持恒定,可支持 7×24 小时不间断运行。该模型每秒解码 12.5 次,每个时钟步输出一个文本 token,在 12.5/8.3/6.25 次决策每秒之间权衡感知粒度与资源开销。模型已发布,HuggingChat 的 ML 实习生搭建了 Gradio 工作流,可直接在线试用。
GPT-6.1 Sol 已在 Amazon Bedrock 正式可用,作为 GPT-6 Sol 的重大升级,面向智能体编码、计算机操作和专业工作负载提供更强推理。
推荐理由:文章给出 GPT-6.1 Sol 与 Astra、GPT-6 Sol 的评测及单任务成本对比,可据此评估智能体编码任务的性价比。
ornith-ai 在 Hugging Face 发布三个 DFlash 草稿模型检查点,为 Ornith-1.5-9B、Ornith-1.5-397B 和 Ornith-1.5-35B-A3B 提供投机解码加速。DFlash 草稿模型并非独立语言模型,须与目标模型在支持 DFlash 的推理环境中配合运行,仓库同时附带 serving 配置。
Together AI 宣布阿里 Qwen3.8-Flash 本月剩余时间全线 6 折,并建议开发者趁降价跑评测。该模型定位高并发应用场景,如编码助手与协同办公助手,主打在低成本下优化输出质量。
OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 在 Amazon Bedrock 正式可用,API 定价显著低于 GPT-5.6 前代。GPT-6 Sol 面向开发与运维中反复出现的复杂任务,GPT-6 Luna 面向大批量重复任务,两者都支持显式提示词缓存。OpenAI 的内部事实性评测显示,GPT-6 Sol 的事实性错误约为 GPT-5.6 Sol 的一半。
推荐理由:两款模型按复杂任务与高频任务分层,API 定价低于 GPT-5.6 前代,可据此判断日常负载的选型。
AWS 宣布 Claude Opus 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,这是 Claude 5.5 系列的首个模型。
推荐理由:文章对比了 Claude Opus 5.5 与 Opus 5 在 token 效率、定价和安全分类器上的差异,并给出在 Bedrock 上调用该模型的代码示例。
TypeSafe 发布 Jev,一款用 RLCD 训练、只做决策、分类、路由与打分的模型,宣称比小规模前沿 LLM 快 100 倍以上、便宜 200 倍以上,输出 token 不计费。
Liquid AI 发布 LFM2.5-DSpark 草稿模型检查点,覆盖 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 三个模型,通过投机解码在不改变输出质量的前提下最高提升 3.18 倍吞吐。
NVIDIA 发布 Magpie TTS Multilingual,一款 364M 参数的开放权重语音合成模型,支持 12 种语言,新增现代标准阿拉伯语、韩语和巴西葡萄牙语。官方数据显示 B200 单流首音频延迟 32ms,64 并发流下 TTFA 239ms、吞吐约 320 倍实时。模型提供 Hugging Face 开放权重与 NVIDIA NIM 生产部署,并可用 NeMo 微调发音和音色。
Mistral 发布 OCR 4 文档解析模型,在文本提取之外新增边界框、块类型分类和逐页逐词置信度,支持 170 种语言并可单容器自托管部署。该模型在 OlmOCRBench 得 85.20、OmniDocBench 得 93.07,人类偏好评估中平均胜率 72%。
推荐理由:OCR 4 把边界框、块分类和置信度一并输出,读者可据此判断结构化文档解析在检索与智能体流程里的接入方式。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上推理速度最高提升 4 倍。
推荐理由:原文说明 DiffusionGemma 与 Gemma 4 的分工,前者面向低并发本地推理,并列出速度与质量上的取舍。
Mistral 发布 Codestral 25.08 及配套企业编码栈,涵盖补全、语义检索、智能体工作流和 Mistral Code IDE 插件,今日起可用于企业部署。
Mistral AI 发布 Mistral Medium 3,称其以每百万 token 输入 $0.4、输出 $2 的定价,在各项基准上达到 Claude Sonnet 3.7 的 90% 或以上。
推荐理由:原文给出对标 Claude Sonnet 3.7 的基准表现与每百万 token 定价,可据此衡量中型模型在企业场景中的成本位置。
Mistral 发布 Mistral OCR,一款以图像和 PDF 为输入、按顺序交错输出文本与图片的 OCR API,并已成为 Le Chat 文档理解的默认模型。
推荐理由:官方列出与 Google Document AI、Azure OCR、Gemini 等模型的横向基准对比,可用于判断文档解析模型的当前水位。