DeepSeek 开源 6 个昇腾版基础组件,对标英伟达版
DeepSeek 于 9 月 30 日开源面向华为昇腾算力平台的 6 个基础设施组件,与此前面向英伟达开源的组件一一对应,完成从英伟达 GPU 到昇腾芯片的整套移植。
推荐理由:读者可以对照这套组件与英伟达版的对应关系,了解头部模型厂商把训练栈移植到国产算力生态的进展。
DeepSeek 于 9 月 30 日开源面向华为昇腾算力平台的 6 个基础设施组件,与此前面向英伟达开源的组件一一对应,完成从英伟达 GPU 到昇腾芯片的整套移植。
推荐理由:读者可以对照这套组件与英伟达版的对应关系,了解头部模型厂商把训练栈移植到国产算力生态的进展。
ComfyUI v0.38.0 发布,新增 Ming Image 0.1 6B 文生图模型、MiniMax-H3 Fun ControlNet Union 2.0 与基于 Wan 2.1 和 VACE 的 ID-V2V 身份保持视频转视频支持。
推荐理由:版本清单列出新增模型节点与量化、HDR 支持,可据此判断现有 ComfyUI 工作流是否要调整。
开发者 julsimon 对比多家供应商数据发现,H100 SXM 按需租用价格半年内上涨 16%-30%,RunPod Secure Cloud 单卡时价格从 3 月的 $2.69 涨至 9 月的 $3.49。这一走势与持续下降的 token 价格形成反差,作者认为反映算力供需紧张。他还发布了覆盖 106 个模型、116 种实例的比价计算器,用于评估不同推理方案的成本。
微软研究院提出 SortedRL 在线长度感知调度系统,瞄准 LLM 强化学习训练的调度瓶颈。RL 生成阶段模型产出长度差异很大的多步推理长响应,而标准训练更新要求 batch 内所有响应都完成,短响应闲置等待最长响应,导致 GPU 在生成周期中有 70%–74% 时间空闲。该系统在不破坏 RL 训练稳定性的前提下加速训练并提升学习效率。
Canonical 与高通宣布,官方 Ubuntu 支持将于 2027 年登陆骁龙 X2 系列笔记本平台,为本地构建和运行 agentic AI 提供软硬件一体环境。该支持提供在骁龙 X2 硬件上严格验证的标准化认证企业级镜像,开箱即用,无需手动调内核或装驱动。平台主打 80 TOPS NPU 加速与多天续航,双方称这是「为 agentic 世界解锁更多 Linux PC」的一步。
PrismQuant 提出量化器感知的旋转框架,将激活主特征空间与非对称分组 INT4 的常量组子空间对齐。在 W4A4KV4 下 Llama-3.2-3B 达到 SOTA,Llama-3.1-70B 困惑度 3.85、平均零样本准确率 72.46%,仅比全精度低 0.22 个百分点。
免训练的 Reliable Parallel Decoding(RPD)通过逐层预测稳定性与最终置信度筛选候选,提升 Masked Diffusion 语言模型并行解码的可靠性。
AAOI(应用光电)被指在美国做过度的垂直整合,CW 激光器产线烧掉大量资本开支后良率依然很差。引用的分析师观点更激进,称只关心 UHP 激光器,Coherent、除源杰外的中国激光公司、Source Photonics(东山精密)与 AAOI 都不行,这批公司是被不懂激光的人推起来的。这折射出 AI 光模块供应链的垂直整合之争与良率隐忧。
开发者 gandamuml 让 LLM 在 tapes 中记录执行顺序,再在克隆环境按序回放,为 Minecraft 1.21.11 世界生成提供了可复现的确定性验证。Minecraft 1.21.11 的世界生成受 Java 运行时差异影响,同一版本自身每次运行结果都可能不同。该方案在完成确定性验证的同时,保留了正式发布运行的灵活性。
FastVR 是一个基于一步扩散模型的流式视频修复框架,可在单张 H20 GPU 上以 11 FPS 处理 1080p 视频。它结合轻量 VAE 与分块因果注意力降低推理成本,并用速度一致性正则化和连续轨迹学习提升修复质量。实验显示 FastVR 比所评估的扩散基线更高效,并在合成与真实世界 benchmark 上达到 SOTA。
Ollama 0.35 发布,新增 /v1/systemone 端点,支持基于 TypeSafe Jev API 的决策模型,并同步上线 Nimble 等三个可本地运行的新模型。Nimble 单次决策仅需 91ms,官方随后补充发布了配套博客、决策能力文档与 API 文档。该功能本地运行无额外成本、延迟更低,适用于工单分诊等需要一次性回答一组命名问题的场景。
FastGuide 用并行与自回归解码的自适应混合来加速扩散大语言模型的奖励引导,在三个奖励基准上比顺序奖励引导解码最高快 4.4 倍,并保持相近的生成质量。它按每个解码步骤计算一次引导并复用于多个 token,借助 KV 缓存与注意力稀疏重算降低开销,模型不自信的 token 会被推迟解掩。
微软推进面向数据系统的 AI SW Factory,覆盖 Targeting、Coding、Reviewing、Ops 四个 SDLC 阶段。在微软数十个代码仓库的规模化部署中,它相比 agentic coding 达到 3 倍工程效率、最高 22 倍 token 效率。
开源 Agent 框架 Omnigent 发布 v0.16.0,Linux Agent 新增 copyonwrite: true 沙盒写入,编辑只留在一次性层、不改动底层文件。
Hugging Face 团队发布 tokenizers v1,并撰文详解这次重构,称在很多场景下比 v0.23 快数十倍,重点是把 encode/decode 与扩展性都做到可度量。
受控评估在 MATH-500 的 386 个任务上对比 8 个生成式 harness 与 1 个 baseline 及 9 份字节相同副本,每个执行 3 次:完全相同的程序仍带来 2.16 个百分点的重复平均 oracle 余量。
研究者提出一种神经符号路由器,把结构化查询交给确定性求解器、只让 SLM 处理开放式应用题,路由逻辑用 L* 语法推断算法学习 DFA。在 Raspberry Pi 4B 的 100 条未测提示上,其路由准确率 100%、总准确率 98.3%,优于 Program-of-Thought 的 72.0%。
Oracle 算力交付进度显示,Project Jupiter 大概率延期约 6 个月至 2027 年产能,但管理层重申不影响营收指引。不含 Jupiter 的本年度节奏为 Q1 交付超 400MW、Q2 再交付 400-500MW、Q3 计划交付 850MW、Q4 计划交付 1.1GW。
DeepSeek 批量更新其大部分开源库,新增对华为昇腾(Huawei Ascend)的支持。eliebakouch 指出了这一更新,yacineMTB 以夸张的戏剧化反应转发,暗示这一 NVIDIA 生态替代信号值得关注。
Audio8 ASR Infinite 发布,采用原生流式架构与滚动 KV Cache,使内存与延迟保持恒定,可支持 7×24 小时不间断运行。该模型每秒解码 12.5 次,每个时钟步输出一个文本 token,在 12.5/8.3/6.25 次决策每秒之间权衡感知粒度与资源开销。模型已发布,HuggingChat 的 ML 实习生搭建了 Gradio 工作流,可直接在线试用。
独立开发者、Ice Cubes 作者 Dimillian 宣布,他加入 OpenAI 后作为 onboarding 工程师的首个项目已合入主分支,这次修复将磁盘写入量减少 50%、存储文件体积缩小 4 倍。他开玩笑希望 Neo 在 DevDay 演讲中提及此事,但 Neo 没看他发的 Slack 私信。
fleetwood.dev 发布长文《Domain specific architectures for AI inference》,论证 GPU 在深度学习中的主导地位很大程度是历史偶然,图形架构遗产至今仍在。
DeepSeek 官方将 DeepGEMM 移植到华为昇腾 NPU 的版本 DeepGEMM Ascend 已开源,作者称其 GEMM 性能达到硬件极限的 99.8%,MegaMoE 达 98%。
DeepSeek 9 月 30 日上午通过官方公众号宣布,正式开源面向华为昇腾算力平台的基础设施组件,涵盖 TileLang 高级语言编译工具、计算库与分布式通信库,所有组件与此前面向英伟达平台的开源组件一一对应。
Amazon Bedrock 现支持在首尔和新加坡以区域内推理调用 Anthropic 的 Claude 模型:首尔提供 Claude Opus 5 和 Claude Sonnet 5,新加坡提供 Claude Sonnet 5。
Amazon Bedrock 在印度上线 Claude Opus 5、Claude Sonnet 5 和 Claude Haiku 4.5,通过地理跨区域推理把请求限制在 ap-south-1 与 ap-south-2 之间,客户数据不存储在目标区域、只保留在源区域。
ModelScope 的 modelscope Python 包不再附带 CLI 工具,所有命令行工具已迁移到新包 modelscope-hub,官方文档未作说明。若发现原 modelscope 命令行工具消失,可用 uv tool install "modelscope-hub" 安装新包。
Vik's Newsletter 长文分析指出,agentic AI 的兴起让 CPU 重新成为 AI 基础设施瓶颈,集群中 CPU:GPU 比例需要上调,甚至可能 CPU 多于 GPU。
SGLang 团队把 Qwen3.8-27B 改造成多模态决策模型,从实时游戏画面出发,以低于 100 毫秒的决策延迟打通《宝可梦火红》的四天王与冠军。工程层面,SGLang 新增原生 /v1/decisions 接口,可将 LLM 和 VLM 当作分类与打分模型使用;另加 /v1/systemone,让 Jev 类开源模型可配合 TypeSafe SDK 使用。
一位开发者为推广其婴儿踢动计数器 app TenKicks,搭建了 reels 自动生成流水线,弃用所有付费视频模型订阅,改在自租的 RunPod GPU 上运行开源 MiniMax H3,无需 credits、无月费,每条 reel 成本约 $0.50。
戴尔 AI 领导力峰会上专家总结出企业 AI 部署的四大洞察:成本与控制正取代模型和 GPU 成为核心议题。戴尔称依托长期芯片合作可在两周内交付 350 个机架,Deepgram 的语音模型将从数据中心走向在 AI 笔记本上物理隔离运行。token 预算被数周耗尽,推动负载回流本地并让 CPU 在智能体 AI 中重新受重视,运行时治理成为企业智能体的准入门槛。
jeffreyajewett 发帖指出,当前算力市场真正稀缺的是没有被长期采购协议(offtake)锁定的算力容量,若所有可用 MW 和 GPU 都被预留给最安全的大客户,下一代巨头将失去成长竞争的机会。他主张市场应刻意为尚未显山露水的公司保留容量。
开发者用 pgrx 将 Rust 实现的 Kafka broker 直接嵌入 Postgres,项目取名 Kafgres。Kafka 客户端连接 Postgres 的 9092 端口即可使用,协议层面完全兼容,客户端无法分辨背后其实是数据库在充当消息队列。这一做法在 X 上引发围观,帖子里附带了更多实现细节的线程链接。
知名技术 YouTuber Sentdex 发推力挺 GLM 5.3,称该系列让普通人在本地就能跑上前沿模型,不需要「一个自以为比你懂什么对你最好的家伙」把关,并号召停止给那些游说反对用户的公司和同类厂商送钱。他同时提醒黑客攻击与网络犯罪仍然违法且刑罚极重,这可能是针对有人拿本地不受限模型搞违法行为的回应。他总结称「它就是个好模型」,具体规格以官方为准。
Condé Nast 用 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频发现方案,将每项内容发现任务耗时从 250 分钟降至不到 2 分钟。方案由 AWS GenAIIC 合作开发,采用 TwelveLabs Marengo 嵌入模型,对超过 140,000 个视频的转录、视觉和音频做意图语义搜索,支持图像查询与精确时间戳。
AWS 博客给出一个合同智能平台的参考架构,用部署在 Amazon Bedrock AgentCore 上的抽取智能体与验证智能体把合同 PDF 转为结构化数据,再通过 Amazon Quick 提供嵌入式仪表盘和自然语言查询。
GPT-6.1 Sol 已在 Amazon Bedrock 正式可用,作为 GPT-6 Sol 的重大升级,面向智能体编码、计算机操作和专业工作负载提供更强推理。
推荐理由:文章给出 GPT-6.1 Sol 与 Astra、GPT-6 Sol 的评测及单任务成本对比,可据此评估智能体编码任务的性价比。
开发者 sathvik1233 分享基于 Hindsight 记忆服务器的 SRE copilot ResolveIQ,让 Agent 记住历史事故教训,并在同一告警再次触发时拦住作者重启数据库。
Pavan Belagatti 提出 AI 软件架构正走向分层智能:由确定性代码维护工作流结构,快速专用小模型处理窄域语义分支,只在异常情况下才升级调用完整推理模型。其中 system-one 小模型(如 Jev)做路由比 LLM 快约 200 倍、便宜约 400 倍。LangGraph 这类框架提供状态管理、持久化执行与人机协同检查点等编排层。
作者结合自己搭建内部智能体的经历,梳理了动作选择器、先规划后执行、代码后执行、MapReduce、双智能体和上下文最小化等防提示注入的架构设计模式。文中指出 LLM 无法区分提示词与上下文,攻击者可用网页里的隐藏指令让智能体泄露数据甚至删表,因此他用 Azure Function 把数据库查询和邮件发送限制在预定义操作与允许名单内。他强调没有单一模式能覆盖全部漏洞,需要针对可能的失败场景组合使用。
推荐理由:作者结合自己搭建内部智能体的经历,把几类防提示注入的架构模式拆成可复用的取舍清单。