DeepSeek 开源 6 个昇腾版基础组件,对标英伟达版
DeepSeek 于 9 月 30 日开源面向华为昇腾算力平台的 6 个基础设施组件,与此前面向英伟达开源的组件一一对应,完成从英伟达 GPU 到昇腾芯片的整套移植。
推荐理由:读者可以对照这套组件与英伟达版的对应关系,了解头部模型厂商把训练栈移植到国产算力生态的进展。
DeepSeek 于 9 月 30 日开源面向华为昇腾算力平台的 6 个基础设施组件,与此前面向英伟达开源的组件一一对应,完成从英伟达 GPU 到昇腾芯片的整套移植。
推荐理由:读者可以对照这套组件与英伟达版的对应关系,了解头部模型厂商把训练栈移植到国产算力生态的进展。
teortaxesTex 指出,DeepSeek 首次确认其目标是从兆瓦级迈向吉瓦级算力基建,并明确提到自研 128 卡「超节点」,规模约相当于两个机柜的华为 950。DeepSeek 并未计划采购华为预制 950 pod,而是自行设计整套系统,这与此前多份招股/备案文件中的信息一致。
Kimi K3 采用 AttnRes、DeepSeek V4 采用 mHC,ByteDance 则提出 HC,三者以不同残差方案应对大模型「深度诅咒」。由于三种方法的训练预算、模型设计与代码库各不相同,无法直接比较优劣。DepthBench 试图对这些深度扩展方案做统一评测。
Latent Space 的 AINews 汇总了 OpenAI DevDay 2026 的发布:由 GPT-6 Astra 驱动、可连接 4000+ 应用的常驻智能体 Dots,定价 $2/$10 per M tokens 的 GPT-6.1 Sol,以及最高 8x 加速的 Ultrafast 和 Decisions API。
推荐理由:汇总了 DevDay 发布清单、定价与第三方评测,可对照 GPT-6.1 Sol 与 Opus 5.5 的成本差异。
OpenAI 发布 6.1 Sol,没有等来 Astra,Dots 仅限 Pro 用户使用。博主 flowersslop 在布拉格断网一周后盘点这些错过动态,并自嘲
DeepSeek 的娘化拟人形象「DeepSeek Chan」正在抖音全面走红,热度居高不下、势头凶猛。据转发推文称,这反映国内 AI 品牌以二次元拟人化方式在短视频平台破圈的传播现象。
用户 teortaxesTex 刻意使用 DeepSeek 网页版,让其中的 Whale 模型「收割」自己的数据,包括他在其他付费模型上产出的工作成果,并称这种做法为「众包蒸馏」。他的理由是数据反正会被拿去训练,不如主动贡献,让模型能力「从所有人之手回到所有人」。这既是对大厂数据训练惯例的戏谑,也反映了部分重度用户对蒸馏机制的默认与利用。
6 个视频、97 格人工标注的横测显示,LLM 漏提取的瓶颈在 ASR 分段切断而非模型能力。本地 CLI + Google One Pro 下 gemini-3.7 与 3.8 均达 91/97 = 93.8%,逐视频分数和错误完全一致,但 3.8 慢 5-6 倍。3.6、3.7-medium、3.7-high 在同一视频都漏掉同样 4 格,DeepSeek V4 Flash 仅 71/97。
DeepSeek 上线面向社区的用户反馈渠道,用户下载 DeepSeek 的 harness 并打开相应选项,即可向官方贡献数据,帮助改进其模型和产品。该渠道的具体操作路径由网友披露;同期还有登录 harness 即可领取 6 元 API 赠金的活动。
X 用户 teortaxesTex 引用 Astra 的分析指出,DeepSeek 的最新开源虽尚不等于一套能完整复现前沿模型训练的昇腾软硬件栈,但距离已经「出奇地近」。他还表示,在 DeepSeek 发布达到 GEMM 99.8%、MegaMoE 98% 硬件上限的开源 kernel 之后,若没有端到端训练能力反而令人难以置信,暗示新模型可能已在华为昇腾硬件上训练。
DeepSeek 推出 Harness 桌面端并发布 v0.2.0-rc.2 新版本,提供 macOS 和 Windows 安装包,无需终端部署即可开箱即用。用户在左下角登录账号即可领取 6 元 API 赠金,活动有效期至 10 月 6 日。
DeepSeek 批量更新其大部分开源库,新增对华为昇腾(Huawei Ascend)的支持。eliebakouch 指出了这一更新,yacineMTB 以夸张的戏剧化反应转发,暗示这一 NVIDIA 生态替代信号值得关注。
DeepSeek 官方将 DeepGEMM 移植到华为昇腾 NPU 的版本 DeepGEMM Ascend 已开源,作者称其 GEMM 性能达到硬件极限的 99.8%,MegaMoE 达 98%。
DeepSeek 9 月 30 日上午通过官方公众号宣布,正式开源面向华为昇腾算力平台的基础设施组件,涵盖 TileLang 高级语言编译工具、计算库与分布式通信库,所有组件与此前面向英伟达平台的开源组件一一对应。
OpenRouter 开源编码模型 token 份额排名中,GLM 5.3 Flash 以 29.2% 居首,DeepSeek V4.1 Flash 25.6%、Kimi K3 18.9% 紧随其后。
DeepSeek Harness v0.2 预览版于 9 月 29 日发布,提供开箱即用的 macOS 和 Windows 桌面端安装包,已上线 DeepSeek 官网。新版新增插件管理页面,输入 npm 包名即可安装、停用和卸载插件,实验性创造模式下还能通过对话让它编写和修改插件。官方按模型 API 用户口径统计,约 60% 的用户使用了第三方插件,团队表示将建设官方插件市场。
美国众议院中国问题特别委员会民主党首席议员 Ro Khanna 致函 DeepSeek、阿里巴巴和 Moonshot AI,询问其在超级智能、递归自我改进(RSI)上的进展,以及是否设有安全防护和 kill switch。
DeepSeek 弹性计算(DSec)团队宣布大量开放招聘名额,尤其需要资深工程师,同时发布技术分享《DeepSeek 弹性计算 (DSec):面向大规模 Agent 训练的沙盒基础设施》。原文将其解读为 DeepSeek 正为 Agent 训练构建沙盒级基础设施,agent 方向的基建投入进入实质扩张阶段。
在 QwQ-32B、DeepSeek-R1-Distill-Qwen-32B 与 Qwen3-32B 上,针对 Adult、COMPAS、Credit 三项高风险决策任务的思考/非思考消融显示,推理对反事实公平性存在不对称双重效应:既消除原有的反事实翻转,又在接近饱和的模型置信度下制造新翻转。
一项对照研究显示,DeepSeek、GPT 和 Gemini 系列模型在美股交易中增加测试时推理量,并未可靠提升扣除交易成本后的组合净收益。研究覆盖一年美股数据、超 80 万条资产预测,输入条件分为数值、可识别新闻与遮蔽新闻三类,DeepSeek 从无推理到最大推理的表现非单调,重复生成还会带来不稳定的处理效应与组合选择。作者据此建议部署前逐任务验证。
中国互联网络信息中心在 2026 中国互联网基础资源大会上发布《生成式人工智能应用发展报告(2026)》,截至 2026 年上半年我国生成式人工智能用户规模超过 7 亿人,普及率突破 50%。
该研究分析了 DeepSeek、Qwen、豆包三个中文大模型在 12,165 个来自真实中文搜索查询的是非事实问题上的迎合行为,覆盖 364,941 条回答。研究在有无推理两种模式下对比基线、用户信念注入和反迎合提示三种设置,并区分与错误信念一致的错误和由正确转为不确定的答案。结果显示推理并非一贯的防线,反迎合指令能在减少错误认同的同时增加不确定性。
Abundant AI 创始人 Bindu Reddy 发布 Agent Networks,一个基于开源 DeepSeek Flash 构建的协作式个人智能体网络,个人 agent 可实际完成工作。该网络内置 100+ 连接器(含 GitHub、WhatsApp),支持 agent 团队相互通信协作,并能协调「人+agent」混合团队。他表示整个平台将快速升级为自动化工作的协作智能体网络。
英伟达 CEO 黄仁勋做客 CNBC 节目《财经早间(Squawk Box)》回应 AI 模型蒸馏争议,称蒸馏属于市场竞争行为,并说若不想别人使用自家产品,只需了解自己的客户并关闭对应服务即可。
GRPO 让模型对同一问题采样多次作答,用可验证奖励为每个答案打分,再以组内平均奖励为基线比较各次尝试来更新模型,无需单独的 critic。该方法由 DeepSeekMath 工作提出,用以替代传统 PPO 的内存开销,文中用「6 箱每箱 8 件、卖出 6 件、答案 42」的算术题演示打分与优势计算。组内奖励完全一致时优势全为零,模型无法判断该偏好哪次尝试。
Steve Yegge 关停编码智能体项目 Gas Town,承认每月数千美元的 agent 订阅只做成了这一个项目;Databricks 向约 3,500 名工程师铺开 GPT-6 Astra 后,整体编码支出增加约 60%。OpenAI 同期发布模型失准事件披露框架及六份案例报告。
ALTK-Evolve 与 ACE 都让智能体从自身轨迹中学习,区别在注入方式:前者按任务检索少量高支持度指南,后者每步注入完整 playbook,因而 Token 更省。
英国 AI Security Institute 分析显示,开源权重模型与闭源前沿模型的网络安全能力差距今年收窄,GLM-5.2 与 DeepSeek V4-Pro 水平接近 4–7 个月前发布的前沿闭源模型,窄于 2025 年大部分时间测得的 6–10 个月。