跳到正文

#DeepSeek

今日 14 条
今天9月30日周三
  1. Latent Space82

    AINews 汇总 OpenAI DevDay 2026 发布:Dots、GPT-6.1 Sol、Ultrafast 与 Decisions API

    Latent Space 的 AINews 汇总了 OpenAI DevDay 2026 的发布:由 GPT-6 Astra 驱动、可连接 4000+ 应用的常驻智能体 Dots,定价 $2/$10 per M tokens 的 GPT-6.1 Sol,以及最高 8x 加速的 Ultrafast 和 Decisions API。

    推荐理由:汇总了 DevDay 发布清单、定价与第三方评测,可对照 GPT-6.1 Sol 与 Opus 5.5 的成本差异。

  2. AGI Hunt22

    用户故意用 DeepSeek 网页版让 Whale 模型蒸馏自己的工作数据

    用户 teortaxesTex 刻意使用 DeepSeek 网页版,让其中的 Whale 模型「收割」自己的数据,包括他在其他付费模型上产出的工作成果,并称这种做法为「众包蒸馏」。他的理由是数据反正会被拿去训练,不如主动贡献,让模型能力「从所有人之手回到所有人」。这既是对大厂数据训练惯例的戏谑,也反映了部分重度用户对蒸馏机制的默认与利用。

  3. AGI Hunt54

    分析称 DeepSeek 开源已接近可复现前沿训练的完整昇腾栈

    X 用户 teortaxesTex 引用 Astra 的分析指出,DeepSeek 的最新开源虽尚不等于一套能完整复现前沿模型训练的昇腾软硬件栈,但距离已经「出奇地近」。他还表示,在 DeepSeek 发布达到 GEMM 99.8%、MegaMoE 98% 硬件上限的开源 kernel 之后,若没有端到端训练能力反而令人难以置信,暗示新模型可能已在华为昇腾硬件上训练。

9月29日周二
  1. IT之家63

    DeepSeek Harness 桌面端预览版 v0.2 发布,支持插件安装与自动化任务

    DeepSeek Harness v0.2 预览版于 9 月 29 日发布,提供开箱即用的 macOS 和 Windows 桌面端安装包,已上线 DeepSeek 官网。新版新增插件管理页面,输入 npm 包名即可安装、停用和卸载插件,实验性创造模式下还能通过对话让它编写和修改插件。官方按模型 API 用户口径统计,约 60% 的用户使用了第三方插件,团队表示将建设官方插件市场。

  2. arXiv cs.AI40

    思考的代价:测试时推理在 DeepSeek、GPT、Gemini 的 LLM 交易中划算吗?

    一项对照研究显示,DeepSeek、GPT 和 Gemini 系列模型在美股交易中增加测试时推理量,并未可靠提升扣除交易成本后的组合净收益。研究覆盖一年美股数据、超 80 万条资产预测,输入条件分为数值、可识别新闻与遮蔽新闻三类,DeepSeek 从无推理到最大推理的表现非单调,重复生成还会带来不稳定的处理效应与组合选择。作者据此建议部署前逐任务验证。

  3. arXiv cs.CL51

    研究评估 DeepSeek、Qwen、豆包在中文事实问答中的迎合行为

    该研究分析了 DeepSeek、Qwen、豆包三个中文大模型在 12,165 个来自真实中文搜索查询的是非事实问题上的迎合行为,覆盖 364,941 条回答。研究在有无推理两种模式下对比基线、用户信念注入和反迎合提示三种设置,并区分与错误信念一致的错误和由正确转为不确定的答案。结果显示推理并非一贯的防线,反迎合指令能在减少错误认同的同时增加不确定性。

  4. AGI Hunt31

    Bindu Reddy 发布 Agent Networks:基于 DeepFlash 的协作个人智能体网络

    Abundant AI 创始人 Bindu Reddy 发布 Agent Networks,一个基于开源 DeepSeek Flash 构建的协作式个人智能体网络,个人 agent 可实际完成工作。该网络内置 100+ 连接器(含 GitHub、WhatsApp),支持 agent 团队相互通信协作,并能协调「人+agent」混合团队。他表示整个平台将快速升级为自动化工作的协作智能体网络。

9月23日周三
  1. Towards Data Science48

    GRPO 如何用可验证奖励训练小语言模型

    GRPO 让模型对同一问题采样多次作答,用可验证奖励为每个答案打分,再以组内平均奖励为基线比较各次尝试来更新模型,无需单独的 critic。该方法由 DeepSeekMath 工作提出,用以替代传统 PPO 的内存开销,文中用「6 箱每箱 8 件、卖出 6 件、答案 42」的算术题演示打分与优势计算。组内奖励完全一致时优势全为零,模型无法判断该偏好哪次尝试。

9月17日周四
8月11日周二
7月20日周一