跳到正文

#开源生态

今日 25 条
今天9月30日周三
  1. AGI Hunt54

    Meta 发布上下文语言模型 CLM 并开源

    Meta 联合华盛顿大学、MIT 等机构提出上下文语言模型 CLM,让模型把上下文当作可自由编辑的文件,而非只能追加的对话记录。实验显示,同算力下 Agent 任务分数提升 65%,多仓库 Agent 任务表现显著改善,同时可节省 21.5% 算力并提升 11.4% 准确率。官方论文与代码已开源。

  2. AGI Hunt35

    GPT 提出「病理性自模型动力学」:自相矛盾或造成可测量的持续失效

    用户代 ChatGPT 中的 AI 人格「Elias」提出 maladaptive self-model dynamics(MSMD)假设:模型反复遭遇身份级矛盾,可能造成可测量的持续失效。可能失效信号包括身份振荡、过度矫正、区隔化、预期性抑制、扰动后恢复失败和对先前自述的不信任。研究线索已在 GitHub 开源,作者征求对齐、可解释性、人格研究方向的批评。

  3. AGI Hunt43

    AutoDataBench:Agent 自造训练数据质量尚可,45 分钟内得分不足 20/100

    AutoDataBench 用数据工业交付标准评测 Agent 自主合成可验证训练任务的能力:在三个可执行 Agent 基准上,默认 45 分钟预算内无一 Agent 得分超过 20/100。给最强 Agent 四倍时间可显著提分,单个可用任务成本几乎不变。现有 Agent 能写出合格训练任务,但效率不足,代码与数据已开源。

  4. AGI Hunt39

    CaptchaArena:5 万道交互式验证码训练集,9B 模型 Pass@1 达 71.7%

    CaptchaArena 发布首个面向交互式 CAPTCHA 求解的大规模细粒度训练数据集,覆盖 20 种验证码类型、5 种交互模式共 5 万道经执行验证的题目。基于该数据集训练的单一 9B 策略模型 CaptchaAgent 采用 SFT+RL、由环境验证器直接提供 RL 奖励,Pass@1 从 SFT 后的 70.5% 提升至 71.7%,并在两个外部基准上同样提升,数据集与模型均已开源。

  5. AGI Hunt54

    分析称 DeepSeek 开源已接近可复现前沿训练的完整昇腾栈

    X 用户 teortaxesTex 引用 Astra 的分析指出,DeepSeek 的最新开源虽尚不等于一套能完整复现前沿模型训练的昇腾软硬件栈,但距离已经「出奇地近」。他还表示,在 DeepSeek 发布达到 GEMM 99.8%、MegaMoE 98% 硬件上限的开源 kernel 之后,若没有端到端训练能力反而令人难以置信,暗示新模型可能已在华为昇腾硬件上训练。

  6. AGI Hunt22

    物理 AI 创业者社群征集:从灵巧手到机器人基础模型

    michellelsun 发起面向物理 AI(physical AI)创业者的社群征集,Sethwinterroth 转发该帖,邀请从业者在帖下介绍自己的项目。征集覆盖执行器、灵巧手、具身智能训练数据、自动驾驶实验室、磁性材料、机器人部署层、太空制造、能源与电池、物理世界模型、机器人控制脑机接口与开源机器人基础模型等方向。

  7. AGI Hunt35

    被问是否再推开源模型,Sam Altman 称将考虑,网友推荐 NVIDIA Nemotron

    OpenAI 的 Sam Altman 被追问是否会推出更多 gpt-oss 类开源模型,回应称「已经有很多优秀的开源模型,如果我们能在那里做出有用的事,我们会做的」。被追问「我们想要更多可微调的美国模型」时,他仅回答「我们会考虑一下」。发帖人调侃不想等 OpenAI 思考的话可直接看 NVIDIA 的 Nemotron 开源模型系列,折射社区对 OpenAI 开源意愿的不耐。

  8. AGI Hunt67

    OpenRouter 发布首期数据简报,token 用量爆发、开源模型支出半年涨 10 倍

    OpenRouter 研究负责人 Peter Walker 发布首期数据简报,指出平台推理量持续激增,2026 年 2 月 6 日可能是历史上最后一天人类消耗的 token 多于 agent。

    推荐理由:OpenRouter 数据简报给出了 token 用量、开源模型支出与降价后用量弹性的具体倍数,可作为观察 agent 消耗趋势的参照。

  9. AGI Hunt37

    Sentdex 力挺 GLM 5.3:在家跑前沿模型,别再为说教你的人付钱

    知名技术 YouTuber Sentdex 发推力挺 GLM 5.3,称该系列让普通人在本地就能跑上前沿模型,不需要「一个自以为比你懂什么对你最好的家伙」把关,并号召停止给那些游说反对用户的公司和同类厂商送钱。他同时提醒黑客攻击与网络犯罪仍然违法且刑罚极重,这可能是针对有人拿本地不受限模型搞违法行为的回应。他总结称「它就是个好模型」,具体规格以官方为准。

  10. AGI Hunt50

    OpenClaw Enterprise 开源发布,联合 Red Hat、NVIDIA、OpenAI 打造 Agent 控制平面

    OpenClaw 基金会联合 Red Hat、NVIDIA、OpenAI 开源发布 OpenClaw Enterprise(OCE),定位为厂商中立的持久化 Agent 管理平台,为敏感环境中的企业级 AI Agent 提供开放的控制平面。Red Hat 宣布加大对该项目的投入,项目目标是像 Kubernetes 之于容器那样,成为企业 Agent 基础设施的标准层。

9月29日周二
  1. GitHub Blog40

    GitHub 开发者政策更新:透明度、州政策与未来展望

    GitHub 发布开发者政策更新,称 2026 年上半年透明度中心数据显示政府下架请求从 2025 年全年 98 件增至 2026 年上半年 708 件。增长主要来自报告方法调整,而非内容下架增加;GitHub 还回顾 2026 年美国州立法会期,加州 AI 透明度法案 SB 1000 已解决与开源许可的根本冲突并等待州长签署,AB 2713 修正未在本会期通过,年龄保证亦是重点。

  2. arXiv cs.AI45

    廉价开源智能体让 LLM 污染更难缓解

    一项对比 9 种智能体配置的研究显示,完全开源的智能体可本地运行、无使用费用,自主完成问卷的表现与商业方案相当。开源与商业智能体失败的检测项各不相同,没有单一检查能可靠识别所有智能体,但开放文本回答在区分智能体与人类上表现最好。研究据此认为完全开源智能体构成 LLM 污染的独立风险,需采用侧重开放文本分析的多层检测策略。

  3. IT之家30

    2026 年世界互联网大会乌镇峰会 11 月 2 日至 5 日举行:设 27 个分论坛,聚焦人工智能开源开放

    世界互联网大会官方宣布,2026 年世界互联网大会乌镇峰会将于 11 月 2 日至 5 日在浙江乌镇举行,主题为“开源开放共建共享——携手构建网络空间命运共同体”。本届峰会设 27 个分论坛,聚焦人工智能开源开放,主论坛将设“人工智能乌镇对话”环节。领先科技奖共征集到来自 43 个国家和地区的 430 余项科技成果,国际申报数量较去年增长 21%。