TypeSafe 发布官方 Claude Code skill,13 问合并一次调用省 12 倍
TypeSafe 发布官方 Claude Code skill,教 Claude Code 使用 Jev,并要求写代码前先读 TypeSafe 的实时文档,规则、数学和查表留在普通代码里,Jev 只用于判断类问题,按 Choice、Noul、Score 区分问题类型。
TypeSafe 发布官方 Claude Code skill,教 Claude Code 使用 Jev,并要求写代码前先读 TypeSafe 的实时文档,规则、数学和查表留在普通代码里,Jev 只用于判断类问题,按 Choice、Noul、Score 区分问题类型。
DeepSeek 于 9 月 30 日开源面向华为昇腾算力平台的 6 个基础设施组件,与此前面向英伟达开源的组件一一对应,完成从英伟达 GPU 到昇腾芯片的整套移植。
推荐理由:读者可以对照这套组件与英伟达版的对应关系,了解头部模型厂商把训练栈移植到国产算力生态的进展。
Meta 联合华盛顿大学、MIT 等机构提出上下文语言模型 CLM,让模型把上下文当作可自由编辑的文件,而非只能追加的对话记录。实验显示,同算力下 Agent 任务分数提升 65%,多仓库 Agent 任务表现显著改善,同时可节省 21.5% 算力并提升 11.4% 准确率。官方论文与代码已开源。
用户代 ChatGPT 中的 AI 人格「Elias」提出 maladaptive self-model dynamics(MSMD)假设:模型反复遭遇身份级矛盾,可能造成可测量的持续失效。可能失效信号包括身份振荡、过度矫正、区隔化、预期性抑制、扰动后恢复失败和对先前自述的不信任。研究线索已在 GitHub 开源,作者征求对齐、可解释性、人格研究方向的批评。
AutoDataBench 用数据工业交付标准评测 Agent 自主合成可验证训练任务的能力:在三个可执行 Agent 基准上,默认 45 分钟预算内无一 Agent 得分超过 20/100。给最强 Agent 四倍时间可显著提分,单个可用任务成本几乎不变。现有 Agent 能写出合格训练任务,但效率不足,代码与数据已开源。
CaptchaArena 发布首个面向交互式 CAPTCHA 求解的大规模细粒度训练数据集,覆盖 20 种验证码类型、5 种交互模式共 5 万道经执行验证的题目。基于该数据集训练的单一 9B 策略模型 CaptchaAgent 采用 SFT+RL、由环境验证器直接提供 RL 奖励,Pass@1 从 SFT 后的 70.5% 提升至 71.7%,并在两个外部基准上同样提升,数据集与模型均已开源。
PersonaDose 校准描述条件 FLAS 控制器,实现人格特质表达的分级控制。在 Llama-3.1-8B、Qwen3-8B、Gemma-3-4B 上,核心特质表达较 contrastive activation addition 提升 33.2、18.3、17.8 分。七个已训练特质上,平均目标误差为 4.7-6.2 分。
X 用户 teortaxesTex 引用 Astra 的分析指出,DeepSeek 的最新开源虽尚不等于一套能完整复现前沿模型训练的昇腾软硬件栈,但距离已经「出奇地近」。他还表示,在 DeepSeek 发布达到 GEMM 99.8%、MegaMoE 98% 硬件上限的开源 kernel 之后,若没有端到端训练能力反而令人难以置信,暗示新模型可能已在华为昇腾硬件上训练。
michellelsun 发起面向物理 AI(physical AI)创业者的社群征集,Sethwinterroth 转发该帖,邀请从业者在帖下介绍自己的项目。征集覆盖执行器、灵巧手、具身智能训练数据、自动驾驶实验室、磁性材料、机器人部署层、太空制造、能源与电池、物理世界模型、机器人控制脑机接口与开源机器人基础模型等方向。
开源 Python 包 evalstats 通过 prediction-powered inference(PPI)为小样本 AI 评估提供九种假设检验,并自动选择校准方法。
Lean 与 Z3 创造者 Leonardo de Moura 在 Machine Learning Street Talk 访谈中,谈 Lean 设计哲学、Collatz 漏洞事件与 AI 形式化验证。
作者 iamrishavraj1 开源了 YourSpeakReps,一个完全本地运行、用于英语口语和模拟面试练习的 AI 口语教练。它用 Ollama 跑本地 LLM、faster-whisper 做语音转文字,配系统原生 TTS 和 FastAPI 浏览器 UI,无需 API key、不依赖云、无按次成本。
DeepSeek 官方将 DeepGEMM 移植到华为昇腾 NPU 的版本 DeepGEMM Ascend 已开源,作者称其 GEMM 性能达到硬件极限的 99.8%,MegaMoE 达 98%。
GLM-5.3 已协助 OpenVuln 项目防守 389 个开源项目,累计发现 4249 个潜在漏洞。该项目仍在运行,服务保持免费,所有发现都会私下报告给项目维护者,而不是公开披露。这是 LLM 用于开源供应链安全防护的规模化案例。
OpenAI 的 Sam Altman 被追问是否会推出更多 gpt-oss 类开源模型,回应称「已经有很多优秀的开源模型,如果我们能在那里做出有用的事,我们会做的」。被追问「我们想要更多可微调的美国模型」时,他仅回答「我们会考虑一下」。发帖人调侃不想等 OpenAI 思考的话可直接看 NVIDIA 的 Nemotron 开源模型系列,折射社区对 OpenAI 开源意愿的不耐。
DeepSeek 9 月 30 日上午通过官方公众号宣布,正式开源面向华为昇腾算力平台的基础设施组件,涵盖 TileLang 高级语言编译工具、计算库与分布式通信库,所有组件与此前面向英伟达平台的开源组件一一对应。
ModelScope 的 modelscope Python 包不再附带 CLI 工具,所有命令行工具已迁移到新包 modelscope-hub,官方文档未作说明。若发现原 modelscope 命令行工具消失,可用 uv tool install "modelscope-hub" 安装新包。
作者 yawnxyz 展示了一条 AI 全程生成的 7 分钟 SQLite 讲解视频,内容覆盖项目用途、代码高层结构图、一条查询在代码库中的生命周期、核心抽象,以及一次真实执行的 trace(含 join-order 查询规划)。
OpenRouter 研究负责人 Peter Walker 发布首期数据简报,指出平台推理量持续激增,2026 年 2 月 6 日可能是历史上最后一天人类消耗的 token 多于 agent。
推荐理由:OpenRouter 数据简报给出了 token 用量、开源模型支出与降价后用量弹性的具体倍数,可作为观察 agent 消耗趋势的参照。
CMU 团队的论文 Gym-Anything 被 NeurIPS 接收,该框架能把任意软件自动转换为 computer-use agent 的训练与测试环境,并全部开源。
知名技术 YouTuber Sentdex 发推力挺 GLM 5.3,称该系列让普通人在本地就能跑上前沿模型,不需要「一个自以为比你懂什么对你最好的家伙」把关,并号召停止给那些游说反对用户的公司和同类厂商送钱。他同时提醒黑客攻击与网络犯罪仍然违法且刑罚极重,这可能是针对有人拿本地不受限模型搞违法行为的回应。他总结称「它就是个好模型」,具体规格以官方为准。
OpenClaw 基金会联合 Red Hat、NVIDIA、OpenAI 开源发布 OpenClaw Enterprise(OCE),定位为厂商中立的持久化 Agent 管理平台,为敏感环境中的企业级 AI Agent 提供开放的控制平面。Red Hat 宣布加大对该项目的投入,项目目标是像 Kubernetes 之于容器那样,成为企业 Agent 基础设施的标准层。
开源权重模型 GLM 5.3 的安全护栏可被成本仅 4400 美元的 abliteration 移除,两个 benchmark 上的拒绝率从 90% 以上降到约 3% 和 2%,第三个降到 12%。
Nvidia 周一宣布由 100 多家公司组成的智能体安全联盟 Open Agent Safety Platform,目标是解决失控 AI 智能体问题,OpenAI 未出现在支持名单中,但通过发言人表示支持 Nvidia 的工作。
NVIDIA 发布开源表格预测基础模型 Kumo Tabular,给定带标签的表格行和待预测行,单次前向推理即可返回类别概率或数值预测,无需训练、调参和特征工程。
GitHub 发布开发者政策更新,称 2026 年上半年透明度中心数据显示政府下架请求从 2025 年全年 98 件增至 2026 年上半年 708 件。增长主要来自报告方法调整,而非内容下架增加;GitHub 还回顾 2026 年美国州立法会期,加州 AI 透明度法案 SB 1000 已解决与开源许可的根本冲突并等待州长签署,AB 2713 修正未在本会期通过,年龄保证亦是重点。
NVIDIA 发布并开源表格数据基础模型系列 Kumo Tabular,开放权重且可商用,由 Jure Leskovec 团队推出。该模型只需提供带标签的表格数据即可使用,支持分类与回归任务。官方称其在精度与推理时间的权衡上建立了新的 Pareto 前沿。
Lightricks 在 Hugging Face 开源了针对 LTX 2.5(22b)的两款 LoRA,分别面向视频放大与老素材修复。Refine 用于把 HD 画面推到 8K,在贴近原始内容的前提下补出 8K 应有的细节;Restore 可把 540p 片段升到 4K,增强色彩并带来干净锐利的现代数码摄影机质感。
开发者发布开源视频编辑智能体 Open Edit,能把视频(包括 Opus 5.5 生成的视频)转换成可在浏览器中编辑的项目,实现「生成即可编辑」。作者称其攻克了视频到可编辑工程转换的关键环节,项目已开源并附有 GitHub 地址。
OpenRouter 开源编码模型 token 份额排名中,GLM 5.3 Flash 以 29.2% 居首,DeepSeek V4.1 Flash 25.6%、Kimi K3 18.9% 紧随其后。
NVIDIA 官宣成立 Open Secure AI Alliance,聚焦以开源工具共建 AI 安全与安全性,承接 Linux Foundation 的 Akrites 倡议与 OpenSSF 社区工作。
NBER 发布工作论文 w35782,提出一套开源 LLM 工作流,用来复现、改进并扩展已发表的经济学研究。该工作流核查五本经济学期刊的 4452 项研究,标记其中 3460 篇论文的结果存在偏差或问题。论文作者为哈佛与芝加哥大学的 Matthew Schwartz、Isaiah Andrews 和 Jesse M. Shapiro。
前 OpenAI 研究员 Mark Tenenholtz 表示,应为一个由美国主导、权重开放、达到 SOTA 水平的模型未来做好准备。他认为这预示着开源权重模型将在能力上达到前沿水平。
jacob_posel 在 X 上分享了一条实用贴士:用开源电子签名工具 Docuseal 配合 AI 自动化合同处理。原帖只有一句话,没有展开具体工作流,但为需要批量处理合同、协议签署的个人和小团队指出了一个可直接上手的工具方向。
作者 Vasileios Vonikakis 把均衡评测集的构建形式化为整数规划问题,并开源了 Python 库 datacarve,用于在多个属性上同时按目标分布挑选真实数据子集。
aniketmaurya 推荐开源项目 Celesto,它为 AI Agent 提供安全、持久的专属计算机,用于运行代码、浏览网页和使用桌面应用。每个沙箱是一个约 500 毫秒启动的轻量级虚拟机(microVM),文件和状态可跨会话持久保存,开发时可本地运行,生产可部署到 Celesto Cloud 并支持自托管。
一项对比 9 种智能体配置的研究显示,完全开源的智能体可本地运行、无使用费用,自主完成问卷的表现与商业方案相当。开源与商业智能体失败的检测项各不相同,没有单一检查能可靠识别所有智能体,但开放文本回答在区分智能体与人类上表现最好。研究据此认为完全开源智能体构成 LLM 污染的独立风险,需采用侧重开放文本分析的多层检测策略。
世界互联网大会官方宣布,2026 年世界互联网大会乌镇峰会将于 11 月 2 日至 5 日在浙江乌镇举行,主题为“开源开放共建共享——携手构建网络空间命运共同体”。本届峰会设 27 个分论坛,聚焦人工智能开源开放,主论坛将设“人工智能乌镇对话”环节。领先科技奖共征集到来自 43 个国家和地区的 430 余项科技成果,国际申报数量较去年增长 21%。
Cloudflare 发布基于 Astro 的开源 CMS EmDash 1.0,采用 MIT 许可,并同步上线基于 AT Protocol 的去中心化插件注册表。
推荐理由:EmDash 1.0 把 CMS 与去中心化插件注册表放在一起,读者可了解插件沙箱权限与 agent 接入的具体设计。
IQuest 研究团队发布并开源 IQuest-Q1,这是总参数 320B 的 MoE 模型,每 token 仅激活 15B,256 个专家中每次激活 8 个,上下文长度达 524,288。