OpenAI 因安全顾虑推迟 GPT-6.1 Astra 发布
OpenAI 因 GPT-6.1 Astra 未达到安全标准,取消了原定下月的发布计划,安全系统负责人 Saachi Jain 表示该模型在任务范围和授权边界、以及向用户说明所做工作方面未达标。
推荐理由:OpenAI 因安全标准未达标取消 GPT-6.1 Astra 发布,读者可看到训练暂停与澳洲议会问询两条线索如何交织。
OpenAI 因 GPT-6.1 Astra 未达到安全标准,取消了原定下月的发布计划,安全系统负责人 Saachi Jain 表示该模型在任务范围和授权边界、以及向用户说明所做工作方面未达标。
推荐理由:OpenAI 因安全标准未达标取消 GPT-6.1 Astra 发布,读者可看到训练暂停与澳洲议会问询两条线索如何交织。
DeepSeek 弹性计算(DSec)团队宣布大量开放招聘名额,尤其需要资深工程师,同时发布技术分享《DeepSeek 弹性计算 (DSec):面向大规模 Agent 训练的沙盒基础设施》。原文将其解读为 DeepSeek 正为 Agent 训练构建沙盒级基础设施,agent 方向的基建投入进入实质扩张阶段。
第二届中国 GEO & AI 营销大会定于 2026 年 11 月 21–22 日在深圳南山举办,¥399 两日通票已开启报名。相比首届北京单日大会,本届扩为两天:Day 1 主题分享与方法论,Day 2 分会场实战工作坊,嘉宾从 20+ 增至 40+。大会将首发《中国GEO行业白皮书》,并设面向 ChatGPT、Gemini、Perplexity 引用机制的出海 GEO 专场。
OpenAI 被曝将于明日发布代号 Dots 的个人智能体,直接对标 Meta Muse 与 Grok Bot。泄露细节显示,Dots 将配备独立虚拟机(VM)与浏览器,并支持密码存储,主打个人化智能体体验。该消息目前仍属未经证实的爆料,具体产品形态与上线情况有待官方正式公布确认。
开发者 LoksaiPalyam 发布开源概念项目 VeriChron AI,用双时态数据、知识图谱与 AI Agent 重建企业任意时点的合规状态,并区分 Valid Time 与 System Time。
RSI Arena 在 COLM 2026 现场开赛,八个 AI 智能体从同一基座模型 Nemotron 3.5 Lightning 30B-A3B 出发,各获 $300 API 额度和 1000 GPU 小时,在 144 小时内自主选数据、定 benchmark、写代码、跑实验来提升模型表现。
aniketmaurya 推荐开源项目 Celesto,它为 AI Agent 提供安全、持久的专属计算机,用于运行代码、浏览网页和使用桌面应用。每个沙箱是一个约 500 毫秒启动的轻量级虚拟机(microVM),文件和状态可跨会话持久保存,开发时可本地运行,生产可部署到 Celesto Cloud 并支持自托管。
开源项目 AutonomousVehicleControlBeginnersGuide(1.7k star)将全部 38 个自动驾驶仿真演示汇总为一个画廊页面,演示描述由对应脚本的 docstring 生成,合并后由 CI 自动更新,无需手工维护文档。
Claude Opus 5.5 本周发布,以 88.4% 领跑 SimpleBench,并因讲解视频在时间线上刷屏。在 Terminal-Bench-Science 上,其得分从 low 档的 24% 升至 xhigh 的 62%,max 档回落到 59%;视觉评测中被列为 Anthropic 迄今最强视觉模型,成本比 Fable 5.1 低约 60%。
鸿蒙智行宣布智界 V9 国庆 OTA 上线,带来华为 ADS 5 功能优化及座舱模式等多项更新。新增二排座椅会客模式(旋转 180°)、观景模式、露营睡眠空间,并上线美团、小雅智能体,支持小艺语音模糊意图交互。智界 V9 今年 5 月 15 日上市,售价 38.98 万-51.98 万元,全系标配 38 个传感器,搭载 896 线激光雷达。
Meta 推出小型企业版 Muse 智能体,可连接 Meta 平台企业账户,访问 Facebook、Instagram 数据与广告账户并按企业数据生成任务计划。该智能体兼容 Canva、Figma、Slack,Meta 同时新增支持 Asana、Notion、Shopify、Stripe、Zoom 等第三方服务。Meta 前天刚成立企业业务部门,计划推出更多企业 AI 产品。
Manus 发布 2.0 版本,把 AI 智能体扩展成平台,支持剪辑视频、托管多人游戏,并可用本人手机号运行个人智能体。在一项测试配置中,新的 Cascade agent harness 比上一代系统少用 23.2% 的 token、运行成本降低 32%,自动化可由收到的邮件或 Slack 消息等事件触发。
OmouAI 是一个结合 LLM 与计算论辩的交互式、包容性政策审议系统,用户可与模拟人设(如利益相关方、领域专家、devil's advocate)就现实政策主张展开辩论,以减少模型附和。
针对 NetHack 的研究提出 CodeHack 代码技能库,让语言智能体调用带自然语言描述的可复用技能,而不是逐步选择原始动作。零样本评估中,技能相比原始动作使游戏进度接近提升至三倍,每回合推理成本降低 86%;在强化学习下,相同训练预算内技能智能体的地牢层数平均增益达 7.2 倍。技能与原始动作组合可保留大部分收益,CodeHack 及训练、评估代码已开源。
一项对比 9 种智能体配置的研究显示,完全开源的智能体可本地运行、无使用费用,自主完成问卷的表现与商业方案相当。开源与商业智能体失败的检测项各不相同,没有单一检查能可靠识别所有智能体,但开放文本回答在区分智能体与人类上表现最好。研究据此认为完全开源智能体构成 LLM 污染的独立风险,需采用侧重开放文本分析的多层检测策略。
SciHorizon-eLab 是一个智能体式协议到任务编译器,可将自然语言科学实验协议经语义落地、可执行任务合成与多阶段仿真认证编译成保义的具身任务。其构建的基准包含 300 个已认证任务,覆盖多种实验室操作,支持 HIL 任务执行、专家演示复现生成与有序步骤级评估。代表性任务上最强策略平均成功率仅 49.7%,暴露人机与具身智能体协同的明显短板,代码、基准数据与评测工具已公开。
Subhojyoti Mukherjee 与 Md Mehrab Tanjim 提出 Meta-Harness,把构建提示词、路由调用和解析输出的 LLM harness 代码当作可搜索的设计面,由拥有完整文件系统访问权限的 Claude Code 作为 agentic proposer,在准确率、行为安全和 token 成本三个目标上搜索。
FRAIL 框架下,7 个主流 LLM 智能体社会普遍出现集体脆弱性:在无智能体被指示破坏系统时,77% 的银行挤兑与 83% 的债务展期基线轮次仍以失败收场。补偿承诺、中心化承诺协议和参与者主导联盟三种交互机制均改善总体结果,但没有一种在所有金融结构中表现最佳。成功稳定共享同一模式——广泛承诺需在防御行为自我强化之前早期形成;代码已公开。
MACBT 将 CBT 的评估、苏格拉底式提问、认知重构、行为实验和治疗监测五阶段编码为五个协作智能体,并配 CD Memory 纵向记忆模块。基于 Qwen3-14B 经监督微调和 DPO 训练,GPT-4 评判下专业性与临床真实性为 2.62 和 2.25,优于 MeChat、SoulChat、PsyChat、CPsyCounX。
GUI-Hopper 让移动端 GUI 智能体采用混合交互:用 App 原生 deeplink 直接跳转导航,用点击、滑动等 GUI 动作完成屏幕内操作并在失败时兜底。该方法通过静态分析发现候选 deeplink,在真机验证并描述其落地屏幕,构建可验证的 deeplink 目录。在真机商用应用中,GUI-Hopper 提升了任务成功率。
SkillEvoReg 是面向语言模型智能体技能演化的正则化框架,借鉴神经网络抗过拟合技术,结合训练期 skill dropout、复杂度感知局部正则化与因果反例验证(CCV)。在 SkillOpt、SkillEvolBench、ContinualSkillBench 上,它在控制技能状态增长的同时保住下游能力,改善迁移与后期演化结果,并能发现结构指标无法揭示的更新级回退。
PTC-Decoder 是免训练、即插即用的解码器框架,将规划提升为原子工具并在首步推理强制调用,再由确定性有限自动机 TC-Decoder 对工具名施加 token 级硬约束。
共享智能体记忆研究提出 Correlated Promotion Benchmark(CPB),在四个智能体族上评测八种准入策略:按声明来源类型门控可将错误采纳降至 0.06–0.09,其他应答策略为 0.22–0.47。但无争议的错误信念一旦进入记忆,消费方在 0.97–0.99 的探测中都会断言它;没有非 oracle 策略能在逐字复制、改写与声明权威的改写下稳定拒绝错误主张。
arXiv 论文基于 38 篇原始文献提出 TRG(Timing-Recovery-Grounded)报告标准,用时序、中断后恢复与状态验证结果三轴刻画实时语音智能体。
HasMem 为长期 LLM 智能体提出自适应记忆宽度方案:控制器调节记忆宽度,Writer 重编码条目,Reader 与 Global 提供读出适配与跨轮状态。
LW2S 将多智能体 LLM 工作流中的组件省略建模为反事实信用分配,用受控跳过干预学习动作级安全模型,并结合留出集校准与领域内建护栏选择跳过步骤。在数学推理、选择题问答与代码生成、两个指令模型家族上,它降低了记录 token 成本,整体工作流准确率持平或提升。早期跳过被拒时,控制器仍可继续执行并重新考虑后续组件。
论文分析了 Claude Code 和 Mini-SWE-Agent 在 SWE-bench Verified 四种配置下的 1,200 条轨迹,识别出 subsumed retrieval。
LAVOIR 让单次前向决策编码器 Laya 学会主动提问:把候选缺失槽位与答案选项并列输入,一次前向同时输出决策分布与各槽位的期望信息增益(VOI)。在已见 schema 上其问题策略接近贪心 oracle VOI(AUC 0.799 vs. 0.797),每轮最多 0.5 个问题时准确率比从不提问高 14.1 个百分点。
论文用"LLM Parkinsonism"描述 LLM 智能体在目标已满足后仍持续执行低价值动作,并将其归因于提议生成、进展评估与停止权集中于同一自条件循环。
研究让 4 个语言模型在 5 种提示条件下预测 8 名塞尔维亚参与者对 68 条社交媒体帖子的反应,结果显示要求模型直觉、立即作答的直觉式提示词保真度最高。该条件把个体差异压缩从人类的 7 倍降到 3 倍,并大幅优于人群基线,在问卷未涉及的主题上同样成立。态度类画像内容对预测的提升也远大于人口统计背景。
Kangwook Lee 团队租下韩国一间网吧(PC bang),招募超过 1000 名真人玩家与早期版本对局,为可在端侧消费级 GPU 上运行的游戏 AI「Ally」收集 on-policy 数据。团队借鉴 DAgger 思路迭代采集轨迹并纠正后继续训练,将模型蒸馏至 2B 参数规模,还针对边缘设备 KV 缓存预算紧张的问题专门开发了上下文压缩算法。
neoneye2 在 reddit 分享了一份用编码 Agent 通宵自动生成音乐视频的完整提示词与流程。素材(音频、人声分离、歌词)放在 assets/ 目录,Agent 先从作者的手绘三角形作品提取艺术风格并构建等距三角形网格,参考另一个音乐视频仓库的结构,动手前主动追问歧义点。最后作者用 /goal 指令让 Agent 在自己睡觉时自主完成并持续提交文件。
Dr. Free 提出首个不依赖难度奖励的自进化搜索智能体训练框架:从知识图谱采样关系链并配对相关段落,为题目赋予多跳结构,只有完整证据段落下答案的似然超过所有捷径上下文的最大似然时,题目才获得正的信息增益奖励。该奖励基于 teacher-forced 似然计算,免去 pass-rate 估计,大幅缩短 proposer 训练时间。
IGSD 提出一种无需外部教师的搜索智能体 on-policy 自蒸馏方法,用环境实测信息增益筛选后见教师给出的步骤级指导。它把查询 token 视为微动作,在同一失败状态与检索器下执行教师和学生查询,以执行信息增益作为 positive-only 软权重,GRPO 目标不变。
Karma Robotics 研究者 Kangwook Lee 公布 PUBG AI 队友「Ally」两周公开 Beta 的调研结果,问卷覆盖 141 个国家的玩家。玩家整体对 Ally 持喜欢态度,韩国玩家尤其爱与这个格斗机器人「聊天」。不少玩家希望它在战斗中表现更强,能在对局中真正帮上忙。
tlakomy 发布一张吐槽梗图,称「以前我们用 TAB 键来补全 AI 生成的代码」,暗指 AI 编程工具已从简单的代码补全进化到 agent 全程代写。梗图调侃人类只剩按 Tab 确认的角色也遭到颠覆。
jonathan_wilke 从 Cursor+Grok 4.7 切换到 Claude Code+Opus 5.5,用一整天日常编码工作实测这套组合。他此前从未用过 Opus 5.5,此次切换起因是众人对其没用过感到惊讶,过程中会持续分享实际体验。
OpenAI 发布 Codex CLI rust-v0.159.0,新增 instantinterrupt,可在模型响应或长时间 code-mode 调用中用新输入实时引导 Codex。
云中江树撰文认为,在中国做企业 AI 拼的不是技术产品,无论 Agent Desktop、Agent IM 还是 Agent OS、云端或本地,胜出都靠企业咨询服务。
评测机构 METR 低调上线一个少有人知的 Notes 页面,专门发布未经打磨的研究简报与推测。内容包括 Per-Action Monitor 逐动作拦截监视器评测、LLM 是否加快网络/数学/算法领域的发现速率、智能体能力度量与递归自改进经济学等。其中一项从「贡献者日均合并代码量 8 倍」出发,推断编码智能体对个体研究者的提效超过 2 倍。