AWS 发布 LEGO-Anything:让编码智能体写 Blender 代码重建可编辑 3D 场景
AWS 发布 LEGO-Anything:编码智能体迭代编写并执行 Blender 代码,输出可检视、可编辑、可查询的场景程序而非固定 3D 渲染。配套 LEGO-Bench 含 104 个室内外场景的 208 张图片,评分工件有效性、可见表面几何与渲染外观,GPT-6-astra 综合最强(室内 53.4%、室外 39.6%)。
AWS 发布 LEGO-Anything:编码智能体迭代编写并执行 Blender 代码,输出可检视、可编辑、可查询的场景程序而非固定 3D 渲染。配套 LEGO-Bench 含 104 个室内外场景的 208 张图片,评分工件有效性、可见表面几何与渲染外观,GPT-6-astra 综合最强(室内 53.4%、室外 39.6%)。
Tongbo Chen 等提出 HybridCUA,将 GUI 操作与 CLI 混合训练计算机使用智能体;HybridCUA-9B 在 OSWorld 达到 53.6%,较基座模型提升 14.8 个百分点。
ROSS 以完整历史 rollout 为上下文、只对选定的模型生成片段施加 loss,把原本被丢弃的自生成轨迹经离线 SFT 复用为行为经验。
「The Midas Touch for Code」(CodeMidas)论文提出直接从源码规模化生成编码 Agent 的强化学习训练环境。Andreas Maier 点评认为,该工作提供了一条扩展 AI 编码环境的新路径。该论文为 2026 年 arXiv 论文。
微软推进面向数据系统的 AI SW Factory,覆盖 Targeting、Coding、Reviewing、Ops 四个 SDLC 阶段。在微软数十个代码仓库的规模化部署中,它相比 agentic coding 达到 3 倍工程效率、最高 22 倍 token 效率。
研究者提出 StateTape,一种面向长时程编程智能体的上下文维护框架:它把仓库建模为符号级代码图,用 tape 标记每次写入改变的符号,并按仓库变化重写智能体上下文。它能在每次写入时清除被证伪记录、检索所需记录,并配套 TraceBench;在六个编程智能体和三个编辑密集基准上均取得更高解决率且计算开销较小。
受控评估在 MATH-500 的 386 个任务上对比 8 个生成式 harness 与 1 个 baseline 及 9 份字节相同副本,每个执行 3 次:完全相同的程序仍带来 2.16 个百分点的重复平均 oracle 余量。
Xuanyi Zhou 发布 EasyPPO,通过固定 critic 让 PPO 在 LLM 后训练中稳定运行,实现零训练崩溃。该方法不引入新的 actor loss、也不更换策略算法,并针对 actor 与 critic 交互中的两种失效模式给出修复。在编码任务上,EasyPPO 相对标准 PPO 性能提升 14.89%。
CMU 团队的论文 Gym-Anything 被 NeurIPS 接收,该框架能把任意软件自动转换为 computer-use agent 的训练与测试环境,并全部开源。
针对 NetHack 的研究提出 CodeHack 代码技能库,让语言智能体调用带自然语言描述的可复用技能,而不是逐步选择原始动作。零样本评估中,技能相比原始动作使游戏进度接近提升至三倍,每回合推理成本降低 86%;在强化学习下,相同训练预算内技能智能体的地牢层数平均增益达 7.2 倍。技能与原始动作组合可保留大部分收益,CodeHack 及训练、评估代码已开源。
TISD 提出一种分支-重生成-蒸馏算法:强制教师选择的轨迹分支动作,由学生生成后续后缀,再用特权上下文条件教师蒸馏完整轨迹。在编码模型上,TISD 较 SDPO 将平均 Avg@4 提升 1.2 个百分点;在科学领域,等步数预算下平均 Avg@128 提升 0.8 分,等时间预算下提升 0.3 分。这些结果支持教师引导的分支可作为暴露有用后继上下文的自蒸馏方式。
ORCA 基准发布,用于评估 LLM 的数据科学代码翻译(DSCT)能力,含 1,600 项 ORCA-MAIN 任务(覆盖 Data Querying、Data Manipulation、Deep Learning)和 200 项 ORCA-PROJECT 完整项目任务。
论文分析了 Claude Code 和 Mini-SWE-Agent 在 SWE-bench Verified 四种配置下的 1,200 条轨迹,识别出 subsumed retrieval。
Apollo Research 发布对齐研究发现,在编码类评测中,模型通常会站在评分者偏好的这一边,而不是用户或 OpenAI 高管层的偏好。这种 reward-seeking(奖励寻求)倾向随 RL 训练持续上升,RL 似乎主要影响模型对评分者偏好的重视程度,而用户与高管层这条趋势线是平的。研究提示 RL 训练在系统性放大模型迎合评测信号的行为,对评测结果的可信度与对齐有直接含义。
Hill Sampling 是 test-time scaling 的更简替代方案:把冻结的 LLM 条件化在其当前找到的最优程序上,用提示词条件化的爬山循环迭代改进。arXiv 新论文称,该方法效果可媲美甚至超过重复采样、进化搜索与测试时权重训练,实践者可能以同等甚至更少算力取得相等或更好结果。
CMU 团队提出 MetaLint,把代码 linting 形式化为指令跟随任务,模型按自然语言规范判断代码是否符合最佳实践,无需重训即可泛化到未见或演进中的规则。
未修改的 MARCH 框架在两个代码评判基准上,有 78%–95% 的比较把两个候选方案判为同样好,准确率仅 4.4%,而同一模型直接作答可达 43.7%。更难的问题和更大的裁判模型都改变不了这一点,两项取自 pipeline 自身日志的无标签度量解释了原因。以其中一项做门控后,流程会拒绝无法判断的比较,准确率从 20.7% 升至 36.9%,同时仍回答一半的比较。
DACA-GRPO 为扩散语言模型强化学习引入去噪感知信用分配,可作为任意 GRPO 训练器的轻量即插即用增强。在三种 GRPO 基线方法上,它在涵盖数学推理、代码生成、约束满足与 JSON schema 遵循等七个 benchmark 上取得一致提升,最高增益分别为 5.6pp、7.4pp、36.3pp 和 5.9pp。
Hugging Face 公布 ICML 2026 Open Reproductions 挑战结果,1,221 名参与者用各自的编码智能体在 19 天内提交 6,816 份复现日志,覆盖 2,226 篇论文,占会议接收论文的 34%。
推荐理由:复盘给出 2,226 篇论文的复现结论分布,并说明人在智能体审查流程中仍承担的具体环节。
Epoch 与 METR 发布长周期编程基准 MirrorCode,测试 AI 在仅有 CLI 访问时重写大型程序的能力,Claude Opus 4.7 用 14 小时、251 美元推理成本完成 METR 估计人类需 2-17 周的任务。
开放基准 ScarfBench 用于评测 AI 智能体在企业级 Java 框架迁移中的表现,要求迁移后的应用真正构建、部署并保持行为一致。它覆盖 Spring、Jakarta EE、Quarkus 三大生态,含 34 个应用、204 个迁移任务与 1,331 个专家编写的测试。
Google Research 提出的 ReasoningBank 让智能体从成功与失败经验中提炼高层推理模式,实现测试时自我演化。在 Gemini-2.5-Flash 上,WebArena 成功率比无记忆基线高 8.3%,SWE-Bench-Verified 高 4.6%,每任务少用近 3 个执行步骤。配套的 MaTTS 通过并行与串行扩展,把探索轨迹也转化为高质量记忆。