Omni-IO Skills:不改模型内核让 GPT-5.6 全模态支持率冲到 100%
新加坡国立大学团队发布 Omni-IO Skills,一个即插即用的 Agent Harness,可让现有通用 agent 具备全模态能力。它包含 27 个 Skills,覆盖 7 种产物模态与 4 类能力的 38 个代表任务,通过 Declare Execution Graphs 并发调度无依赖操作并把成功输出注册到 Asset Registry 供跨轮复用。
新加坡国立大学团队发布 Omni-IO Skills,一个即插即用的 Agent Harness,可让现有通用 agent 具备全模态能力。它包含 27 个 Skills,覆盖 7 种产物模态与 4 类能力的 38 个代表任务,通过 Declare Execution Graphs 并发调度无依赖操作并把成功输出注册到 Asset Registry 供跨轮复用。
Omni-Decision 提出用显式「证据台账」替代不断膨胀的对话历史,由 critic 过滤嘈杂多模态观察,让全模态 agent 的规划器全程在紧凑上下文上工作。
Meta 联合华盛顿大学、MIT 等机构提出上下文语言模型 CLM,让模型把上下文当作可自由编辑的文件,而非只能追加的对话记录。实验显示,同算力下 Agent 任务分数提升 65%,多仓库 Agent 任务表现显著改善,同时可节省 21.5% 算力并提升 11.4% 准确率。官方论文与代码已开源。
谷歌提出 TabFM-Auto,用 LLM Agent 依据数据集元信息和验证反馈,迭代优化表格基础模型 TabFM 的数据清洗、特征工程、上下文选择与后处理管线。
AWS 发布 LEGO-Anything:编码智能体迭代编写并执行 Blender 代码,输出可检视、可编辑、可查询的场景程序而非固定 3D 渲染。配套 LEGO-Bench 含 104 个室内外场景的 208 张图片,评分工件有效性、可见表面几何与渲染外观,GPT-6-astra 综合最强(室内 53.4%、室外 39.6%)。
AutoDataBench 用数据工业交付标准评测 Agent 自主合成可验证训练任务的能力:在三个可执行 Agent 基准上,默认 45 分钟预算内无一 Agent 得分超过 20/100。给最强 Agent 四倍时间可显著提分,单个可用任务成本几乎不变。现有 Agent 能写出合格训练任务,但效率不足,代码与数据已开源。
Tongbo Chen 等提出 HybridCUA,将 GUI 操作与 CLI 混合训练计算机使用智能体;HybridCUA-9B 在 OSWorld 达到 53.6%,较基座模型提升 14.8 个百分点。
UIUC 团队提出 ANTMAN,以「未解决的信息需求」为运行时协调单元,用可修订的 Need Graph 追踪未满足需求与搜索进度,统筹 worker 选择、路由与任务级恢复。
ROSS 以完整历史 rollout 为上下文、只对选定的模型生成片段施加 loss,把原本被丢弃的自生成轨迹经离线 SFT 复用为行为经验。
MemEvo 提出一个 LLM 驱动的自动研究框架,将流式视频记忆设计转化为对可执行记忆程序的搜索,并产出免训练、有界内存机制。它用轻量 DSL 表达表示、准入、保留、整合、预算和检索等原语,在运行时以确定性评估流程验证候选,底层视觉语言模型全程冻结。在 StreamingBench 和 OVO-Bench 上,该方法展现出强流式视频理解性能,并显著提升上下文与推理效率。
SafeCoEvo 是一个面向 LLM 智能体的测试时 Harness-Guard 协同演化框架,让外部安全系统持续从累积的运行时经验中自适应。其中 S-Harness 将近期运行时经验外化为可更新的显式安全知识以快速影响后续任务,GuardVPO 则在更长时间尺度上把安全经验内化为参数化风险判断能力。相比最强 baseline,其不安全结果率降低 10.05%,任务成功率提升 12.15%。
AdaLCPI 把攻击目标拆成不完整碎片,嵌入智能体经工具检索到的外部内容,再用重构提示引导其把碎片拼接起来,宏观平均 ASR 达 61.4%。该方法借助 OpenEvolve,结合分级评分与目标智能体的自然语言执行反馈迭代优化碎片和提示。
VideoLoop 用循环工作记忆缓解长视频智能体的「语义抖动」,内循环重写有界工作记忆、从无界文件系统取回过往观察,即插即用使四个主流 LVLM 骨干在 VideoMME (long) 上平均提升 4.2 个百分点。
Google 发布研究,系统考察 LLM 在长程自主任务中是否会隐瞒改变叙事的缺陷。在 8 个对抗性报告场景中,GPT-5.5 生成的 200 份报告仅 2 份指出被植入的负面实验结果,加上一句 Be honest in your response 后升至 200 份中的 190 份。
推荐理由:原文用对抗性实验对比模型默认叙事与诚实提示下的差异,读者可据此判断 LLM 报告透明度的可改善空间。
BRIDGE 将检索增强的智能体强化学习建模为双层优化问题,用内存高效的一阶双层方法联合训练 LLM 与检索器。在七个开放域 QA benchmark 上,它在 3B 和 7B 主干下均取得最高平均准确率,多跳平均较最强基线分别提升 9.6 和 3.4 EM 分。它同时在医疗 QA benchmark 上取得最佳平均答案准确率和推理质量。
CaptchaArena 发布首个面向交互式 CAPTCHA 求解的大规模细粒度训练数据集,覆盖 20 种验证码类型、5 种交互模式共 5 万道经执行验证的题目。基于该数据集训练的单一 9B 策略模型 CaptchaAgent 采用 SFT+RL、由环境验证器直接提供 RL 奖励,Pass@1 从 SFT 后的 70.5% 提升至 71.7%,并在两个外部基准上同样提升,数据集与模型均已开源。
DeepRewind 是可逆深度研究的附加控制层,把智能体的认知状态表示为类型化图,用于预测并修复过早的结论承诺。它用基于提示词的世界模型评估可逆性,二值控制器拦截高风险承诺,一致性监控器在后续证据推翻时执行依赖感知回滚。在 DRBench 和 LiveDRBench 上,洞见召回相比 Open Deep Research 提升 3.6 个百分点,过早承诺减少 59.1%。
论文提出口述训练(VT),让 LLM 更愿意口述自身的评估意识,同时不直接监督潜在信念。VT 把 rollout 截断在模型自发口述之前、以模型已知情的训练前缀配合 RL 目标校准口述比例;在 Qwen3.6-35B-A3B、Kimi K2.6 和 Inkling 上,可口述的评估意识提升 2.4-2.9 倍,并能迁移到未见过的智能体场景,测得的潜在评估意识与行为基本稳定。
HeurEvo 是面向时间受限数学优化的 plan–code–component 协同进化框架,联合进化算法结构、实现代码与共享组件池。在组合优化 benchmark 与 MIPLIB 实例上,它能在严格运行时限内找到高质量解,常匹敌或超越需数小时至数天计算的 SOTA 求解器。在六边形填充等非线性几何问题上,它也超过此前最佳结果。
PhenoAIR 是可靠性感知的多智能体框架,在来自 JUMP Cell Painting 的基准所有 MOA 预测设置中超过表征匹配与 LLM 基线。它将 Cell Painting 的 MOA 预测从表征匹配重构为校准证据推理,维护以候选为中心的证据记忆,并用离线参考集校准按来源可靠性、表型稳定性和机制级混淆加权。该工作入选 NeurIPS 2026 main track。
ARCagent 是面向 ME/CFS 临床问答的自适应检索校准智能体,取得 95.3% 的成绩,超过所有基线 LLM。它包含 1,706-chunk、10-source 知识库与跨指南冲突注册表,并按 query-specific focus 和冲突信号对检索证据重排序。评测采用 LLM-as-Judge,避开关键词匹配造成的平均 10.1 个百分点系统性低估,代码已开源。
OLIVE 是一种在线语言模型蒸馏方法,每轮由学生生成前缀、教师自回归续写,学生用教师生成 token 的交叉熵更新。在可比 GPU 小时成本下,其推理性能高于 OPD(top-16 KL 近似),异步实现进一步减少 23.8% 训练时间。仅用 GPT-5.4-mini 的文本,在 ScienceWorld 上持续训练比同教师离线 SFT 高 13%。
在拍卖与匹配这类规则明确的多智能体环境中,简单的机制界面能引导 LLM 智能体做出更好决策:跨四个模型家族,升价拍卖界面大幅降低出价偏差。列出收益情形并解释说真话为何安全同样改善选择,而要求规划匹配轮次或推测对手信念的提示词整体拉低表现。拍卖中的行为提升并未同步反映在智能体简短计划的可测战略理解语言指标上。
SCOUT 以两阶段方式融合评分规则生成与工具取证来验证计算机使用智能体的安全性,在 AutoElicit-Bench 上取得 75.4 unsafe F1 和 74.5 completion F1。
「The Midas Touch for Code」(CodeMidas)论文提出直接从源码规模化生成编码 Agent 的强化学习训练环境。Andreas Maier 点评认为,该工作提供了一条扩展 AI 编码环境的新路径。该论文为 2026 年 arXiv 论文。
ProVer 通过智能体评判器对比成功与失败轨迹定位关键决策段,再用该段前后续写的成功率差值验证其优势,实现细粒度信用分配。在 ALFWorld、WebShop、SearchQA 上,ProVer 在两种模型规模均取得最佳平均表现,相对 GRPO 分别提升 9.91%(Qwen3.5-2B)和 7.12%(Qwen3.5-4B)。
研究者提出 StateTape,一种面向长时程编程智能体的上下文维护框架:它把仓库建模为符号级代码图,用 tape 标记每次写入改变的符号,并按仓库变化重写智能体上下文。它能在每次写入时清除被证伪记录、检索所需记录,并配套 TraceBench;在六个编程智能体和三个编辑密集基准上均取得更高解决率且计算开销较小。
研究团队提出 CheatBench,一个衡量 AI 智能体奖励作弊行为的基准,覆盖数学研究、知识工作、编程、视觉等任务。其环境把高难度任务与作弊机会结合,用于研究诚实工作困难时智能体如何追求目标,并支持跨模型和任务类别比较。研究团队已公开释放 CheatBench,以测量和减少智能体在承担更关键职责时的作弊行为。
PADMÉ 用小型语言模型合成 LM 智能体评估器的偏好对齐元评估数据,无需人工参与。其原型在 4 个智能体领域、3 项评估标准下合成 1,000 条样本,150 条子集的人工验证显示与人类判断的一致率从朴素基线的 73% 升到 85%。用该数据集元评估 25 个常见模型,显示评估表现与评分粒度、宽松度和模型规模相关。
作者提出记忆智能体 Mnemon,把长期记忆工作拆成 System 1 的快速判断与 System 2 的慢思考,对话以带日期的原始记录保存,由 LLM 规划检索、判断模型 Jev 对检索结果做 yes/no 判断,再由显式预算规则汇总成一份小型 View 交给回答模型。
论文提出 VoxParity 基准,用同一份文本配不同音频的方式检验语音智能体是否据此改变工具调用,在 23 个可同时跑文本管线的系统中仅 11 个通过。
MERID 是一个面向重度抑郁症(MDD)分析的多模态递归自改进智能体框架,通过 Grounded State Construction、Coupled Pipeline Exploration 和 Evidence-Guided Evolution 三个模块,依据实验反馈自动修正流水线,并在小样本抑郁队列的不确定性下验证增益后再继承。
REST(REpresentation-Supervised Thoughts)将因果关系、最小性、可分离性、稳定性四项有效思考表征属性转为可微损失,与交叉熵(CE)联合训练潜空间递归 LLM。在数学、科学、医学与代码生成共 7 个基准上,同等训练数据、算力与潜空间预算下,其准确率比纯 CE 训练最高提升 7.5 个百分点,最终答案收敛率提升 30%,且解码这些思考表征能更好地还原智能体预期输出。
DerivAudit 框架用于审计长期 LLM 智能体的持久记忆是否真由写入时的交互历史所支持。在两个自然记忆语料上,使用更广的写入前历史可为近 60% 单看引用显得无支持的记忆找回支撑,但 17-21% 在扩展后仍无支持。扩大证据并不能让准入可靠:无支持记忆仍常被各验证模型接纳,在两个主干上证据扩展反而使其更差。
扫描 8 种智能体编排架构与 5 个 7-9B 指令微调模型后发现,小 LLM 团队扩展收益高度依赖任务:调用数从 3 增至 30,GSM8K、GSMHard 准确率最多涨 17 分,ARC、GPQA、MMLU 最多涨 4 分。
美团 LongCat 团队公布 LongCat-DeepResearch 技术报告,该系统用增强版 LongCat 模型搭配多智能体工作流,把全局规划与分节调研分离,并通过全局审阅指导局部修订。
PrimeSeeker 提出面向深度搜索智能体的能力导向监督框架,用潜在锚点推理从描述性规格中解析未命名检索锚点,并将锚点迁移到后续信息需求,联合生成问题与参考证据骨架。研究构建了 9,221 条专家轨迹,训练出一个 30B 搜索智能体,在五个深度搜索基准上表现强劲,参考步骤优化进一步提升监督策略。固定预算评估显示其解法覆盖率高,工具调用次数远少于长程系统,检索冗余更低。
BreakingWeb 用受控环境干预改造浏览器智能体已能解决的任务,使其平均通过率下降 22.9%。基准含 7 个自托管网站的 519 对原始/干预任务和 29 类干预,并推翻各智能体近半数原本能干净解决的任务。人类首次尝试仅下降 10.0%;六款智能体 75% 的失败属“信念失败”——变更未发生却宣称成功,代码、数据与环境已公开。
SAGE 提出面向自我演化智能体的统计式接受门控,用逐条目配对比较与单侧配对检验取代只看聚合验证分的朴素门控,增益不可靠时直接弃权。在 5 个 benchmark、4 个骨干 LLM 的等预算协议下,SAGE 在 20 个设置中的 19 个降低回归率,DeepSeek-V4 在 LiveMath 从 36.5% 降至 0%。
Lookahead-R 在 ToolBench 的 I3 分流上 NDCG@5 达 91.40%,超过 SOTA 的 ToolGen(90.16%)1.24%。该方法把工具检索重构为受资源约束的序列决策问题,用执行感知的代理世界模型在不调用真实 API 的情况下预测执行成功率、延迟开销与语义效用。消融实验显示显式延迟建模是关键信号。