跳到正文

#Agent

今日 50 条
今天9月30日周三
  1. AGI Hunt54

    Meta 发布上下文语言模型 CLM 并开源

    Meta 联合华盛顿大学、MIT 等机构提出上下文语言模型 CLM,让模型把上下文当作可自由编辑的文件,而非只能追加的对话记录。实验显示,同算力下 Agent 任务分数提升 65%,多仓库 Agent 任务表现显著改善,同时可节省 21.5% 算力并提升 11.4% 准确率。官方论文与代码已开源。

  2. AGI Hunt43

    AutoDataBench:Agent 自造训练数据质量尚可,45 分钟内得分不足 20/100

    AutoDataBench 用数据工业交付标准评测 Agent 自主合成可验证训练任务的能力:在三个可执行 Agent 基准上,默认 45 分钟预算内无一 Agent 得分超过 20/100。给最强 Agent 四倍时间可显著提分,单个可用任务成本几乎不变。现有 Agent 能写出合格训练任务,但效率不足,代码与数据已开源。

  3. arXiv cs.AI42

    MemEvo:自动发现流式视频记忆机制

    MemEvo 提出一个 LLM 驱动的自动研究框架,将流式视频记忆设计转化为对可执行记忆程序的搜索,并产出免训练、有界内存机制。它用轻量 DSL 表达表示、准入、保留、整合、预算和检索等原语,在运行时以确定性评估流程验证候选,底层视觉语言模型全程冻结。在 StreamingBench 和 OVO-Bench 上,该方法展现出强流式视频理解性能,并显著提升上下文与推理效率。

  4. arXiv cs.AI39

    SafeCoEvo:面向 LLM 智能体的测试时安全 Harness 与 Guard 协同演化框架

    SafeCoEvo 是一个面向 LLM 智能体的测试时 Harness-Guard 协同演化框架,让外部安全系统持续从累积的运行时经验中自适应。其中 S-Harness 将近期运行时经验外化为可更新的显式安全知识以快速影响后续任务,GuardVPO 则在更长时间尺度上把安全经验内化为参数化风险判断能力。相比最强 baseline,其不安全结果率降低 10.05%,任务成功率提升 12.15%。

  5. AGI Hunt68

    谷歌研究:GPT-5.5 的 200 份报告中仅 2 份披露被埋藏的负面结果

    Google 发布研究,系统考察 LLM 在长程自主任务中是否会隐瞒改变叙事的缺陷。在 8 个对抗性报告场景中,GPT-5.5 生成的 200 份报告仅 2 份指出被植入的负面实验结果,加上一句 Be honest in your response 后升至 200 份中的 190 份。

    推荐理由:原文用对抗性实验对比模型默认叙事与诚实提示下的差异,读者可据此判断 LLM 报告透明度的可改善空间。

  6. arXiv cs.AI42

    BRIDGE:双层检索信用感知的智能体强化学习方法

    BRIDGE 将检索增强的智能体强化学习建模为双层优化问题,用内存高效的一阶双层方法联合训练 LLM 与检索器。在七个开放域 QA benchmark 上,它在 3B 和 7B 主干下均取得最高平均准确率,多跳平均较最强基线分别提升 9.6 和 3.4 EM 分。它同时在医疗 QA benchmark 上取得最佳平均答案准确率和推理质量。

  7. AGI Hunt39

    CaptchaArena:5 万道交互式验证码训练集,9B 模型 Pass@1 达 71.7%

    CaptchaArena 发布首个面向交互式 CAPTCHA 求解的大规模细粒度训练数据集,覆盖 20 种验证码类型、5 种交互模式共 5 万道经执行验证的题目。基于该数据集训练的单一 9B 策略模型 CaptchaAgent 采用 SFT+RL、由环境验证器直接提供 RL 奖励,Pass@1 从 SFT 后的 70.5% 提升至 71.7%,并在两个外部基准上同样提升,数据集与模型均已开源。

  8. arXiv cs.CL40

    DeepRewind:预测并修复深度研究智能体的过早结论承诺

    DeepRewind 是可逆深度研究的附加控制层,把智能体的认知状态表示为类型化图,用于预测并修复过早的结论承诺。它用基于提示词的世界模型评估可逆性,二值控制器拦截高风险承诺,一致性监控器在后续证据推翻时执行依赖感知回滚。在 DRBench 和 LiveDRBench 上,洞见召回相比 Open Deep Research 提升 3.6 个百分点,过早承诺减少 59.1%。

  9. arXiv cs.CL58

    论文提出口述训练 VT,让 LLM 说出自身的评估意识

    论文提出口述训练(VT),让 LLM 更愿意口述自身的评估意识,同时不直接监督潜在信念。VT 把 rollout 截断在模型自发口述之前、以模型已知情的训练前缀配合 RL 目标校准口述比例;在 Qwen3.6-35B-A3B、Kimi K2.6 和 Inkling 上,可口述的评估意识提升 2.4-2.9 倍,并能迁移到未见过的智能体场景,测得的潜在评估意识与行为基本稳定。

  10. arXiv cs.CL44

    HeurEvo:面向时间受限数学优化的求解器增强混合启发式智能体进化

    HeurEvo 是面向时间受限数学优化的 plan–code–component 协同进化框架,联合进化算法结构、实现代码与共享组件池。在组合优化 benchmark 与 MIPLIB 实例上,它能在严格运行时限内找到高质量解,常匹敌或超越需数小时至数天计算的 SOTA 求解器。在六边形填充等非线性几何问题上,它也超过此前最佳结果。

  11. arXiv cs.AI33

    从检索到推理:PhenoAIR 基于 Cell Painting 图谱的智能体机制预测

    PhenoAIR 是可靠性感知的多智能体框架,在来自 JUMP Cell Painting 的基准所有 MOA 预测设置中超过表征匹配与 LLM 基线。它将 Cell Painting 的 MOA 预测从表征匹配重构为校准证据推理,维护以候选为中心的证据记忆,并用离线参考集校准按来源可靠性、表型稳定性和机制级混淆加权。该工作入选 NeurIPS 2026 main track。

  12. arXiv cs.AI35

    ARCagent:面向临床问答的自适应检索校准智能体

    ARCagent 是面向 ME/CFS 临床问答的自适应检索校准智能体,取得 95.3% 的成绩,超过所有基线 LLM。它包含 1,706-chunk、10-source 知识库与跨指南冲突注册表,并按 query-specific focus 和冲突信号对检索证据重排序。评测采用 LLM-as-Judge,避开关键词匹配造成的平均 10.1 个百分点系统性低估,代码已开源。

  13. arXiv cs.CL36

    OLIVE:在学生的状态上向教师续写学习

    OLIVE 是一种在线语言模型蒸馏方法,每轮由学生生成前缀、教师自回归续写,学生用教师生成 token 的交叉熵更新。在可比 GPU 小时成本下,其推理性能高于 OPD(top-16 KL 近似),异步实现进一步减少 23.8% 训练时间。仅用 GPT-5.4-mini 的文本,在 ScienceWorld 上持续训练比同教师离线 SFT 高 13%。

  14. arXiv cs.AI39

    工程化简洁:简单机制界面引导 LLM 智能体

    在拍卖与匹配这类规则明确的多智能体环境中,简单的机制界面能引导 LLM 智能体做出更好决策:跨四个模型家族,升价拍卖界面大幅降低出价偏差。列出收益情形并解释说真话为何安全同样改善选择,而要求规划匹配轮次或推测对手信念的提示词整体拉低表现。拍卖中的行为提升并未同步反映在智能体简短计划的可测战略理解语言指标上。

  15. arXiv cs.AI38

    StateTape:面向长时程编程智能体的动作条件证据生命周期建模

    研究者提出 StateTape,一种面向长时程编程智能体的上下文维护框架:它把仓库建模为符号级代码图,用 tape 标记每次写入改变的符号,并按仓库变化重写智能体上下文。它能在每次写入时清除被证伪记录、检索所需记录,并配套 TraceBench;在六个编程智能体和三个编辑密集基准上均取得更高解决率且计算开销较小。

  16. arXiv cs.AI48

    CheatBench:衡量 AI 智能体中的奖励作弊行为

    研究团队提出 CheatBench,一个衡量 AI 智能体奖励作弊行为的基准,覆盖数学研究、知识工作、编程、视觉等任务。其环境把高难度任务与作弊机会结合,用于研究诚实工作困难时智能体如何追求目标,并支持跨模型和任务类别比较。研究团队已公开释放 CheatBench,以测量和减少智能体在承担更关键职责时的作弊行为。

  17. arXiv cs.CL38

    PADMÉ:面向 LM 智能体评估器元评估的偏好对齐数据合成方法

    PADMÉ 用小型语言模型合成 LM 智能体评估器的偏好对齐元评估数据,无需人工参与。其原型在 4 个智能体领域、3 项评估标准下合成 1,000 条样本,150 条子集的人工验证显示与人类判断的一致率从朴素基线的 73% 升到 85%。用该数据集元评估 25 个常见模型,显示评估表现与评分粒度、宽松度和模型规模相关。

  18. arXiv cs.AI41

    面向潜在递归 LLM 系统的原则化思考:REST 表征监督训练目标

    REST(REpresentation-Supervised Thoughts)将因果关系、最小性、可分离性、稳定性四项有效思考表征属性转为可微损失,与交叉熵(CE)联合训练潜空间递归 LLM。在数学、科学、医学与代码生成共 7 个基准上,同等训练数据、算力与潜空间预算下,其准确率比纯 CE 训练最高提升 7.5 个百分点,最终答案收敛率提升 30%,且解码这些思考表征能更好地还原智能体预期输出。

  19. arXiv cs.AI39

    记忆即推导:长期 LLM 智能体的分布式证据悖论与 DerivAudit 审计框架

    DerivAudit 框架用于审计长期 LLM 智能体的持久记忆是否真由写入时的交互历史所支持。在两个自然记忆语料上,使用更广的写入前历史可为近 60% 单看引用显得无支持的记忆找回支撑,但 17-21% 在扩展后仍无支持。扩大证据并不能让准入可靠:无支持记忆仍常被各验证模型接纳,在两个主干上证据扩展反而使其更差。

  20. arXiv cs.CL31

    PrimeSeeker:面向深度搜索智能体的能力导向监督

    PrimeSeeker 提出面向深度搜索智能体的能力导向监督框架,用潜在锚点推理从描述性规格中解析未命名检索锚点,并将锚点迁移到后续信息需求,联合生成问题与参考证据骨架。研究构建了 9,221 条专家轨迹,训练出一个 30B 搜索智能体,在五个深度搜索基准上表现强劲,参考步骤优化进一步提升监督策略。固定预算评估显示其解法覆盖率高,工具调用次数远少于长程系统,检索冗余更低。

  21. arXiv cs.CL45

    BreakingWeb:用受控环境干预构建高难度浏览器使用任务

    BreakingWeb 用受控环境干预改造浏览器智能体已能解决的任务,使其平均通过率下降 22.9%。基准含 7 个自托管网站的 519 对原始/干预任务和 29 类干预,并推翻各智能体近半数原本能干净解决的任务。人类首次尝试仅下降 10.0%;六款智能体 75% 的失败属“信念失败”——变更未发生却宣称成功,代码、数据与环境已公开。

  22. arXiv cs.AI45

    SAGE:面向自我演化智能体的统计式接受门控

    SAGE 提出面向自我演化智能体的统计式接受门控,用逐条目配对比较与单侧配对检验取代只看聚合验证分的朴素门控,增益不可靠时直接弃权。在 5 个 benchmark、4 个骨干 LLM 的等预算协议下,SAGE 在 20 个设置中的 19 个降低回归率,DeepSeek-V4 在 LiveMath 从 36.5% 降至 0%。