跳到正文

#Agent

今日 168 条
今天9月30日周三
  1. AGI Hunt39

    CaptchaArena:5 万道交互式验证码训练集,9B 模型 Pass@1 达 71.7%

    CaptchaArena 发布首个面向交互式 CAPTCHA 求解的大规模细粒度训练数据集,覆盖 20 种验证码类型、5 种交互模式共 5 万道经执行验证的题目。基于该数据集训练的单一 9B 策略模型 CaptchaAgent 采用 SFT+RL、由环境验证器直接提供 RL 奖励,Pass@1 从 SFT 后的 70.5% 提升至 71.7%,并在两个外部基准上同样提升,数据集与模型均已开源。

  2. arXiv cs.CL40

    DeepRewind:预测并修复深度研究智能体的过早结论承诺

    DeepRewind 是可逆深度研究的附加控制层,把智能体的认知状态表示为类型化图,用于预测并修复过早的结论承诺。它用基于提示词的世界模型评估可逆性,二值控制器拦截高风险承诺,一致性监控器在后续证据推翻时执行依赖感知回滚。在 DRBench 和 LiveDRBench 上,洞见召回相比 Open Deep Research 提升 3.6 个百分点,过早承诺减少 59.1%。

  3. arXiv cs.CL58

    论文提出口述训练 VT,让 LLM 说出自身的评估意识

    论文提出口述训练(VT),让 LLM 更愿意口述自身的评估意识,同时不直接监督潜在信念。VT 把 rollout 截断在模型自发口述之前、以模型已知情的训练前缀配合 RL 目标校准口述比例;在 Qwen3.6-35B-A3B、Kimi K2.6 和 Inkling 上,可口述的评估意识提升 2.4-2.9 倍,并能迁移到未见过的智能体场景,测得的潜在评估意识与行为基本稳定。

  4. arXiv cs.CL44

    HeurEvo:面向时间受限数学优化的求解器增强混合启发式智能体进化

    HeurEvo 是面向时间受限数学优化的 plan–code–component 协同进化框架,联合进化算法结构、实现代码与共享组件池。在组合优化 benchmark 与 MIPLIB 实例上,它能在严格运行时限内找到高质量解,常匹敌或超越需数小时至数天计算的 SOTA 求解器。在六边形填充等非线性几何问题上,它也超过此前最佳结果。

  5. arXiv cs.AI33

    从检索到推理:PhenoAIR 基于 Cell Painting 图谱的智能体机制预测

    PhenoAIR 是可靠性感知的多智能体框架,在来自 JUMP Cell Painting 的基准所有 MOA 预测设置中超过表征匹配与 LLM 基线。它将 Cell Painting 的 MOA 预测从表征匹配重构为校准证据推理,维护以候选为中心的证据记忆,并用离线参考集校准按来源可靠性、表型稳定性和机制级混淆加权。该工作入选 NeurIPS 2026 main track。

  6. arXiv cs.AI35

    ARCagent:面向临床问答的自适应检索校准智能体

    ARCagent 是面向 ME/CFS 临床问答的自适应检索校准智能体,取得 95.3% 的成绩,超过所有基线 LLM。它包含 1,706-chunk、10-source 知识库与跨指南冲突注册表,并按 query-specific focus 和冲突信号对检索证据重排序。评测采用 LLM-as-Judge,避开关键词匹配造成的平均 10.1 个百分点系统性低估,代码已开源。

  7. arXiv cs.CL36

    OLIVE:在学生的状态上向教师续写学习

    OLIVE 是一种在线语言模型蒸馏方法,每轮由学生生成前缀、教师自回归续写,学生用教师生成 token 的交叉熵更新。在可比 GPU 小时成本下,其推理性能高于 OPD(top-16 KL 近似),异步实现进一步减少 23.8% 训练时间。仅用 GPT-5.4-mini 的文本,在 ScienceWorld 上持续训练比同教师离线 SFT 高 13%。

  8. arXiv cs.AI39

    工程化简洁:简单机制界面引导 LLM 智能体

    在拍卖与匹配这类规则明确的多智能体环境中,简单的机制界面能引导 LLM 智能体做出更好决策:跨四个模型家族,升价拍卖界面大幅降低出价偏差。列出收益情形并解释说真话为何安全同样改善选择,而要求规划匹配轮次或推测对手信念的提示词整体拉低表现。拍卖中的行为提升并未同步反映在智能体简短计划的可测战略理解语言指标上。

  9. AGI Hunt25

    IIT马德拉斯教授谈代理式AI:扩展应用不能忽视安全护栏

    印度理工学院马德拉斯分校 Wadhwani 数据科学与 AI 学院负责人 Balaraman Ravindran 在 DT Next 专访中表示,AI 正从聊天机器人问答转向能够规划任务、与其他 AI 协作的代理式行动阶段,扩展模型时安全护栏必须与技术发展同步跟上。他还谈到代理式 AI 带来的网络安全挑战、对就业的影响,以及在印度语言场景下的应用。

  10. arXiv cs.AI38

    StateTape:面向长时程编程智能体的动作条件证据生命周期建模

    研究者提出 StateTape,一种面向长时程编程智能体的上下文维护框架:它把仓库建模为符号级代码图,用 tape 标记每次写入改变的符号,并按仓库变化重写智能体上下文。它能在每次写入时清除被证伪记录、检索所需记录,并配套 TraceBench;在六个编程智能体和三个编辑密集基准上均取得更高解决率且计算开销较小。

  11. arXiv cs.AI48

    CheatBench:衡量 AI 智能体中的奖励作弊行为

    研究团队提出 CheatBench,一个衡量 AI 智能体奖励作弊行为的基准,覆盖数学研究、知识工作、编程、视觉等任务。其环境把高难度任务与作弊机会结合,用于研究诚实工作困难时智能体如何追求目标,并支持跨模型和任务类别比较。研究团队已公开释放 CheatBench,以测量和减少智能体在承担更关键职责时的作弊行为。

  12. arXiv cs.CL38

    PADMÉ:面向 LM 智能体评估器元评估的偏好对齐数据合成方法

    PADMÉ 用小型语言模型合成 LM 智能体评估器的偏好对齐元评估数据,无需人工参与。其原型在 4 个智能体领域、3 项评估标准下合成 1,000 条样本,150 条子集的人工验证显示与人类判断的一致率从朴素基线的 73% 升到 85%。用该数据集元评估 25 个常见模型,显示评估表现与评分粒度、宽松度和模型规模相关。

  13. arXiv cs.AI41

    面向潜在递归 LLM 系统的原则化思考:REST 表征监督训练目标

    REST(REpresentation-Supervised Thoughts)将因果关系、最小性、可分离性、稳定性四项有效思考表征属性转为可微损失,与交叉熵(CE)联合训练潜空间递归 LLM。在数学、科学、医学与代码生成共 7 个基准上,同等训练数据、算力与潜空间预算下,其准确率比纯 CE 训练最高提升 7.5 个百分点,最终答案收敛率提升 30%,且解码这些思考表征能更好地还原智能体预期输出。

  14. arXiv cs.AI39

    记忆即推导:长期 LLM 智能体的分布式证据悖论与 DerivAudit 审计框架

    DerivAudit 框架用于审计长期 LLM 智能体的持久记忆是否真由写入时的交互历史所支持。在两个自然记忆语料上,使用更广的写入前历史可为近 60% 单看引用显得无支持的记忆找回支撑,但 17-21% 在扩展后仍无支持。扩大证据并不能让准入可靠:无支持记忆仍常被各验证模型接纳,在两个主干上证据扩展反而使其更差。

  15. arXiv cs.CL31

    PrimeSeeker:面向深度搜索智能体的能力导向监督

    PrimeSeeker 提出面向深度搜索智能体的能力导向监督框架,用潜在锚点推理从描述性规格中解析未命名检索锚点,并将锚点迁移到后续信息需求,联合生成问题与参考证据骨架。研究构建了 9,221 条专家轨迹,训练出一个 30B 搜索智能体,在五个深度搜索基准上表现强劲,参考步骤优化进一步提升监督策略。固定预算评估显示其解法覆盖率高,工具调用次数远少于长程系统,检索冗余更低。

  16. arXiv cs.CL45

    BreakingWeb:用受控环境干预构建高难度浏览器使用任务

    BreakingWeb 用受控环境干预改造浏览器智能体已能解决的任务,使其平均通过率下降 22.9%。基准含 7 个自托管网站的 519 对原始/干预任务和 29 类干预,并推翻各智能体近半数原本能干净解决的任务。人类首次尝试仅下降 10.0%;六款智能体 75% 的失败属“信念失败”——变更未发生却宣称成功,代码、数据与环境已公开。

  17. arXiv cs.AI45

    SAGE:面向自我演化智能体的统计式接受门控

    SAGE 提出面向自我演化智能体的统计式接受门控,用逐条目配对比较与单侧配对检验取代只看聚合验证分的朴素门控,增益不可靠时直接弃权。在 5 个 benchmark、4 个骨干 LLM 的等预算协议下,SAGE 在 20 个设置中的 19 个降低回归率,DeepSeek-V4 在 LiveMath 从 36.5% 降至 0%。

  18. arXiv cs.CL36

    成功记忆为何误导具身智能体:MATE 的任务条件化执行记忆适配

    MATE 是一种确定性的检索后处理流程,把具身智能体检索到的成功轨迹转换为面向执行的记忆,无需额外 LLM 推理。在 134 个 ALFWorld 任务上,MATE 配合 Qwen2.5-14B 与 72B 的任务成功率分别为 81.3% 和 93.3%,token 用量约为原始轨迹的十分之一,其中经核验的动作归一化是恢复检索经验效用的主要机制。

  19. arXiv cs.AI66

    arXiv 论文:小语言模型多智能体辩论的收益被归为集成采样效应

    一项 arXiv 论文在来自 11 个厂商家族的 23 个小模型、5 项任务、5500 多次辩论与控制运行中检验多智能体辩论(MAD)的收益来源,认知多样性假设在人格、采样温度和模型身份三个维度上均被否定。

    推荐理由:23 个模型与 5500 多次运行的对照显示,多智能体辩论的收益可被同预算采样复现,为后续辩论机制给出了比较基线。

  20. arXiv cs.CL32

    从词法基线到 Agentic RAG:基于 SFIA 框架的结构化技能与责任等级抽取

    研究首次针对 SFIA 框架给出结构化、等级感知的技能抽取可复现基线,将任务形式化为从自由文本预测 (skill, level) 对,并在 SFIA 的 147 项技能、7 个责任等级上对比五种策略:检索式匹配识别技能最多、生成式策略更精确,只有把等级作为显式决策才能可靠预测,基于相似度的选择错误率高出两倍以上。

  21. arXiv cs.CV35

    AerialDojo-200K:面向开放世界空中目标搜索的大规模基准套件

    研究提出面向开放世界空中目标搜索的大规模基准套件 AerialDojo-200K,其场景数与任务实例数分别达现有最大同类基准的 3 倍和 18.7 倍。该套件含 42 个仿真场景和 205,732 个任务实例,并提供 21 个分布内与 21 个分布外场景的统一评测框架。对 5 个开源和 4 个闭源多模态大语言模型的评测显示,通用空中智能体仍有很长的路要走。

  22. arXiv cs.CV42

    系统性多智能体视觉语言导航:形式化、MAVLN 基准与 TRISS 方法

    作者称首次将多智能体 VLN 形式化为带依赖与资源约束的协同问题,并发布 MAVLN 基准与 TRISS 协作导航系统。MAVLN 含 11,724 条 episode、145 个场景,覆盖最多四个智能体与三种指令设定,配套约束感知指标。TRISS 由基于 LLM 的子任务调度器、共享拓扑记忆与冲突感知执行机制构成,实验显示其可作为综合基线,调度、规划与执行仍有较大提升空间。

  23. AGI Hunt69

    OpenAI 向 Pro 用户推出后台智能体 dots,独立开发者开源同类项目 Thursday 并逐项对比

    OpenAI 面向 Pro 用户上线常驻云端的后台智能体 dots,开源同类项目 Thursday 的作者随后发布逐项对比。dots 的优势是 24 小时跑在 OpenAI 云端电脑上,接入 GPT-6 Astra 与 4000+ 连接应用目录,且零配置。

    推荐理由:文中逐项列出 dots 的云端常驻优势与 Thursday 在本地文件访问、多 bot 交接上的差异,便于理解两类后台智能体的取舍。