跳到正文

#MCP/工具调用

今日 3 条
今天9月30日周三
9月29日周二
  1. HuggingFace Blog45

    ProvenanceGuard:面向 MCP 智能体的来源感知事实性验证

    ProvenanceGuard 是面向 MCP 智能体的来源感知事实核查层,在不重训模型的前提下对黑盒智能体答案做后置验证,专门识别事实为真但归错来源的跨源混淆。在 281 条医疗智能体真实轨迹中,专家判定 361 条断言里 139 条不应通过,该方法拦下 138 条,可识别来源时约 86% 选对来源。

  2. arXiv cs.CL37

    ToolSearcher:通过强化学习优化大规模工具选择

    ToolSearcher 是一个面向大规模工具选择的强化学习框架,用类别约束的工具区分、事件级搜索建模与轨迹对齐信用分配,提升 LLM 在上下文限制下的多轮工具搜索与组合能力。它将大规模工具选择视为智能体强化学习的新挑战,指出现有知识问答 RL 方法难以兼顾工具兼容性。在迭代搜索与复杂工具组合等基准设置下,它持续优于多个强基线,并已被 NeurIPS 2026 接收。

  3. arXiv cs.CL36

    Cartograph:面向 AI 智能体的联邦式工具发现与运营方认证检索

    Cartograph 是联邦式 MCP 代理,把 AI 智能体的工具发现从 O(n) 改为 O(k) 渐进式披露。在 22 个服务器、374 个工具的部署中仅暴露三个代理工具,49 条查询基准 R@5 为 0.816,高于 Jaccard 基线的 0.592。Rift 三层分析识别出 49 个易混淆簇,网关十次试验平均增加 5ms 延迟(0.8%)。

9月16日周三
  1. Apple Machine Learning Research43

    面向智能体 LLM 系统的共享选择性持久记忆架构

    共享选择性持久记忆架构面向智能体 LLM 系统,只保留任务规范、数据 schema、工具配置与输出约束四类可复用上下文,工作区可按角色访问权限跨用户共享。在三个企业部署场景中任务完成率达 96%,高于无记忆的 79% 与保留完整历史的 71%。零 token 数据刷新免去重复更新的 LLM 重调用,任务耗时降低 14×;摘要驱动生成使单次调用 token 成本降低 97×。