UIUC 团队 ANTMAN:用需求图动态协调多智能体,上下文扩 16 倍协调开销仅增 1.23 倍
UIUC 团队提出 ANTMAN,以「未解决的信息需求」为运行时协调单元,用可修订的 Need Graph 追踪未满足需求与搜索进度,统筹 worker 选择、路由与任务级恢复。
UIUC 团队提出 ANTMAN,以「未解决的信息需求」为运行时协调单元,用可修订的 Need Graph 追踪未满足需求与搜索进度,统筹 worker 选择、路由与任务级恢复。
五个稠密检索器与一个稀疏基线在政治新闻和消费者健康问答中都会更倾向返回与查询自身政治倾向一致的报道,且对用非裔美国人语言(AAL)写的提问表现差于白人主流英语(WME)。控制词汇不对称得分后合成集合的差距基本不变,线性探针仍能从查询嵌入向量中还原政治倾向与方言。这类偏差若不加处理,可能加剧极化并强化 AAL 使用者已有的健康差距。
BRIDGE 将检索增强的智能体强化学习建模为双层优化问题,用内存高效的一阶双层方法联合训练 LLM 与检索器。在七个开放域 QA benchmark 上,它在 3B 和 7B 主干下均取得最高平均准确率,多跳平均较最强基线分别提升 9.6 和 3.4 EM 分。它同时在医疗 QA benchmark 上取得最佳平均答案准确率和推理质量。
ARCagent 是面向 ME/CFS 临床问答的自适应检索校准智能体,取得 95.3% 的成绩,超过所有基线 LLM。它包含 1,706-chunk、10-source 知识库与跨指南冲突注册表,并按 query-specific focus 和冲突信号对检索证据重排序。评测采用 LLM-as-Judge,避开关键词匹配造成的平均 10.1 个百分点系统性低估,代码已开源。
LLM-Guided Graph Pruning(LGP)通过 LLM 推理剪枝已有 ANN 图索引中的结构低价值邻居,并用 LLM 选择的替代邻居替换,以解决几何-语义不匹配。在代表性语义检索基准上,LGP 在 DiskANN、HNSW 等图索引上持续优于原始贪心图搜索和基于 LLM 的 reranking。该框架保留原图的稀疏性和高效可导航性。
论文提出 PILLAR,一个基于 Private Information Retrieval(PIR)的隐私保护 RAG 系统,客户端从服务器语料中取回与查询最相似的 k 篇文档,服务器无法获知查询词项与访问模式。
EDAR 自适应熵路由框架在推理时依据 RAG 响应前几个 token 的预测熵,决定直接用检索片段回答还是升级为完整长上下文处理。在 LongBench v2 与 Infinity-Bench 上,它保留纯长上下文基线 97.4% 的准确率、token 开销减少 70.7%,仅 18.2% 的查询被升级。
GeoOutageBench 是一个评估 LLM 地理时空 KGQA 的基准,面向多模态停电与韧性分析。它整合停电记录、遥感、气象观测、风暴与电力事件、地理实体与领域本体,提供从时空包含与邻近、时空共现、多模态证据到假设评估的分级查询分类。该基准可配置地评测歧义时空问题的 NL 到 SPARQL 理解、查询驱动的本体效用与多模态 KGQA 检索准确率,代码与数据已公开。
TRACE 是面向肿瘤学 LLM 的可部署树关系结构增强框架:肿瘤学概念与关系被组织为可更新的树关系结构,离线学习结构、在线检索紧凑提示词证据,零样本下无需监督标签即可做任务自适应选择。
研究首次针对 SFIA 框架给出结构化、等级感知的技能抽取可复现基线,将任务形式化为从自由文本预测 (skill, level) 对,并在 SFIA 的 147 项技能、7 个责任等级上对比五种策略:检索式匹配识别技能最多、生成式策略更精确,只有把等级作为显式决策才能可靠预测,基于相似度的选择错误率高出两倍以上。
Sieve and Sage 框架把 RALM 的检索失败拆成「无答案」和「受干扰」两种状态,用轻量模块 Sieve 先筛除检索文档中的干扰证据,再交给高开销 LLM(Sage)完成有据生成与拒答。
AWS 博客给出一个合同智能平台的参考架构,用部署在 Amazon Bedrock AgentCore 上的抽取智能体与验证智能体把合同 PDF 转为结构化数据,再通过 Amazon Quick 提供嵌入式仪表盘和自然语言查询。
作者演示客服 AI agent SupportMemory,用 Hindsight 作持久记忆层记住客户历史信息,不再重复索要订单号。无记忆架构是「客户→AI→回复」,有记忆则先召回历史上下文再回复并留存新信息。demo 用 Ananya、Steven、Max 三位虚拟客户验证对话可延续,结论是 AI agent 不只要生成好回答,还要记住正确的上下文。
VeilMind 原型提出一套多租户 AI 记忆方案:每个客户拥有独立隔离的记忆,项目结束后把泛化教训经可识别信息检查后写入共享 playbook。作者还搭建攻击测试环境,验证能否诱导 AI 泄露其他项目信息,并对冲突知识选择呈现冲突而非当作普适真理。该原型被定位为 hackathon 原型,而非生产级安全系统。
开发者 sathvik1233 分享基于 Hindsight 记忆服务器的 SRE copilot ResolveIQ,让 Agent 记住历史事故教训,并在同一告警再次触发时拦住作者重启数据库。
资金审查场景下,作者提出 Hindsight 只提供记忆上下文、不能充当证据,当前敞口与政策校验必须锚定应用可验证的记录。系统以 FastAPI 后端、Frankfurter 汇率数据、SQLite 存敞口/政策/快照/审计事件、Hindsight Cloud 做记忆召回、Groq 生成书面评估,缺敞口或政策即拒绝评估。
开发者 LoksaiPalyam 发布开源概念项目 VeriChron AI,用双时态数据、知识图谱与 AI Agent 重建企业任意时点的合规状态,并区分 Valid Time 与 System Time。
LogicTree-RAG 提出用逻辑树引导检索增强生成,为长篇幅专利起草提供全局组织骨架,无需专家预设起草大纲。它把每个技术元素构建为逻辑树节点,再通过混合遍历映射到专利章节,实现可控且章节均衡的生成。实验显示,该框架在内容质量和语言合规性上优于强 LLM 基线,并能以高 token 效率完成更长的结构化生成。
DealPulse 基于 Vectorize Hindsight 持久记忆构建 B2B 销售助手,用三库分区记忆替代上下文堆砌。记忆分为 episodic 通话记录、赢单 playbook 和竞争对手情报三类,逐字保留客户异议与利益相关者情绪,可在 2 秒内召回此前具体承诺并生成有依据的反制策略。代码已在 GitHub 开源。
作者在调试 RAG 系统时发现,模型幻觉的根源可能是检索层没召回所需 chunk,模型只能靠先验知识作答——两类失败外部症状相同,修法却相反。把每次回答对应的召回 chunk 记入日志能发现部分问题但仍需人工查看,独立测量检索召回率则需要多数团队不具备的标注数据。作者向社区提问:是否把检索质量和回答质量分开度量。
Qdrant 发布研究预览版 Constella,让检索系统在更换查询端 embedding 模型时无需对全部文档重新嵌入、重建向量索引。其中 Nano 与 Zero 两个模型专门训练为与 Stella 的文档嵌入兼容,为检索系统的模型迭代提供了更灵活的方式。
黑客松项目 RecallDesk 是一个带长期记忆的 AI 客服 agent,集成 Hindsight 保留跨对话上下文并复用既有问题解决方案,以提升 LLM 客服系统相对无状态 chatbot 的一致性。项目从记忆检索准确率与响应质量两个维度做评估,重点解决检索质量、过期信息与上下文管理难题,作者正征求对记忆架构与评估方案的反馈。
Google Cloud 将原生 TPU 支持集成进 vLLM,在 Cloud TPU 上实现企业级精度的长上下文多模态嵌入推理。该方案以 Qwen3-Embedding-8B 为目标模型,支持文本 4K+ tokens、多模态文本加图像 15K+ tokens 的超长上下文,并以余弦相似度验证跨硬件数值对齐,文本目标阈值 ≥0.999、多模态 ≥0.995。
Muslim 是已部署的阿拉伯语语音 AI 平台,向真实用户提供有出处、可溯源的伊斯兰知识,实测 124 例诵读校验准确率 98.4%,端到端语音延迟 0.9-1.7s。
论文识别出 stale-document poisoning(过期文档投毒)现象,即模型在不检索时能答对,检索到过期证据后答案反而被覆盖。作者构建覆盖医学、法律、软件和平台政策的 317 个已验证知识反转基准,在 12 个模型上测试:过期检索让 Llama 30%、Qwen 37% 的回答翻转,加上显式遵循文档的指令后分别升至 66% 和 75%。
PIA 是一个与消费级健康智能体并行的个人智能体,自行决定如何读写,把健康对话转成带类型的临床记录、再合成为对用户的理解。其记忆框架含 extraction、memory、retrieval、understanding 四项控制,各配 schema、医学别名词典、知识图谱、时序规则等可插拔健康模块;注入记忆从一维回忆、二维健康快照加深到带因果的三维轨迹时,同一查询会得到不同答案。
在 74 个标注 Real/Fake 的日语医疗 YouTube 长视频上,完整转录文本(Baseline)在基于 LLM 的真实性分类中表现最佳,而 LLM 摘要、RAPTOR 的 RAG 与 Screening 三种压缩输入均增加了假阴性。
CARGO 框架将检索到的参考当作流程范例、以实例观测上下文锚定事实判断、并按检索置信度门控,用于生产环境的智能体 AI 评估。在 246 条样本、7,872 次判断的 CARGO-Bench 上,参考式 judge 会惩罚 100% 的正确实体替换答案且 DI 约为 0,CARGO 将误判降至 0/50、矛盾召回保持 50/50,DI 升至 0.58;但其宽松设计对流程性错误的召回仅 20%。
一项案例研究提出两套分类体系,把检索式医学事实核查的失败拆解为检索阶段五类质量维度错误与验证推理六步错误。研究基于 MedExpert 开放式数据集和 3 个封闭式数据集,用 LLM-as-Judge 自动标注,并在 4 种检索方法与 6 个前沿验证模型上压力测试。结果显示扩大模型规模、增加推理投入、纳入权威网络来源与医学微调都无法消除这些失败模式。
SignTrace 用自然语言描述反查中文手语词典,在 6,699 条词条上取得 94.0% Hit@1。系统整合 LLM 词典富化、动作抽取、七通道检索与候选重排,重排把 500 条描述基准的 Hit@1 从 71.8% 提升至 94.0%,Hit@9 达 97.4%。六路并发下中位查询耗时 13.37 秒,已部署试用;基准措辞取自词典,泛化到用户自述描述受限。
HiCoMER 提出面向 LLM 智能体的层次化协作记忆管理与有效性感知检索框架,先维护团队与个体记忆的有效性,再检索仍然有效的记忆。框架含记忆冲突更新、有效性感知检索和记忆接地答案生成三个组件。作者为协作场景构建两个记忆接地问答数据集,实验显示 HiCoMER 持续优于强基线,减少过期检索并保留团队共识、提升下游问答质量。
TypeSafe AI 发布 Jev,一个非自回归的校准决策模型,可在低于 500ms 的延迟下并行执行类型化概率微决策,成本远低于通用 LLM。Jev 提供 Noul、Choice、Score 三种原语,用于 GraphRAG 的实体消解、跨本体 schema 映射与边权重标注。文章提出由 Jev 承担 System 1 微决策、LLM 负责 System 2 推理的双引擎架构。
作者用纯 Python 实现了纯检索 RAG、确定性动作规划器和混合系统三种版本,在同样的九个任务上各跑一遍,只有混合系统同时通过知识类与知识加动作类任务。系统基于 22 篇文章切出的 334 个 chunk 语料和 TF-IDF 检索,构建过程中作者发现并修复了两个解析器 bug,混合系统一度在纯知识任务上失败。
平台账户用 Amazon Bedrock AgentCore Gateway 把各业务线账户的 MCP server 聚合成单一 MCP 端点,智能体无需复制数据即可跨账户发现并调用工具,数据只在查询时流出所属账户。
Ari Joury 在 Towards Data Science 撰文提出,RAG 只是把候选证据交给模型,无法证明模型刚生成的论断得到支持,应把控制单位从文档下沉到原子论断。
作者认为流水线中的必填字段和相似度缓存都会在正确答案为空时返回编造值,并以自建的开源本地 RAG 检索系统为例做了验证。他用自写的西班牙语行政问题对测试 bge-m3,加入仅差一个 token 的改写对照后 AUC 从 0.3556 升到 0.9333,但最低被接受的改写仍低于最高被拒绝的否定句,因此没有可用阈值。
推荐理由:文中记录了作者自建语义缓存的阈值实验与失败细节,并提出可套用到抽取和检索组件的三个自查问题。
HEMA 基于 MCP 和 Amazon Bedrock AgentCore 构建内部 AI 助手 HAL,把分散在门户、wiki 与文档中的知识集中,并在 HAL 聊天、Kiro、Claude 等工具中直接提供答案。此前查一个答案需在 3 或 4 个门户间跳转、有时耗费整个下午,现在可在 IDE 或聊天窗口几秒内完成;当前为只读知识层,下一步将转为可执行操作层。
Cloudflare 宣布 Python Workers 正式可用(GA),Python 成为 Cloudflare Workers 运行时的一等支持语言。
推荐理由:Python Workers 转为正式可用,文章说明了 WSGI/ASGI 连接器与 socket 桥接如何让框架、数据库驱动和 AI 库直接在 Workers 上运行。
V7 使用 GPT-5.6 把分散的公司文件转化为智能体可用的上下文,用于完成复杂且带来源链接的工作。该方案将成本降低 78%,同时提升了准确率。
Glyph 是一个生产系统,把列描述生成与列类型标注建模为由状态图编排的协作式 LLM 智能体。Descriptor 从企业 GitHub 按需检索流水线源码来支撑生成。