跳到正文

#RAG

今日 12 条
今天9月30日周三
  1. arXiv cs.CL47

    稠密检索器对查询中身份信号的敏感性

    五个稠密检索器与一个稀疏基线在政治新闻和消费者健康问答中都会更倾向返回与查询自身政治倾向一致的报道,且对用非裔美国人语言(AAL)写的提问表现差于白人主流英语(WME)。控制词汇不对称得分后合成集合的差距基本不变,线性探针仍能从查询嵌入向量中还原政治倾向与方言。这类偏差若不加处理,可能加剧极化并强化 AAL 使用者已有的健康差距。

  2. arXiv cs.AI42

    BRIDGE:双层检索信用感知的智能体强化学习方法

    BRIDGE 将检索增强的智能体强化学习建模为双层优化问题,用内存高效的一阶双层方法联合训练 LLM 与检索器。在七个开放域 QA benchmark 上,它在 3B 和 7B 主干下均取得最高平均准确率,多跳平均较最强基线分别提升 9.6 和 3.4 EM 分。它同时在医疗 QA benchmark 上取得最佳平均答案准确率和推理质量。

  3. arXiv cs.AI35

    ARCagent:面向临床问答的自适应检索校准智能体

    ARCagent 是面向 ME/CFS 临床问答的自适应检索校准智能体,取得 95.3% 的成绩,超过所有基线 LLM。它包含 1,706-chunk、10-source 知识库与跨指南冲突注册表,并按 query-specific focus 和冲突信号对检索证据重排序。评测采用 LLM-as-Judge,避开关键词匹配造成的平均 10.1 个百分点系统性低估,代码已开源。

  4. arXiv cs.AI40

    LGP:通过(高效)LLM 引导剪枝改进 ANN 图索引

    LLM-Guided Graph Pruning(LGP)通过 LLM 推理剪枝已有 ANN 图索引中的结构低价值邻居,并用 LLM 选择的替代邻居替换,以解决几何-语义不匹配。在代表性语义检索基准上,LGP 在 DiskANN、HNSW 等图索引上持续优于原始贪心图搜索和基于 LLM 的 reranking。该框架保留原图的稀疏性和高效可导航性。

  5. arXiv cs.AI31

    GeoOutageBench:面向多模态停电与韧性分析的歧义感知、本体支撑地理时空 KGQA 基准

    GeoOutageBench 是一个评估 LLM 地理时空 KGQA 的基准,面向多模态停电与韧性分析。它整合停电记录、遥感、气象观测、风暴与电力事件、地理实体与领域本体,提供从时空包含与邻近、时空共现、多模态证据到假设评估的分级查询分类。该基准可配置地评测歧义时空问题的 NL 到 SPARQL 理解、查询驱动的本体效用与多模态 KGQA 检索准确率,代码与数据已公开。

  6. arXiv cs.CL32

    从词法基线到 Agentic RAG:基于 SFIA 框架的结构化技能与责任等级抽取

    研究首次针对 SFIA 框架给出结构化、等级感知的技能抽取可复现基线,将任务形式化为从自由文本预测 (skill, level) 对,并在 SFIA 的 147 项技能、7 个责任等级上对比五种策略:检索式匹配识别技能最多、生成式策略更精确,只有把等级作为显式决策才能可靠预测,基于相似度的选择错误率高出两倍以上。

9月29日周二
  1. AGI Hunt37

    用 Hindsight 持久记忆打造会记住客户的客服 Agent

    作者演示客服 AI agent SupportMemory,用 Hindsight 作持久记忆层记住客户历史信息,不再重复索要订单号。无记忆架构是「客户→AI→回复」,有记忆则先召回历史上下文再回复并留存新信息。demo 用 Ananya、Steven、Max 三位虚拟客户验证对话可延续,结论是 AI agent 不只要生成好回答,还要记住正确的上下文。

  2. AGI Hunt33

    VeilMind 原型:跨客户共享 AI 记忆,同时隔离各家隐私经验

    VeilMind 原型提出一套多租户 AI 记忆方案:每个客户拥有独立隔离的记忆,项目结束后把泛化教训经可识别信息检查后写入共享 playbook。作者还搭建攻击测试环境,验证能否诱导 AI 泄露其他项目信息,并对冲突知识选择呈现冲突而非当作普适真理。该原型被定位为 hackathon 原型,而非生产级安全系统。

  3. arXiv cs.AI35

    LogicTree-RAG:面向长篇幅专利起草的逻辑树引导检索增强生成

    LogicTree-RAG 提出用逻辑树引导检索增强生成,为长篇幅专利起草提供全局组织骨架,无需专家预设起草大纲。它把每个技术元素构建为逻辑树节点,再通过混合遍历映射到专利章节,实现可控且章节均衡的生成。实验显示,该框架在内容质量和语言合规性上优于强 LLM 基线,并能以高 token 效率完成更长的结构化生成。

  4. AGI Hunt34

    RAG 失败排查:症状相同的幻觉,问题可能出在检索而非模型

    作者在调试 RAG 系统时发现,模型幻觉的根源可能是检索层没召回所需 chunk,模型只能靠先验知识作答——两类失败外部症状相同,修法却相反。把每次回答对应的召回 chunk 记入日志能发现部分问题但仍需人工查看,独立测量检索召回率则需要多数团队不具备的标注数据。作者向社区提问:是否把检索质量和回答质量分开度量。

  5. AGI Hunt34

    黑客松项目 RecallDesk:用长期记忆构建 AI 客服 agent 的架构与评估思路

    黑客松项目 RecallDesk 是一个带长期记忆的 AI 客服 agent,集成 Hindsight 保留跨对话上下文并复用既有问题解决方案,以提升 LLM 客服系统相对无状态 chatbot 的一致性。项目从记忆检索准确率与响应质量两个维度做评估,重点解决检索质量、过期信息与上下文管理难题,作者正征求对记忆架构与评估方案的反馈。

  6. Google Developers Blog38

    Google Cloud 在 Cloud TPU 上实现企业级高精度长上下文多模态嵌入推理

    Google Cloud 将原生 TPU 支持集成进 vLLM,在 Cloud TPU 上实现企业级精度的长上下文多模态嵌入推理。该方案以 Qwen3-Embedding-8B 为目标模型,支持文本 4K+ tokens、多模态文本加图像 15K+ tokens 的超长上下文,并以余弦相似度验证跨硬件数值对齐,文本目标阈值 ≥0.999、多模态 ≥0.995。

  7. arXiv cs.CL53

    RAG 过期检索证据会覆盖模型正确答案,论文构建 317 例知识反转基准

    论文识别出 stale-document poisoning(过期文档投毒)现象,即模型在不检索时能答对,检索到过期证据后答案反而被覆盖。作者构建覆盖医学、法律、软件和平台政策的 317 个已验证知识反转基准,在 12 个模型上测试:过期检索让 Llama 30%、Qwen 37% 的回答翻转,加上显式遵循文档的指令后分别升至 66% 和 75%。

  8. arXiv cs.CL43

    PIA:把健康对话变成记录、把记录变成理解的个人智能体

    PIA 是一个与消费级健康智能体并行的个人智能体,自行决定如何读写,把健康对话转成带类型的临床记录、再合成为对用户的理解。其记忆框架含 extraction、memory、retrieval、understanding 四项控制,各配 schema、医学别名词典、知识图谱、时序规则等可插拔健康模块;注入记忆从一维回忆、二维健康快照加深到带因果的三维轨迹时,同一查询会得到不同答案。

  9. arXiv cs.CL34

    CARGO:面向生产环境智能体 AI 的上下文感知检索门控评估

    CARGO 框架将检索到的参考当作流程范例、以实例观测上下文锚定事实判断、并按检索置信度门控,用于生产环境的智能体 AI 评估。在 246 条样本、7,872 次判断的 CARGO-Bench 上,参考式 judge 会惩罚 100% 的正确实体替换答案且 DI 约为 0,CARGO 将误判降至 0/50、矛盾召回保持 50/50,DI 升至 0.58;但其宽松设计对流程性错误的召回仅 20%。

  10. arXiv cs.CL39

    检索式开放式评估为何失效?长文本医学答案事实性验证的自动分类体系

    一项案例研究提出两套分类体系,把检索式医学事实核查的失败拆解为检索阶段五类质量维度错误与验证推理六步错误。研究基于 MedExpert 开放式数据集和 3 个封闭式数据集,用 LLM-as-Judge 自动标注,并在 4 种检索方法与 6 个前沿验证模型上压力测试。结果显示扩大模型规模、增加推理投入、纳入权威网络来源与医学微调都无法消除这些失败模式。

  11. arXiv cs.CL37

    SignTrace:用自然语言描述手势,反查中文手语词典词条

    SignTrace 用自然语言描述反查中文手语词典,在 6,699 条词条上取得 94.0% Hit@1。系统整合 LLM 词典富化、动作抽取、七通道检索与候选重排,重排把 500 条描述基准的 Hit@1 从 71.8% 提升至 94.0%,Hit@9 达 97.4%。六路并发下中位查询耗时 13.37 秒,已部署试用;基准措辞取自词典,泛化到用户自述描述受限。

9月28日周一
  1. arXiv cs.CL33

    HiCoMER:面向 LLM 智能体的层次化协作记忆与有效性感知检索

    HiCoMER 提出面向 LLM 智能体的层次化协作记忆管理与有效性感知检索框架,先维护团队与个体记忆的有效性,再检索仍然有效的记忆。框架含记忆冲突更新、有效性感知检索和记忆接地答案生成三个组件。作者为协作场景构建两个记忆接地问答数据集,实验显示 HiCoMER 持续优于强基线,减少过期检索并保留团队共识、提升下游问答质量。

9月27日周日
  1. Towards Data Science35

    GraphRAG 与 TypeSafe Jev:用 System 1 方法构建可扩展知识图谱

    TypeSafe AI 发布 Jev,一个非自回归的校准决策模型,可在低于 500ms 的延迟下并行执行类型化概率微决策,成本远低于通用 LLM。Jev 提供 Noul、Choice、Score 三种原语,用于 GraphRAG 的实体消解、跨本体 schema 映射与边权重标注。文章提出由 Jev 承担 System 1 微决策、LLM 负责 System 2 推理的双引擎架构。

9月25日周五
  1. Towards Data Science50

    RAG 不是 Agent:我用纯 Python 搭出检索与动作之间的衔接层

    作者用纯 Python 实现了纯检索 RAG、确定性动作规划器和混合系统三种版本,在同样的九个任务上各跑一遍,只有混合系统同时通过知识类与知识加动作类任务。系统基于 22 篇文章切出的 334 个 chunk 语料和 TF-IDF 检索,构建过程中作者发现并修复了两个解析器 bug,混合系统一度在纯知识任务上失败。

9月24日周四
  1. Towards Data Science68

    当正确答案为空时,结构化输出与语义缓存会返回什么

    作者认为流水线中的必填字段和相似度缓存都会在正确答案为空时返回编造值,并以自建的开源本地 RAG 检索系统为例做了验证。他用自写的西班牙语行政问题对测试 bge-m3,加入仅差一个 token 的改写对照后 AUC 从 0.3556 升到 0.9333,但最低被接受的改写仍低于最高被拒绝的否定句,因此没有可用阈值。

    推荐理由:文中记录了作者自建语义缓存的阈值实验与失败细节,并提出可套用到抽取和检索组件的三个自查问题。

  2. AWS Machine Learning Blog37

    从门户跳转到即时答案:HEMA 用 MCP 和 Amazon Bedrock AgentCore 构建 HAL 的历程

    HEMA 基于 MCP 和 Amazon Bedrock AgentCore 构建内部 AI 助手 HAL,把分散在门户、wiki 与文档中的知识集中,并在 HAL 聊天、Kiro、Claude 等工具中直接提供答案。此前查一个答案需在 3 或 4 个门户间跳转、有时耗费整个下午,现在可在 IDE 或聊天窗口几秒内完成;当前为只读知识层,下一步将转为可执行操作层。

9月21日周一
9月16日周三