跳到正文

#RAG

今日 11 条
今天9月30日周三
  1. arXiv cs.CL47

    稠密检索器对查询中身份信号的敏感性

    五个稠密检索器与一个稀疏基线在政治新闻和消费者健康问答中都会更倾向返回与查询自身政治倾向一致的报道,且对用非裔美国人语言(AAL)写的提问表现差于白人主流英语(WME)。控制词汇不对称得分后合成集合的差距基本不变,线性探针仍能从查询嵌入向量中还原政治倾向与方言。这类偏差若不加处理,可能加剧极化并强化 AAL 使用者已有的健康差距。

  2. arXiv cs.AI42

    BRIDGE:双层检索信用感知的智能体强化学习方法

    BRIDGE 将检索增强的智能体强化学习建模为双层优化问题,用内存高效的一阶双层方法联合训练 LLM 与检索器。在七个开放域 QA benchmark 上,它在 3B 和 7B 主干下均取得最高平均准确率,多跳平均较最强基线分别提升 9.6 和 3.4 EM 分。它同时在医疗 QA benchmark 上取得最佳平均答案准确率和推理质量。

  3. arXiv cs.AI35

    ARCagent:面向临床问答的自适应检索校准智能体

    ARCagent 是面向 ME/CFS 临床问答的自适应检索校准智能体,取得 95.3% 的成绩,超过所有基线 LLM。它包含 1,706-chunk、10-source 知识库与跨指南冲突注册表,并按 query-specific focus 和冲突信号对检索证据重排序。评测采用 LLM-as-Judge,避开关键词匹配造成的平均 10.1 个百分点系统性低估,代码已开源。

  4. arXiv cs.AI40

    LGP:通过(高效)LLM 引导剪枝改进 ANN 图索引

    LLM-Guided Graph Pruning(LGP)通过 LLM 推理剪枝已有 ANN 图索引中的结构低价值邻居,并用 LLM 选择的替代邻居替换,以解决几何-语义不匹配。在代表性语义检索基准上,LGP 在 DiskANN、HNSW 等图索引上持续优于原始贪心图搜索和基于 LLM 的 reranking。该框架保留原图的稀疏性和高效可导航性。

  5. arXiv cs.AI31

    GeoOutageBench:面向多模态停电与韧性分析的歧义感知、本体支撑地理时空 KGQA 基准

    GeoOutageBench 是一个评估 LLM 地理时空 KGQA 的基准,面向多模态停电与韧性分析。它整合停电记录、遥感、气象观测、风暴与电力事件、地理实体与领域本体,提供从时空包含与邻近、时空共现、多模态证据到假设评估的分级查询分类。该基准可配置地评测歧义时空问题的 NL 到 SPARQL 理解、查询驱动的本体效用与多模态 KGQA 检索准确率,代码与数据已公开。

  6. arXiv cs.CL32

    从词法基线到 Agentic RAG:基于 SFIA 框架的结构化技能与责任等级抽取

    研究首次针对 SFIA 框架给出结构化、等级感知的技能抽取可复现基线,将任务形式化为从自由文本预测 (skill, level) 对,并在 SFIA 的 147 项技能、7 个责任等级上对比五种策略:检索式匹配识别技能最多、生成式策略更精确,只有把等级作为显式决策才能可靠预测,基于相似度的选择错误率高出两倍以上。

9月29日周二
  1. arXiv cs.AI35

    LogicTree-RAG:面向长篇幅专利起草的逻辑树引导检索增强生成

    LogicTree-RAG 提出用逻辑树引导检索增强生成,为长篇幅专利起草提供全局组织骨架,无需专家预设起草大纲。它把每个技术元素构建为逻辑树节点,再通过混合遍历映射到专利章节,实现可控且章节均衡的生成。实验显示,该框架在内容质量和语言合规性上优于强 LLM 基线,并能以高 token 效率完成更长的结构化生成。

  2. arXiv cs.CL53

    RAG 过期检索证据会覆盖模型正确答案,论文构建 317 例知识反转基准

    论文识别出 stale-document poisoning(过期文档投毒)现象,即模型在不检索时能答对,检索到过期证据后答案反而被覆盖。作者构建覆盖医学、法律、软件和平台政策的 317 个已验证知识反转基准,在 12 个模型上测试:过期检索让 Llama 30%、Qwen 37% 的回答翻转,加上显式遵循文档的指令后分别升至 66% 和 75%。

  3. arXiv cs.CL43

    PIA:把健康对话变成记录、把记录变成理解的个人智能体

    PIA 是一个与消费级健康智能体并行的个人智能体,自行决定如何读写,把健康对话转成带类型的临床记录、再合成为对用户的理解。其记忆框架含 extraction、memory、retrieval、understanding 四项控制,各配 schema、医学别名词典、知识图谱、时序规则等可插拔健康模块;注入记忆从一维回忆、二维健康快照加深到带因果的三维轨迹时,同一查询会得到不同答案。

  4. arXiv cs.CL34

    CARGO:面向生产环境智能体 AI 的上下文感知检索门控评估

    CARGO 框架将检索到的参考当作流程范例、以实例观测上下文锚定事实判断、并按检索置信度门控,用于生产环境的智能体 AI 评估。在 246 条样本、7,872 次判断的 CARGO-Bench 上,参考式 judge 会惩罚 100% 的正确实体替换答案且 DI 约为 0,CARGO 将误判降至 0/50、矛盾召回保持 50/50,DI 升至 0.58;但其宽松设计对流程性错误的召回仅 20%。

  5. arXiv cs.CL39

    检索式开放式评估为何失效?长文本医学答案事实性验证的自动分类体系

    一项案例研究提出两套分类体系,把检索式医学事实核查的失败拆解为检索阶段五类质量维度错误与验证推理六步错误。研究基于 MedExpert 开放式数据集和 3 个封闭式数据集,用 LLM-as-Judge 自动标注,并在 4 种检索方法与 6 个前沿验证模型上压力测试。结果显示扩大模型规模、增加推理投入、纳入权威网络来源与医学微调都无法消除这些失败模式。

  6. arXiv cs.CL37

    SignTrace:用自然语言描述手势,反查中文手语词典词条

    SignTrace 用自然语言描述反查中文手语词典,在 6,699 条词条上取得 94.0% Hit@1。系统整合 LLM 词典富化、动作抽取、七通道检索与候选重排,重排把 500 条描述基准的 Hit@1 从 71.8% 提升至 94.0%,Hit@9 达 97.4%。六路并发下中位查询耗时 13.37 秒,已部署试用;基准措辞取自词典,泛化到用户自述描述受限。

9月28日周一
  1. arXiv cs.CL33

    HiCoMER:面向 LLM 智能体的层次化协作记忆与有效性感知检索

    HiCoMER 提出面向 LLM 智能体的层次化协作记忆管理与有效性感知检索框架,先维护团队与个体记忆的有效性,再检索仍然有效的记忆。框架含记忆冲突更新、有效性感知检索和记忆接地答案生成三个组件。作者为协作场景构建两个记忆接地问答数据集,实验显示 HiCoMER 持续优于强基线,减少过期检索并保留团队共识、提升下游问答质量。

9月16日周三
  1. Google Research37

    绕过推理瓶颈:Google Research 用 Retrieve-for-Train 加速复杂 AI 搜索

    Google Research 提出 Retrieve-for-Train 框架,用离线强化学习把奖励对齐的查询 fan-out 编译成监督信号,蒸馏进仅 53.9M 参数的扩散检索器,实现单次非自回归查询扩展。该框架微调 Gemma3-4B 和 Qwen3-4B,以集合级奖励评估整组结果,绕开零样本 LLM 的语义重复与数百个 CoT 推理 token 带来的自回归延迟。

3月17日周二