稠密检索器对查询中身份信号的敏感性
五个稠密检索器与一个稀疏基线在政治新闻和消费者健康问答中都会更倾向返回与查询自身政治倾向一致的报道,且对用非裔美国人语言(AAL)写的提问表现差于白人主流英语(WME)。控制词汇不对称得分后合成集合的差距基本不变,线性探针仍能从查询嵌入向量中还原政治倾向与方言。这类偏差若不加处理,可能加剧极化并强化 AAL 使用者已有的健康差距。
五个稠密检索器与一个稀疏基线在政治新闻和消费者健康问答中都会更倾向返回与查询自身政治倾向一致的报道,且对用非裔美国人语言(AAL)写的提问表现差于白人主流英语(WME)。控制词汇不对称得分后合成集合的差距基本不变,线性探针仍能从查询嵌入向量中还原政治倾向与方言。这类偏差若不加处理,可能加剧极化并强化 AAL 使用者已有的健康差距。
LLM-Guided Graph Pruning(LGP)通过 LLM 推理剪枝已有 ANN 图索引中的结构低价值邻居,并用 LLM 选择的替代邻居替换,以解决几何-语义不匹配。在代表性语义检索基准上,LGP 在 DiskANN、HNSW 等图索引上持续优于原始贪心图搜索和基于 LLM 的 reranking。该框架保留原图的稀疏性和高效可导航性。
论文提出 PILLAR,一个基于 Private Information Retrieval(PIR)的隐私保护 RAG 系统,客户端从服务器语料中取回与查询最相似的 k 篇文档,服务器无法获知查询词项与访问模式。
美团 LongCat 团队公布 LongCat-DeepResearch 技术报告,该系统用增强版 LongCat 模型搭配多智能体工作流,把全局规划与分节调研分离,并通过全局审阅指导局部修订。
PrimeSeeker 提出面向深度搜索智能体的能力导向监督框架,用潜在锚点推理从描述性规格中解析未命名检索锚点,并将锚点迁移到后续信息需求,联合生成问题与参考证据骨架。研究构建了 9,221 条专家轨迹,训练出一个 30B 搜索智能体,在五个深度搜索基准上表现强劲,参考步骤优化进一步提升监督策略。固定预算评估显示其解法覆盖率高,工具调用次数远少于长程系统,检索冗余更低。
IGSD 提出一种无需外部教师的搜索智能体 on-policy 自蒸馏方法,用环境实测信息增益筛选后见教师给出的步骤级指导。它把查询 token 视为微动作,在同一失败状态与检索器下执行教师和学生查询,以执行信息增益作为 positive-only 软权重,GRPO 目标不变。
ZooWork-ShopRanker 是一组电商开源偏好对齐重排序器,含 0.6B、4B、8B 三个规模,训练标签由多个推理 LLM 组成的偏好评审团生成。其 8B 旗舰作为蒸馏教师训练 4B 与 0.6B,并发布含约 10,000 对私域流量偏好对的 ShopRank-Bench。
REALMS 是已部署在企业客户数据平台上的对话式受众规模测算系统,可用自然语言查询数百万画像、数千属性并在几秒内返回精确计数。系统由基于嵌入向量搜索的属性检索、带模板化上下文学习的 LLM NL2SQL 流水线、schema 标准化三部分构成。真实企业数据评估显示属性检索召回高、SQL 执行准确率高、延迟低,此前需数小时的任务可实时完成。
SignTrace 用自然语言描述反查中文手语词典,在 6,699 条词条上取得 94.0% Hit@1。系统整合 LLM 词典富化、动作抽取、七通道检索与候选重排,重排把 500 条描述基准的 Hit@1 从 71.8% 提升至 94.0%,Hit@9 达 97.4%。六路并发下中位查询耗时 13.37 秒,已部署试用;基准措辞取自词典,泛化到用户自述描述受限。
Cartograph 是联邦式 MCP 代理,把 AI 智能体的工具发现从 O(n) 改为 O(k) 渐进式披露。在 22 个服务器、374 个工具的部署中仅暴露三个代理工具,49 条查询基准 R@5 为 0.816,高于 Jaccard 基线的 0.592。Rift 三层分析识别出 49 个易混淆簇,网关十次试验平均增加 5ms 延迟(0.8%)。
Google 推出 TurboQuant,一种零精度损失的压缩算法,可同时压缩 KV cache 并加速向量搜索。它先用 PolarQuant 随机旋转向量完成主体压缩,再用 1 bit 的 QJL 消除残差误差,TurboQuant 将在 ICLR 2026 展示。