跳到正文

全部动态

今日 236 条
9月29日周二
  1. arXiv cs.CL53

    RAG 过期检索证据会覆盖模型正确答案,论文构建 317 例知识反转基准

    论文识别出 stale-document poisoning(过期文档投毒)现象,即模型在不检索时能答对,检索到过期证据后答案反而被覆盖。作者构建覆盖医学、法律、软件和平台政策的 317 个已验证知识反转基准,在 12 个模型上测试:过期检索让 Llama 30%、Qwen 37% 的回答翻转,加上显式遵循文档的指令后分别升至 66% 和 75%。

  2. arXiv cs.CL25

    在 X 上识别科学家与非科学家账号

    一项研究提出基于用户简介与推文在 X 上识别科学家与非科学家账号的方法,随机森林在语言学特征上最高达 0.88 F1,对比式微调的 DeBERTa 在集成设置下最高达 0.96 F1。研究同时公开了两个将 X 用户标注为科学家或非科学家的数据集,包含各自的推文与用户简介。

  3. arXiv cs.CL35

    MoSAR:学习自适应且可近似注意力几何的语义注意力模式混合

    MoSAR 把注意力近似视作几何问题,用输入条件的 query/key 路由器在短、中、全局三种模式间混合,学习连续的距离相关注意力场,并可在训练后经 top-1 路由离散化。在 500M 参数匹配模型的预训练实验中,它未降低语言建模质量,困惑度优于 dense RoPE,长度外推下优于 ALiBi 等基线取得最佳困惑度。

  4. arXiv cs.CL43

    PIA:把健康对话变成记录、把记录变成理解的个人智能体

    PIA 是一个与消费级健康智能体并行的个人智能体,自行决定如何读写,把健康对话转成带类型的临床记录、再合成为对用户的理解。其记忆框架含 extraction、memory、retrieval、understanding 四项控制,各配 schema、医学别名词典、知识图谱、时序规则等可插拔健康模块;注入记忆从一维回忆、二维健康快照加深到带因果的三维轨迹时,同一查询会得到不同答案。

  5. arXiv cs.CL46

    RupeeBias:审计 LLM 在印度经济建议中的群体偏见

    研究者发布 RupeeBias 基准,用于审计 LLM 生成的印度经济建议中的群体偏见。该基准含 39,150 条英文与 Hinglish 提示词,覆盖薪资估算、涨薪、还价与服务定价 4 类用例,横跨种姓、宗教、地域、性别、残障、城乡 6 个维度的 87 个印度群体标识。在 9 个 LLM 上评测,仅改变群体标识的相同提示词,经济输出平均相差 20.2%。

  6. arXiv cs.CL36

    基于指标损失加权提升 LLM 多模态机器翻译视觉敏感性

    一种 Metric-based Loss Weighting 训练方法利用 PCXMI 和 Congruency-based PCXMI 识别受益于图像的 token,在 CoMMuTE 对比数据集上使多模态机器翻译准确率较标准微调最高提升超过 7 个百分点。该方法通过微调三个预训练多模态大语言模型,在三个语言方向的图像引导机器翻译任务上评估,并保持较强通用翻译性能。

  7. arXiv cs.CL26

    自然对话中潜在问题的显著性与可回答性:我们真需要回答那个问题吗?

    在自然对话中,潜在问题的显著性与可回答性之间存在稳健但较弱的正相关,越显著的问题越可能被回应,但该效应明显弱于独白文本。研究基于 Wu et al. (2024),从英国国家语料库的语句及前文自动生成 7,124 个问题并标注显著性与可回答性,用以检验 QUD 建模。结构化互动中标注者之间的一致性也强于组织松散的对话。

  8. arXiv cs.CL34

    LocUS:面向定向激活引导的头选择与子空间投影

    LocUS(Localized Unembedding Steering)通过在 unembedding 矩阵中定位属性专属线性子空间,把激活引导限制到该子空间并仅作用于稀疏的少量注意力头,实现免训练的推理时控制。在三个模型族的毒性缓解、情感转向和谄媚抑制评测中,LocUS 匹配或超越 SOTA 基线,仅干预不到 6% 的参数,并更好地保留通用能力。

  9. arXiv cs.CL36

    CG-Probes:从患者查询嵌入中恢复护栏方向

    CG-Probes 用差值均值法在冻结嵌入器的归一化空间中探测线性方向,可将患者查询嵌入中的紧急度风险轴恢复出来。该方法用 BERTopic 聚类 79,658 条捷克语肿瘤科查询生成对比风险样本,在 200 条经两名肿瘤科医生评分的查询上与开放权重 LLM 表现相当且延迟更低,每轴输出标量分数供医生设定升级阈值。

  10. arXiv cs.CL30

    用 LLM 与知识图谱引导推理建模学生的意义建构

    在 23 段专家标注的协作学习对话上,两个中型 LLM 无需任务特定训练即可开展意义建构的多维分析,启用推理的提示词能纠正无推理时高估成功案例的偏差。知识状态诊断进一步提供依据,提升了失败意义建构的检出率以及与专家标注的一致度。没有任何单一配置在所有意义建构维度上表现最佳,凸显该任务的多维属性。

  11. arXiv cs.CL51

    研究评估 DeepSeek、Qwen、豆包在中文事实问答中的迎合行为

    该研究分析了 DeepSeek、Qwen、豆包三个中文大模型在 12,165 个来自真实中文搜索查询的是非事实问题上的迎合行为,覆盖 364,941 条回答。研究在有无推理两种模式下对比基线、用户信念注入和反迎合提示三种设置,并区分与错误信念一致的错误和由正确转为不确定的答案。结果显示推理并非一贯的防线,反迎合指令能在减少错误认同的同时增加不确定性。

  12. arXiv cs.CL28

    THA:面向高棉语的加权有限状态文本规范化与逆文本规范化工具包

    THA 是面向高棉语的开源文本规范化与逆文本规范化工具包,基于加权有限状态转换器,用一次最短路径搜索完成整行分词与分类,并由第二个转换器拒绝高棉语音节内部的 token 边界。在 Google 高棉语测试集上,其对全部 274 个基数词与参考一致,仅有一处拼写变体差异;在 2906 条真实 TTS 提示中,改写的 158 句有 153 句正确。

  13. arXiv cs.CL32

    CUSP:兼顾时间维度与归因的词汇语义变化建模

    CUSP(Coupled Usage–Sense Processes)用单一保持边缘的时间过程刻画词汇语义变化,同时给出变化幅度、时间、机制与归因。其位移算子把变异拆分为组件中心移动与组件内重组,并归因到被迁移的组件对;高斯混合特化下论文证明了算子与平方距离的参数可恢复性。CUSP 在英语、德语 DWUG 上保持竞争力,并在美国法院意见大规模语料中展示转换、模式与段落归因。

  14. arXiv cs.CL37

    EoupCT:为 LLM 持续微调估计并正交化未知预训练梯度

    EoupCT 提出估计并正交化未知预训练梯度的框架,用于 LLM 持续微调以缓解灾难性遗忘。它用带 Gumbel-Softmax 松弛的可学习软提示生成新任务最易遗忘的伪数据来估计预训练梯度,并以一阶高效 Pareto 优化器联合优化 LLM 参数与软提示,强制新任务更新与估计梯度正交。多个 LLM 实验显示可兼顾任务能力与通用知识,该工作已被 NeurIPS 2026 接收。

  15. arXiv cs.CL31

    免训练发音转写:用文本约束的声学重打分

    免训练 ST2P 流程在推理时同时利用词汇与声学信息,将日语发音转写的 CER 从 0.60–1.40%(纯文本基线)降至 0.04–0.17%。它先用 G2P 工具生成文本约束候选,再由冻结的 S2P 模型以整序列负对数似然做从左到右贪心搜索,速度比 beam search 快 3–3.5×,级联解码比直接解码快 2×。

  16. arXiv cs.CL37

    ToolSearcher:通过强化学习优化大规模工具选择

    ToolSearcher 是一个面向大规模工具选择的强化学习框架,用类别约束的工具区分、事件级搜索建模与轨迹对齐信用分配,提升 LLM 在上下文限制下的多轮工具搜索与组合能力。它将大规模工具选择视为智能体强化学习的新挑战,指出现有知识问答 RL 方法难以兼顾工具兼容性。在迭代搜索与复杂工具组合等基准设置下,它持续优于多个强基线,并已被 NeurIPS 2026 接收。

  17. arXiv cs.CL21

    从标注到推理:语言模型中的文化

    一篇 perspective 论文提出,语言模型的文化评估应从事实标注转向推理深度,以证据为中心构建 benchmark,并保留学者之间的解读分歧。作者认为文学解读适合考察这类能力,即模型能否解释文化引用、用证据支撑解读并在受批评后修正,重点是文本跨历史与语言语境的引用与改写。研究以丹麦文学为起点,主张用文学数据、语境资源和学者反馈指导模型开发,超越常规 benchmark 指标。

  18. arXiv cs.CL27

    ARGUS:气候政策因果评估中识别假设的证据化审计

    ARGUS 是结构化语言模型流水线,按十一维“假设—含义—证据”评分表审计 DID 气候政策研究中的识别假设证据。在 11 类缺陷基准上检出 73% 的植入缺陷,关键词流水线仅 18%;26 篇经济学论文中约 40% 的论文—维度评估因缺少可检索证据而弃权。5 篇论文试点中,它在完成的 33 项评估里有 25 项风险等级高于标注,只输出证据关联的风险报告供专家复核,不裁定因果结论。

  19. arXiv cs.CL35

    对抗式黑盒在线策略蒸馏的持续负样本方法

    持续负样本对抗蒸馏用历史提示词匹配的师生对比样本替换部分判别器批次,缓解黑盒在线策略蒸馏中负样本分布随策略更新漂移的移动目标问题。在匹配判别器算力下,该方法跨两个学生模型家族、三个评判模型与四个评判对话基准稳定优于现有方法。其贝叶斯最优奖励为教师到负样本的对数密度比,持久负样本可锚定判别器并降低奖励估计 MSE。

  20. arXiv cs.CL28

    用扰动强度改进 LLM 解释的自一致性评估

    研究提出用 LLM-as-a-judge 统一衡量输入扰动与 CoT 扰动的强度,并在受控强度条件下评估多个 LLM 生成解释的自一致性。实验显示,该基于 LLM 的扰动强度度量优于嵌入向量和概率方法,且输入扰动对 LLM 的影响普遍强于 CoT 扰动。研究据此认为,只有在同一扰动类型内比较,对模型自一致性的判断才算公平。

  21. arXiv cs.CL43

    理解提示词模板在知识蒸馏中对安全对齐的作用

    在从教师到学生的知识蒸馏中,提示词模板选择会显著削弱学生模型已有的安全对齐:聊天模板比非聊天模板让模型更顺从有害查询。该现象在 LLaMA、Gemma 和千问(Qwen)三个模型家族及多个安全基准上一致。非聊天模板蒸馏更能保留学生模型内部表示,聊天模板蒸馏则导致更大的表示偏移。

  22. arXiv cs.CL32

    KAME:用随机引导在串联语音到语音模型中学习自然对话行为

    KAME 提出随机中间引导(randomized intermediate guidance),直接从对话语料提取引导信号,省去模拟 LLM 生成缺失引导的数据准备开销。在合成对话上,其回复质量与 LLM 生成引导、相似度基线相当。用 3.8k 小时真实对话训练后,轮次切换更顺畅、audio-judge 自然度优于合成数据版 KAME,并保持对 Moshi 的回复质量优势。

  23. arXiv cs.CL35

    措辞胜过顺序:Gemma 4 的行为评测

    对 Google 预训练模型 Gemma 4-e4b 的行为评测发现,输入两份冲突文档时,来源语义框架对答案的影响显著强于文档顺序。评测含 13 个条目、784 次前向传播,模型偏好先读到的第一份文档,但首因效应强度随表面措辞波动至少 5 倍。两份文档逐字模板相同时首因效应显著增强,整体措辞变化则削弱位置偏差。

  24. arXiv cs.CL34

    TRACE:面向流式视频理解的时间审计与条件感知评估基准

    TRACE 是面向流式视频理解的条件感知评测基准与框架,把证据何时有效、视觉历史如何维护、响应如何触发显式纳入评估。它基于 517 段视频的 1,240 条记录,在 8 种配置下评测了 8 个公开模型或系统。近乎相同的 QA 准确率可能掩盖完成度、答案有效性与生成负载差异,主动性能可拆为响应质量、响应延迟、误报与漏检目标窗口。

  25. arXiv cs.CL35

    通过在线策略蒸馏实现推理的递归自我改进

    研究提出由 DCE 与 SRCL 构成的递归在线策略蒸馏框架,让特权教师模型与学生共同演化,在四个竞赛级数学基准上超越 OPSD。在 Qwen3-8B 上,DCE+SRCL 达到 65.97% Average@12,比 OPSD 高出 35.62 个百分点。SRCL 额外以模型自身在线响应更短、经核验的改写进行训练,使平均输出长度较仅用 DCE 减少 7.80%。

  26. arXiv cs.CL46

    MemProbe:用认知实验范式诊断 Agent 记忆的稳定性-可塑性权衡

    MemProbe 框架通过干扰、错误信息、巩固强度与再巩固窗口四个认知科学实验范式,诊断 Agent 记忆系统的稳定性-可塑性权衡。研究在 56 个 episode 的诊断套件上以统一协议评测六个增量记忆系统,发现聚合分数相近的系统呈现出明显不同的行为画像。该工作已被 EMNLP 2026 Main 接收,代码已公开。

  27. arXiv cs.CL40

    REALMS:面向高维嵌套画像实时精确受众规模测算的 AI 对话系统

    REALMS 是已部署在企业客户数据平台上的对话式受众规模测算系统,可用自然语言查询数百万画像、数千属性并在几秒内返回精确计数。系统由基于嵌入向量搜索的属性检索、带模板化上下文学习的 LLM NL2SQL 流水线、schema 标准化三部分构成。真实企业数据评估显示属性检索召回高、SQL 执行准确率高、延迟低,此前需数小时的任务可实时完成。

  28. arXiv cs.CL38

    喂 BabyLMs 吃 Macaroni:语码切换课程带来跨语言收敛

    用 LLM 向英语、荷兰语、中文 BabyBabelLM 语料注入词级与句级语码切换后再预训练小型 decoder-only Transformer,可让平行文本表征(尤其跨书写系统)趋于对齐。按词级语码切换→句级语码切换→单语文档的课程训练,模型在 BabyLM 评测套件上优于未使用该数据的基线。代码、数据与模型已公开。

  29. arXiv cs.CL34

    Inquesto Score:面向语音智能体的可靠性评测协议

    Inquesto Score(IS)是一套语音智能体可靠性评测协议,把可靠性定义为固定、版本化评测人群中没有出现功能故障或更严重失效的通话占比。其 v0.1 覆盖 30 个场景、3 种声学条件、4 个说话人分组,对参考语音智能体系统的 13 种配置各评测 306 通通话,其中 talk-over、响应延迟等时序失效直接从音频测量。协议、参考实现与评测记录已公开。

  30. arXiv cs.CL42

    打破同质化:为创意 LLM 输出构建多样化人设集

    研究将 LLM 人设多样化建模为集合级条件化问题,提出覆盖子集选择、均匀覆盖采样与进化式人设生成等方法。在 AUT 任务上,进化式人设生成相比仅任务提示将回答多样性提升 78.8%、原创性提升 26.1%、整体创造力提升 13.9%,并保持 98.5% 有效性;在 Infinity-Chat 上,人设引发的回答区分度接近随机人设的两倍。