跳到正文

#arXiv

今日 66 条
9月29日周二
  1. arXiv cs.AI26

    HCOE:基于生物医学语言模型的临床本体双曲嵌入

    HCOE 将冻结的 BioBERT 嵌入映射到 Poincare 球,实现层级感知的临床概念表示。它结合父侧与子侧本体引导的对比学习与由粗到细的本体路径聚合,覆盖 CCS 组织的 ICD 编码和 ATC 药物层级。在 ICD/ATC 临床关系预测、CCS-to-PheCode 层级迁移及 MIMIC-IV 的死亡率、再入院、用药推荐与罕见药物预测上均表现最佳。

  2. arXiv cs.AI25

    ACV-Gate:视觉 token 通信中全预算反事实推理的选择性摊销

    ACV-Gate 用 set-aware student 借助终端优势与遗憾预测候选排序,只对受成本阈值约束的有限候选做精确反事实评估,在降低视觉 token 通信编码端计算的同时提升重建质量。在 CIFAR-10 的 0.20 bpp 下,其主配置比 LocalMDL 提升 0.636 dB PSNR,每图仅需 2.13 次候选评估,约为 Exact-Full 专家调用量的 27.60%。

  3. arXiv cs.AI36

    LW2S:面向高效多智能体 LLM 工作流的反事实信用分配与跳过学习

    LW2S 将多智能体 LLM 工作流中的组件省略建模为反事实信用分配,用受控跳过干预学习动作级安全模型,并结合留出集校准与领域内建护栏选择跳过步骤。在数学推理、选择题问答与代码生成、两个指令模型家族上,它降低了记录 token 成本,整体工作流准确率持平或提升。早期跳过被拒时,控制器仍可继续执行并重新考虑后续组件。

  4. arXiv cs.AI39

    LAVOIR:用摊销信息价值教单次前向决策编码器 Laya 何时提问、问什么

    LAVOIR 让单次前向决策编码器 Laya 学会主动提问:把候选缺失槽位与答案选项并列输入,一次前向同时输出决策分布与各槽位的期望信息增益(VOI)。在已见 schema 上其问题策略接近贪心 oracle VOI(AUC 0.799 vs. 0.797),每轮最多 0.5 个问题时准确率比从不提问高 14.1 个百分点。

  5. AGI Hunt33

    arXiv 综述:推荐系统离线评估的数据处理实践混乱不一

    arXiv 论文 2609.31696 由 Alberto Mancino 等 8 位作者综述推荐系统离线评估的数据处理流程,覆盖数据集选择到训练/验证/测试划分的完整流水线。综述跨越协同过滤、序列、图、多模态、联邦与 LLM 推荐等范式,发现训练前数据处理决策影响算法可得信息、实验可比性与可复现性,但长期缺乏审视、实践高度不一致,并提出统一框架与分类法。

  6. AGI Hunt34

    Deep Kernel Hedging:深度学习与核方法结合的金融对冲新框架

    arXiv 新论文提出 Deep Kernel Hedging 框架,把深度学习表达能力与核方法的结构化归纳偏置结合用于金融对冲。对冲函数限制在再生核希尔伯特空间,核由输入特征的神经网络嵌入参数化,并用截断时间增强 signature 特征处理路径依赖。合成与真实数据实验显示,该方法尤其在小数据场景下比标准核方法与经典 deep hedging 架构更稳健。

  7. IT之家56

    苏黎世联邦理工学院研制出可凭指尖行走的机械手

    苏黎世联邦理工学院软体机器人实验室研制出一款能靠指尖自行行走的机械手,由市面常规仿人机械手改造而来,共五根手指、20 个驱动关节,整机重 818 克。该手在英伟达的艾萨克实验室(NVIDIA's Isaac Lab)仿真平台中用强化学习训练步态,手掌装有电池、基于树莓派(Raspberry Pi)的机载计算机和运动传感器,可完全独立运行。

  8. arXiv cs.CL38

    Sorry Robot, Happy Human:视觉语言模型只读出两层可辨识排印文字中的一层

    研究用 Decoy Font 方法构建包含 300 张图像的 DecoyBench,测试 3 个模型家族共 6 个闭源视觉语言模型,发现它们只能读出双层文字中的一层。高分辨率下模型对锐利轮廓文字准确率接近人类,却几乎无法完整提取柔和阴影文字;低分辨率下轮廓文字人类与模型均读不出,阴影文字反而能高准确率提取。

  9. arXiv cs.CL35

    MoSAR:学习自适应且可近似注意力几何的语义注意力模式混合

    MoSAR 把注意力近似视作几何问题,用输入条件的 query/key 路由器在短、中、全局三种模式间混合,学习连续的距离相关注意力场,并可在训练后经 top-1 路由离散化。在 500M 参数匹配模型的预训练实验中,它未降低语言建模质量,困惑度优于 dense RoPE,长度外推下优于 ALiBi 等基线取得最佳困惑度。

  10. arXiv cs.CL43

    PIA:把健康对话变成记录、把记录变成理解的个人智能体

    PIA 是一个与消费级健康智能体并行的个人智能体,自行决定如何读写,把健康对话转成带类型的临床记录、再合成为对用户的理解。其记忆框架含 extraction、memory、retrieval、understanding 四项控制,各配 schema、医学别名词典、知识图谱、时序规则等可插拔健康模块;注入记忆从一维回忆、二维健康快照加深到带因果的三维轨迹时,同一查询会得到不同答案。

  11. arXiv cs.CL36

    CG-Probes:从患者查询嵌入中恢复护栏方向

    CG-Probes 用差值均值法在冻结嵌入器的归一化空间中探测线性方向,可将患者查询嵌入中的紧急度风险轴恢复出来。该方法用 BERTopic 聚类 79,658 条捷克语肿瘤科查询生成对比风险样本,在 200 条经两名肿瘤科医生评分的查询上与开放权重 LLM 表现相当且延迟更低,每轴输出标量分数供医生设定升级阈值。

  12. arXiv cs.CL27

    ARGUS:气候政策因果评估中识别假设的证据化审计

    ARGUS 是结构化语言模型流水线,按十一维“假设—含义—证据”评分表审计 DID 气候政策研究中的识别假设证据。在 11 类缺陷基准上检出 73% 的植入缺陷,关键词流水线仅 18%;26 篇经济学论文中约 40% 的论文—维度评估因缺少可检索证据而弃权。5 篇论文试点中,它在完成的 33 项评估里有 25 项风险等级高于标注,只输出证据关联的风险报告供专家复核,不裁定因果结论。

  13. arXiv cs.CL35

    对抗式黑盒在线策略蒸馏的持续负样本方法

    持续负样本对抗蒸馏用历史提示词匹配的师生对比样本替换部分判别器批次,缓解黑盒在线策略蒸馏中负样本分布随策略更新漂移的移动目标问题。在匹配判别器算力下,该方法跨两个学生模型家族、三个评判模型与四个评判对话基准稳定优于现有方法。其贝叶斯最优奖励为教师到负样本的对数密度比,持久负样本可锚定判别器并降低奖励估计 MSE。

  14. arXiv cs.CL32

    KAME:用随机引导在串联语音到语音模型中学习自然对话行为

    KAME 提出随机中间引导(randomized intermediate guidance),直接从对话语料提取引导信号,省去模拟 LLM 生成缺失引导的数据准备开销。在合成对话上,其回复质量与 LLM 生成引导、相似度基线相当。用 3.8k 小时真实对话训练后,轮次切换更顺畅、audio-judge 自然度优于合成数据版 KAME,并保持对 Moshi 的回复质量优势。

  15. arXiv cs.CL40

    REALMS:面向高维嵌套画像实时精确受众规模测算的 AI 对话系统

    REALMS 是已部署在企业客户数据平台上的对话式受众规模测算系统,可用自然语言查询数百万画像、数千属性并在几秒内返回精确计数。系统由基于嵌入向量搜索的属性检索、带模板化上下文学习的 LLM NL2SQL 流水线、schema 标准化三部分构成。真实企业数据评估显示属性检索召回高、SQL 执行准确率高、延迟低,此前需数小时的任务可实时完成。

  16. arXiv cs.CL42

    打破同质化:为创意 LLM 输出构建多样化人设集

    研究将 LLM 人设多样化建模为集合级条件化问题,提出覆盖子集选择、均匀覆盖采样与进化式人设生成等方法。在 AUT 任务上,进化式人设生成相比仅任务提示将回答多样性提升 78.8%、原创性提升 26.1%、整体创造力提升 13.9%,并保持 98.5% 有效性;在 Infinity-Chat 上,人设引发的回答区分度接近随机人设的两倍。

  17. arXiv cs.CL39

    检索式开放式评估为何失效?长文本医学答案事实性验证的自动分类体系

    一项案例研究提出两套分类体系,把检索式医学事实核查的失败拆解为检索阶段五类质量维度错误与验证推理六步错误。研究基于 MedExpert 开放式数据集和 3 个封闭式数据集,用 LLM-as-Judge 自动标注,并在 4 种检索方法与 6 个前沿验证模型上压力测试。结果显示扩大模型规模、增加推理投入、纳入权威网络来源与医学微调都无法消除这些失败模式。

  18. arXiv cs.CL34

    概念与组块统一理论:基于 Cobweb 的扩展与 trellis 实现

    Cobweb 分类与概念形成模型被扩展为统一处理概念与组块的理论,配套实现 trellis 在三个合成语法上完成实验。该理论不限定模态,适用于任何可分解为元素及其关系的经验;实验显示 trellis 能表示句法知识、解析与生成句子,并从样本解析中学习组合结构。论文被 ACS-26 接收作口头报告。

  19. arXiv cs.CL30

    系统性综述筛选自动化的基准框架:SRBench 与 PromptSR

    SRBench 基准数据集以 45,064 条标注数据评估 LLM 在系统性综述(SR)筛选中的表现,覆盖 32 项精选二次研究。其评测框架考虑 SR 中排除文章天然多于纳入文章的类别不平衡问题,并指出传统指标在这类高度不平衡场景下可能产生误导;配套的 PromptSR 工具支持提示词实验、实验管理与结果分析。

  20. arXiv cs.CL37

    SignTrace:用自然语言描述手势,反查中文手语词典词条

    SignTrace 用自然语言描述反查中文手语词典,在 6,699 条词条上取得 94.0% Hit@1。系统整合 LLM 词典富化、动作抽取、七通道检索与候选重排,重排把 500 条描述基准的 Hit@1 从 71.8% 提升至 94.0%,Hit@9 达 97.4%。六路并发下中位查询耗时 13.37 秒,已部署试用;基准措辞取自词典,泛化到用户自述描述受限。

9月28日周一
  1. arXiv cs.AI34

    将 AI 引入自主系统:从认知到集体智能

    研究提出一套基于通用智能体架构的自主系统设计与评估框架,将智能体行为刻画为围绕长期记忆组织的认知功能组合。该框架要求连接主义 AI 与符号 AI 结合,覆盖感知数据与结构化记忆的链接、目标决策与规划,以及多智能体协调下的个体与集体智能;智能体可信赖性还须涵盖认知属性维度。作者指出,自主多智能体系统的愿景与当前技术水平仍存在巨大差距。

  2. arXiv cs.CV36

    AlphaEarth 能区分城市,却压缩了城市内部差异

    研究审计 AlphaEarth 对 162 个国家 1000 个城市区域的嵌入表示,发现它支持跨区域比较,却压缩了城市内部差异。城市嵌入落在偏离全球均值方向 62.7° 的偏移重叠区域,城市化程度仅解释 8.9% 的城市内变异。城市中心离散度随国家发展水平每标准差高 14.1%,表示的年际变化近八倍于像素重绘所能解释。

9月16日周三