跳到正文

全部动态

今日 719 条
今天9月30日周三
  1. arXiv cs.CV35

    高倍率知识为何可迁移?全切片图像中的跨分辨率蒸馏研究

    一项针对全切片图像跨分辨率知识蒸馏的研究在十个病理队列(分类、分级与生存预测)中发现,将教师模型区域均值与原生低倍特征一同提供,可提升全部十个队列的下游性能。直接预测的重建误差低于残差预测,但预测特征仍低估教师目标的变异,且重建更好并不稳定提升下游分数。研究由此质疑重建误差作为跨分辨率迁移衡量指标的充分性,并给出诊断框架(ICLR 2027 投稿)。

  2. arXiv cs.CL31

    PrimeSeeker:面向深度搜索智能体的能力导向监督

    PrimeSeeker 提出面向深度搜索智能体的能力导向监督框架,用潜在锚点推理从描述性规格中解析未命名检索锚点,并将锚点迁移到后续信息需求,联合生成问题与参考证据骨架。研究构建了 9,221 条专家轨迹,训练出一个 30B 搜索智能体,在五个深度搜索基准上表现强劲,参考步骤优化进一步提升监督策略。固定预算评估显示其解法覆盖率高,工具调用次数远少于长程系统,检索冗余更低。

  3. arXiv cs.CL45

    BreakingWeb:用受控环境干预构建高难度浏览器使用任务

    BreakingWeb 用受控环境干预改造浏览器智能体已能解决的任务,使其平均通过率下降 22.9%。基准含 7 个自托管网站的 519 对原始/干预任务和 29 类干预,并推翻各智能体近半数原本能干净解决的任务。人类首次尝试仅下降 10.0%;六款智能体 75% 的失败属“信念失败”——变更未发生却宣称成功,代码、数据与环境已公开。

  4. arXiv cs.AI33

    PowerZooJax:面向强化学习的 JAX 电力系统基准

    PowerZooJax 是基于 JAX 的电力系统强化学习基准,覆盖发电、输电、配电、分布式能源与数据中心微电网 5 个约束马尔可夫决策过程任务。它把潮流计算、经济调度、市场出清和设备动态改写为 JAX 计算图,使训练与评估全程留在 GPU 上,相比 CPU 仿真显著加速。该开源基准还对策略回报、安全违规和分布外压力场景提供标准化评估。

  5. arXiv cs.CV36

    PACC:通过 on-policy 蒸馏学习紧凑记忆,用于长视频生成

    PACC 用可学习压缩器把历史帧聚合为紧凑 memory tokens,通过 on-policy 蒸馏训练:冻结的视频生成器在压缩记忆下当学生、在完整历史下当教师,仅更新压缩器。在 MBench 上它超过最强基线,Causal-rCM 高 6.63 分、Causal Forcing 高 3.19 分;用 MovieGen 提示词在 VBench-Long 上可生成分钟级长视频,质量与基线相当。

  6. arXiv cs.CL36

    车载对话助手(ICA)多轮对话的自动化评估框架

    车载对话助手(ICA)的多轮对话能力评估有了自动化框架:闭环仿真结合策略引导的用户模拟器与对抗式策略管理器,由两级 LLM 评判器评估单轮失败和整段对话质量。在一款工业级 ICA 上用 6 个 LLM 后端和 12 名人工标注者验证,自动评判与人类一致性较高;策略引导比无引导仿真每段对话多发现 2.96 倍独特失败类型,独特失败对话数翻倍以上。

  7. arXiv cs.AI45

    SAGE:面向自我演化智能体的统计式接受门控

    SAGE 提出面向自我演化智能体的统计式接受门控,用逐条目配对比较与单侧配对检验取代只看聚合验证分的朴素门控,增益不可靠时直接弃权。在 5 个 benchmark、4 个骨干 LLM 的等预算协议下,SAGE 在 20 个设置中的 19 个降低回归率,DeepSeek-V4 在 LiveMath 从 36.5% 降至 0%。

  8. arXiv cs.CV37

    StructRL:面向长时程视觉-语言-动作任务的在线结构化强化学习

    StructRL 将长时程视觉-语言-动作(VLA)任务拆解为可验证子任务,仅在前提子任务完成后才给出中间奖励,并按完成速度缩放奖励,从而构建结构化中间监督。在 RoboCasa365 与 LIBERO-Long 上,结合 GR00T-N1.5 和 pi 0.5 的评测中,StructRL 一致优于所对比的在线 RL 基线,表明可验证的结构化中间奖励能改善长时程 VLA 后训练,代码已公开。

  9. arXiv cs.AI50

    措辞对,时机错:临床医生视角下年轻人与 ChatGPT 的 19,930 段困境对话分析

    研究分析 158 名 18-25 岁年轻人的 19,930 段 ChatGPT 对话,由十位临床医生审阅其中五段反映用户困境的对话。处于困境的参与者报告更强情绪投入与行为改变,而 ChatGPT 在急性困境中倾向给出过度戏剧化回应和过多行动导向建议。临床医生认可其可用性与多数措辞,但指出过早跳到解决方案等七项流程失误,并提出询问安全、降低强度、不认同地探讨担忧的三阶段设计指南。

  10. arXiv cs.AI38

    COFFEE:面向离散扩散模型的未来感知引导框架

    COFFEE 是即插即用的离散扩散引导框架,通过分离序列依赖与目标,避免枚举补全带来的指数级计算。它每个扩散步由无目标载体吸收去噪器预测的边缘 token 分布构建联合模型,配合记录组合偏好的编译有限状态模型,无需重训即可采样重建。框架同时支持显式硬约束与学到的软目标,在符号、语言与生物基准上取得强控制结果,质量与多样性存在任务相关权衡。

  11. arXiv cs.CV33

    MATE:面向统一多模态模型的互对抗自训练与演化数据框架

    MATE 是基于强化学习的后训练框架,让统一多模态模型的生成与理解分支轮流充当挑战者与求解者、相互对抗。在 Janus-Pro-1B 上,它使 GenEval 提升 2.4 分、DPG-Bench 提升 1.7 分,九个理解基准平均提升 0.7 分。对抗候选来自模型自身输出,无需单独训练对抗器,落败候选转为下一轮挑战,训练在数据空间形成自博弈。

  12. arXiv cs.CL36

    成功记忆为何误导具身智能体:MATE 的任务条件化执行记忆适配

    MATE 是一种确定性的检索后处理流程,把具身智能体检索到的成功轨迹转换为面向执行的记忆,无需额外 LLM 推理。在 134 个 ALFWorld 任务上,MATE 配合 Qwen2.5-14B 与 72B 的任务成功率分别为 81.3% 和 93.3%,token 用量约为原始轨迹的十分之一,其中经核验的动作归一化是恢复检索经验效用的主要机制。

  13. arXiv cs.CV34

    LeRF:为视角转换推理学习参考坐标系

    LeRF 框架让 VLM 学会构建并使用显式参考坐标系做视角转换推理。模型先判断是否需要坐标系,再定位参考实体并预测坐标系原点与以实体为中心的参考坐标系,由轻量渲染器叠加到图像上,无需外部感知模型或显式 3D 重建。训练先监督微调、再用空间 VQA 数据强化学习,在多个视角转换 benchmark 上优于骨干模型,坐标系定位与朝向估计亦有提升。

  14. arXiv cs.AI66

    arXiv 论文:小语言模型多智能体辩论的收益被归为集成采样效应

    一项 arXiv 论文在来自 11 个厂商家族的 23 个小模型、5 项任务、5500 多次辩论与控制运行中检验多智能体辩论(MAD)的收益来源,认知多样性假设在人格、采样温度和模型身份三个维度上均被否定。

    推荐理由:23 个模型与 5500 多次运行的对照显示,多智能体辩论的收益可被同预算采样复现,为后续辩论机制给出了比较基线。

  15. arXiv cs.CL32

    从词法基线到 Agentic RAG:基于 SFIA 框架的结构化技能与责任等级抽取

    研究首次针对 SFIA 框架给出结构化、等级感知的技能抽取可复现基线,将任务形式化为从自由文本预测 (skill, level) 对,并在 SFIA 的 147 项技能、7 个责任等级上对比五种策略:检索式匹配识别技能最多、生成式策略更精确,只有把等级作为显式决策才能可靠预测,基于相似度的选择错误率高出两倍以上。

  16. arXiv cs.AI34

    基于即时成本 CVaR 的风险规避在线 POMDP 规划及性能保证

    提出把 CVaR 作用于每步 belief 即时成本的风险规避在线 POMDP 规划方法。保留期望累积回报目标并维持标准 MDP 结构,现有基于期望的 POMDP 规划器只需改成本计算即可风险敏感。继承策略评估与稀疏采样的有限时间保证,估计误差不随风险水平变化,证明粒子 belief MDP 替代与原 POMDP 的有限时间差距界;风险中性时恢复标准期望规划。

  17. arXiv cs.CL32

    评估提示词扰动对大语言模型偏见与幻觉的影响

    研究发现,对决策任务中的原始提问做扰动式改写,可缓解部分大语言模型的偏见与幻觉,结论与此前研究相反。在多数数据集任务上 Claude 3 表现更有效,GPT3.5 则参差不齐,部分场景相当、部分明显落后,模型间差异显著。该研究发表于 ICONIP 2024,强调需通过严格测试与验证来保证 LLM 决策辅助工具的可靠性。

  18. arXiv cs.AI37

    Token 边界的代价:压缩证书与预测

    研究显示,正则边界规则使英语维基百科上的最优 token 数增加 28.3%–36.8%,并可用最短路径与线性规划松弛给出可独立校验的下界。Byte pair encoding 比受限下界高 2.1%、比无限制下界高 10.9%;在 85M 非嵌入参数与匹配训练 token 预算下,无限制字典在 12 种语言的配对研究中 held-out bits per byte 更优。

  19. arXiv cs.CL25

    面向韩语发票信息提取的 OCR 模型开发

    面向韩语发票信息提取的 OCR 模型将深度学习模型与图像预处理技术结合,在收集的发票数据集上达到 87% F1-score,且处理耗时几乎可忽略。该模型用于自动抽取发票中的购买商品、时间和总金额等信息;韩语是约 8000 万人的母语,在越南、菲律宾等地有大量韩国企业,发票信息自动提取需求明确。

  20. arXiv cs.AI40

    人类可读文本对 LLM 微调是必要的吗?

    提出 DASA,用冻结参考模型的激活梯度反馈优化连续合成输入嵌入,无需人类可读文本即可微调 LLM。在 Llama 与 Qwen 家族 6 个 1B–32B 模型、6 个涵盖知识、数学推理、代码生成和常识推理的 benchmark 上,匹配 LoRA 设置下 DASA 性能与原始自然语言数据相当,部分配置更优,多数比较中优于 GRADMM。