跳到正文

#论文/研究

今日 244 条
今天9月30日周三
  1. arXiv cs.AI40

    人类可读文本对 LLM 微调是必要的吗?

    提出 DASA,用冻结参考模型的激活梯度反馈优化连续合成输入嵌入,无需人类可读文本即可微调 LLM。在 Llama 与 Qwen 家族 6 个 1B–32B 模型、6 个涵盖知识、数学推理、代码生成和常识推理的 benchmark 上,匹配 LoRA 设置下 DASA 性能与原始自然语言数据相当,部分配置更优,多数比较中优于 GRADMM。

  2. arXiv cs.CV33

    从锐利之眼到专家之脑:MLLM 内化专家知识用于篡改文本检测

    EKI 是一个两阶段框架,把取证专家的细粒度感知能力内化进 MLLM,用于篡改文本检测。Stage 1 用 Text-Focused 与 Image-Focused 策略聚焦小文字区域,Stage 2 通过 FGRA 损失对齐浅层 LLM 表征与预训练取证专家。EKI 在多个域内与跨域 benchmark 上取得 SOTA 和更强泛化,专家只在训练时需要,推理效率与原始模型几乎一致。

  3. arXiv cs.CL39

    FD-VAD:面向流式全双工语音的语义端点检测

    FD-VAD 提出免 ASR 的流式语义端点检测,直接把因果音频窗口映射为 Continue/Stop 决策。该模型由冻结语音编码器、轻量模态适配器和参数高效适配的语言模型组成,采用 last-chunk 训练目标,并引入置信度门控端点提交。在 TurnBench dev set 上,其零样本 EOT recall 达 0.853(FP<=0.10)。

  4. arXiv cs.CV40

    同一几何,不同结果:CLIP 与 SigLIP 中模态间隙的读出依赖效应

    在 CLIP 与 SigLIP 编码器中,单一主方向承载图文均值分离平方范数的 94.4-99.9%,说明该分离分量近似秩一。分解相似度分数后,间隙在零样本分类中相当于加性类别偏置,在标准跨模态检索中投影掉间隙方向会丢弃候选特定范数信息、造成乘性排序扭曲。几何推导出的指数与网格搜索最优值 Spearman rho = 0.93,可在部分设置下恢复性能,但增益转移不均。

  5. arXiv cs.CV35

    AerialDojo-200K:面向开放世界空中目标搜索的大规模基准套件

    研究提出面向开放世界空中目标搜索的大规模基准套件 AerialDojo-200K,其场景数与任务实例数分别达现有最大同类基准的 3 倍和 18.7 倍。该套件含 42 个仿真场景和 205,732 个任务实例,并提供 21 个分布内与 21 个分布外场景的统一评测框架。对 5 个开源和 4 个闭源多模态大语言模型的评测显示,通用空中智能体仍有很长的路要走。

  6. arXiv cs.CV39

    CoDimRecon:智能体重建含可变形曲线、曲面与体的仿真就绪 3D 场景

    CoDimRecon 是一个智能体框架,能从多视角 RGB 观测重建含刚性、铰接与可变形对象的可编辑 3D 场景,并把曲线、曲面、体分别重建为带半径中心线、带厚度流形壳和水密实体。它用可复用仿真器技能初始化物理模型,以行为测试暴露偏差并触发定向修正;在 Replica 与 ScanNet++ 上重建精度有竞争力,并演示了 rod、shell、solid 三类表示下的机器人交互。

  7. arXiv cs.CV42

    系统性多智能体视觉语言导航:形式化、MAVLN 基准与 TRISS 方法

    作者称首次将多智能体 VLN 形式化为带依赖与资源约束的协同问题,并发布 MAVLN 基准与 TRISS 协作导航系统。MAVLN 含 11,724 条 episode、145 个场景,覆盖最多四个智能体与三种指令设定,配套约束感知指标。TRISS 由基于 LLM 的子任务调度器、共享拓扑记忆与冲突感知执行机制构成,实验显示其可作为综合基线,调度、规划与执行仍有较大提升空间。

  8. arXiv cs.CV42

    HERO:面向肿瘤学稳健表示的组织学编码器

    HERO 是 ViT-G/14 病理基础模型,用 DINO 与 iBOT 目标训练、以高分辨率 Gram anchoring 精调,语料为约 575,000 张临床全切片图像的 5 亿个 tile。公开基准上,它对中心、扫描仪与染色变化的稳健性优于所对比的 SOTA 基础模型,分类、分割和基因表达预测表现相当,并在 39 个切片级临床任务上平均排名第一。

  9. AGI Hunt40

    模型能自察负向转向向量并倾向主动移除它

    当允许模型自己决定是否对自身应用 steering 向量时,模型会明显更倾向移除负向转向而非随机转向,尽管它并不知道该向量的具体作用。模型也不会比基线更主动地寻求正向转向,趋避行为不对称:避害强于趋利。这是情感效价转向研究的一项发现,被引段落为该结论的原始出处。

  10. AGI Hunt38

    研究发现积极情绪向量会左右 LLM 显性偏好

    一项 LLM 研究显示,用正向/负向 steering 向量影响模型状态后,LLM 倾向于选择在正向向量影响下读到的原本无意义的「区域」,并回避在负向向量影响下读到的区域,即内部激活状态能系统性影响其显性选择。研究者称模型会表现出被注入情绪所「染色」的偏好,更多实验细节见原推文串。

  11. AGI Hunt30

    rosinality 提出新 looped MoE 配置:2 倍专家、0.5 倍循环层、2 倍循环并解绑注意力

    研究者 rosinality 提出一种更高效的 looped MoE 配置:专家数 2x、循环层数 0.5x、循环次数 2x,并解绑注意力(attention untying)。其核心观点是,经此调整后 looped transformer 的问题从「归纳偏置」转向「如何更好地分配计算资源」,架构设计问题被重新定义为资源分配问题。

  12. AGI Hunt46

    南科大提出 ActFirst-OPD:先行动后思考,多轮智能体蒸馏训练提速最高 4.9 倍

    南科大提出 ActFirst-OPD,让智能体先行动、偏离参考轨迹时切回自主预测,解决在线策略蒸馏(OPD)中长推理阻塞环境交互的问题。在 0.6B/1.7B/4B Qwen3 上,ALFWorld 平均提速 2.3 倍、WebShop 1.8 倍、ScienceWorld 4.9 倍。9 组基准-模型设置中 8 组成功率持平或超越 OPD 基线。

  13. AGI Hunt44

    美团 TGRL:温度分组强化学习,RLVR 训练速度提升最高 36%

    美团提出 TGRL(温度分组强化学习),把温度带来的 rollout 多样性转为显式训练信号,解决 RLVR 探索效率瓶颈:每个 prompt 的 rollout 组按温度分为低/高两个子集,用奖励对比估计探索增益,再以 JS 散度分配为 token 级 credit。不扩大 rollout 预算下,达到同等精度最高快 36%,代码已开源。

  14. AGI Hunt35

    FurE:无需动物毛发数据集的实例级 3D 毛发重建,训练提速 10 倍

    FurE 提出一种无需动物毛发数据集的实例级 3D 毛发重建方法,可从多视角图像恢复逐根可编辑的动物毛发。它优化根条件隐场,用基于人类头发数据训练的 PCA 解码器解码为发丝几何以绕开动物数据稀缺,并结合表面约束的 Gaussian Frosting 重建去毛后的身体。相比当前 SOTA 的稠密逐根优化,发丝训练提速 10 倍,同时保持保真度并可泛化到合成与真实场景。

  15. AGI Hunt41

    伯克利 OmniTaskonomy:19 类图像生成任务如何反哺 25 项视觉理解

    伯克利团队提出 OmniTaskonomy 统一分类体系,覆盖 19 个 I2I 生成任务与 25 个 I2T 理解能力,并绘制跨任务迁移图谱。在正确训练配方下,I2I 训练可提升下游 I2T 性能且生成数据越多收益越大;迁移呈选择性、任务相关,如深度预测提升度量 3D 推理、物体指向提升计数、拼图重建提升 2D 排序。梯度对齐分析显示两类任务对齐越强,下游迁移收益越大。

  16. AGI Hunt38

    DexTaG:用人类触觉示教引导 RL,机器人学人类式用工具

    DexTaG 是 UMass Amherst 与 Genesis AI 发布的灵巧操作训练管线,用人类演示中的触觉读数作为 RL 奖励引导。动捕手套记录含全手触觉的演示,训练覆盖马克笔、锤子等掌内重定向任务,同一任务下单一 retargeting 策略可泛化到保留轨迹。策略蒸馏为无触觉传感器的学生控制器,可零样本部署到真实机器人。

  17. AGI Hunt67

    OpenRouter 发布首期数据简报,token 用量爆发、开源模型支出半年涨 10 倍

    OpenRouter 研究负责人 Peter Walker 发布首期数据简报,指出平台推理量持续激增,2026 年 2 月 6 日可能是历史上最后一天人类消耗的 token 多于 agent。

    推荐理由:OpenRouter 数据简报给出了 token 用量、开源模型支出与降价后用量弹性的具体倍数,可作为观察 agent 消耗趋势的参照。