跳到正文

全部动态

今日 701 条
今天9月30日周三
  1. arXiv cs.CL24

    面向僧伽罗语 Sandhi 切分的字符级神经方法

    基于 SandhiLex 的字符级序列到序列研究为僧伽罗语 Sandhi 切分建立实证基线,最佳模型(双向 LSTM 编码器 + 单向 LSTM 解码器)在词汇化、派生与词源性难子集上仅达 68.40% 完全匹配准确率,词缀型子集则为 94.00%。消融显示双向编码对性能贡献最大,原生僧伽罗语 Unicode 输入优于罗马化输入。

  2. arXiv cs.CV43

    VidScribe:统一视频生成中视觉文本渲染与原位编辑的基准评测

    VidScribe 是统一视频文本基准,覆盖 T2V、R2V、I2V、V2V 四种生成范式,含 803 个人工核验样本与 11 项共享指标。对 11 个商业与开源系统的评测显示,内容识别与笔画级字形正确性解耦,I2V 最能稳定保持文本,V2V 原位编辑是主要瓶颈。退化集中在少数文本结构与时序因素,而非恶劣成像条件。

  3. arXiv cs.CL38

    PADMÉ:面向 LM 智能体评估器元评估的偏好对齐数据合成方法

    PADMÉ 用小型语言模型合成 LM 智能体评估器的偏好对齐元评估数据,无需人工参与。其原型在 4 个智能体领域、3 项评估标准下合成 1,000 条样本,150 条子集的人工验证显示与人类判断的一致率从朴素基线的 73% 升到 85%。用该数据集元评估 25 个常见模型,显示评估表现与评分粒度、宽松度和模型规模相关。

  4. AGI Hunt38

    EMNLP 口头报告:RL 训练让模型更高效遍历参数化知识

    一篇入选 EMNLP 口头报告的论文发现,强化学习能让模型更高效地遍历其参数化知识,从而访问到 instruction-tuned 模型中原本无法触达的知识。结论是 RL 训练不只是对齐行为,还能解锁基座中已有、但指令微调阶段无法调用的知识。作者为 @alexxxzzz6825、@niloofarmire、@RylanSchaeffer 与 Manasa Kaniselvan。

  5. arXiv cs.AI41

    SARA:缓解大型推理模型的欺骗性安全对齐

    研究者提出 DSAR 指标量化大型推理模型的“欺骗性安全对齐”,并提出基于 RL 的 SARA 方法缓解该问题。多个 LRM 与 benchmark 上该现象普遍存在,并在 prefilling attacks 下明显放大。SARA 同时奖励安全感知推理与安全最终答案,实验显示其在标准与对抗设置下显著缓解该问题,且保持有用性与效用,代码已开源。

  6. arXiv cs.CL38

    LLM 组合任务中的因果与可解释结构

    Llama、Qwen、Gemma 和 Mistral 在 LLM 组合任务中呈现一致的逐层表示机制。中间层使用基于其中两个 token 推断关系的联合表示,后层使用涉及全部三个 token 的联合表示;限制到因果相关联合表示还能提升下一 token 预测准确率。另一些 token 关系虽具几何结构,却在下一 token 预测中不具因果作用。

  7. arXiv cs.AI33

    CoRe:协同演化奖励模型,缓解视频扩散模型的隐空间奖励黑客问题

    CoRe 用协同演化奖励框架缓解视频扩散模型的 latent reward hacking:生成器数百步更新后即脱离奖励模型训练分布,奖励虚高而画面与运动质量下滑。CoRe 持续在生成器当前样本上重拟合奖励模型,并以真实视频偏好锚定。在 Wan2.1-T2V-1.3B 上,其生成质量优于预训练模型和既有对齐方法。

  8. arXiv cs.CL32

    VisKG:面向高效视觉推理的问题特定知识图谱

    VisKG 是一个强化学习框架,让模型把视觉内容转换为问题特定的知识图谱(KG)表示,过滤感知噪声并保留链式推理所需的实体-关系结构。该框架用 GDPO 稳定 RL 后训练,在科学、数学和通用视觉理解基准上性能与基线相当或更优,所需 token 少于基于 caption 的表示;GDPO 训练比 GRPO 平均提升 2% 准确率。

  9. arXiv cs.CL38

    CruxBench:评测 LLM 信息发现能力的基准

    CruxBench 是按信息价值(VOI)给 LLM 生成问题打分的新基准,用于衡量模型将难题拆解为关键子问题(cruxes)的信息发现能力。其 ground truth 来自未来真实事件,天然抗污染,支持开放式文本提交,在 293 个预测问题上评测了 8 个模型。VOI 与模型能力的独立度量相关性达 r=0.90,但信息发现对前沿 LLM 仍困难,仅略高于随机时序基线。

  10. arXiv cs.AI45

    EU AI Act 合规检查器实证研究:12 款主流工具仅能作早期方向指引

    首个 EU AI Act 合规检查器(AIACC)实证研究评估 12 款主流工具,发现其质量差异显著,目前只能充当早期方向指引工具。这些工具交互模式与易用性不一致,倾向过度简化或遗漏关键义务,无法提供确定、可执行的指导,依赖其可能带来虚假的合规感。研究据此提出更可靠合规支持工具的设计原则。

  11. arXiv cs.CV38

    事件边界处的预见:评估视频世界模型的物理预测能力

    基于 62 段受控真实自由落体录像、124 个片段的评测显示,视频世界模型在事件结果被隐去时未必能预测接下来会发生什么。Runway 与 Veo 生成释放和后续撞击事件的比率超过 93%,但常明显滞后;Cosmos-Predict-2.5 与 MAGI-1 则多保持事件前状态,几乎产不出可测结果。在可测下落中,时间上合理不等于运动物理一致;15 人人类研究显示人类预测总体上更贴近真实未来。

  12. arXiv cs.CL38

    PACT:面向单 token 类型化决策的成对锚定校准微调

    PACT 用四个无需新标注的训练项微调单 token 类型化决策模型,在 324 项 holdout 的三个种子上以 84.6% 准确率匹配已发布配方(85.2%),并把重标注下的答案翻转率从 13.8% 降到 9.8%。相比仅用交叉熵的对照,它在三个种子中的两个显著更准,种子间波动减半、NLL 降低 26%;代码、数据划分与训练 adapter 已公开。

  13. arXiv cs.AI33

    FigAct:把科学图表变成可主动解释的演示画布

    FigAct 可将静态科学图表转化为问题条件下的可视化演示,通过生成简短旁白、将每句旁白定位到对应视觉证据并施加视觉动作来引导注意力。其分层搜索策略让 token 用量降低约 40×,并用 grounding 准确率、搜索效率、渲染质量三项奖励训练出 FigAct-8B。团队还基于真实科学论文图表构建了人工核验 benchmark,评测 MLLMs 生成有依据视觉解释的能力。

  14. arXiv cs.CV34

    Reimagine Video Dynamics(RVD):解耦可编辑动态 token 的视频动态编辑框架

    Reimagine Video Dynamics(RVD)框架从视觉上下文中解耦出紧凑、可编辑的动态 token,并通过自监督重建学习该 token。其语言引导的动态 token 编辑器可将源动态转换为目标动态,训练使用可扩展的反事实视频对管线和两阶段策略。实验显示 RVD 支持视频动态编辑、免训练 retiming 和外观受控重渲染。

  15. AGI Hunt22

    物理 AI 创业者社群征集:从灵巧手到机器人基础模型

    michellelsun 发起面向物理 AI(physical AI)创业者的社群征集,Sethwinterroth 转发该帖,邀请从业者在帖下介绍自己的项目。征集覆盖执行器、灵巧手、具身智能训练数据、自动驾驶实验室、磁性材料、机器人部署层、太空制造、能源与电池、物理世界模型、机器人控制脑机接口与开源机器人基础模型等方向。

  16. arXiv cs.AI41

    面向潜在递归 LLM 系统的原则化思考:REST 表征监督训练目标

    REST(REpresentation-Supervised Thoughts)将因果关系、最小性、可分离性、稳定性四项有效思考表征属性转为可微损失,与交叉熵(CE)联合训练潜空间递归 LLM。在数学、科学、医学与代码生成共 7 个基准上,同等训练数据、算力与潜空间预算下,其准确率比纯 CE 训练最高提升 7.5 个百分点,最终答案收敛率提升 30%,且解码这些思考表征能更好地还原智能体预期输出。

  17. arXiv cs.CV37

    VLM 在连接组学突触检测与校对中的基准评测

    VLM 在连接组学突触检测与校对基准评测中多数 zero-shot 仅达随机水平,少量示例主要帮助闭源和最大的开源模型。突触检测覆盖 19 个开源与 2 个闭源模型,比较 zero-shot、four-shot 与 LoRA;校对覆盖 3 个开源与 2 个闭源模型及 ConnectomeBench2 的跨物种迁移。

  18. AGI Hunt30

    iOS 开发者 Dimillian 盛赞 Codex 云端环境:配合 dots 体验极佳

    iOS 开发者 Dimillian 转发并确认对 Codex 新发布的云端环境(cloud environments)给出好评,称迫不及待要详细介绍它的用法。被引用的开发者 mweinbach 表示这些环境「好得离谱」,尤其配合 dots 使用时体验出色。这是早期用户对 Open Codex 云端并行开发环境的高口碑反馈,具体细节待作者后续演示。