跳到正文

全部动态

今日 668 条
今天9月30日周三
  1. arXiv cs.CL44

    HeurEvo:面向时间受限数学优化的求解器增强混合启发式智能体进化

    HeurEvo 是面向时间受限数学优化的 plan–code–component 协同进化框架,联合进化算法结构、实现代码与共享组件池。在组合优化 benchmark 与 MIPLIB 实例上,它能在严格运行时限内找到高质量解,常匹敌或超越需数小时至数天计算的 SOTA 求解器。在六边形填充等非线性几何问题上,它也超过此前最佳结果。

  2. arXiv cs.AI33

    从检索到推理:PhenoAIR 基于 Cell Painting 图谱的智能体机制预测

    PhenoAIR 是可靠性感知的多智能体框架,在来自 JUMP Cell Painting 的基准所有 MOA 预测设置中超过表征匹配与 LLM 基线。它将 Cell Painting 的 MOA 预测从表征匹配重构为校准证据推理,维护以候选为中心的证据记忆,并用离线参考集校准按来源可靠性、表型稳定性和机制级混淆加权。该工作入选 NeurIPS 2026 main track。

  3. arXiv cs.CV36

    MoRe-Drag:以拖拽为证据的运动锚定潜在重组,用于拖拽式编辑

    MoRe-Drag 是运动锚定的拖拽式编辑方法,将像素空间 warping 作为粗运动证据注入生成采样轨迹。它通过区域感知潜在重组和阶段自适应条件,从运动结构生成转向语义精修,并以适配 MLLM 文本编码器实现无指令界面。在 DragBench-SR 和 DragBench-DR 上,其拖拽精度优于强基础编辑器并领跑 SOTA 拖拽方法,语义一致、视觉真实,代码和数据集将公开。

  4. arXiv cs.CL41

    Population Fidelity:评估 LLM 的人群代表性

    研究者提出 Population Fidelity 框架,从群体层面准确度、群体间差异量及其结构三个维度评估 LLM 生成回答的人群代表性。将该框架用于复现 LLM 问卷回答“machine bias”研究及更新模型后发现,代表性不佳既因群体间差异不足,也因差异被归入错误群体;cultural fine-tuning 虽能提升与调查中心的契合度,却不改善群体内差异的代表性。

  5. arXiv cs.AI35

    ARCagent:面向临床问答的自适应检索校准智能体

    ARCagent 是面向 ME/CFS 临床问答的自适应检索校准智能体,取得 95.3% 的成绩,超过所有基线 LLM。它包含 1,706-chunk、10-source 知识库与跨指南冲突注册表,并按 query-specific focus 和冲突信号对检索证据重排序。评测采用 LLM-as-Judge,避开关键词匹配造成的平均 10.1 个百分点系统性低估,代码已开源。

  6. arXiv cs.CL36

    OLIVE:在学生的状态上向教师续写学习

    OLIVE 是一种在线语言模型蒸馏方法,每轮由学生生成前缀、教师自回归续写,学生用教师生成 token 的交叉熵更新。在可比 GPU 小时成本下,其推理性能高于 OPD(top-16 KL 近似),异步实现进一步减少 23.8% 训练时间。仅用 GPT-5.4-mini 的文本,在 ScienceWorld 上持续训练比同教师离线 SFT 高 13%。

  7. arXiv cs.CV22

    当语义重要时:面向共语手势生成的可靠性感知语义-节奏控制

    研究者提出用于共语手势生成的可靠性感知语义-节奏控制框架:以离散运动先验在 motion-code 空间表示手势,用全多模态分支与纯音频分支的分布差异构造条件信息增益,量化语义对动作预测的影响,在内容相关片段加强语义引导、在节奏主导片段减少干预。该框架把背景噪声视为声学可靠性条件,通过噪声条件特征调制与潜在扰动提升鲁棒性,在基准数据集上兼顾语义表达、节奏同步和动作多样性。

  8. arXiv cs.CL34

    认知专家语言模型与对应脑系统对齐更佳

    研究通过提示词与微调,为感官、空间、数值、推理、社交、抽象六个认知域构建专家 LLM 变体,各专家的表征与对应认知域的脑系统对齐程度优于其他专家。该结论在提示与微调两种方式、三个基座模型和三个 fMRI 数据集上均成立,非认知与表层干预的对照分析未出现类似对齐。专门化只改变区域对齐,整体预测准确率基本不变。

  9. arXiv cs.AI29

    关系型基础模型 ICL 中的支持集目标泄漏:影响、检测与缓解

    研究将关系型基础模型 ICL 中的一种失效模式定义为“支持集目标泄漏”:目标派生(泄漏)列只存在于带标签的支持集,查询保持干净。作者构造 14 种合成泄漏类型(对应 20 列),在 RelBench 留出数据库上评测冻结关系编码器加 ICL 头,发现目标表泄漏的性能下降最明显,一跳、两跳泄漏未被模型稳定使用。

  10. AGI Hunt39

    Ollama 0.35 上线本地决策模型,Nimble 单次决策仅 91ms

    Ollama 0.35 发布,新增 /v1/systemone 端点,支持基于 TypeSafe Jev API 的决策模型,并同步上线 Nimble 等三个可本地运行的新模型。Nimble 单次决策仅需 91ms,官方随后补充发布了配套博客、决策能力文档与 API 文档。该功能本地运行无额外成本、延迟更低,适用于工单分诊等需要一次性回答一组命名问题的场景。

  11. arXiv cs.AI39

    工程化简洁:简单机制界面引导 LLM 智能体

    在拍卖与匹配这类规则明确的多智能体环境中,简单的机制界面能引导 LLM 智能体做出更好决策:跨四个模型家族,升价拍卖界面大幅降低出价偏差。列出收益情形并解释说真话为何安全同样改善选择,而要求规划匹配轮次或推测对手信念的提示词整体拉低表现。拍卖中的行为提升并未同步反映在智能体简短计划的可测战略理解语言指标上。

  12. AGI Hunt26

    开发者 gandamu_ml 用决策点验证法证明 Minecraft 世界生成克隆与原版等价

    开发者 gandamu_ml 展示了 Minecraft 世界生成器克隆的决策点验证法:不必证明生成顺序分布与 Java 原版一致,只需证明在给定相同顺序时两者结果等价。实现上他借助 LLM 自动寻找合适的决策点,使克隆环境的验证回放流程能无缝切换到接下来需要执行的代码。他坦承不确定 LLM 具体做了什么,但认为该方案理论上可行。

  13. arXiv cs.CV32

    ReWorld-Track:面向语言引导多摄像头跟踪的递归事件世界模型

    ReWorld-Track 面向语言引导多摄像头跟踪提出递归事件世界模型,将关联不确定性带入未来预测,用来推断下一摄像头与到达时间。该模型在 CityFlowV2 取得 65.19 HOTA、MTMMC 取得 45.36 HOTA。在 MTMMC 上其结构化后验更新较同规模通用更新器高 0.50 HOTA,下一摄像头准确率从 86.03% 升至 87.41%。

  14. arXiv cs.CL46

    迷失在翻译中:测量非母语英语对大语言模型终端用户表现的影响

    FABLE 数据集用 174K 条真实用户提示词生成 190,911 条英文提示词变体,测量非母语英语对大语言模型用户表现的影响。在 34 个开放权重 LLM 上的评测显示,模型不会把拼写错误带入输出,却会复制提示词中更高层的修辞与词汇特征。最流畅与最不流畅提示词的答案质量差异显著,非母语英语用户得到质量更低、流畅度更差的回答。

  15. arXiv cs.AI40

    LGP:通过(高效)LLM 引导剪枝改进 ANN 图索引

    LLM-Guided Graph Pruning(LGP)通过 LLM 推理剪枝已有 ANN 图索引中的结构低价值邻居,并用 LLM 选择的替代邻居替换,以解决几何-语义不匹配。在代表性语义检索基准上,LGP 在 DiskANN、HNSW 等图索引上持续优于原始贪心图搜索和基于 LLM 的 reranking。该框架保留原图的稀疏性和高效可导航性。

  16. arXiv cs.CV39

    YORO:重新思考视觉重编程的长时间训练

    YORO 提出单次前向、无需反向传播的视觉重编程方法:BDM 从流式类别统计构建协方差感知仿射映射,在冻结响应空间直接生成下游预测器。三组全数据设置中,平均准确率较最强先前无梯度映射提升 18.4–24.4%;16-shot CLIP 上四骨干平均从 71.4% 升至 77.2%。需要进一步输入适配时,YORO-FP 可选微调视觉提示 20 epochs,验证常保留单次预测器。

  17. AGI Hunt25

    IIT马德拉斯教授谈代理式AI:扩展应用不能忽视安全护栏

    印度理工学院马德拉斯分校 Wadhwani 数据科学与 AI 学院负责人 Balaraman Ravindran 在 DT Next 专访中表示,AI 正从聊天机器人问答转向能够规划任务、与其他 AI 协作的代理式行动阶段,扩展模型时安全护栏必须与技术发展同步跟上。他还谈到代理式 AI 带来的网络安全挑战、对就业的影响,以及在印度语言场景下的应用。

  18. arXiv cs.CV34

    并非每次修正都有益:GAIN 增益引导的持续测试时自适应

    GAIN 是免反向传播、无样本存储与回放的持续测试时自适应(CTTA)框架,按“历史提议、增益决定”原则,用目标统计生成修正提议、以源相对增益决定每个样本的干预强度。在五个 benchmark 上它取得较强预测性能,ImageNet-C 上以接近源模型的校准达到 61.9% 准确率,并比代表性优化式 CTTA 基线快 15.9x。

  19. AGI Hunt28

    Sakana AI 招聘防务领域前置部署工程师,深耕涉密环境AI落地

    Sakana AI 发布招聘信息,招募「Forward Deployed Engineer(Defense)」,要求深入防卫与情报领域客户现场,基于 LLM 和 AI 智能体提出解决方案并亲自实现。任职要求包括 LLM/生成式 AI 应用开发经验、数据科学与机器学习项目实务经验,以及在信息保密、封闭网络等严苛约束下交付 AI 的能力,反映 AI 公司向日本防务/情报领域拓展的趋势。

  20. arXiv cs.CL33

    FastGuide:加速扩散大语言模型的奖励引导

    FastGuide 用并行与自回归解码的自适应混合来加速扩散大语言模型的奖励引导,在三个奖励基准上比顺序奖励引导解码最高快 4.4 倍,并保持相近的生成质量。它按每个解码步骤计算一次引导并复用于多个 token,借助 KV 缓存与注意力稀疏重算降低开销,模型不自信的 token 会被推迟解掩。

  21. arXiv cs.CV38

    VLM4Cluster:视觉语言预训练时代的深度聚类基准测试

    图像聚类基准 VLM4Cluster 发布,覆盖 17 种经典、深度与语言辅助聚类方法及 20 个数据集,并评测鲁棒性、泛化与计算效率三个维度。结果显示语言辅助聚类(LaIC)在语义要求高的基准上推进性能前沿,分布偏移下泛化更强、效果与效率权衡更优,但在大规模和细粒度数据集上增益不稳定,也未系统性降低对抗扰动敏感性。

  22. arXiv cs.CV29

    OCA:ODE 驱动的交叉注意力用于图像到点云配准

    OCA(ODE 驱动的交叉注意力)通过常微分方程建模图像到点云(I2P)特征交互,缓解 2D-3D 对应学习中的注意力歧义。该模块可无缝接入现有 I2P 配准框架,作者将其集成进五个 SOTA 基线、在四个公开基准上评测。结果显示配准召回率在标准、微调、零样本设置下分别最高提升 5%、9% 和 15%。

  23. arXiv cs.CV36

    超越二元偏好:GM-DPO 与 FlexBench 用于肢体动作描述的分级偏好优化

    提出 FlexBench 基准与 GM-DPO 分级偏好优化方法,用于改善 VLM 肢体动作描述的细粒度准确性。在三个 VLM backbone 上,GM-DPO 的 GPA 分数较 DPO 提升 2.02-3.40 分,Qwen3-8B 上加权幻觉率降低 21.3%。FlexBench 含 3,105 个镜头、18,161 条评测查询,方法同时保持长文本输出并改善镜头结构。