跳到正文

全部动态

今日 871 条
9月29日周二
  1. arXiv cs.AI36

    LW2S:面向高效多智能体 LLM 工作流的反事实信用分配与跳过学习

    LW2S 将多智能体 LLM 工作流中的组件省略建模为反事实信用分配,用受控跳过干预学习动作级安全模型,并结合留出集校准与领域内建护栏选择跳过步骤。在数学推理、选择题问答与代码生成、两个指令模型家族上,它降低了记录 token 成本,整体工作流准确率持平或提升。早期跳过被拒时,控制器仍可继续执行并重新考虑后续组件。

  2. arXiv cs.AI39

    LAVOIR:用摊销信息价值教单次前向决策编码器 Laya 何时提问、问什么

    LAVOIR 让单次前向决策编码器 Laya 学会主动提问:把候选缺失槽位与答案选项并列输入,一次前向同时输出决策分布与各槽位的期望信息增益(VOI)。在已见 schema 上其问题策略接近贪心 oracle VOI(AUC 0.799 vs. 0.797),每轮最多 0.5 个问题时准确率比从不提问高 14.1 个百分点。

  3. arXiv cs.AI40

    思考的代价:测试时推理在 DeepSeek、GPT、Gemini 的 LLM 交易中划算吗?

    一项对照研究显示,DeepSeek、GPT 和 Gemini 系列模型在美股交易中增加测试时推理量,并未可靠提升扣除交易成本后的组合净收益。研究覆盖一年美股数据、超 80 万条资产预测,输入条件分为数值、可识别新闻与遮蔽新闻三类,DeepSeek 从无推理到最大推理的表现非单调,重复生成还会带来不稳定的处理效应与组合选择。作者据此建议部署前逐任务验证。

  4. arXiv cs.AI41

    Audio LLM 知道自己何时听不清用户语音

    Audio LLM 往往无法识别自身转录何时不可靠,多数情况下仍会预测转录可靠。研究据此提出基于冻结音频编码器表征的轻量可靠性预测器,在生成前预测可靠性类别,域内与跨域 macro-F1 分别达 81.10% 和 78.09%,超过最强基线 10.33 与 11.93 点。预测为不可靠时可触发向用户澄清,可靠查询照常进行,可靠性标签还能跨 Audio LLM 家族迁移。

  5. arXiv cs.AI40

    T-RoPE:面向序列推荐的时间感知旋转位置嵌入

    T-RoPE 用时间戳角度、多尺度频率组和非平稳 key 旋转替换 RoPE 的仅序号旋转,为序列生成式推荐引入时间感知位置编码。在五个公开基准上全部指标最优,稀疏 PixelRec 的 HR@10 较最强基线提升 78–130%。在超 6B 交互的工业电商数据上较 HSTU + Time RAB 提升 13–82%,Shop 应用 A/B 测试转化率 +0.33%、订单量 +0.63%。

  6. arXiv cs.AI34

    HARDEN:用约束进化搜索生成更难且保持答案不变的评估用例

    HARDEN 提出一种约束进化搜索方法,在保持期望输出不变的前提下把现有评估用例改写成更难变体,并强制语义、真实性与执行有效性等可行性约束。在 FinQA、PubMedQA、ContractNLI 及 Qwen3.5 三种规模(35B-A3B、122B-A10B、397B-A17B)上,HARDEN 平均降低任务准确率 22.7%,相对单次通过基线最多降低 49.9%。

  7. arXiv cs.AI46

    少思考反而模拟更好:直觉式提示词提升 LLM 智能体模拟个人社交媒体反应的保真度

    研究让 4 个语言模型在 5 种提示条件下预测 8 名塞尔维亚参与者对 68 条社交媒体帖子的反应,结果显示要求模型直觉、立即作答的直觉式提示词保真度最高。该条件把个体差异压缩从人类的 7 倍降到 3 倍,并大幅优于人群基线,在问卷未涉及的主题上同样成立。态度类画像内容对预测的提升也远大于人口统计背景。

  8. arXiv cs.AI23

    Benchy:迈向任务型 AI 基准测试的通用语言

    Benchy 是一套用于 AI 程序基准测试的语义语言与执行引擎,基准由程序、评分函数与数据集三元组定义,与 AI 系统分离。基准以规范 YAML 编写,按 task/domain/language 本体分类,编译为规范 JSON 中间表示,不修复无效定义或注入默认值。引擎以命名输入对象进、命名输出对象出的统一契约执行,叶子输出字段即评分维度,外部 AI 系统在边界处适配。

  9. arXiv cs.AI36

    BioEVAL:面向生物工程的全球多机构大语言模型与多模态模型基准

    BioEVAL 是由 22 个研究团队共建的 PhD 级生物工程基准,用于评测大语言模型与多模态模型的实验推理能力。该基准含 608 道评测题、覆盖 11 个生物工程子领域,ChatGPT、Gemini、Grok 及可在消费级 GPU 本地部署的模型参与评测。多选题最高准确率 90%,文献综合相似度 0.72,小样本多模态推理题准确率 80%。

  10. arXiv cs.AI37

    Spectral Feedback:蛋白质扩散模型的测试时对齐方法

    Spectral Feedback 通过反馈回路选择编辑位置、重新 mask 并重采样 token,让离散扩散模型迭代修正自身生成结果。该方法与模型无关,可用于预训练、测试时对齐与微调的扩散模型,且不修改底层生成过程。在蛋白质逆折叠任务上配合稳定性 reward oracle,稳定蛋白比例提升 32.3%,Best-of-10 提升 24.8%,SOTA RL 微调扩散模型提升 5.8%。

  11. arXiv cs.AI29

    用 GNN SchNet 从 3D 结构预测跨膜蛋白拓扑

    研究用图神经网络 SchNet 从 3D 结构推断跨膜蛋白拓扑,训练数据与 DeepTMHMM 相同,并采用 5 折交叉验证。模型不使用任何预训练权重,且不同于只用蛋白序列或 α-carbons 作特征的做法,改用全部原子级嵌入向量。结果显示 GNN 在拓扑预测上具备潜力。

  12. arXiv cs.AI32

    面向 XAI 方法评估的合成真值框架

    一个基于合成真值的可解释 AI(XAI)评估框架被提出,通过受控干预生成输入组件重要性可由设计确定的合成数据集,从而得到与模型行为直接对齐的真值解释。该框架覆盖二值图像、表格数据和时间序列三个数据域,对九种常用 XAI 方法的评估显示当前技术存在显著局限,并凸显基于合成干预的基准对可靠评估解释质量的重要性。

  13. AGI Hunt33

    arXiv 综述:推荐系统离线评估的数据处理实践混乱不一

    arXiv 论文 2609.31696 由 Alberto Mancino 等 8 位作者综述推荐系统离线评估的数据处理流程,覆盖数据集选择到训练/验证/测试划分的完整流水线。综述跨越协同过滤、序列、图、多模态、联邦与 LLM 推荐等范式,发现训练前数据处理决策影响算法可得信息、实验可比性与可复现性,但长期缺乏审视、实践高度不一致,并提出统一框架与分类法。

  14. AGI Hunt47

    Kangwook Lee 团队包下韩国网吧,招募超 1000 名玩家训练星际争霸 AI「Ally」

    Kangwook Lee 团队租下韩国一间网吧(PC bang),招募超过 1000 名真人玩家与早期版本对局,为可在端侧消费级 GPU 上运行的游戏 AI「Ally」收集 on-policy 数据。团队借鉴 DAgger 思路迭代采集轨迹并纠正后继续训练,将模型蒸馏至 2B 参数规模,还针对边缘设备 KV 缓存预算紧张的问题专门开发了上下文压缩算法。

  15. AGI Hunt42

    Spotify 为数百万用户生成自然语言口味画像,强化基础模型推荐

    Spotify 团队发表论文 Textual User Taste (TUT),其自然语言用户口味画像系统已部署于数百万用户。该系统从收听行为、互动信号、内容元数据与可选用户反馈生成结构化画像,覆盖生成、评测、优化到维护的生产生命周期。团队提出多维度评测框架,结果显示画像独立携带用户预测信号,与行为 embedding 结合后能进一步提升推荐效果。

  16. AGI Hunt60

    作者分享让编码 Agent 通宵自动生成音乐视频的提示词流程

    neoneye2 在 reddit 分享了一份用编码 Agent 通宵自动生成音乐视频的完整提示词与流程。素材(音频、人声分离、歌词)放在 assets/ 目录,Agent 先从作者的手绘三角形作品提取艺术风格并构建等距三角形网格,参考另一个音乐视频仓库的结构,动手前主动追问歧义点。最后作者用 /goal 指令让 Agent 在自己睡觉时自主完成并持续提交文件。

  17. AGI Hunt39

    Dr. Free 抛弃难度奖励,用证据增益训练自进化搜索智能体

    Dr. Free 提出首个不依赖难度奖励的自进化搜索智能体训练框架:从知识图谱采样关系链并配对相关段落,为题目赋予多跳结构,只有完整证据段落下答案的似然超过所有捷径上下文的最大似然时,题目才获得正的信息增益奖励。该奖励基于 teacher-forced 似然计算,免去 pass-rate 估计,大幅缩短 proposer 训练时间。

  18. AGI Hunt30

    JevBench 作者回击:靠「感觉和信任」选模型是自欺

    JevBench 作者 @airesearch12 回击「靠 vibes 和信任选模型」的说法,称靠感觉挑模型是自欺,或是在掩饰模型开发领域没有护城河。他承认 benchmark 不完美,但认为它仍是目前最好的客观、科学代理指标。JevBench 刻意设计成无法被 benchmaxxed:每次发布都更换指标与测试集构成,站点还提供号称全球首个 benchmaxxing 分数。

  19. AGI Hunt46

    把 LLM 当推荐算法:按「性格龙」找同款小说

    一位作者读完《金翅雀》后让 LLM 理解主角「自我毁灭之龙」的人物设定,并据此推荐主角拥有「急躁之龙」的类似小说。这种基于抽象人物特质的语义匹配是传统推荐算法做不到的,展示了 LLM 作为开放维度推荐引擎的潜力。

  20. AGI Hunt24

    ryunuck 提出 RLEI 替代 RLVR:从认知不完备中强化学习引热议

    博主 ryunuck 提出以 RLEI(认知不完备强化学习)替代 RLVR(可验证奖励强化学习),引发热议。该构想设计图灵带式自动机,通过自洽性健康启发式纠缠内外层建模与正则化,使学习、惊讶等信号锚定真实指标,并可精确探测模型不确定性位置。这属个人对智能爆炸路径的非主流构想,未经验证。

  21. AGI Hunt39

    arXiv 论文《Focusing Condition》提出 SCS:推理时零训练提升 LLM 条件文本嵌入

    arXiv 论文《Focusing Condition》提出推理时即插即用的自对比引导方法 SCS,通过遮蔽条件得到无条件嵌入,再用它引导多头自注意力计算,提升 LLM 条件文本嵌入质量。该方法无需额外数据或微调,推理时仅多一次多头自注意力计算。在聚类、语义文本相似度(STS)和三元组对齐数据集上验证,可叠加现有 prompt 方法并全面提升性能,代码已开源。

  22. AGI Hunt44

    英国 AI 公司联署公开信呼吁取消竞业限制

    Inherent Labs 发起《Free to Start and Scale》公开信,呼吁英国政府取消阻碍 AI 顶尖人才跳槽或创业的限制条款,已获累计融资达 50 亿美元的英国 AI 公司联署支持。DeepMind 研究副总裁 Nando de Freitas 转发声援,批评 AI 行业普遍存在的一年期竞业协议,主张让最优秀的人才自由流动与创业。

  23. AGI Hunt63

    快手可灵发布 Kling 4.0,支持唇形同步与最多 15 项参考素材

    快手可灵正式发布 Kling 4.0 大版本更新,10 月正式上线,高性价比的 Kling 4.0 Flash 已于 9 月 28 日开放小范围体验。新版本支持 10-bit HDR、30 秒长镜头与最多 15 项参考素材,主打真实、可控、专业。早期体验创作者已用它制作完整音乐视频,唇形同步成为最大亮点,可通过黑帧渲染音轨与静帧合成实现口型对齐。