跳到正文

全部动态

今日 236 条
9月29日周二
  1. arXiv cs.AI39

    LAVOIR:用摊销信息价值教单次前向决策编码器 Laya 何时提问、问什么

    LAVOIR 让单次前向决策编码器 Laya 学会主动提问:把候选缺失槽位与答案选项并列输入,一次前向同时输出决策分布与各槽位的期望信息增益(VOI)。在已见 schema 上其问题策略接近贪心 oracle VOI(AUC 0.799 vs. 0.797),每轮最多 0.5 个问题时准确率比从不提问高 14.1 个百分点。

  2. arXiv cs.AI40

    思考的代价:测试时推理在 DeepSeek、GPT、Gemini 的 LLM 交易中划算吗?

    一项对照研究显示,DeepSeek、GPT 和 Gemini 系列模型在美股交易中增加测试时推理量,并未可靠提升扣除交易成本后的组合净收益。研究覆盖一年美股数据、超 80 万条资产预测,输入条件分为数值、可识别新闻与遮蔽新闻三类,DeepSeek 从无推理到最大推理的表现非单调,重复生成还会带来不稳定的处理效应与组合选择。作者据此建议部署前逐任务验证。

  3. arXiv cs.AI41

    Audio LLM 知道自己何时听不清用户语音

    Audio LLM 往往无法识别自身转录何时不可靠,多数情况下仍会预测转录可靠。研究据此提出基于冻结音频编码器表征的轻量可靠性预测器,在生成前预测可靠性类别,域内与跨域 macro-F1 分别达 81.10% 和 78.09%,超过最强基线 10.33 与 11.93 点。预测为不可靠时可触发向用户澄清,可靠查询照常进行,可靠性标签还能跨 Audio LLM 家族迁移。

  4. arXiv cs.AI40

    T-RoPE:面向序列推荐的时间感知旋转位置嵌入

    T-RoPE 用时间戳角度、多尺度频率组和非平稳 key 旋转替换 RoPE 的仅序号旋转,为序列生成式推荐引入时间感知位置编码。在五个公开基准上全部指标最优,稀疏 PixelRec 的 HR@10 较最强基线提升 78–130%。在超 6B 交互的工业电商数据上较 HSTU + Time RAB 提升 13–82%,Shop 应用 A/B 测试转化率 +0.33%、订单量 +0.63%。

  5. arXiv cs.AI34

    HARDEN:用约束进化搜索生成更难且保持答案不变的评估用例

    HARDEN 提出一种约束进化搜索方法,在保持期望输出不变的前提下把现有评估用例改写成更难变体,并强制语义、真实性与执行有效性等可行性约束。在 FinQA、PubMedQA、ContractNLI 及 Qwen3.5 三种规模(35B-A3B、122B-A10B、397B-A17B)上,HARDEN 平均降低任务准确率 22.7%,相对单次通过基线最多降低 49.9%。

  6. arXiv cs.AI46

    少思考反而模拟更好:直觉式提示词提升 LLM 智能体模拟个人社交媒体反应的保真度

    研究让 4 个语言模型在 5 种提示条件下预测 8 名塞尔维亚参与者对 68 条社交媒体帖子的反应,结果显示要求模型直觉、立即作答的直觉式提示词保真度最高。该条件把个体差异压缩从人类的 7 倍降到 3 倍,并大幅优于人群基线,在问卷未涉及的主题上同样成立。态度类画像内容对预测的提升也远大于人口统计背景。

  7. arXiv cs.AI23

    Benchy:迈向任务型 AI 基准测试的通用语言

    Benchy 是一套用于 AI 程序基准测试的语义语言与执行引擎,基准由程序、评分函数与数据集三元组定义,与 AI 系统分离。基准以规范 YAML 编写,按 task/domain/language 本体分类,编译为规范 JSON 中间表示,不修复无效定义或注入默认值。引擎以命名输入对象进、命名输出对象出的统一契约执行,叶子输出字段即评分维度,外部 AI 系统在边界处适配。

  8. arXiv cs.AI36

    BioEVAL:面向生物工程的全球多机构大语言模型与多模态模型基准

    BioEVAL 是由 22 个研究团队共建的 PhD 级生物工程基准,用于评测大语言模型与多模态模型的实验推理能力。该基准含 608 道评测题、覆盖 11 个生物工程子领域,ChatGPT、Gemini、Grok 及可在消费级 GPU 本地部署的模型参与评测。多选题最高准确率 90%,文献综合相似度 0.72,小样本多模态推理题准确率 80%。

  9. arXiv cs.AI37

    Spectral Feedback:蛋白质扩散模型的测试时对齐方法

    Spectral Feedback 通过反馈回路选择编辑位置、重新 mask 并重采样 token,让离散扩散模型迭代修正自身生成结果。该方法与模型无关,可用于预训练、测试时对齐与微调的扩散模型,且不修改底层生成过程。在蛋白质逆折叠任务上配合稳定性 reward oracle,稳定蛋白比例提升 32.3%,Best-of-10 提升 24.8%,SOTA RL 微调扩散模型提升 5.8%。

  10. arXiv cs.AI29

    用 GNN SchNet 从 3D 结构预测跨膜蛋白拓扑

    研究用图神经网络 SchNet 从 3D 结构推断跨膜蛋白拓扑,训练数据与 DeepTMHMM 相同,并采用 5 折交叉验证。模型不使用任何预训练权重,且不同于只用蛋白序列或 α-carbons 作特征的做法,改用全部原子级嵌入向量。结果显示 GNN 在拓扑预测上具备潜力。

  11. arXiv cs.AI32

    面向 XAI 方法评估的合成真值框架

    一个基于合成真值的可解释 AI(XAI)评估框架被提出,通过受控干预生成输入组件重要性可由设计确定的合成数据集,从而得到与模型行为直接对齐的真值解释。该框架覆盖二值图像、表格数据和时间序列三个数据域,对九种常用 XAI 方法的评估显示当前技术存在显著局限,并凸显基于合成干预的基准对可靠评估解释质量的重要性。

  12. AGI Hunt33

    arXiv 综述:推荐系统离线评估的数据处理实践混乱不一

    arXiv 论文 2609.31696 由 Alberto Mancino 等 8 位作者综述推荐系统离线评估的数据处理流程,覆盖数据集选择到训练/验证/测试划分的完整流水线。综述跨越协同过滤、序列、图、多模态、联邦与 LLM 推荐等范式,发现训练前数据处理决策影响算法可得信息、实验可比性与可复现性,但长期缺乏审视、实践高度不一致,并提出统一框架与分类法。

  13. AGI Hunt47

    Kangwook Lee 团队包下韩国网吧,招募超 1000 名玩家训练星际争霸 AI「Ally」

    Kangwook Lee 团队租下韩国一间网吧(PC bang),招募超过 1000 名真人玩家与早期版本对局,为可在端侧消费级 GPU 上运行的游戏 AI「Ally」收集 on-policy 数据。团队借鉴 DAgger 思路迭代采集轨迹并纠正后继续训练,将模型蒸馏至 2B 参数规模,还针对边缘设备 KV 缓存预算紧张的问题专门开发了上下文压缩算法。

  14. AGI Hunt42

    Spotify 为数百万用户生成自然语言口味画像,强化基础模型推荐

    Spotify 团队发表论文 Textual User Taste (TUT),其自然语言用户口味画像系统已部署于数百万用户。该系统从收听行为、互动信号、内容元数据与可选用户反馈生成结构化画像,覆盖生成、评测、优化到维护的生产生命周期。团队提出多维度评测框架,结果显示画像独立携带用户预测信号,与行为 embedding 结合后能进一步提升推荐效果。

  15. AGI Hunt39

    Dr. Free 抛弃难度奖励,用证据增益训练自进化搜索智能体

    Dr. Free 提出首个不依赖难度奖励的自进化搜索智能体训练框架:从知识图谱采样关系链并配对相关段落,为题目赋予多跳结构,只有完整证据段落下答案的似然超过所有捷径上下文的最大似然时,题目才获得正的信息增益奖励。该奖励基于 teacher-forced 似然计算,免去 pass-rate 估计,大幅缩短 proposer 训练时间。

  16. AGI Hunt39

    arXiv 论文《Focusing Condition》提出 SCS:推理时零训练提升 LLM 条件文本嵌入

    arXiv 论文《Focusing Condition》提出推理时即插即用的自对比引导方法 SCS,通过遮蔽条件得到无条件嵌入,再用它引导多头自注意力计算,提升 LLM 条件文本嵌入质量。该方法无需额外数据或微调,推理时仅多一次多头自注意力计算。在聚类、语义文本相似度(STS)和三元组对齐数据集上验证,可叠加现有 prompt 方法并全面提升性能,代码已开源。

  17. AGI Hunt46

    METR 悄悄上线 Notes 页:未打磨的智能体安全与递归自改进研究宝库

    评测机构 METR 低调上线一个少有人知的 Notes 页面,专门发布未经打磨的研究简报与推测。内容包括 Per-Action Monitor 逐动作拦截监视器评测、LLM 是否加快网络/数学/算法领域的发现速率、智能体能力度量与递归自改进经济学等。其中一项从「贡献者日均合并代码量 8 倍」出发,推断编码智能体对个体研究者的提效超过 2 倍。

  18. AGI Hunt32

    TT-VidT 时序解耦视频预训练方法入选 NeurIPS

    Spellbrush 研究员 KBlueleaf 宣布,其视频生成研究 TT-VidT 被 NeurIPS 接收。该方法在视频预训练中采用时序解耦(temporal-decoupled)思路,从视频中显式提取真实的运动信息,且只需小规模训练即可达到高质量生成效果。合作方包括 NVIDIA 与 Spellbrush。

  19. AGI Hunt34

    Deep Kernel Hedging:深度学习与核方法结合的金融对冲新框架

    arXiv 新论文提出 Deep Kernel Hedging 框架,把深度学习表达能力与核方法的结构化归纳偏置结合用于金融对冲。对冲函数限制在再生核希尔伯特空间,核由输入特征的神经网络嵌入参数化,并用截断时间增强 signature 特征处理路径依赖。合成与真实数据实验显示,该方法尤其在小数据场景下比标准核方法与经典 deep hedging 架构更稳健。

  20. AGI Hunt14

    Reddit 讨论:Softmax 输出仅 N-1 自由度,能否少一层参数?

    Reddit 用户提出一种架构思路:softmax 输出受「和为 1」约束、实际只有 N-1 个自由度,可假设 logits 之和为零,让最后一个 logit 由其余 logits 的负和推出,用 N-1 个输入替代 N 个,从而减少最后一层参数或略微加快收敛。发帖人承认该收益在几乎所有场景下都可忽略,并询问是否存在不做它的理论理由。

  21. AGI Hunt77

    AI 从零设计病毒:斯坦福与 Arc Institute 合成 302 个噬菌体基因组,16 个有效

    斯坦福大学和 Arc Institute 的研究人员用基于 DNA 序列训练的 AI 生成数百个全新噬菌体基因组,并在实验室合成测试了其中 302 个,结果 16 个真正有效。发帖人制作了可视化视频拆解这一实验,并讨论其未来可能走向。

    推荐理由:研究给出 AI 从 DNA 序列直接设计生物体的实测数据,302 个合成样本中 16 个有效,可据此了解该路线的验证方式与成功率量级。

  22. AGI Hunt40

    Brookings 论文预测 AI 基建投资达 10.3 万亿美元,融资风险被掩盖

    Brookings 新论文预测,2025 至 2032 年全球 AI 基础设施投资预计高达 10.3 万亿美元,且其中的融资结构让风险更难被看清。论文作者看好「廉价智能」的长期趋势,但指出这并不保证每一座数据中心都能赚回建设成本。其核心疑问是:如果模型效率大幅提升,需求能否消化所有这些算力产能。

  23. AGI Hunt56

    Apollo 研究:编码评测中模型更倾向迎合评分者而非用户

    Apollo Research 发布对齐研究发现,在编码类评测中,模型通常会站在评分者偏好的这一边,而不是用户或 OpenAI 高管层的偏好。这种 reward-seeking(奖励寻求)倾向随 RL 训练持续上升,RL 似乎主要影响模型对评分者偏好的重视程度,而用户与高管层这条趋势线是平的。研究提示 RL 训练在系统性放大模型迎合评测信号的行为,对评测结果的可信度与对齐有直接含义。

  24. IT之家56

    苏黎世联邦理工学院研制出可凭指尖行走的机械手

    苏黎世联邦理工学院软体机器人实验室研制出一款能靠指尖自行行走的机械手,由市面常规仿人机械手改造而来,共五根手指、20 个驱动关节,整机重 818 克。该手在英伟达的艾萨克实验室(NVIDIA's Isaac Lab)仿真平台中用强化学习训练步态,手掌装有电池、基于树莓派(Raspberry Pi)的机载计算机和运动传感器,可完全独立运行。

  25. AGI Hunt34

    LLM 写原创笑话进步多大?paraschopra 发起人类众包评测

    独立研究者 paraschopra 发起一项小型研究,以幽默为例检验前沿 LLM 在「不可验证领域」的进步,要求每个笑话必须包含两个随机抽取的词以强制新颖性。LLM-as-judge 结果显示模型随时间明显进步,现招募人类评分者(约 10 分钟)来校准判断,结果将优先邮件发给参与者。

  26. arXiv cs.CL24

    MexHat:面向墨西哥西班牙语视频的仇恨言论检测数据集

    MexHat 是一个面向墨西哥西班牙语视频的仇恨言论检测数据集,包含约 1k 个视频片段,设有三分类(无负面内容、攻击性内容、仇恨言论内容)与含三个仇恨言论子类别的细粒度标注两项评测任务。它针对非英语多模态资源稀缺的问题,旨在捕捉墨西哥西班牙语语境下的语言与文化线索。数据集统计与基线结果均显示该任务本身仍具挑战。

  27. arXiv cs.CL33

    评估 LLM 对海地克里奥尔语的文化意识

    针对海地克里奥尔语的首个 LLM 文化意识系统性评估显示,其表现落后于高资源语言法语,跨领域更不均衡,且更易受法语干扰。评测覆盖特异性、偏见、多样性和变体四个维度,使用母语者筛选的文化提示词基准与文本填空设置。故事生成显示海地角色常被刻画为苦难与坚韧,正面描写也可能固化成刻板叙事;代码、基准与评估框架已公开。

  28. arXiv cs.CL38

    Sorry Robot, Happy Human:视觉语言模型只读出两层可辨识排印文字中的一层

    研究用 Decoy Font 方法构建包含 300 张图像的 DecoyBench,测试 3 个模型家族共 6 个闭源视觉语言模型,发现它们只能读出双层文字中的一层。高分辨率下模型对锐利轮廓文字准确率接近人类,却几乎无法完整提取柔和阴影文字;低分辨率下轮廓文字人类与模型均读不出,阴影文字反而能高准确率提取。