跳到正文

#推理

今日 50 条
今天9月30日周三
  1. AGI Hunt50

    研究者 BlancheMinerva 复盘 AI 玩宝可梦,获胜但对局质量堪忧

    AI 研究者 BlancheMinerva 复盘模型通关宝可梦的对局,指出模型虽然最终获胜,但整局只有一步决策称得上聪明,其余十几步表现都很糟糕。她认为模型可能只是靠选择速度最快、属性克制的宝可梦这类简单策略取胜,并质疑模型给出的赢棋理由存在事实性错误。她还进一步探究模型究竟掌握多少敌方队伍信息,怀疑其抢先派出胡地迎战阿桔的依据并不成立。

  2. AGI Hunt44

    美团 TGRL:温度分组强化学习,RLVR 训练速度提升最高 36%

    美团提出 TGRL(温度分组强化学习),把温度带来的 rollout 多样性转为显式训练信号,解决 RLVR 探索效率瓶颈:每个 prompt 的 rollout 组按温度分为低/高两个子集,用奖励对比估计探索增益,再以 JS 散度分配为 token 级 credit。不扩大 rollout 预算下,达到同等精度最高快 36%,代码已开源。

  3. AGI Hunt48

    SGLang 把 Qwen3.8-27B 变决策模型,百毫秒内通关《宝可梦火红》

    SGLang 团队把 Qwen3.8-27B 改造成多模态决策模型,从实时游戏画面出发,以低于 100 毫秒的决策延迟打通《宝可梦火红》的四天王与冠军。工程层面,SGLang 新增原生 /v1/decisions 接口,可将 LLM 和 VLM 当作分类与打分模型使用;另加 /v1/systemone,让 Jev 类开源模型可配合 TypeSafe SDK 使用。

9月29日周二
  1. Apple Machine Learning Research39

    语言模型树结构表达式序列化的通信瓶颈:一项往返研究

    研究用往返协议测试 16 个语言模型,发现用自然语言序列化树结构表达式存在有损且不对称的瓶颈,最佳生成-抽取组合准确率 92.9%。交换生成端与抽取端会使准确率变化最多 60.4 个百分点,至少 73.6% 的失败源自生成端,难度由树结构而非模型家族决定。约 3600 条微调样本即可让所有开放权重模型超过未训练的 Gemini-3.1-Pro。

  2. Wired AI53

    Timnit Gebru 认为 AI 不存在存在性威胁

    在 Wired 的访谈中,AI 研究者 Timnit Gebru 表示 AI 并不构成存在性威胁,认为这一叙事不只是分心,而且有害。她把这种叙事追溯到资助 Anthropic 早期融资并资助 METR 等机构的人群,称其为监管俘获的一部分,并援引 Lina Khan 提出的欺骗性营销、数据透明度与数据工人劳动剥削等现有法律本该管辖的事项。

  3. AGI Hunt47

    Timnit Gebru 断言 AI 无生存威胁:末日论是创始人赚钱话术

    Timnit Gebru 在 WIRED 专访中称 AI 并不构成生存威胁,「AI 末日论」的真正驱动力是创始人们追逐利润。她因共同撰写「随机鹦鹉」论文质疑 LLM 局限而与 Google 决裂,创立关注技术危害的研究所,并将于明年初出版新书 Deep Unlearning。包括 Anthropic 联合创始人在内的业内人士反驳称该观点已过时,认为 AI 已具备推理能力。

  4. Latent Space38

    Claude Opus 5.5 擅长做讲解视频

    Claude Opus 5.5 本周发布,以 88.4% 领跑 SimpleBench,并因讲解视频在时间线上刷屏。在 Terminal-Bench-Science 上,其得分从 low 档的 24% 升至 xhigh 的 62%,max 档回落到 59%;视觉评测中被列为 Anthropic 迄今最强视觉模型,成本比 Fable 5.1 低约 60%。

  5. arXiv cs.AI40

    Self-Play Search Distillation:用自对弈搜索蒸馏提升 LLM 推理能力

    Self-Play Search Distillation(SPSD)通过棋盘游戏自对弈中的 MuZero 类网络搜索生成超人类合成数据,并把搜索记录转成思维链,为大语言模型提供环境接地监督。在 Qwen3-4B-Base 上,六个数学基准的平均分从 24.1 升至 36.6,未见过的游戏胜率从 15% 升至 45%。该方法仅用自对弈搜索记录训练,即可迁移到数学推理。

  6. arXiv cs.AI36

    LW2S:面向高效多智能体 LLM 工作流的反事实信用分配与跳过学习

    LW2S 将多智能体 LLM 工作流中的组件省略建模为反事实信用分配,用受控跳过干预学习动作级安全模型,并结合留出集校准与领域内建护栏选择跳过步骤。在数学推理、选择题问答与代码生成、两个指令模型家族上,它降低了记录 token 成本,整体工作流准确率持平或提升。早期跳过被拒时,控制器仍可继续执行并重新考虑后续组件。

  7. arXiv cs.AI39

    LAVOIR:用摊销信息价值教单次前向决策编码器 Laya 何时提问、问什么

    LAVOIR 让单次前向决策编码器 Laya 学会主动提问:把候选缺失槽位与答案选项并列输入,一次前向同时输出决策分布与各槽位的期望信息增益(VOI)。在已见 schema 上其问题策略接近贪心 oracle VOI(AUC 0.799 vs. 0.797),每轮最多 0.5 个问题时准确率比从不提问高 14.1 个百分点。

  8. arXiv cs.AI40

    思考的代价:测试时推理在 DeepSeek、GPT、Gemini 的 LLM 交易中划算吗?

    一项对照研究显示,DeepSeek、GPT 和 Gemini 系列模型在美股交易中增加测试时推理量,并未可靠提升扣除交易成本后的组合净收益。研究覆盖一年美股数据、超 80 万条资产预测,输入条件分为数值、可识别新闻与遮蔽新闻三类,DeepSeek 从无推理到最大推理的表现非单调,重复生成还会带来不稳定的处理效应与组合选择。作者据此建议部署前逐任务验证。

  9. arXiv cs.AI41

    Audio LLM 知道自己何时听不清用户语音

    Audio LLM 往往无法识别自身转录何时不可靠,多数情况下仍会预测转录可靠。研究据此提出基于冻结音频编码器表征的轻量可靠性预测器,在生成前预测可靠性类别,域内与跨域 macro-F1 分别达 81.10% 和 78.09%,超过最强基线 10.33 与 11.93 点。预测为不可靠时可触发向用户澄清,可靠查询照常进行,可靠性标签还能跨 Audio LLM 家族迁移。

  10. arXiv cs.AI40

    T-RoPE:面向序列推荐的时间感知旋转位置嵌入

    T-RoPE 用时间戳角度、多尺度频率组和非平稳 key 旋转替换 RoPE 的仅序号旋转,为序列生成式推荐引入时间感知位置编码。在五个公开基准上全部指标最优,稀疏 PixelRec 的 HR@10 较最强基线提升 78–130%。在超 6B 交互的工业电商数据上较 HSTU + Time RAB 提升 13–82%,Shop 应用 A/B 测试转化率 +0.33%、订单量 +0.63%。

  11. arXiv cs.AI46

    少思考反而模拟更好:直觉式提示词提升 LLM 智能体模拟个人社交媒体反应的保真度

    研究让 4 个语言模型在 5 种提示条件下预测 8 名塞尔维亚参与者对 68 条社交媒体帖子的反应,结果显示要求模型直觉、立即作答的直觉式提示词保真度最高。该条件把个体差异压缩从人类的 7 倍降到 3 倍,并大幅优于人群基线,在问卷未涉及的主题上同样成立。态度类画像内容对预测的提升也远大于人口统计背景。

  12. AGI Hunt39

    Dr. Free 抛弃难度奖励,用证据增益训练自进化搜索智能体

    Dr. Free 提出首个不依赖难度奖励的自进化搜索智能体训练框架:从知识图谱采样关系链并配对相关段落,为题目赋予多跳结构,只有完整证据段落下答案的似然超过所有捷径上下文的最大似然时,题目才获得正的信息增益奖励。该奖励基于 teacher-forced 似然计算,免去 pass-rate 估计,大幅缩短 proposer 训练时间。

  13. AGI Hunt39

    arXiv 论文《Focusing Condition》提出 SCS:推理时零训练提升 LLM 条件文本嵌入

    arXiv 论文《Focusing Condition》提出推理时即插即用的自对比引导方法 SCS,通过遮蔽条件得到无条件嵌入,再用它引导多头自注意力计算,提升 LLM 条件文本嵌入质量。该方法无需额外数据或微调,推理时仅多一次多头自注意力计算。在聚类、语义文本相似度(STS)和三元组对齐数据集上验证,可叠加现有 prompt 方法并全面提升性能,代码已开源。

  14. IT之家39

    SEMIFIVE 接获 LPDDR6 加持 AI 推理 ASIC 的规格交接型芯片设计订单

    韩国芯片设计服务企业 SEMIFIVE 宣布将为一家美国无晶圆厂 AI 芯片企业开发支持 LPDDR6、PCIe Gen5 的数据中心级推理加速器,订单采用“规格交接”模式。合同总价约 703 亿韩元(约合 3.48 亿元人民币),是 SEMIFIVE 史上最大单笔合同,也是其在北美的首个同类型项目。该芯片预计 2027H1 流片,2028 年量产出货。

  15. AGI Hunt28

    Lampinen 与 Grady Booch 辩论数学与自然语言的边界

    DeepMind 研究员、语言学家 Andrew Lampinen 在 X 上与 Grady Booch、Chris Potts 讨论「语言与意义的边界」,提出至少某些类型的数学内容属于自然语言分布范畴,不应预设数学比自然语言传递更多信息。他同时承认,实践中数学表达在精确性上具有优势,这一观点引发了对语言模型学习数学能力本质的进一步思考。