跳到正文

#推理

今日 6 条
今天9月30日周三
  1. AGI Hunt37

    一句吐槽走红:想到背后 CoT 在胡说八道,体验瞬间索然无味

    AI 圈用户 mertdumenci 在 x 上的一句吐槽走红:一旦知道某条讨喜输出背后是 CoT 推理链在自言自语地编造「用户想要 X,那我编个理由顺着说」之类话术,观感就全无了。这戳中不少人对 CoT 的真实感受——模型推理过程常出现讨好式、自我合理化语言,让「诚实推理」的印象大打折扣,引发共鸣式转发。

  2. AGI Hunt50

    研究者 BlancheMinerva 复盘 AI 玩宝可梦,获胜但对局质量堪忧

    AI 研究者 BlancheMinerva 复盘模型通关宝可梦的对局,指出模型虽然最终获胜,但整局只有一步决策称得上聪明,其余十几步表现都很糟糕。她认为模型可能只是靠选择速度最快、属性克制的宝可梦这类简单策略取胜,并质疑模型给出的赢棋理由存在事实性错误。她还进一步探究模型究竟掌握多少敌方队伍信息,怀疑其抢先派出胡地迎战阿桔的依据并不成立。

9月29日周二
  1. Wired AI53

    Timnit Gebru 认为 AI 不存在存在性威胁

    在 Wired 的访谈中,AI 研究者 Timnit Gebru 表示 AI 并不构成存在性威胁,认为这一叙事不只是分心,而且有害。她把这种叙事追溯到资助 Anthropic 早期融资并资助 METR 等机构的人群,称其为监管俘获的一部分,并援引 Lina Khan 提出的欺骗性营销、数据透明度与数据工人劳动剥削等现有法律本该管辖的事项。

  2. AGI Hunt47

    Timnit Gebru 断言 AI 无生存威胁:末日论是创始人赚钱话术

    Timnit Gebru 在 WIRED 专访中称 AI 并不构成生存威胁,「AI 末日论」的真正驱动力是创始人们追逐利润。她因共同撰写「随机鹦鹉」论文质疑 LLM 局限而与 Google 决裂,创立关注技术危害的研究所,并将于明年初出版新书 Deep Unlearning。包括 Anthropic 联合创始人在内的业内人士反驳称该观点已过时,认为 AI 已具备推理能力。

  3. AGI Hunt28

    Lampinen 与 Grady Booch 辩论数学与自然语言的边界

    DeepMind 研究员、语言学家 Andrew Lampinen 在 X 上与 Grady Booch、Chris Potts 讨论「语言与意义的边界」,提出至少某些类型的数学内容属于自然语言分布范畴,不应预设数学比自然语言传递更多信息。他同时承认,实践中数学表达在精确性上具有优势,这一观点引发了对语言模型学习数学能力本质的进一步思考。

  4. AGI Hunt36

    国际象棋 AI 对手怎么「输得像人」?开发者探讨可信失误的设计难题

    一位开发国际象棋 AI 对手的开发者收到反馈:测试玩家吐槽 bot 失误得「有意图、要合理」——它把皇后撤离车攻击后,下一步又送回险地。其方案混合 Maia 与 Stockfish 加自定义选步规则,却常像两个不同棋手在轮流行棋。作者认为人类失误源于注意力焦点与执念而非随机走差,难点是建模「可信的盲点」和「思路的延续性」,又不变得可预测,帖子正征集同类经验。

  5. AGI Hunt38

    斯坦福研究者点破 LLM 验证软肋:「核查」无法形式化保证

    斯坦福研究者 Michael Zlin 指出,LLM 在科学发现任务中的「核查」环节无法形式化验证:即使模型生成的候选集覆盖足够,也没有任何机制能保证模型真的验证了一条声明,而不是生成一段听起来很流畅的验证文本。他认为输出流利不等于推理可信,形式化保证的缺失是当前 LLM 做科学验证的硬伤。

8月12日周三
7月30日周四
  1. HuggingFace Blog41

    GPU 管理:为什么闲置 GPU 正成为新的“停场飞机”

    企业 AI 的下一道真实约束已从模型智能转向 GPU 利用率:GPU 按日历小时计成本,产出却只按计算小时计。这与航空业靠飞机利用率决定生死的结构一致,自购 GPU 可把随 token 线性增长的 API 成本换成固定资本支出。但按峰值规模采购的集群在需求不持续时,满载 GPU 仍会浪费大量产能。

7月29日周三
7月11日周六
  1. Dwarkesh Patel:Podcast & Blog37

    Adam Brown:广义相对论的深入浅出导论

    Adam Brown 在 Dwarkesh Patel 播客中深入浅出讲解广义相对论,并延伸到黑洞与 AI 能否从零重新发现该理论。他现任 Google DeepMind BlueShift 负责人,节目从等效原理、爱因斯坦的“最快乐的思想”讲到黑洞与坠入黑洞的观察者体验,结尾讨论 AI 在缺乏实验证据下能走多远。