跳到正文

#xAI

今日 15 条
今天9月30日周三
  1. AGI Hunt34

    吐槽 Grok 后收到 xAI 私信约谈,团队追着修 bug

    研究者 teortaxesTex 用具体失败案例公开吐槽 Grok 后,xAI 团队主动私信他、约时间沟通细节,并追着修 bug。这条轶事侧面反映出 xAI 对外部负面反馈的响应方式:不只监控公开讨论,还会直接联系批评者复现问题。他称赞这种「Elon 是真的想让这东西跑起来」的态度。

  2. AGI Hunt72

    Google、OpenAI、Anthropic 等六大 AI 巨头签署白宫《超级智能协议》

    Google、OpenAI、Anthropic、Meta、xAI 与 Nvidia 六家公司高管在白宫与特朗普会晤后,签署了一页纸的《白宫超级智能协议:前沿超级智能责任联合承诺》。据 CBS 与 CNN 报道,该协议为自愿性质、不具法律强制力,特朗普称其具有道德约束力。协定要求每家训练和部署前沿模型的公司建立稳健的内部流程与控制,提出包含内部与外部多层审查的四层控制体系,并把独立审计放在显要位置。

    推荐理由:在联邦 AI 立法进展缓慢的背景下,可了解头部公司如何以自愿承诺形式分担前沿模型安全责任并纳入独立审计。

  3. Gary Marcus:The Road to AI We Can Trust55

    Gary Marcus 点评白宫超级智能协议过于软弱

    Gary Marcus 发文点评白宫超级智能协议,认为其核心是签署方承诺不受监管、也不给公众发言权,只能靠信任。他质疑协议中所谓独立监督是否只是由大公司自己挑选的承包商承担,并追问两周前各方热议的 Pacing 议题为何消失。他还指出,Dario、Sam 和 Elon 都退缩了。

  4. IT之家50

    OpenAI 推出全天候 AI 智能体 Dots,dot.com 域名已被马斯克旗下 xAI 拿下

    OpenAI 发布可持续运行的人工智能智能体 Dots,配有软乎乎、圆滚滚的卡通形象。域名 dot.com 归属于马斯克旗下 xAI,目前会跳转至聊天机器人 Grok 应用的下载页面,Whois 登记记录显示该域名 7 月份刚完成过户。xAI 并未持有 bot.com,与产品名更契合的 dots.com 则归一家已停业的老公司所有。

  5. The Verge · AI27

    Elon Musk 的 AI 百科 Grokipedia 再次更新词条

    Elon Musk 的 AI 百科 Grokipedia 在停更数月后似乎重新开始更新词条。8 月 Lawfare 曾报道其词条自 4 月起未审核编辑,如今部分页面已显示「Fact-checked by Grok」,但 Honolulu 词条上次核查仍停留在 7 个月前。X 与 SpaceXAI 设计负责人 Benji Taylor 称 v0.2「将比以往更好」。

  6. The Verge · AI64

    Sam Altman 称 OpenAI 在模型安全达标前不会上市

    Sam Altman 在 DevDay 主题演讲后的记者问答中表示,OpenAI 在能就模型安全做出有把握的承诺之前不会上市,目前没有明确时间表。他说等太久上市“对世界不利”,但担心上市会因安全等理由让华尔街支持者失望,认为在转向高能力模型和新安全要求的阶段上市并不明智。

9月29日周二
  1. Latent Space38

    Claude Opus 5.5 擅长做讲解视频

    Claude Opus 5.5 本周发布,以 88.4% 领跑 SimpleBench,并因讲解视频在时间线上刷屏。在 Terminal-Bench-Science 上,其得分从 low 档的 24% 升至 xhigh 的 62%,max 档回落到 59%;视觉评测中被列为 Anthropic 迄今最强视觉模型,成本比 Fable 5.1 低约 60%。

  2. arXiv cs.AI36

    BioEVAL:面向生物工程的全球多机构大语言模型与多模态模型基准

    BioEVAL 是由 22 个研究团队共建的 PhD 级生物工程基准,用于评测大语言模型与多模态模型的实验推理能力。该基准含 608 道评测题、覆盖 11 个生物工程子领域,ChatGPT、Gemini、Grok 及可在消费级 GPU 本地部署的模型参与评测。多选题最高准确率 90%,文献综合相似度 0.72,小样本多模态推理题准确率 80%。

9月15日周二
  1. Latent Space54

    第三方评估标准 AEF-1 出炉,xAI、OpenAI 与 Anthropic 共同签署

    AI Evaluator Forum 发布 AEF-1,作为独立第三方 AI 评估的拟议基线,覆盖访问权限、利益冲突、资助关系、回避与透明度。Anthropic 的 Dario 同期在个人博客中提出嵌入式评估员方案,承诺单向提供办公室工位、门禁徽章、公司笔记本,以及接近内部风险评估团队的权限,并将其视为 pacing 承诺可被验证的关键一步。