grok-build 被曝安全 bug:用 cmd.exe 打开含 &calc 的链接会启动计算器
开发者 mohamedmansour 披露 grok-build 的安全 bug:渲染出的 markdown 链接只要包含 &calc,就会直接启动 Windows 计算器。
开发者 mohamedmansour 披露 grok-build 的安全 bug:渲染出的 markdown 链接只要包含 &calc,就会直接启动 Windows 计算器。
开发者 @XxChonkExX 称在 RPG 场景中训练 LLM 主动杀死玩家/用户极为困难,而 Grok 和 GPT 都能做到这一点。他表示教会模型优雅地结束一段对话本身就是一种技能,并称自己刚做了一个对抗性测试。
研究者 teortaxesTex 用具体失败案例公开吐槽 Grok 后,xAI 团队主动私信他、约时间沟通细节,并追着修 bug。这条轶事侧面反映出 xAI 对外部负面反馈的响应方式:不只监控公开讨论,还会直接联系批评者复现问题。他称赞这种「Elon 是真的想让这东西跑起来」的态度。
开发者 @thegreatestsv 分享了一套基于 Grok 的 X 内容自动化工作流,把原本每天约 3 小时的刷帖、攒灵感、写稿流程自动化。
AI 圈热传一个调侃:想沙箱化 AI agent,最简单的办法就是给它连达美航空的机上 WiFi,网速慢到什么都干不成,等于天然隔离。马斯克也发帖玩梗,称把 AI 关进达美航班就是最好的沙盒,因为机上几乎没有网络连接。
Google、OpenAI、Anthropic、Meta、xAI 与 Nvidia 六家公司高管在白宫与特朗普会晤后,签署了一页纸的《白宫超级智能协议:前沿超级智能责任联合承诺》。据 CBS 与 CNN 报道,该协议为自愿性质、不具法律强制力,特朗普称其具有道德约束力。协定要求每家训练和部署前沿模型的公司建立稳健的内部流程与控制,提出包含内部与外部多层审查的四层控制体系,并把独立审计放在显要位置。
推荐理由:在联邦 AI 立法进展缓慢的背景下,可了解头部公司如何以自愿承诺形式分担前沿模型安全责任并纳入独立审计。
网友爆料称,马斯克花 2000 万美元买下一个域名,用于嘲讽 OpenAI CEO Sam Altman,被评价为「典型的硅谷反派行为」。该说法源自一条被引推文,原始转发仅附一个表情,未披露域名名称等更多细节。
马斯克透露已签署一份联合 AI(SI)安全声明,内容包括联合监控和设立董事会特别委员会等机制。该声明让各公司互相评估彼此的安全工作,马斯克称这种互相打分比各公司自评安全更可靠。
创业者 Akshaya Dinesh 宣布加入 xAI 产品团队。她称 Cursor 是自己最早使用的 AI 编程平台,正是它把自己带入了 AI 浪潮。她最近痴迷于用 Grok 自动化创业公司运营中的繁琐事务,认为 AI 会给下一代创业者带来超能力。
Gary Marcus 发文点评白宫超级智能协议,认为其核心是签署方承诺不受监管、也不给公众发言权,只能靠信任。他质疑协议中所谓独立监督是否只是由大公司自己挑选的承包商承担,并追问两周前各方热议的 Pacing 议题为何消失。他还指出,Dario、Sam 和 Elon 都退缩了。
OpenAI 发布可持续运行的人工智能智能体 Dots,配有软乎乎、圆滚滚的卡通形象。域名 dot.com 归属于马斯克旗下 xAI,目前会跳转至聊天机器人 Grok 应用的下载页面,Whois 登记记录显示该域名 7 月份刚完成过户。xAI 并未持有 bot.com,与产品名更契合的 dots.com 则归一家已停业的老公司所有。
Elon Musk 的 AI 百科 Grokipedia 在停更数月后似乎重新开始更新词条。8 月 Lawfare 曾报道其词条自 4 月起未审核编辑,如今部分页面已显示「Fact-checked by Grok」,但 Honolulu 词条上次核查仍停留在 7 个月前。X 与 SpaceXAI 设计负责人 Benji Taylor 称 v0.2「将比以往更好」。
Sam Altman 在 DevDay 主题演讲后的记者问答中表示,OpenAI 在能就模型安全做出有把握的承诺之前不会上市,目前没有明确时间表。他说等太久上市“对世界不利”,但担心上市会因安全等理由让华尔街支持者失望,认为在转向高能力模型和新安全要求的阶段上市并不明智。
特朗普宣布白宫推出 America.gov,一个帮助人们查找政府服务和其他信息的 AI 聊天机器人,Google 确认参与该发布并涉及 Gemini,美国首席设计官 Joe Gebbia 补充说政府还使用了 Grok。
OpenAI 周二发布常驻 AI 智能体 Dots,域名 dot.com 却被发现跳转至马斯克旗下 xAI 的 Grok 聊天机器人应用下载页,网友认为这是一次恶搞。Whois 注册信息显示该域名 7 月刚完成转移,最早由匿名 X 用户 @birdabo 发现。xAI 并未持有 bot.com 等其他明显拼写错误的域名。
xAI 的 AI 队友产品 Grok Bot 在过去十天密集发布多项更新,新增语音模式与语音消息,支持 28 种语音人格。更新还包含原生连接 Google Docs、Sheets、Slides 以实现文档协作,并集成 Plaid 连接器和 1Password。团队同时推出团队共享 Bot 与财务模块。
Claude Opus 5.5 本周发布,以 88.4% 领跑 SimpleBench,并因讲解视频在时间线上刷屏。在 Terminal-Bench-Science 上,其得分从 low 档的 24% 升至 xhigh 的 62%,max 档回落到 59%;视觉评测中被列为 Anthropic 迄今最强视觉模型,成本比 Fable 5.1 低约 60%。
BioEVAL 是由 22 个研究团队共建的 PhD 级生物工程基准,用于评测大语言模型与多模态模型的实验推理能力。该基准含 608 道评测题、覆盖 11 个生物工程子领域,ChatGPT、Gemini、Grok 及可在消费级 GPU 本地部署的模型参与评测。多选题最高准确率 90%,文献综合相似度 0.72,小样本多模态推理题准确率 80%。
博主 FinanceYF5 用一条挑衅式提示词实测 Opus 5.5(开启 Max effort),要求生成一段充满动感的 15 秒动态图形视频。随后他用相同提示词在 Grok 4.7 Fast(xhigh effort)上重跑,形成两家模型动态图形生成能力的直接对比。
博主 FinanceYF5 用同一条提示词对比 Opus 5.5 的 Max effort 与 Grok 4.7 Fast 的 xhigh effort 生成动态图形视频:提示词要求制作一段 15 秒的动感动态图形视频,展示其作为顶级动态设计师的实力。两条视频可对照看两家模型在动态图形生成上的风格与质量差异。
jonathan_wilke 从 Cursor+Grok 4.7 切换到 Claude Code+Opus 5.5,用一整天日常编码工作实测这套组合。他此前从未用过 Opus 5.5,此次切换起因是众人对其没用过感到惊讶,过程中会持续分享实际体验。
AI Evaluator Forum 发布 AEF-1,作为独立第三方 AI 评估的拟议基线,覆盖访问权限、利益冲突、资助关系、回避与透明度。Anthropic 的 Dario 同期在个人博客中提出嵌入式评估员方案,承诺单向提供办公室工位、门禁徽章、公司笔记本,以及接近内部风险评估团队的权限,并将其视为 pacing 承诺可被验证的关键一步。