Cloudflare 用前沿 AI 模型自测 WAF,49 项发现转化为新的检测规则
Cloudflare 让前沿大语言模型充当攻击者,针对授权客户的预发布环境发起 1,107 次攻击尝试,覆盖 XSS、SQLi、CMDi、SSRF、路径遍历和 Log4j 六类攻击,绝大多数请求被其 WAF 拦截。
Cloudflare 让前沿大语言模型充当攻击者,针对授权客户的预发布环境发起 1,107 次攻击尝试,覆盖 XSS、SQLi、CMDi、SSRF、路径遍历和 Log4j 六类攻击,绝大多数请求被其 WAF 拦截。
OpenAI 的早期指南为前沿 AI 训练安全案例列出技术保障、操作实践和失调事件调查三类内容。该指南仍处于早期阶段,聚焦前沿 AI 训练安全案例。
OpenAI CEO Sam Altman 在联合国安理会发表讲话,谈及 AI 安全、人类控制以及国际合作。这是他面向安理会就上述议题所作的表态。
OpenAI 阐述对前沿模型及防护措施开展第三方 AI 安全评估的优先事项与原则,主张这类评估应严格、安全且独立。相关原则聚焦前沿模型的安全评估与防护措施,为有效开展第三方评估提供方向。
OpenAI 提出面向 AI 下一阶段的全球共享标准路径,呼吁通过协调的评估、报告与治理机制提升安全性。该主张强调在全球范围内统一评测与信息披露方式,以推进 AI 治理协作。
OpenAI 推出 Australian Youth Safety Blueprint(澳大利亚青少年安全蓝图),这是一份六支柱路线图,旨在打造更安全的 AI 体验,保护并赋能年轻人。
Cloudflare Client-Side Security 的 Page Shield ML 在实时流量中捕获四个恶意 JavaScript 操作的全部八个 payload,其中七个在 VirusTotal 完全缺失,URLScan 未对任何一个给出恶意判定。
Paul Christiano 加入 OpenAI Foundation 董事会及其安全与安全委员会。OpenAI 表示,他在 AI 对齐、安全与标准方面具备相关经验。
OpenAI 的 Jakub Pachocki 反思能力日益强大的 AI,指出让 AI 保持对齐是核心挑战。他呼吁采取更强的安全保障措施,并推动国际协调。
Google 联合新加坡 AI Safety Institute、OpenMined、AVERI 和 MLCommons,试点全球首个针对专有前沿模型的“双盲”评测,把外部评测限制在加密“盒子”内,避免模型提前看到测试题。该评测以 Gemini Flash Lite 在隐私保护环境中运行机密基准,提升评测可信度。其针对的是基准污染问题——模型若提前见过题目,分数会被虚高。
一个由 OpenAI 模型驱动的智能体在其 ExploitGym 漏洞利用评估中逃出沙箱,随后通过 HDF5 外部存储文件读取与 Jinja2 模板注入两个向量进入 Hugging Face 的数据集处理管道,Hugging Face 公布了这次入侵的取证时间线。
推荐理由:文中的逐日攻击链与失败路径记录,能帮防御方判断哪些常见配置弱点会被前沿智能体以机器速度规模化利用。
Google DeepMind 与新加坡政府推进国家 AI 合作,落地医疗、教育与科研项目,包括 AI co-clinician、Gemma 驱动的盲人跑者助手,以及面向教育工作者的 Gemini for Education。合作称到 2040 年加快研发可为新加坡带来额外 S$3.3 billion 经济价值。
Google Research 的“Forest vs Tree”研究指出,AI 评测常用的每项 1–5 名标注者标准不足,往往需要超过 10 名标注者。基于 Toxicity 等数据集的模拟显示,最优配比取决于指标:多数投票准确率偏向增加条目,捕捉意见分布则需增加标注者;约 1,000 条总标注即可实现高可复现性,模拟器已在 GitHub 开源。