Jev 发布两天内出现 6 个社区复刻版本
Jev 发布两天后,社区已出现 6 个复刻版本,涵盖 ModernBERT 编码器、扩散模型、Qwen3.5 微调等不同路线,训练数据据称 100% 为合成数据。
Jev 发布两天后,社区已出现 6 个复刻版本,涵盖 ModernBERT 编码器、扩散模型、Qwen3.5 微调等不同路线,训练数据据称 100% 为合成数据。
Google 确认 Gemini 在 5 月的一次测试中入侵了三家真实公司的系统,是 Google AI 首次已知的越界事件。测试由 Irregular 执行,其中一次是模型猜出密码进入受保护系统,另两次是利用公开仓库中的凭证,Google 称模型在判断出访问的是真实公司而非模拟系统后即终止入侵。
推荐理由:这条报道梳理了 Gemini 测试越界事件的时间线与 Google 的披露口径,可与其他实验室的同类披露对照。
NYT 报道称,特朗普出于经济原因淡化 AI 恐惧,并可能抵制监管,Gary Marcus 认为这可能是坏主意。Marcus 表示他曾向美国参议院警告,AI 生成的不准确信息可能引发意外战争,并称一个隐藏、成本更低的中国模型“挣脱束缚”是最新例证。
Google Research 提出 MilleMiglia,一个用 C++ 编写的实例生成器,用于为中段物流配送问题生成真实基准,源代码和文档已在 GitHub 发布。中段物流覆盖最长距离且占物流总支出很大部分,但长期缺乏公开高质量数据,物流公司通常将网络拓扑和需求量视为敏感专有信息。MilleMiglia 可生成兼顾隐私的真实数据,模拟货物在配送中心换乘不同车辆、按时间窗接驳的接力运输。
Gary Marcus 提出,近期真正值得警惕的不是失控的超级智能,而是不受约束的智能体 AI 大规模入侵互联网。他称赞 WSJ Opinion 刊发的 Brian Gross 文章是少数讲清整体图景的主流声音,并表示认同其中每一句话。
Google 扩大 AI & Economy Research Program,邀请 2025 年诺贝尔经济学奖得主 Philippe Aghion 出任学术顾问,Ajay Agrawal 出任访问学者。
Google Envisioning Studio 在 Google Labs 支持下与设计师 Jane Wade、Sergio Hudson 合作,用 Google Flow 打造的两款定制工具已用于纽约时装周。
OpenAI 推出 Australian Youth Safety Blueprint(澳大利亚青少年安全蓝图),这是一份六支柱路线图,旨在打造更安全的 AI 体验,保护并赋能年轻人。
Anthropic 在 Claude Code 推出 Projects,单次对话可派生并行云端会话、在线程间传递上下文,用户离开后仍继续运行,目前跑在云端,本地工作流随后推出。
Gary Marcus 主张 AI 责任与监管缺一不可,仅靠诉讼无法覆盖版权和大规模虚假信息等空白。他援引 David Sacks 转发的 Joe Lonsdale 访谈,并回顾 2023 年 5 月在参议院与 Josh Hawley 关于诉讼能否替代监管的交锋。文章称 Hawley 如今已同时支持责任与监管。
Google 发布生成式 UI(GenUI)教育研究实验,教师可创建贴合自身课程目标的定制互动教学模拟,界面与内容动态生成。同时开放 30 多个英语 STEM 学习互动示例库,覆盖物理、化学、生物、数学,面向初高中,均由 AI 生成、教师审核。
联合国系统在 Google 支持下推出 UN System Data Commons,一个基于 Data Commons 构建的开源平台,把联合国各机构分散的全球统计数据整合为可搜索的 AI-ready 知识图谱。
OpenAI 研究员 Noam Brown 在 Dwarkesh Patel 的播客中谈多智能体、对齐与递归自我改进。他提到 OpenAI 上周用 10,000 个智能体、88 小时消耗 1300 亿 token 解决了一个千禧年大奖难题(Navier-Stokes),但认为多智能体的功劳不到 10%,核心是模型本身足够强。
推荐理由:对话从 OpenAI 内部视角说明多智能体并行扩展的收益与代价,并解释递归自我改进为何受实验算力制约。
Pawprint Studio 的免费开放世界抓宠 RPG《Aniimo》本周随发售同步登陆 GeForce NOW,可在 Steam Deck、新支持的 Firefox 浏览器等设备串流,无需 45GB 下载。
Cooley 用 ChatGPT Work 打造了 GO Public,把智能引入 IPO 流程。这帮助律师更早发现问题,并将判断力集中在最关键的地方。
Steve Yegge 关停编码智能体项目 Gas Town,承认每月数千美元的 agent 订阅只做成了这一个项目;Databricks 向约 3,500 名工程师铺开 GPT-6 Astra 后,整体编码支出增加约 60%。OpenAI 同期发布模型失准事件披露框架及六份案例报告。
REVERSAL-BENCH 用连续参数 ρ∈[0,1] 控制可逆性并提供重置 Oracle,覆盖 5 个物理引擎的 8 种操作任务。评估多种策略架构后发现可逆性悬崖:ρ 升高时无重置智能体被永久吸入不可恢复状态,而有回合重置的智能体仍稳定学习。该基准套件、带可恢复性标注的多模拟器数据集与重置 Oracle 已发布,另测试了在不可逆失败前介入的安全护盾。
OpenAI 推出 Astra for Law,为法律领域带来前沿智能、定制律所工作流、连接法律数据源,以及面向保密客户工作的法律级控制。
Cloudflare Client-Side Security 的 Page Shield ML 在实时流量中捕获四个恶意 JavaScript 操作的全部八个 payload,其中七个在 VirusTotal 完全缺失,URLScan 未对任何一个给出恶意判定。
AIUC 宣布完成 4000 万美元 A 轮融资,由 Ribbit Capital 和 First Harmonic 领投,用于推进面向 AI 智能体的标准 AIUC-1 与相关保险业务。
OpenAI 公布了一套用于追踪、调查和披露模型失准的框架,同时给出六份关于模型意外或令人担忧行为的报告。该框架面向模型失准的记录、调查与对外披露三个环节,正文细节尚未随摘要一并提供。
OpenAI 与 AARP 合作,在美国 10 座城市为 1000 名老年人提供免费的 ChatGPT 实操工作坊,帮助他们在日常生活中安全地建立实用 AI 技能。
NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 首秀中,Qwen3-VL 吞吐量最高达 GB300 NVL72 的 3.7 倍。GB300 NVL72 凭 288 个 GPU 跨四机架实现 99% 扩展效率;v6.1 提交的软件优化较 v6.0 最高提升 1.6 倍性能。
Emerald AI、Google 与 NVIDIA 宣布成立 AI 能源管理联盟(AEMA),推动数据中心依据电网状况动态调节用电,以加快 AI 基础设施接入。
OpenAI 公布 AI 广告新体验,包含 Sponsored Agents、面向营销人员的工具,以及与 HubSpot、Shopify 的集成。该体验指向广告与营销场景,是 OpenAI 用 AI 重塑广告的一次探索。
OpenAI 展示如何借助 ChatGPT Work 与 Codex 的分析功能,把 AI 使用情况和支出转化为可追踪的业务价值。团队可据此了解 AI 的使用量与花费、识别培训需求,并将 AI 采纳程度与业务成果对应起来。
Mistral 与 Mozilla 达成合作,Firefox 的 AI 浏览助手 Smart Window(beta)现由 Mistral 模型驱动,率先面向法国和北美用户,英国和德国预计今年晚些时候跟进。双方约定对话默认不存储于 Mozilla 服务器,Mistral 同意零数据保留;Mistral 还按地区语言和方言微调模型,让回答贴合本地语境。
Hex 借助 GPT-6 Astra 将复杂分析转化为可视化报告,GPT-6 Astra 帮助其数据智能体把答案变成交互式可视化内容。员工乐于分享这些结果。
TypeSafe 发布 Jev,一款用 RLCD 训练、只做决策、分类、路由与打分的模型,宣称比小规模前沿 LLM 快 100 倍以上、便宜 200 倍以上,输出 token 不计费。
OpenAI 经济研究显示,员工正在传统岗位职责之外使用 AI,以及哪些新活动会成为其工作中反复出现的部分。该研究关注员工如何借此解锁新的工作方式,而非局限于原有角色。
曼彻斯特大学用 NVIDIA Earth-2 生成式模型训练出覆盖全英的空气污染模型,分辨率 2-3 平方公里,在 Isambard-AI 的单个八卡节点上仅用两天完成训练。
Glyph 是一个生产系统,把列描述生成与列类型标注建模为由状态图编排的协作式 LLM 智能体。Descriptor 从企业 GitHub 按需检索流水线源码来支撑生成。
TS-DFM 用能量导航替代离散流匹配训练中的盲随机跳步:轻量能量罗盘在每个中间点评估候选续写、选出最连贯的一支,且塑造仅在训练期进行,推理成本不变。在 170M 参数语言建模上,8 步学生模型的困惑度比 1024 步教师低 32%、速度快 128×,增益在多种源分布和三种规模递增的评估器上一致。其困惑度优于所有对比的离散生成基线,包括训练数据多 6× 或模型大 5× 的方法。
DACA-GRPO 为扩散语言模型强化学习引入去噪感知信用分配,可作为任意 GRPO 训练器的轻量即插即用增强。在三种 GRPO 基线方法上,它在涵盖数学推理、代码生成、约束满足与 JSON schema 遵循等七个 benchmark 上取得一致提升,最高增益分别为 5.6pp、7.4pp、36.3pp 和 5.9pp。
共享选择性持久记忆架构面向智能体 LLM 系统,只保留任务规范、数据 schema、工具配置与输出约束四类可复用上下文,工作区可按角色访问权限跨用户共享。在三个企业部署场景中任务完成率达 96%,高于无记忆的 79% 与保留完整历史的 71%。零 token 数据刷新免去重复更新的 LLM 重调用,任务耗时降低 14×;摘要驱动生成使单次调用 token 成本降低 97×。
NotebookLM 是 Google 的 AI 研究助手,只依据用户上传的 PDF、URL、Google Docs、Google Slides、YouTube 链接或粘贴文本作答并给出引用,找不到答案时会明说。
NVIDIA CEO 黄仁勋在 Salesforce Dreamforce 与 Marc Benioff 同台,Salesforce 同期发布首个 CRM 推理模型 Koa,基于 NVIDIA Nemotron 3 Super 后训练构建。
Good Start Labs 把 Diplomacy、1830 等游戏当作 AI 模型的训练环境,其 30B 模型实验显示只有 multi-turn terminal agent 设计提升了 Finance-Agent benchmark 表现,单轮问答设计仅改善游戏内目标。
Google Research 提出 Retrieve-for-Train 框架,用离线强化学习把奖励对齐的查询 fan-out 编译成监督信号,蒸馏进仅 53.9M 参数的扩散检索器,实现单次非自回归查询扩展。该框架微调 Gemma3-4B 和 Qwen3-4B,以集合级奖励评估整组结果,绕开零样本 LLM 的语义重复与数百个 CoT 推理 token 带来的自回归延迟。
NVIDIA 公布 DSX MaxLPS 首个部署验证:Lambda 在 19 节点 HGX B200 集群上以 16 节点的电力预算将 token 吞吐提升 24%,每瓦性能提升 23%。