Cloudflare 发布 Worker Previews,为每个 Git 分支提供隔离预览环境
Cloudflare 发布 Worker Previews,为每个 Git 分支提供接近生产的隔离运行环境,各自拥有独立的代码、配置、URL、可观测性和状态。
推荐理由:每个 Git 分支都获得带独立状态与 URL 的预览环境,读者可据此了解智能体开发闭环怎样接入现有部署流程。
Cloudflare 发布 Worker Previews,为每个 Git 分支提供接近生产的隔离运行环境,各自拥有独立的代码、配置、URL、可观测性和状态。
推荐理由:每个 Git 分支都获得带独立状态与 URL 的预览环境,读者可据此了解智能体开发闭环怎样接入现有部署流程。
NVIDIA 官方博客提出 AI 安全是工程问题,需要为智能体栈各层设置可强制执行的边界、明确责任人和可验证的保护证据。文章介绍了开源安全运行时 NVIDIA OpenShell,以及在其之上构建治理层的 Cisco DefenseClaw、用于扫描与校验智能体技能的 JFrog 等 Open Secure AI Alliance 伙伴实践。
Cloudflare 宣布 Python Workers 正式可用(GA),Python 成为 Cloudflare Workers 运行时的一等支持语言。
推荐理由:Python Workers 转为正式可用,文章说明了 WSGI/ASGI 连接器与 socket 桥接如何让框架、数据库驱动和 AI 库直接在 Workers 上运行。
V7 使用 GPT-5.6 把分散的公司文件转化为智能体可用的上下文,用于完成复杂且带来源链接的工作。该方案将成本降低 78%,同时提升了准确率。
llm-keys-ui 0.1 插件发布,为 llm CLI 提供保存 API key 的网页界面,避免把 key 粘贴进智能体会话。运行 `uvx --with llm-keys-ui llm keys-ui --all` 会返回含局域网或 Tailscale 设备 IP 的 URL,之后可用 `llm keys get anthropic` 在 shell 命令中取用。
NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 首秀中,Qwen3-VL 吞吐量最高达 GB300 NVL72 的 3.7 倍。GB300 NVL72 凭 288 个 GPU 跨四机架实现 99% 扩展效率;v6.1 提交的软件优化较 v6.0 最高提升 1.6 倍性能。
TypeSafe 发布 Jev,一款用 RLCD 训练、只做决策、分类、路由与打分的模型,宣称比小规模前沿 LLM 快 100 倍以上、便宜 200 倍以上,输出 token 不计费。
曼彻斯特大学用 NVIDIA Earth-2 生成式模型训练出覆盖全英的空气污染模型,分辨率 2-3 平方公里,在 Isambard-AI 的单个八卡节点上仅用两天完成训练。
Glyph 是一个生产系统,把列描述生成与列类型标注建模为由状态图编排的协作式 LLM 智能体。Descriptor 从企业 GitHub 按需检索流水线源码来支撑生成。
TS-DFM 用能量导航替代离散流匹配训练中的盲随机跳步:轻量能量罗盘在每个中间点评估候选续写、选出最连贯的一支,且塑造仅在训练期进行,推理成本不变。在 170M 参数语言建模上,8 步学生模型的困惑度比 1024 步教师低 32%、速度快 128×,增益在多种源分布和三种规模递增的评估器上一致。其困惑度优于所有对比的离散生成基线,包括训练数据多 6× 或模型大 5× 的方法。
共享选择性持久记忆架构面向智能体 LLM 系统,只保留任务规范、数据 schema、工具配置与输出约束四类可复用上下文,工作区可按角色访问权限跨用户共享。在三个企业部署场景中任务完成率达 96%,高于无记忆的 79% 与保留完整历史的 71%。零 token 数据刷新免去重复更新的 LLM 重调用,任务耗时降低 14×;摘要驱动生成使单次调用 token 成本降低 97×。
NVIDIA 公布 DSX MaxLPS 首个部署验证:Lambda 在 19 节点 HGX B200 集群上以 16 节点的电力预算将 token 吞吐提升 24%,每瓦性能提升 23%。
Cloudflare Workers 新增资源级访问控制与 Metadata Read-Only、Content Read-Only、Editor、Admin 四个角色,可只把单个 Worker 的权限授予指定团队成员或智能体,即日起面向所有客户开放。
OpenAI 将 Habitat 从 Python 库演进为全球分布式存储平台,以支撑超过 10 亿 ChatGPT 用户。该平台每秒需处理 22M 请求。
Cloudera 与 Mistral 宣布合作,将 Mistral 模型集成进 Cloudera 混合数据平台,企业可在私有云、公有云、本地及完全气隙环境中运行推理并保留完全控制权。企业还可在受控环境内用大量专有数据训练自定义模型,并以开放权重拥有数据和模型智能。Cloudera 平台承载着 30 exabytes 的客户管理数据。
TRL v1.14 的 AsyncGRPOTrainer 已支持只训练 LoRA 适配器并把它同步到 vLLM,这篇实践在此基础上把训练与推理拆到不同机器上。训练器、两个 vLLM 副本各跑一个 HF Jobs,通过挂载同一个 Storage Bucket 传递适配器而不依赖 NCCL,中间的一个代理负责按 KV 前缀路由 rollout 并向所有副本广播适配器加载。
推荐理由:这篇实践给出跨 Job 的 LoRA 异步 GRPO 配方与代理路由细节,其瓶颈定位方法可迁移到其他异步训练部署。
该指南用 TRL 对 LFM2.5-350M 做 GRPO 微调,在 IFStruct 基准上的通过率从 22.6% 提升到 29.7%。训练约用 500 条 Nemotron 结构化输出样本、100 步,LoRA 只训练约 6M 参数,可在免费 Colab 或 Kaggle GPU 上跑,评测则在本地通过 llama.cpp 完成。
Hugging Face 发布 @huggingface/kernels,一个从 Hugging Face Hub 加载并运行 WebGPU 内核的 JavaScript 库,同时上线 207 个内核,每个内核以独立仓库发布并采用 Apache-2.0 许可。
推荐理由:文中给出与 ORT WebGPU 的算子级对比数据和加载示例,可据此了解浏览器端推理的性能空间。
作者把一份手写的 Gemma 4 纯 JAX 端口跑在 Cloud TPU v5e、v6e 和 NVIDIA T4G 上,模型代码、编译缓存和静态形状无需改动即可跨这三种加速器复用。
Quantization-Aware Healing(QAH)让 GPT-OSS 120B 压缩到 60B、量化为 MXFP4 后,在 9 项基准中 7 项超过其 bfloat16 全精度版本。
Gradio 内置的 gr.Workflow 把 AI 管线变成可运行的节点图,每个节点能单独运行并就地显示中间结果,同一张图同时是 REST API 和一键部署到 Hugging Face Spaces 的入口。
推荐理由:Gradio 把多步 AI 管线做成可视化节点图,并自动生成 REST 接口与部署入口,读者可据此了解这套搭建方式。
Meta 发布 MetaRoCE,这是一款为 AI 工作负载在通用以太网上从零设计的 RDMA 传输协议,并通过 OCP 开放协议规范、软件参考实现 libsoftmetaroce 和合规测试套件。
Meta 公布 MTIA 300,这是其自研芯片家族中首款面向推荐与排序模型训练优化的加速器。芯片封装内集成两个网络 chiplet,各含 6 个定制 800 Gbps RDMA NIC,总 I/O 带宽 1.2 TB/s,另有 16 个消息引擎(ME)独立承担通信,使大 GEMM 与集合通信并发时计算吞吐下降小于 0.5%。
Hugging Face 公开 Papers with Code 的搜索架构,用 PostgreSQL 全文检索加 pgvector 向量检索组成混合检索,由 RRF 融合两路排名。
Liquid AI 发布 LFM2.5-DSpark 草稿模型检查点,覆盖 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 三个模型,通过投机解码在不改变输出质量的前提下最高提升 3.18 倍吞吐。
约束感知 GPU 分配器让相同硬件与同一批负载下的利用率最多提升 33 个百分点,优先加权产出最多提升 105%。五个竞争场景中,利用率从 52–85% 升至 72–88%,优先加权价值平均提升 52%,最高 105.1%。最强单例是 8 GPU 训练密集型负载,利用率由 53.6% 升至 87.0%,关键在于实时推理按需求曲线分配、批式任务按优先级跨整个调度周期放置。
ALTK-Evolve 与 ACE 都让智能体从自身轨迹中学习,区别在注入方式:前者按任务检索少量高支持度指南,后者每步注入完整 playbook,因而 Token 更省。
Mistral 公布三项推进 AI 主权的举措:Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行;Mistral Priority Tier 进入公开预览,为关键业务提供带 SLA 的承诺服务等级和自定义速率限制。
NVIDIA 发布 Magpie TTS Multilingual,一款 364M 参数的开放权重语音合成模型,支持 12 种语言,新增现代标准阿拉伯语、韩语和巴西葡萄牙语。官方数据显示 B200 单流首音频延迟 32ms,64 并发流下 TTFA 239ms、吞吐约 320 倍实时。模型提供 Hugging Face 开放权重与 NVIDIA NIM 生产部署,并可用 NeMo 微调发音和音色。
Multiverse Computing 提出离线缓存教师 top-100 logits 和融合分块 KL 损失两项改动,让知识蒸馏不必同时把教师与学生模型放在显存里。
Baseten 成为 Hugging Face Hub 支持的 Inference Provider,首批上线对话与文本生成任务,可调用 Kimi K3、DeepSeek V4 Flash、GLM-5.2 等开源权重 LLM。
Meta 公布广告排序的多阶段序列建模架构,把离线用户建模与在线排序解耦,并在真实广告流量上呈现出随算力对数线性增长的 LLM 式扩展规律。该架构用稠密 tokenization 与 target-aware 多头注意力融合稀疏特征和用户行为序列,让模型直接从数据学习特征交互,减少对手工特征的依赖。
企业 AI 的下一道真实约束已从模型智能转向 GPU 利用率:GPU 按日历小时计成本,产出却只按计算小时计。这与航空业靠飞机利用率决定生死的结构一致,自购 GPU 可把随 token 线性增长的 API 成本换成固定资本支出。但按峰值规模采购的集群在需求不持续时,满载 GPU 仍会浪费大量产能。
Hugging Face 将 Nunchaku Lite 集成进 Diffusers,可用 from_pretrained() 直接加载 SVDQuant 4-bit 量化检查点,无需单独推理引擎或本地 CUDA 编译。
推荐理由:原文给出 BF16 与 4-bit 量化在显存和端到端延迟上的对比数据,可据此判断消费级显卡跑扩散模型的实际收益。
同一 CodeAct 智能体在 AppWorld Test Challenge 的 417 个任务上,Claude Sonnet 4.6 共花费 $79,GPT-4.1 则为 $155,尽管后者 token 定价更低。
Hugging Face 博客发布 PyTorch 性能分析系列第三部分,用 profiler 轨迹逐一对比朴素 attention、in-place 掩码以及 SDPA 的 math、efficient、flash 和 cuDNN 四种后端实现。
推荐理由:逐层对比四种 attention 后端的 profiler 轨迹,提供先做预期再验证这一可迁移的性能排查方法。
Hugging Face 表示 vLLM 的 transformers 建模后端现已在多个 LLM 架构上达到甚至超过 vLLM 手写原生实现的吞吐。对比覆盖 Qwen3 4B 单卡、32B 张量并行、235B FP8 MoE 数据加专家并行三种部署,模型只需加 --model-impl transformers 即可启用,且仍可用于训练。
推荐理由:文章给出 transformers 后端与 vLLM 原生实现在三种 Qwen3 模型上的吞吐对比,便于了解免移植推理的实现路径。
Hugging Face 与 Amazon SageMaker AI 打通深度链接,开发者在受支持模型页点击 Customize 或 Deploy 按钮即可进入 SageMaker Studio,所选模型自动预加载。
微软在 Build 2026 上宣布在 Foundry 上线 Hugging Face 模型集合,这是一个每周刷新的开源权重模型目录,可一键部署到 Foundry Managed Compute。
Hugging Face 与 SkyPilot 联合推出新的 SkyPilot 存储后端 store: hf,用户用单个 hf:// URL 加上已有的 HF_TOKEN,即可把 Bucket 或任意模型、数据集、Space 仓库挂载进 SkyPilot 任务,在 20 多个云、Kubernetes、Slurm 和本地集群上运行。
推荐理由:把数据存在 Hugging Face、算力放到任意云,读者可了解跨云读取为何不再产生出网费用。