当只有解码器时每个决策都像生成:作者主张为智能体路由引入决策层
作者 Lambert Leong 主张,智能体系统中的路由这类有限决策不应交给自回归解码器逐 token 生成,而应按分类问题由决策层处理:给定显式候选路由、返回带类型的分数,再按阈值或弃权策略交给确定性软件分支。
作者 Lambert Leong 主张,智能体系统中的路由这类有限决策不应交给自回归解码器逐 token 生成,而应按分类问题由决策层处理:给定显式候选路由、返回带类型的分数,再按阈值或弃权策略交给确定性软件分支。
作者开发了部署前风险 agent DeployMind,把部署结束后的复盘反馈转成可召回的反思记忆,供未来类似部署前调用。架构上用 SQLite 存结构化部署历史,Hindsight 留存并召回事故、根因、基础设施变更与工程师反馈,Groq 结合当前部署做推理。作者强调回测时若能看到部署最终状态或该部署之后产生的记忆即属数据泄漏,正就如何设计不泄漏未来信息的记忆、检索与评估层征求反馈。
一位现任 AWS 员工在访谈中称,Bedrock 的核心卖点是原生集成 AWS 体系,提供数据驻留合规、HIPAA 等企业级标准以及统一账单与用量管理。他还表示模型切换成本已大幅下降,非技术场景并不一定需要旗舰模型。
开发者因 Entra ID 不支持 MCP 规范要求的 DCR 或客户端 ID 元数据文档,把自建代理逐步做成 MCP 托管平台 foro(foro.sh)。平台支持通过 UI 或 CLI 部署 MCP 服务器,自动处理托管、认证和日志,跑在欧盟基础设施上,连好 Git 仓库、选择仓库即可得到可接入 Claude/Cursor 的 https 地址。
CData Software 推出 Connect AI Gateway,让 IT 团队在一处注册模型、MCP 服务器与智能体并设定各自可用规则,现已进入 early access。
Cloudflare 推出 Application Profiles,用 Schema Profiles 学习 HTTP 请求的结构与格式、识别偏离,以正向安全策略大幅缩小攻击面。
Cloudflare 正在开发内部工具 CryptoLabe,用 AI 扫描代码库中的加密用法,为 2029 年实现全面后量子就绪做规划。该工具分发现和分析两个阶段,运行在 Cloudflare Workers、Durable Objects 和 Workflows 上,并通过 AI Gateway 调用 Workers AI 上的开源权重模型。
HPE 提出,当 AI 从试验走向持续运行的生产负载,企业应测算自有算力在何种使用量上比按 token 逐次购买更经济。Deloitte《2026 企业 AI 现状》显示,2025 年员工使用 AI 的比例上升 5%,至少 40% AI 项目投产的公司占比预计在半年内翻倍。企业投入资本前需判断需求是否稳定可预测,以及能否通过采用和治理让算力保持满负荷。
NVIDIA BioNeMo 团队为 MoE 类稀疏模型推出 GPU 执行优化方案,在 8 张 B200 GPU 上把 Mixtral-8x7B 训练吞吐最高提升 2.21 倍。对比基线为 Hugging Face BF16,方案旨在加速生物基础模型的高效训练。
Reddit 用户 MedicineBlogscanner 用手机、Mac 与 PC 组成的异构设备,跑通了 4-bit 量化的 gpt-oss-120b,该模型官方要求至少 60GB 内存。
开发者 @LodestoneRock 通过残差数学重排,可把 DiT 等 transformer 残差模型转换成更高效的 U-Net 风格结构,中间层只处理约 1/4 的 token。推理速度比原模型快 2.3 倍,配合快速校准(calibration)能恢复大部分原始输出质量。该方法理论上适用于任意 transformer 残差模型。
新华三发布 UniPoD S81000 X1 超节点,单 Scale-Up 域最大支持 40 张国产加速卡。该产品通过 4 个 Scale-Up 专用交换 Tray 实现一级 CLOS 全互联,任意两卡间 P2P 带宽达 448GB/s,40 卡聚合为 5760GB 统一编址显存池,支持 FP8,总算力可达 28P FLOPS。
LW2S 将多智能体 LLM 工作流中的组件省略建模为反事实信用分配,用受控跳过干预学习动作级安全模型,并结合留出集校准与领域内建护栏选择跳过步骤。在数学推理、选择题问答与代码生成、两个指令模型家族上,它降低了记录 token 成本,整体工作流准确率持平或提升。早期跳过被拒时,控制器仍可继续执行并重新考虑后续组件。
Kangwook Lee 团队租下韩国一间网吧(PC bang),招募超过 1000 名真人玩家与早期版本对局,为可在端侧消费级 GPU 上运行的游戏 AI「Ally」收集 on-policy 数据。团队借鉴 DAgger 思路迭代采集轨迹并纠正后继续训练,将模型蒸馏至 2B 参数规模,还针对边缘设备 KV 缓存预算紧张的问题专门开发了上下文压缩算法。
Vercel 创始人 Guillermo Rauch 宣布团队已把梅赛德斯-AMG PETRONAS F1 车队官网迁移到 Vercel,构建速度提升约 70%,页面绘制(paint)速度提升约 75%。这是一个包含大量原服务商特有模式的成熟生产级站点,迁移以尽量少人工干预为原则,实际工作不到一周完成。团队还从迁移过程中提炼出两个 AI skills,计划随后开源。
吉利智充 C12 在杭州、上海、宁波、嘉兴、西安五城同步落地,单枪峰值功率 2250 千瓦,10% 至 97% 补能平均用时 8 分 40 秒。该技术依托吉利与阶跃星辰联合开发的全域能源大模型“星睿 PowerMind 能源大脑”,AI“边充边养”使充电最高温度低于 65℃,电池循环寿命提升 20% 以上。领克 10、极氪 001 搭载 900V 神盾金砖超短刀电池,最高充电倍率 12C。
Hugging Face 官宣 transformers 库新增对 GGUF(llama.cpp 量化格式)的支持,用户可从 Hub 选取 GGUF checkpoint,用 from_pretrained 在本机以熟悉的 transformers API 生成。
推荐理由:transformers 接入 GGUF 后,本地量化模型可在熟悉的 API 下加载与调试,读者可据此判断现有部署路径是否要调整。
ornith-ai 在 Hugging Face 发布三个 DFlash 草稿模型检查点,为 Ornith-1.5-9B、Ornith-1.5-397B 和 Ornith-1.5-35B-A3B 提供投机解码加速。DFlash 草稿模型并非独立语言模型,须与目标模型在支持 DFlash 的推理环境中配合运行,仓库同时附带 serving 配置。
antirez 建议企业自建 DGX Spark、Mac Ultra 本地机群,作为公司 API 配额用完后的算力托底。他在 X 上回复企业本地 AI 部署讨论时表示,公司购置一批这类设备组成机群,员工在公司 API 配额耗尽后可继续用这些本地算力干活,避免工作中断。
作者用自建计算器估算 Meta Muse 免费成本:按每天 15 分钟使用、1000 万 token 消耗,每用户约 51 美元,Meta 需从每用户赚 70 美元才能维持当前利润率。基线来自 SemiAnalysis、DeepSeek DSec、AWS 定价与 Meta 财报。作者称 Muse 沙盒 CPU 平均利用率不足 5%,一个物理核可支撑 25 个沙盒核。
开发者发布基于 llama.cpp 的开源工具 Carla v0.1.0,一个完全本地运行的 loom TUI 与角色实验室。其流程为基座模型加种子文档、分支式续写再到对话式 loom 以涌现 AI 角色,支持 /loom [count] 并行多轮对话,由 Jev 按自定义行为规范评估循环、spiraling 与有害语言。作者称目标是为下一阶段的训练做准备。
研究员 YouJiacheng 转发「124M 模型用了 65B embedding」的帖子,戏称继续 scale 需要 AFED,即 Attention、FFN、Embedding 分离(disaggregation)。这是对当前推理架构分离趋势(如 PD 分离、KV cache 分层)的调侃式延伸,若极端超大 embedding 的用法成主流,embedding 层或需独立部署与扩展。
Qdrant 发布研究预览版 Constella,让检索系统在更换查询端 embedding 模型时无需对全部文档重新嵌入、重建向量索引。其中 Nano 与 Zero 两个模型专门训练为与 Stella 的文档嵌入兼容,为检索系统的模型迭代提供了更灵活的方式。
Uber 工程团队公开特征一致性框架 feature logging,解决训练与推理特征不一致问题:生产环境特征值可能因来源、格式(如 en vs en-US)或计算逻辑差异而与训练数据偏离。该框架从在线推理管道直接产出训练数据,形成训练数据飞轮,在线特征含 userid、语言、餐厅元数据及预计算的历史点击/下单行为特征。Uber Eats 排序模型每秒服务约 800 万次预测。
Google 在开发者博客给出在树莓派 5 上用 LiteRT 与 Gemma 运行端侧 AI 的部署指南。据文中数据,Gemma 4 E2B 在 LiteRT-LM 下达到 99 tokens/sec prefill 与 9 tokens/sec decode,峰值内存 1432 MB。
HeyGen 与 Google Cloud 把 18B 参数的 Avatar IV 移植到八芯片 Trillium(v6e)主机,提速 1.86×。Avatar IV 是驱动说话头视频的扩散模型栈,以 Web 和 API 提供 720p/1080p、25fps 流式渲染。迁移经 torchax 前端完成,性能接近 8×H100 生产环境,视频成本效率最高提升 25%。
Google 开发者博客发布指南,介绍如何用 Agent Development Kit(ADK)构建零信任 AI 智能体。文章给出三层防护实现:Cloud KMS 硬件密钥为每次数据库写入签名、gVisor 用户态沙箱隔离动态生成代码、确定性语义网关在模型调用和写库前后做规则校验,并把安全策略写成 CI/CD 中的回归测试。
推荐理由:文章给出可用 HMAC 本地复现的三层防护实现,读者可据此核对自家智能体写库与代码执行的信任边界。
Google Cloud 将原生 TPU 支持集成进 vLLM,在 Cloud TPU 上实现企业级精度的长上下文多模态嵌入推理。该方案以 Qwen3-Embedding-8B 为目标模型,支持文本 4K+ tokens、多模态文本加图像 15K+ tokens 的超长上下文,并以余弦相似度验证跨硬件数值对齐,文本目标阈值 ≥0.999、多模态 ≥0.995。
Google for Startups AI Agents Challenge 结束后,Google 从各赛道排名靠前的提交中总结出四个工程模式,分别是以 MCP 双向暴露工具、事件驱动并发、备用模型走同一校验函数和分级路由。
推荐理由:从真实挑战赛代码提交中提炼出四个可复用的智能体工程模式,覆盖 MCP 双向暴露、事件驱动并发与分级路由。
Google Cloud 的 Gemini Enterprise DevEx 计划以 Sprint 形式按开发者真实路径压测自家工具,本轮聚焦智能体治理,梳理出身份预置、Agent Registry 注册、Agent Gateway 绑定、政策与 Model Armor 内容安全、请求验证 5 条端到端工作流。
客服 Agent 持久记忆实战用 Hindsight 分层存取:MemoryService 为每个客户建独立 memory bank,HindsightClient 封装对 Hindsight Cloud 的调用。
Together AI 宣布阿里 Qwen3.8-Flash 本月剩余时间全线 6 折,并建议开发者趁降价跑评测。该模型定位高并发应用场景,如编码助手与协同办公助手,主打在低成本下优化输出质量。
开发者在2004年代魔兽怀旧服私服模拟器中搭建多智能体生态,约750个角色各拥有独立人格、情绪、记忆、关系与目标,同时在线400多个,由本地运行的Qwen小模型驱动感知、推理与游戏内动作。这些智能体能互相记住并谈论彼此,累计已产生约22.1万条世界记录。作者随后复盘了系统面临的感知延迟与负载调度等工程挑战。
Pydantic 作者 samuelcolvin 宣布开源 Monty(github.com/pydantic/monty,已获 8.4k star),一个用 Rust 编写的安全 Python 解释器与沙箱,专为运行 LLM 生成的代码设计,用以替代基于容器的沙箱并避开其延迟、复杂度与成本。
推荐理由:正文给出 Monty 的开源与商业两种形态,以及容器沙箱在延迟和成本上的对比,便于判断适用场景。
SemiAnalysis 分析指出,GLM-5.3 的稀疏注意力虽降低了 KV cache 带宽与访存需求,但 top-k 选择需完整上下文驻留 HBM,内存容量瓶颈未被消除。
Amazon Web Services 的 Amazon CloudWatch Omni 已正式可用,把可观测性问题从系统是否运行转向智能体为何给出错误回答。它内置 17 个评估器,对连贯性、有用性、忠实度和路由正确性等指标打分,并支持从单条 trace 创建评估数据集、持续针对线上流量运行评估。
Autoheal 完成 $7.9M 种子轮融资,由 Innovation Endeavors 领投,其平台用 Evaluator agent 和 Healer agent 评估并修复企业软件工厂中的 AI 智能体。
NinjaTech AI 推出 SuperNinja Enterprise,让大型企业以固定年费在自有云环境中运行 AI 员工,价格还包含其所需的 GPU 算力。
Muslim 是已部署的阿拉伯语语音 AI 平台,向真实用户提供有出处、可溯源的伊斯兰知识,实测 124 例诵读校验准确率 98.4%,端到端语音延迟 0.9-1.7s。
ServiceNow AI 平台安全产品副总裁 Bhakti Pitre 在 Okta 的 Oktane 活动上表示,应对失控 AI 智能体不能只靠"一键关停",需结合风险与业务上下文决定暂停还是撤销权限。