智能体 AI 正在突破按 token 计费,企业需为成本变化提前规划
分析师 Zeus Kerravala 指出,智能体 AI 每次任务的 token 消耗可达单次推理调用的 10 到 100 倍,按 token 计费让成功上线的 AI 项目成本失控。
分析师 Zeus Kerravala 指出,智能体 AI 每次任务的 token 消耗可达单次推理调用的 10 到 100 倍,按 token 计费让成功上线的 AI 项目成本失控。
MoSAR 把注意力近似视作几何问题,用输入条件的 query/key 路由器在短、中、全局三种模式间混合,学习连续的距离相关注意力场,并可在训练后经 top-1 路由离散化。在 500M 参数匹配模型的预训练实验中,它未降低语言建模质量,困惑度优于 dense RoPE,长度外推下优于 ALiBi 等基线取得最佳困惑度。
G²PTQ 提出统一的大语言模型训练后量化框架,在全局监督的块级目标下融合一阶与二阶信息,并在量化每个 Transformer 块前刷新梯度与 Hessian 估计。它引入 trust-region 缩放机制约束梯度步长,防止权重更新爆炸。在多种模型族和位宽上,G²PTQ 与全精度模型的对齐优于 SOTA 基线。
REALMS 是已部署在企业客户数据平台上的对话式受众规模测算系统,可用自然语言查询数百万画像、数千属性并在几秒内返回精确计数。系统由基于嵌入向量搜索的属性检索、带模板化上下文学习的 LLM NL2SQL 流水线、schema 标准化三部分构成。真实企业数据评估显示属性检索召回高、SQL 执行准确率高、延迟低,此前需数小时的任务可实时完成。
一位用户在 Reddit 求助:在 4080 Super + 32GB 内存上尝试的图生视频(I2V)方案全部失败,生成一个 4 秒片段要数小时,或直接 OOM 跑不完。帖子正寻求可行的本地视频生成配置建议。
Google MaxText 团队在 Cloud TPU 上从头复现了 Ai2 的 Olmo 3 7B 预训练与中期退火,阶段 1、阶段 2 的损失曲线与 Ai2 公开参考在留出评估上对齐。
boxd 发布一段 60 秒演示,宣称一整个 Linux 机器启动时间不到 10 毫秒。该产品定位为可组合的轻量虚拟机,配置一次工具和数据后可按需批量拉起,并支持运行中途 fork、休眠、按流量唤醒和团队共享,安装只需一行 curl 命令。
SK 海力士凭借在 CoWoS 2.5D 先进封装平台上的 HBM5 内存验证,获台积电“3DFabric-HBM 集成”类别年度合作伙伴奖,连续第二年获奖。该公司还在活动上展示 12Hi 48GB HBM4E 等新品,并表示正为 PCIe Gen6 / Gen7 固态硬盘准备基于 Chiplet、以 UCIe 互连的控制器方案。
Dell Technologies 将于 10 月 6–7 日举办“AI Data Platform Event: From Ambition to AI at Scale”线上活动,theCUBE 同步直播并由分析师 Dave Vellante、John Furrier 进行独家访谈。
作者提出用对抗验证检测数据漂移,给训练集打 0、生产批次打 1 训练分类器,AUC 接近 0.5 说明分布一致,超过约 0.65 则说明特征间的联合关系已变化,并能指出具体是哪些列。
生产 text-to-SQL 流水线中部署的 gpt-4o-mini LLM-as-judge 与人工标注一致性极低,分歧富集集上 Cohen's kappa 仅 0.04、均匀随机抽查 0.42,并误标 77.1% 的人工判定 FAITHFUL 案例。
CSCWD 通过跨尺度通道知识蒸馏,把 YOLO11m-P2 教师的高分辨率空间表征迁移到 YOLO11n 学生,且不改变其推理架构。在 Drone-vs-Bird 协议下,YOLO11n-CSCWD 达 50.17% mAP@0.5 与 59.73% recall,较 CA-YOLO11n baseline 提升 2.92 和 3.55 个百分点。
theCUBE 将于 9 月 29 日直播 Dell AI Leadership Symposium,Dell 与 Deepgram、Intel 等企业代表将讨论把 AI 推向生产环境所需的基础设施与运营决策。
CoreWeave 完成 Nvidia Vera Rubin NVL72 在 CoreWeave Cloud 上的行业首次 bring-up 与验证,推进面向智能体 AI 的全栈 AI 云布局。
AWS 的 NarrateAI 团队公开了在 Amazon Bedrock 上实现生产级 LLM 质量保障的五种技术,覆盖自适应流水线编排、跨账号多模型故障转移、实时流式评估、复合评估框架和数据准确性验证。
AWS 官方博客给出在 Amazon SageMaker AI 上通过 JumpStart 部署 Qwen3-TTS-12Hz-1.7B-Base 到实时推理端点、并用几秒参考音频做语音克隆的完整步骤。
Datacor 将 Amazon Quick Sight 嵌入 TrackAbout,为气体与焊接分销商提供自助式租赁分析仪表盘与自然语言搜索栏。TrackAbout 客户合计管理 2750 万个资产、每月超 72.5 万张账单,此前租金数据只能靠 IT 生成的报告获取。自然语言问答由 Amazon Q in Quick Sight 驱动。
Amazon SageMaker HyperPod 搭配 Qumulo 的 CNQ 与 Cloud Data Fabric(CDF),让训练集群无需复制数据即可读取另一 AWS Region 的数据集。
在反思自己过度依赖 AI 后,作者改为把 AI 当学习向导,梳理出 10 个 AI 之外的技术概念。前四个是量子计算、后量子密码学(PQC)、分布式系统与边缘计算,其余涵盖云架构、事件驱动架构、零信任架构、数字主权、数据网格与数字孪生。文中引用 McKinsey 数据称,全球量子技术市场未来十年规模最高可达 $100 billion。
GitHub 的 Primer Design System 将所有组件从 CSS-in-JS 迁移到 CSS Modules,到 2024 年 12 月完成,服务端渲染页面耗时减少 55%,组件初始化耗时减少 25%。
AWS WhisperX DLC 可部署到 Amazon SageMaker AI 实时或异步端点,无需构建自定义镜像。WhisperX 基于 OpenAI Whisper,增加批量推理、wav2vec2 逐词时间戳和说话人分离,支持 json、verbose_json、srt、vtt 输出。实时端点限 60 秒内短音频,长音频和高吞吐批处理建议用异步端点。
平台账户用 Amazon Bedrock AgentCore Gateway 把各业务线账户的 MCP server 聚合成单一 MCP 端点,智能体无需复制数据即可跨账户发现并调用工具,数据只在查询时流出所属账户。
Aderant 通过 Amazon Bedrock 调用 Amazon Nova Lite 构建 Intelligent Ticket Analyzer,为 38 人 SierraOps 团队自动分类、路由工单并补全上下文。
Ari Joury 在 Towards Data Science 撰文提出,RAG 只是把候选证据交给模型,无法证明模型刚生成的论断得到支持,应把控制单位从文档下沉到原子论断。
作者认为流水线中的必填字段和相似度缓存都会在正确答案为空时返回编造值,并以自建的开源本地 RAG 检索系统为例做了验证。他用自写的西班牙语行政问题对测试 bge-m3,加入仅差一个 token 的改写对照后 AUC 从 0.3556 升到 0.9333,但最低被接受的改写仍低于最高被拒绝的否定句,因此没有可用阈值。
推荐理由:文中记录了作者自建语义缓存的阈值实验与失败细节,并提出可套用到抽取和检索组件的三个自查问题。
HEMA 基于 MCP 和 Amazon Bedrock AgentCore 构建内部 AI 助手 HAL,把分散在门户、wiki 与文档中的知识集中,并在 HAL 聊天、Kiro、Claude 等工具中直接提供答案。此前查一个答案需在 3 或 4 个门户间跳转、有时耗费整个下午,现在可在 IDE 或聊天窗口几秒内完成;当前为只读知识层,下一步将转为可执行操作层。
OpenCode 可接入 Amazon Bedrock 的开放权重模型,作为终端 AI 编程智能体在本地运行、推理留在 AWS 账户,且无按席位费用。示例模型包括 Moonshot AI Kimi K3、OpenAI GPT-OSS 120B 与 NVIDIA Nemotron 3 Super 120B。
Airbnb 扩大对 GPT-6 Astra 及 OpenAI 前沿模型的接入范围,帮助工程团队排查 bug、设计系统并加快交付。
GPT-6 改进了提示词缓存,带来更高的缓存命中率、新增的诊断能力与显式断点,以及可降低延迟和成本的控制项。这些改动让开发者能更清楚地排查缓存行为并控制推理开销。
OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 在 Amazon Bedrock 正式可用,API 定价显著低于 GPT-5.6 前代。GPT-6 Sol 面向开发与运维中反复出现的复杂任务,GPT-6 Luna 面向大批量重复任务,两者都支持显式提示词缓存。OpenAI 的内部事实性评测显示,GPT-6 Sol 的事实性错误约为 GPT-5.6 Sol 的一半。
推荐理由:两款模型按复杂任务与高频任务分层,API 定价低于 GPT-5.6 前代,可据此判断日常负载的选型。
AWS 宣布 Claude Opus 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,这是 Claude 5.5 系列的首个模型。
推荐理由:文章对比了 Claude Opus 5.5 与 Opus 5 在 token 效率、定价和安全分类器上的差异,并给出在 Bedrock 上调用该模型的代码示例。
Cloudflare 发布 Worker Previews,为每个 Git 分支提供接近生产的隔离运行环境,各自拥有独立的代码、配置、URL、可观测性和状态。
推荐理由:每个 Git 分支都获得带独立状态与 URL 的预览环境,读者可据此了解智能体开发闭环怎样接入现有部署流程。
NVIDIA 官方博客提出 AI 安全是工程问题,需要为智能体栈各层设置可强制执行的边界、明确责任人和可验证的保护证据。文章介绍了开源安全运行时 NVIDIA OpenShell,以及在其之上构建治理层的 Cisco DefenseClaw、用于扫描与校验智能体技能的 JFrog 等 Open Secure AI Alliance 伙伴实践。
Cloudflare 宣布 Python Workers 正式可用(GA),Python 成为 Cloudflare Workers 运行时的一等支持语言。
推荐理由:Python Workers 转为正式可用,文章说明了 WSGI/ASGI 连接器与 socket 桥接如何让框架、数据库驱动和 AI 库直接在 Workers 上运行。
V7 使用 GPT-5.6 把分散的公司文件转化为智能体可用的上下文,用于完成复杂且带来源链接的工作。该方案将成本降低 78%,同时提升了准确率。
llm-keys-ui 0.1 插件发布,为 llm CLI 提供保存 API key 的网页界面,避免把 key 粘贴进智能体会话。运行 `uvx --with llm-keys-ui llm keys-ui --all` 会返回含局域网或 Tailscale 设备 IP 的 URL,之后可用 `llm keys get anthropic` 在 shell 命令中取用。
NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 首秀中,Qwen3-VL 吞吐量最高达 GB300 NVL72 的 3.7 倍。GB300 NVL72 凭 288 个 GPU 跨四机架实现 99% 扩展效率;v6.1 提交的软件优化较 v6.0 最高提升 1.6 倍性能。
TypeSafe 发布 Jev,一款用 RLCD 训练、只做决策、分类、路由与打分的模型,宣称比小规模前沿 LLM 快 100 倍以上、便宜 200 倍以上,输出 token 不计费。
曼彻斯特大学用 NVIDIA Earth-2 生成式模型训练出覆盖全英的空气污染模型,分辨率 2-3 平方公里,在 Isambard-AI 的单个八卡节点上仅用两天完成训练。
Glyph 是一个生产系统,把列描述生成与列类型标注建模为由状态图编排的协作式 LLM 智能体。Descriptor 从企业 GitHub 按需检索流水线源码来支撑生成。