fleetwood.dev 长文:GPU 统治深度学习纯属偶然,定制 chiplet 架构或将重塑推理
fleetwood.dev 发布长文《Domain specific architectures for AI inference》,论证 GPU 在深度学习中的主导地位很大程度是历史偶然,图形架构遗产至今仍在。
fleetwood.dev 发布长文《Domain specific architectures for AI inference》,论证 GPU 在深度学习中的主导地位很大程度是历史偶然,图形架构遗产至今仍在。
Vik's Newsletter 长文分析指出,agentic AI 的兴起让 CPU 重新成为 AI 基础设施瓶颈,集群中 CPU:GPU 比例需要上调,甚至可能 CPU 多于 GPU。
jeffreyajewett 发帖指出,当前算力市场真正稀缺的是没有被长期采购协议(offtake)锁定的算力容量,若所有可用 MW 和 GPU 都被预留给最安全的大客户,下一代巨头将失去成长竞争的机会。他主张市场应刻意为尚未显山露水的公司保留容量。
知名技术 YouTuber Sentdex 发推力挺 GLM 5.3,称该系列让普通人在本地就能跑上前沿模型,不需要「一个自以为比你懂什么对你最好的家伙」把关,并号召停止给那些游说反对用户的公司和同类厂商送钱。他同时提醒黑客攻击与网络犯罪仍然违法且刑罚极重,这可能是针对有人拿本地不受限模型搞违法行为的回应。他总结称「它就是个好模型」,具体规格以官方为准。
Pavan Belagatti 提出 AI 软件架构正走向分层智能:由确定性代码维护工作流结构,快速专用小模型处理窄域语义分支,只在异常情况下才升级调用完整推理模型。其中 system-one 小模型(如 Jev)做路由比 LLM 快约 200 倍、便宜约 400 倍。LangGraph 这类框架提供状态管理、持久化执行与人机协同检查点等编排层。
作者 Lambert Leong 主张,智能体系统中的路由这类有限决策不应交给自回归解码器逐 token 生成,而应按分类问题由决策层处理:给定显式候选路由、返回带类型的分数,再按阈值或弃权策略交给确定性软件分支。
一位现任 AWS 员工在访谈中称,Bedrock 的核心卖点是原生集成 AWS 体系,提供数据驻留合规、HIPAA 等企业级标准以及统一账单与用量管理。他还表示模型切换成本已大幅下降,非技术场景并不一定需要旗舰模型。
HPE 提出,当 AI 从试验走向持续运行的生产负载,企业应测算自有算力在何种使用量上比按 token 逐次购买更经济。Deloitte《2026 企业 AI 现状》显示,2025 年员工使用 AI 的比例上升 5%,至少 40% AI 项目投产的公司占比预计在半年内翻倍。企业投入资本前需判断需求是否稳定可预测,以及能否通过采用和治理让算力保持满负荷。
antirez 建议企业自建 DGX Spark、Mac Ultra 本地机群,作为公司 API 配额用完后的算力托底。他在 X 上回复企业本地 AI 部署讨论时表示,公司购置一批这类设备组成机群,员工在公司 API 配额耗尽后可继续用这些本地算力干活,避免工作中断。
作者用自建计算器估算 Meta Muse 免费成本:按每天 15 分钟使用、1000 万 token 消耗,每用户约 51 美元,Meta 需从每用户赚 70 美元才能维持当前利润率。基线来自 SemiAnalysis、DeepSeek DSec、AWS 定价与 Meta 财报。作者称 Muse 沙盒 CPU 平均利用率不足 5%,一个物理核可支撑 25 个沙盒核。
研究员 YouJiacheng 转发「124M 模型用了 65B embedding」的帖子,戏称继续 scale 需要 AFED,即 Attention、FFN、Embedding 分离(disaggregation)。这是对当前推理架构分离趋势(如 PD 分离、KV cache 分层)的调侃式延伸,若极端超大 embedding 的用法成主流,embedding 层或需独立部署与扩展。
ServiceNow AI 平台安全产品副总裁 Bhakti Pitre 在 Okta 的 Oktane 活动上表示,应对失控 AI 智能体不能只靠"一键关停",需结合风险与业务上下文决定暂停还是撤销权限。
分析师 Zeus Kerravala 指出,智能体 AI 每次任务的 token 消耗可达单次推理调用的 10 到 100 倍,按 token 计费让成功上线的 AI 项目成本失控。
一位用户在 Reddit 求助:在 4080 Super + 32GB 内存上尝试的图生视频(I2V)方案全部失败,生成一个 4 秒片段要数小时,或直接 OOM 跑不完。帖子正寻求可行的本地视频生成配置建议。
NVIDIA 官方博客提出 AI 安全是工程问题,需要为智能体栈各层设置可强制执行的边界、明确责任人和可验证的保护证据。文章介绍了开源安全运行时 NVIDIA OpenShell,以及在其之上构建治理层的 Cisco DefenseClaw、用于扫描与校验智能体技能的 JFrog 等 Open Secure AI Alliance 伙伴实践。
企业 AI 的下一道真实约束已从模型智能转向 GPU 利用率:GPU 按日历小时计成本,产出却只按计算小时计。这与航空业靠飞机利用率决定生死的结构一致,自购 GPU 可把随 token 线性增长的 API 成本换成固定资本支出。但按峰值规模采购的集群在需求不持续时,满载 GPU 仍会浪费大量产能。
Import AI 第 464 期汇总多项研究进展:Fable 在 KernelBench-Mega 上以 18.71X 加速写出 CUDA megakernel,据榜单维护者称是该榜首个且最快的 megakernel。