跳到正文

#部署/工程

今日 37 条
今天9月30日周三
  1. AGI Hunt53

    token 价格走低,H100 租金半年上涨 16%-30%

    开发者 julsimon 对比多家供应商数据发现,H100 SXM 按需租用价格半年内上涨 16%-30%,RunPod Secure Cloud 单卡时价格从 3 月的 $2.69 涨至 9 月的 $3.49。这一走势与持续下降的 token 价格形成反差,作者认为反映算力供需紧张。他还发布了覆盖 106 个模型、116 种实例的比价计算器,用于评估不同推理方案的成本。

  2. AGI Hunt40

    GPU 空转高达 74%,微软研究院 SortedRL 直击 RL 训练调度瓶颈

    微软研究院提出 SortedRL 在线长度感知调度系统,瞄准 LLM 强化学习训练的调度瓶颈。RL 生成阶段模型产出长度差异很大的多步推理长响应,而标准训练更新要求 batch 内所有响应都完成,短响应闲置等待最长响应,导致 GPU 在生成周期中有 70%–74% 时间空闲。该系统在不破坏 RL 训练稳定性的前提下加速训练并提升学习效率。

  3. AGI Hunt48

    Canonical 与高通宣布:Ubuntu 将于 2027 年正式支持骁龙 X2 平台,面向本地 Agentic AI

    Canonical 与高通宣布,官方 Ubuntu 支持将于 2027 年登陆骁龙 X2 系列笔记本平台,为本地构建和运行 agentic AI 提供软硬件一体环境。该支持提供在骁龙 X2 硬件上严格验证的标准化认证企业级镜像,开箱即用,无需手动调内核或装驱动。平台主打 80 TOPS NPU 加速与多天续航,双方称这是「为 agentic 世界解锁更多 Linux PC」的一步。

  4. AGI Hunt21

    AAOI 被指美国垂直整合过激:激光器产线良率仍差、烧掉大量资本开支

    AAOI(应用光电)被指在美国做过度的垂直整合,CW 激光器产线烧掉大量资本开支后良率依然很差。引用的分析师观点更激进,称只关心 UHP 激光器,Coherent、除源杰外的中国激光公司、Source Photonics(东山精密)与 AAOI 都不行,这批公司是被不懂激光的人推起来的。这折射出 AI 光模块供应链的垂直整合之争与良率隐忧。

  5. AGI Hunt35

    开发者让 LLM 记录执行顺序,破解 Minecraft 1.21.11 世界生成非确定性难题

    开发者 gandamuml 让 LLM 在 tapes 中记录执行顺序,再在克隆环境按序回放,为 Minecraft 1.21.11 世界生成提供了可复现的确定性验证。Minecraft 1.21.11 的世界生成受 Java 运行时差异影响,同一版本自身每次运行结果都可能不同。该方案在完成确定性验证的同时,保留了正式发布运行的灵活性。

  6. arXiv cs.CV35

    FastVR:基于一步扩散的高效流式视频修复

    FastVR 是一个基于一步扩散模型的流式视频修复框架,可在单张 H20 GPU 上以 11 FPS 处理 1080p 视频。它结合轻量 VAE 与分块因果注意力降低推理成本,并用速度一致性正则化和连续轨迹学习提升修复质量。实验显示 FastVR 比所评估的扩散基线更高效,并在合成与真实世界 benchmark 上达到 SOTA。

  7. AGI Hunt39

    Ollama 0.35 上线本地决策模型,Nimble 单次决策仅 91ms

    Ollama 0.35 发布,新增 /v1/systemone 端点,支持基于 TypeSafe Jev API 的决策模型,并同步上线 Nimble 等三个可本地运行的新模型。Nimble 单次决策仅需 91ms,官方随后补充发布了配套博客、决策能力文档与 API 文档。该功能本地运行无额外成本、延迟更低,适用于工单分诊等需要一次性回答一组命名问题的场景。

  8. arXiv cs.CL33

    FastGuide:加速扩散大语言模型的奖励引导

    FastGuide 用并行与自回归解码的自适应混合来加速扩散大语言模型的奖励引导,在三个奖励基准上比顺序奖励引导解码最高快 4.4 倍,并保持相近的生成质量。它按每个解码步骤计算一次引导并复用于多个 token,借助 KV 缓存与注意力稀疏重算降低开销,模型不自信的 token 会被推迟解掩。

  9. AGI Hunt41

    Audio8 ASR Infinite 发布:流式语音识别以滚动 KV Cache 实现 7×24 常数延迟

    Audio8 ASR Infinite 发布,采用原生流式架构与滚动 KV Cache,使内存与延迟保持恒定,可支持 7×24 小时不间断运行。该模型每秒解码 12.5 次,每个时钟步输出一个文本 token,在 12.5/8.3/6.25 次决策每秒之间权衡感知粒度与资源开销。模型已发布,HuggingChat 的 ML 实习生搭建了 Gradio 工作流,可直接在线试用。

  10. AGI Hunt48

    SGLang 把 Qwen3.8-27B 变决策模型,百毫秒内通关《宝可梦火红》

    SGLang 团队把 Qwen3.8-27B 改造成多模态决策模型,从实时游戏画面出发,以低于 100 毫秒的决策延迟打通《宝可梦火红》的四天王与冠军。工程层面,SGLang 新增原生 /v1/decisions 接口,可将 LLM 和 VLM 当作分类与打分模型使用;另加 /v1/systemone,让 Jev 类开源模型可配合 TypeSafe SDK 使用。

  11. SiliconANGLE:AI33

    戴尔 AI 领导力峰会四大洞察:成本与控制重塑企业 AI 部署策略

    戴尔 AI 领导力峰会上专家总结出企业 AI 部署的四大洞察:成本与控制正取代模型和 GPU 成为核心议题。戴尔称依托长期芯片合作可在两周内交付 350 个机架,Deepgram 的语音模型将从数据中心走向在 AI 笔记本上物理隔离运行。token 预算被数周耗尽,推动负载回流本地并让 CPU 在智能体 AI 中重新受重视,运行时治理成为企业智能体的准入门槛。

  12. AGI Hunt37

    Sentdex 力挺 GLM 5.3:在家跑前沿模型,别再为说教你的人付钱

    知名技术 YouTuber Sentdex 发推力挺 GLM 5.3,称该系列让普通人在本地就能跑上前沿模型,不需要「一个自以为比你懂什么对你最好的家伙」把关,并号召停止给那些游说反对用户的公司和同类厂商送钱。他同时提醒黑客攻击与网络犯罪仍然违法且刑罚极重,这可能是针对有人拿本地不受限模型搞违法行为的回应。他总结称「它就是个好模型」,具体规格以官方为准。

  13. AWS Machine Learning Blog40

    Condé Nast 如何用 Amazon Bedrock 构建多模态视频发现

    Condé Nast 用 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频发现方案,将每项内容发现任务耗时从 250 分钟降至不到 2 分钟。方案由 AWS GenAIIC 合作开发,采用 TwelveLabs Marengo 嵌入模型,对超过 140,000 个视频的转录、视觉和音频做意图语义搜索,支持图像查询与精确时间戳。

  14. AWS Machine Learning Blog67

    GPT-6.1 Sol 在 Amazon Bedrock 上正式可用

    GPT-6.1 Sol 已在 Amazon Bedrock 正式可用,作为 GPT-6 Sol 的重大升级,面向智能体编码、计算机操作和专业工作负载提供更强推理。

    推荐理由:文章给出 GPT-6.1 Sol 与 Astra、GPT-6 Sol 的评测及单任务成本对比,可据此评估智能体编码任务的性价比。

9月29日周二
  1. AGI Hunt45

    Jev 等小模型路由比 LLM 快 200 倍、便宜 400 倍,AI 软件架构走向分层智能

    Pavan Belagatti 提出 AI 软件架构正走向分层智能:由确定性代码维护工作流结构,快速专用小模型处理窄域语义分支,只在异常情况下才升级调用完整推理模型。其中 system-one 小模型(如 Jev)做路由比 LLM 快约 200 倍、便宜约 400 倍。LangGraph 这类框架提供状态管理、持久化执行与人机协同检查点等编排层。

  2. Towards Data Science66

    如何为 AI 智能体设计防提示注入的架构防护栏

    作者结合自己搭建内部智能体的经历,梳理了动作选择器、先规划后执行、代码后执行、MapReduce、双智能体和上下文最小化等防提示注入的架构设计模式。文中指出 LLM 无法区分提示词与上下文,攻击者可用网页里的隐藏指令让智能体泄露数据甚至删表,因此他用 Azure Function 把数据库查询和邮件发送限制在预定义操作与允许名单内。他强调没有单一模式能覆盖全部漏洞,需要针对可能的失败场景组合使用。

    推荐理由:作者结合自己搭建内部智能体的经历,把几类防提示注入的架构模式拆成可复用的取舍清单。