跳到正文

#部署/工程

今日 4 条
今天9月30日周三
  1. AGI Hunt37

    Sentdex 力挺 GLM 5.3:在家跑前沿模型,别再为说教你的人付钱

    知名技术 YouTuber Sentdex 发推力挺 GLM 5.3,称该系列让普通人在本地就能跑上前沿模型,不需要「一个自以为比你懂什么对你最好的家伙」把关,并号召停止给那些游说反对用户的公司和同类厂商送钱。他同时提醒黑客攻击与网络犯罪仍然违法且刑罚极重,这可能是针对有人拿本地不受限模型搞违法行为的回应。他总结称「它就是个好模型」,具体规格以官方为准。

9月29日周二
  1. AGI Hunt45

    Jev 等小模型路由比 LLM 快 200 倍、便宜 400 倍,AI 软件架构走向分层智能

    Pavan Belagatti 提出 AI 软件架构正走向分层智能:由确定性代码维护工作流结构,快速专用小模型处理窄域语义分支,只在异常情况下才升级调用完整推理模型。其中 system-one 小模型(如 Jev)做路由比 LLM 快约 200 倍、便宜约 400 倍。LangGraph 这类框架提供状态管理、持久化执行与人机协同检查点等编排层。

  2. MIT Technology Review:AI24

    HPE:如何让 AI 成为资产而非开支,而不是一项费用

    HPE 提出,当 AI 从试验走向持续运行的生产负载,企业应测算自有算力在何种使用量上比按 token 逐次购买更经济。Deloitte《2026 企业 AI 现状》显示,2025 年员工使用 AI 的比例上升 5%,至少 40% AI 项目投产的公司占比预计在半年内翻倍。企业投入资本前需判断需求是否稳定可预测,以及能否通过采用和治理让算力保持满负荷。

9月21日周一
7月30日周四
  1. HuggingFace Blog41

    GPU 管理:为什么闲置 GPU 正成为新的“停场飞机”

    企业 AI 的下一道真实约束已从模型智能转向 GPU 利用率:GPU 按日历小时计成本,产出却只按计算小时计。这与航空业靠飞机利用率决定生死的结构一致,自购 GPU 可把随 token 线性增长的 API 成本换成固定资本支出。但按峰值规模采购的集群在需求不持续时,满载 GPU 仍会浪费大量产能。

7月6日周一