跳到正文

#部署/工程

今日 37 条
9月29日周二
  1. AGI Hunt26

    DeployMind 把部署复盘反馈变成可召回的反思记忆

    作者开发了部署前风险 agent DeployMind,把部署结束后的复盘反馈转成可召回的反思记忆,供未来类似部署前调用。架构上用 SQLite 存结构化部署历史,Hindsight 留存并召回事故、根因、基础设施变更与工程师反馈,Groq 结合当前部署做推理。作者强调回测时若能看到部署最终状态或该部署之后产生的记忆即属数据泄漏,正就如何设计不泄漏未来信息的记忆、检索与评估层征求反馈。

  2. AGI Hunt38

    开发者因 Entra ID 认证太折腾,做出 MCP 托管平台 foro

    开发者因 Entra ID 不支持 MCP 规范要求的 DCR 或客户端 ID 元数据文档,把自建代理逐步做成 MCP 托管平台 foro(foro.sh)。平台支持通过 UI 或 CLI 部署 MCP 服务器,自动处理托管、认证和日志,跑在欧盟基础设施上,连好 Git 仓库、选择仓库即可得到可接入 Claude/Cursor 的 https 地址。

  3. MIT Technology Review:AI24

    HPE:如何让 AI 成为资产而非开支,而不是一项费用

    HPE 提出,当 AI 从试验走向持续运行的生产负载,企业应测算自有算力在何种使用量上比按 token 逐次购买更经济。Deloitte《2026 企业 AI 现状》显示,2025 年员工使用 AI 的比例上升 5%,至少 40% AI 项目投产的公司占比预计在半年内翻倍。企业投入资本前需判断需求是否稳定可预测,以及能否通过采用和治理让算力保持满负荷。

  4. arXiv cs.AI36

    LW2S:面向高效多智能体 LLM 工作流的反事实信用分配与跳过学习

    LW2S 将多智能体 LLM 工作流中的组件省略建模为反事实信用分配,用受控跳过干预学习动作级安全模型,并结合留出集校准与领域内建护栏选择跳过步骤。在数学推理、选择题问答与代码生成、两个指令模型家族上,它降低了记录 token 成本,整体工作流准确率持平或提升。早期跳过被拒时,控制器仍可继续执行并重新考虑后续组件。

  5. AGI Hunt47

    Kangwook Lee 团队包下韩国网吧,招募超 1000 名玩家训练星际争霸 AI「Ally」

    Kangwook Lee 团队租下韩国一间网吧(PC bang),招募超过 1000 名真人玩家与早期版本对局,为可在端侧消费级 GPU 上运行的游戏 AI「Ally」收集 on-policy 数据。团队借鉴 DAgger 思路迭代采集轨迹并纠正后继续训练,将模型蒸馏至 2B 参数规模,还针对边缘设备 KV 缓存预算紧张的问题专门开发了上下文压缩算法。

  6. AGI Hunt35

    Vercel 迁移奔驰 F1 官网:构建快 70%、渲染快 75%,一周内完成

    Vercel 创始人 Guillermo Rauch 宣布团队已把梅赛德斯-AMG PETRONAS F1 车队官网迁移到 Vercel,构建速度提升约 70%,页面绘制(paint)速度提升约 75%。这是一个包含大量原服务商特有模式的成熟生产级站点,迁移以尽量少人工干预为原则,实际工作不到一周完成。团队还从迁移过程中提炼出两个 AI skills,计划随后开源。

  7. IT之家32

    吉利智充 C12 率先落地杭州、上海、宁波、嘉兴、西安:单枪峰值功率 2250 千瓦,10% 至 97% 补能平均 8 分 40 秒

    吉利智充 C12 在杭州、上海、宁波、嘉兴、西安五城同步落地,单枪峰值功率 2250 千瓦,10% 至 97% 补能平均用时 8 分 40 秒。该技术依托吉利与阶跃星辰联合开发的全域能源大模型“星睿 PowerMind 能源大脑”,AI“边充边养”使充电最高温度低于 65℃,电池循环寿命提升 20% 以上。领克 10、极氪 001 搭载 900V 神盾金砖超短刀电池,最高充电倍率 12C。

  8. AGI Hunt45

    开源工具 Carla:本地跑 llama.cpp 造「AI 角色」的织机实验室

    开发者发布基于 llama.cpp 的开源工具 Carla v0.1.0,一个完全本地运行的 loom TUI 与角色实验室。其流程为基座模型加种子文档、分支式续写再到对话式 loom 以涌现 AI 角色,支持 /loom [count] 并行多轮对话,由 Jev 按自定义行为规范评估循环、spiraling 与有害语言。作者称目标是为下一阶段的训练做准备。

  9. AGI Hunt32

    Uber Eats 排序模型每秒 800 万次预测,工程团队公开特征一致性方案

    Uber 工程团队公开特征一致性框架 feature logging,解决训练与推理特征不一致问题:生产环境特征值可能因来源、格式(如 en vs en-US)或计算逻辑差异而与训练数据偏离。该框架从在线推理管道直接产出训练数据,形成训练数据飞轮,在线特征含 userid、语言、餐厅元数据及预计算的历史点击/下单行为特征。Uber Eats 排序模型每秒服务约 800 万次预测。

  10. Google Developers Blog67

    用 Google Agent Development Kit 构建零信任 AI 智能体

    Google 开发者博客发布指南,介绍如何用 Agent Development Kit(ADK)构建零信任 AI 智能体。文章给出三层防护实现:Cloud KMS 硬件密钥为每次数据库写入签名、gVisor 用户态沙箱隔离动态生成代码、确定性语义网关在模型调用和写库前后做规则校验,并把安全策略写成 CI/CD 中的回归测试。

    推荐理由:文章给出可用 HMAC 本地复现的三层防护实现,读者可据此核对自家智能体写库与代码执行的信任边界。

  11. Google Developers Blog38

    Google Cloud 在 Cloud TPU 上实现企业级高精度长上下文多模态嵌入推理

    Google Cloud 将原生 TPU 支持集成进 vLLM,在 Cloud TPU 上实现企业级精度的长上下文多模态嵌入推理。该方案以 Qwen3-Embedding-8B 为目标模型,支持文本 4K+ tokens、多模态文本加图像 15K+ tokens 的超长上下文,并以余弦相似度验证跨硬件数值对齐,文本目标阈值 ≥0.999、多模态 ≥0.995。

  12. Google Developers Blog61

    Google 总结 AI Agents 挑战赛中最强提交的四个工程模式

    Google for Startups AI Agents Challenge 结束后,Google 从各赛道排名靠前的提交中总结出四个工程模式,分别是以 MCP 双向暴露工具、事件驱动并发、备用模型走同一校验函数和分级路由。

    推荐理由:从真实挑战赛代码提交中提炼出四个可复用的智能体工程模式,覆盖 MCP 双向暴露、事件驱动并发与分级路由。

  13. AGI Hunt50

    400个AI智能体入住MMO私服,本地Qwen小模型驱动多智能体生态

    开发者在2004年代魔兽怀旧服私服模拟器中搭建多智能体生态,约750个角色各拥有独立人格、情绪、记忆、关系与目标,同时在线400多个,由本地运行的Qwen小模型驱动感知、推理与游戏内动作。这些智能体能互相记住并谈论彼此,累计已产生约22.1万条世界记录。作者随后复盘了系统面临的感知延迟与负载调度等工程挑战。

  14. AGI Hunt67

    Pydantic 开源 Monty,用 Rust 编写的 Python 沙箱专跑 LLM 生成代码

    Pydantic 作者 samuelcolvin 宣布开源 Monty(github.com/pydantic/monty,已获 8.4k star),一个用 Rust 编写的安全 Python 解释器与沙箱,专为运行 LLM 生成的代码设计,用以替代基于容器的沙箱并避开其延迟、复杂度与成本。

    推荐理由:正文给出 Monty 的开源与商业两种形态,以及容器沙箱在延迟和成本上的对比,便于判断适用场景。