跳到正文

#部署/工程

今日 7 条
今天9月30日周三
  1. arXiv cs.CV35

    FastVR:基于一步扩散的高效流式视频修复

    FastVR 是一个基于一步扩散模型的流式视频修复框架,可在单张 H20 GPU 上以 11 FPS 处理 1080p 视频。它结合轻量 VAE 与分块因果注意力降低推理成本,并用速度一致性正则化和连续轨迹学习提升修复质量。实验显示 FastVR 比所评估的扩散基线更高效,并在合成与真实世界 benchmark 上达到 SOTA。

  2. arXiv cs.CL33

    FastGuide:加速扩散大语言模型的奖励引导

    FastGuide 用并行与自回归解码的自适应混合来加速扩散大语言模型的奖励引导,在三个奖励基准上比顺序奖励引导解码最高快 4.4 倍,并保持相近的生成质量。它按每个解码步骤计算一次引导并复用于多个 token,借助 KV 缓存与注意力稀疏重算降低开销,模型不自信的 token 会被推迟解掩。

9月29日周二
  1. arXiv cs.AI36

    LW2S:面向高效多智能体 LLM 工作流的反事实信用分配与跳过学习

    LW2S 将多智能体 LLM 工作流中的组件省略建模为反事实信用分配,用受控跳过干预学习动作级安全模型,并结合留出集校准与领域内建护栏选择跳过步骤。在数学推理、选择题问答与代码生成、两个指令模型家族上,它降低了记录 token 成本,整体工作流准确率持平或提升。早期跳过被拒时,控制器仍可继续执行并重新考虑后续组件。

  2. AGI Hunt47

    Kangwook Lee 团队包下韩国网吧,招募超 1000 名玩家训练星际争霸 AI「Ally」

    Kangwook Lee 团队租下韩国一间网吧(PC bang),招募超过 1000 名真人玩家与早期版本对局,为可在端侧消费级 GPU 上运行的游戏 AI「Ally」收集 on-policy 数据。团队借鉴 DAgger 思路迭代采集轨迹并纠正后继续训练,将模型蒸馏至 2B 参数规模,还针对边缘设备 KV 缓存预算紧张的问题专门开发了上下文压缩算法。

  3. arXiv cs.CL35

    MoSAR:学习自适应且可近似注意力几何的语义注意力模式混合

    MoSAR 把注意力近似视作几何问题,用输入条件的 query/key 路由器在短、中、全局三种模式间混合,学习连续的距离相关注意力场,并可在训练后经 top-1 路由离散化。在 500M 参数匹配模型的预训练实验中,它未降低语言建模质量,困惑度优于 dense RoPE,长度外推下优于 ALiBi 等基线取得最佳困惑度。

  4. arXiv cs.CL40

    REALMS:面向高维嵌套画像实时精确受众规模测算的 AI 对话系统

    REALMS 是已部署在企业客户数据平台上的对话式受众规模测算系统,可用自然语言查询数百万画像、数千属性并在几秒内返回精确计数。系统由基于嵌入向量搜索的属性检索、带模板化上下文学习的 LLM NL2SQL 流水线、schema 标准化三部分构成。真实企业数据评估显示属性检索召回高、SQL 执行准确率高、延迟低,此前需数小时的任务可实时完成。

9月28日周一
9月16日周三
  1. Apple Machine Learning Research46

    TS-DFM:以轨迹为教师、经能量导航蒸馏的少步离散流匹配

    TS-DFM 用能量导航替代离散流匹配训练中的盲随机跳步:轻量能量罗盘在每个中间点评估候选续写、选出最连贯的一支,且塑造仅在训练期进行,推理成本不变。在 170M 参数语言建模上,8 步学生模型的困惑度比 1024 步教师低 32%、速度快 128×,增益在多种源分布和三种规模递增的评估器上一致。其困惑度优于所有对比的离散生成基线,包括训练数据多 6× 或模型大 5× 的方法。

  2. Apple Machine Learning Research43

    面向智能体 LLM 系统的共享选择性持久记忆架构

    共享选择性持久记忆架构面向智能体 LLM 系统,只保留任务规范、数据 schema、工具配置与输出约束四类可复用上下文,工作区可按角色访问权限跨用户共享。在三个企业部署场景中任务完成率达 96%,高于无记忆的 79% 与保留完整历史的 71%。零 token 数据刷新免去重复更新的 LLM 重调用,任务耗时降低 14×;摘要驱动生成使单次调用 token 成本降低 97×。

8月25日周二
8月11日周二
8月10日周一
6月27日周六
6月25日周四
  1. Google Research44

    Google 提出线性弹性缓存:Spanner 内存用量降 15.5%、TCO 降约 5%

    Google 提出线性弹性缓存,把页面淘汰建模为滑雪租赁问题,用轻量机器学习按访问模式给页面设定 TTL,在内存占用与缓存未命中之间做取舍。集成进 Spanner 生产服务器数月后,内存用量降低 15.5%,缓存未命中仅增 5.5%,总拥有成本(TCO)降低约 5%,且未命中的增加集中在取回成本较低的数据上,I/O 成本影响仅 0.5%。

3月25日周三
3月18日周三
  1. Google Research72

    Google 与 NHS 合作在 Nature Cancer 发表两项 AI 乳腺癌筛查研究

    Google 与多家 NHS 机构合作的 AIMS 研究在 Nature Cancer 发表两项论文,分别评估 AI 乳腺癌筛查系统的独立性能及其作为第二读片人嵌入双读流程的效果。

    推荐理由:两项研究给出了AI作为第二读片人的性能数据与部署细节,可供评估AI嵌入既有人工复核流程的可行性与难点。