跳到正文

#部署/工程

今日 37 条
9月29日周二
  1. arXiv cs.CL35

    MoSAR:学习自适应且可近似注意力几何的语义注意力模式混合

    MoSAR 把注意力近似视作几何问题,用输入条件的 query/key 路由器在短、中、全局三种模式间混合,学习连续的距离相关注意力场,并可在训练后经 top-1 路由离散化。在 500M 参数匹配模型的预训练实验中,它未降低语言建模质量,困惑度优于 dense RoPE,长度外推下优于 ALiBi 等基线取得最佳困惑度。

  2. arXiv cs.CL40

    REALMS:面向高维嵌套画像实时精确受众规模测算的 AI 对话系统

    REALMS 是已部署在企业客户数据平台上的对话式受众规模测算系统,可用自然语言查询数百万画像、数千属性并在几秒内返回精确计数。系统由基于嵌入向量搜索的属性检索、带模板化上下文学习的 LLM NL2SQL 流水线、schema 标准化三部分构成。真实企业数据评估显示属性检索召回高、SQL 执行准确率高、延迟低,此前需数小时的任务可实时完成。

9月28日周一
9月26日周六
9月25日周五
  1. Towards Data Science28

    AI 之外我在学的 10 个技术概念:提升技术素养

    在反思自己过度依赖 AI 后,作者改为把 AI 当学习向导,梳理出 10 个 AI 之外的技术概念。前四个是量子计算、后量子密码学(PQC)、分布式系统与边缘计算,其余涵盖云架构、事件驱动架构、零信任架构、数字主权、数据网格与数字孪生。文中引用 McKinsey 数据称,全球量子技术市场未来十年规模最高可达 $100 billion。

9月24日周四
  1. Towards Data Science68

    当正确答案为空时,结构化输出与语义缓存会返回什么

    作者认为流水线中的必填字段和相似度缓存都会在正确答案为空时返回编造值,并以自建的开源本地 RAG 检索系统为例做了验证。他用自写的西班牙语行政问题对测试 bge-m3,加入仅差一个 token 的改写对照后 AUC 从 0.3556 升到 0.9333,但最低被接受的改写仍低于最高被拒绝的否定句,因此没有可用阈值。

    推荐理由:文中记录了作者自建语义缓存的阈值实验与失败细节,并提出可套用到抽取和检索组件的三个自查问题。

  2. AWS Machine Learning Blog37

    从门户跳转到即时答案:HEMA 用 MCP 和 Amazon Bedrock AgentCore 构建 HAL 的历程

    HEMA 基于 MCP 和 Amazon Bedrock AgentCore 构建内部 AI 助手 HAL,把分散在门户、wiki 与文档中的知识集中,并在 HAL 聊天、Kiro、Claude 等工具中直接提供答案。此前查一个答案需在 3 或 4 个门户间跳转、有时耗费整个下午,现在可在 IDE 或聊天窗口几秒内完成;当前为只读知识层,下一步将转为可执行操作层。

9月23日周三
  1. AWS Machine Learning Blog67

    GPT-6 Sol 与 GPT-6 Luna 在 Amazon Bedrock 正式可用

    OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 在 Amazon Bedrock 正式可用,API 定价显著低于 GPT-5.6 前代。GPT-6 Sol 面向开发与运维中反复出现的复杂任务,GPT-6 Luna 面向大批量重复任务,两者都支持显式提示词缓存。OpenAI 的内部事实性评测显示,GPT-6 Sol 的事实性错误约为 GPT-5.6 Sol 的一半。

    推荐理由:两款模型按复杂任务与高频任务分层,API 定价低于 GPT-5.6 前代,可据此判断日常负载的选型。

9月22日周二
9月21日周一
9月16日周三