跳到正文

#教程/实践

今日 39 条
9月29日周二
  1. AGI Hunt33

    10 分钟花 20 美元生成一集动画,NoSpoon 推动 AI 电影进化

    动画创作者 @AlfredAlfer77 用 AI 影视工具 NoSpoon 搭配 Minimax H3 模型,凭一段单段落 prompt 在 10 分钟、约 20 美元内自动写并拍出一集动画片段。他坦言结果仍有大量错误和 glitch,但几次重roll加轻度剪辑即可成片。他认为 NoSpoon 与 The Slop Cannon 这类 harness 正把 AI 生成电影带向全新阶段。

9月28日周一
  1. Towards Data Science39

    Grokking:神经网络在看似训练完成后才学会真正理解

    小型神经网络在模加法任务上训练到 20000 步时,对新问题的准确率从 1000 步时的约 10% 跃升至接近 100%,这一现象被命名为 grokking。2023 年的后续研究发现,网络自行学会把数字表示为圆上的位置并用旋转组合,相当于重新发现了三角函数。研究者指出,标准 early stopping 规则可能在性能平台期提前切断训练,而 grokking 目前仅在少数窄的规则任务中被记录。

9月27日周日
  1. Towards Data Science35

    GraphRAG 与 TypeSafe Jev:用 System 1 方法构建可扩展知识图谱

    TypeSafe AI 发布 Jev,一个非自回归的校准决策模型,可在低于 500ms 的延迟下并行执行类型化概率微决策,成本远低于通用 LLM。Jev 提供 Noul、Choice、Score 三种原语,用于 GraphRAG 的实体消解、跨本体 schema 映射与边权重标注。文章提出由 Jev 承担 System 1 微决策、LLM 负责 System 2 推理的双引擎架构。

9月26日周六
  1. Towards Data Science40

    你的 LLM 拥有一片弯曲的段落空间

    实验提出 hRoPE,为段落、句子和 token 索引各设相互独立的旋转通道,以检验 Transformer 的位置编码是否丢失层级信息。在 WikiText-2、OpenWebText 和 Python 源码三个语料上,抹掉真实段落边界会降低跨段注意力,插入假边界则抬高它。

9月25日周五
  1. Towards Data Science28

    AI 之外我在学的 10 个技术概念:提升技术素养

    在反思自己过度依赖 AI 后,作者改为把 AI 当学习向导,梳理出 10 个 AI 之外的技术概念。前四个是量子计算、后量子密码学(PQC)、分布式系统与边缘计算,其余涵盖云架构、事件驱动架构、零信任架构、数字主权、数据网格与数字孪生。文中引用 McKinsey 数据称,全球量子技术市场未来十年规模最高可达 $100 billion。

  2. Towards Data Science50

    RAG 不是 Agent:我用纯 Python 搭出检索与动作之间的衔接层

    作者用纯 Python 实现了纯检索 RAG、确定性动作规划器和混合系统三种版本,在同样的九个任务上各跑一遍,只有混合系统同时通过知识类与知识加动作类任务。系统基于 22 篇文章切出的 334 个 chunk 语料和 TF-IDF 检索,构建过程中作者发现并修复了两个解析器 bug,混合系统一度在纯知识任务上失败。

9月24日周四
  1. Towards Data Science68

    当正确答案为空时,结构化输出与语义缓存会返回什么

    作者认为流水线中的必填字段和相似度缓存都会在正确答案为空时返回编造值,并以自建的开源本地 RAG 检索系统为例做了验证。他用自写的西班牙语行政问题对测试 bge-m3,加入仅差一个 token 的改写对照后 AUC 从 0.3556 升到 0.9333,但最低被接受的改写仍低于最高被拒绝的否定句,因此没有可用阈值。

    推荐理由:文中记录了作者自建语义缓存的阈值实验与失败细节,并提出可套用到抽取和检索组件的三个自查问题。

  2. AWS Machine Learning Blog37

    从门户跳转到即时答案:HEMA 用 MCP 和 Amazon Bedrock AgentCore 构建 HAL 的历程

    HEMA 基于 MCP 和 Amazon Bedrock AgentCore 构建内部 AI 助手 HAL,把分散在门户、wiki 与文档中的知识集中,并在 HAL 聊天、Kiro、Claude 等工具中直接提供答案。此前查一个答案需在 3 或 4 个门户间跳转、有时耗费整个下午,现在可在 IDE 或聊天窗口几秒内完成;当前为只读知识层,下一步将转为可执行操作层。

  3. Simon Willison31

    Shadow roots:用实时示例讲解

    Simon Willison 展示了一个由 Fable 5.1 Medium 构建的交互式 artifact,用实时示例讲解 CSS Shadow roots。示例涵盖样式封装、继承、slots、parts 和 JavaScript 访问。它展示 shadow root 如何创建带私有样式表和元素的隔离 DOM 树,并以特定、受控方式与页面 DOM 交互。

9月23日周三
  1. Towards Data Science34

    从词到向量:TF-IDF 如何把文本变成数字?

    TF-IDF 被拆成 tokenization、词表、TF、IDF、Python 实现、PCA 可视化与文本分类,解释文本如何转为数字向量。4 条示例文档中,TF 看词在单篇中的频率,IDF 由 DF 衡量词在全部文档中的稀有度,TF×IDF 得到 TF-IDF。最后列出 TF-IDF 的局限,并转向嵌入向量。

  2. Towards Data Science48

    GRPO 如何用可验证奖励训练小语言模型

    GRPO 让模型对同一问题采样多次作答,用可验证奖励为每个答案打分,再以组内平均奖励为基线比较各次尝试来更新模型,无需单独的 critic。该方法由 DeepSeekMath 工作提出,用以替代传统 PPO 的内存开销,文中用「6 箱每箱 8 件、卖出 6 件、答案 42」的算术题演示打分与优势计算。组内奖励完全一致时优势全为零,模型无法判断该偏好哪次尝试。

  3. Towards Data Science71

    如何从零手写你的第一个世界模型(CartPole 实战)

    作者用 500 局 CartPole 数据训练了一个 13,635 参数的 GRU 世界模型,预测下一步状态变化与是否翻车。该模型单步预测误差为 3.8 毫米车位置和 0.00026 弧度杆角,可信滚动预测视界为 29 步;配合 200 条随机动作序列的规划,100 局全部拿到 500/500。

    推荐理由:从 CartPole 出发手写世界模型,对比 DQN 展示同一模型如何零重训切换目标。

9月21日周一
9月17日周四
9月14日周一
9月11日周五
9月10日周四
  1. HuggingFace Blog60

    HF Jobs 上用 LoRA 跑异步 GRPO,500 步从 3 小时 27 分降到 53 分

    TRL v1.14 的 AsyncGRPOTrainer 已支持只训练 LoRA 适配器并把它同步到 vLLM,这篇实践在此基础上把训练与推理拆到不同机器上。训练器、两个 vLLM 副本各跑一个 HF Jobs,通过挂载同一个 Storage Bucket 传递适配器而不依赖 NCCL,中间的一个代理负责按 KV 前缀路由 rollout 并向所有副本广播适配器加载。

    推荐理由:这篇实践给出跨 Job 的 LoRA 异步 GRPO 配方与代理路由细节,其瓶颈定位方法可迁移到其他异步训练部署。

9月9日周三
9月8日周二