EO2Weave 实战踩坑:WebMCP 智能体的工具加载、站点信任与移动端设计难题
浏览器原生 AI 智能体 EO2Weave 团队公开接入 WebMCP 后的三大未决设计难题:工具加载架构、站点 per-origin 授权与移动端定位。工具集增至 30 个以上后选择质量明显下降,团队改为模型只看到 searchtools/calltool 两个工具、其余放目录按需查 schema。移动端用户只看进度、批准或拒绝后离开,当前约 50 个弹窗的缩水桌面式 UX 是最大抱怨。
浏览器原生 AI 智能体 EO2Weave 团队公开接入 WebMCP 后的三大未决设计难题:工具加载架构、站点 per-origin 授权与移动端定位。工具集增至 30 个以上后选择质量明显下降,团队改为模型只看到 searchtools/calltool 两个工具、其余放目录按需查 schema。移动端用户只看进度、批准或拒绝后离开,当前约 50 个弹窗的缩水桌面式 UX 是最大抱怨。
一位 Reddit 用户分享了一套 retention_analysis 提示词模板,用来解决 AI 生成多角色对话视频时的台词错位和人物形象在各镜头间漂移问题。
动画创作者 @AlfredAlfer77 用 AI 影视工具 NoSpoon 搭配 Minimax H3 模型,凭一段单段落 prompt 在 10 分钟、约 20 美元内自动写并拍出一集动画片段。他坦言结果仍有大量错误和 glitch,但几次重roll加轻度剪辑即可成片。他认为 NoSpoon 与 The Slop Cannon 这类 harness 正把 AI 生成电影带向全新阶段。
Google MaxText 团队在 Cloud TPU 上从头复现了 Ai2 的 Olmo 3 7B 预训练与中期退火,阶段 1、阶段 2 的损失曲线与 Ai2 公开参考在留出评估上对齐。
GitHub 博客介绍其 Security Lab 用开源的 Taskflow Agent 智能体在 Android 应用中发现了 24 个漏洞,并给出 OsmAnd 位置追踪与 Wikipedia 账号接管两个案例。
推荐理由:文中给出审计 taskflow 查找 Android 漏洞的具体案例与运行步骤,安全研究者可迁移到自有应用的审计流程。
小型神经网络在模加法任务上训练到 20000 步时,对新问题的准确率从 1000 步时的约 10% 跃升至接近 100%,这一现象被命名为 grokking。2023 年的后续研究发现,网络自行学会把数字表示为圆上的位置并用旋转组合,相当于重新发现了三角函数。研究者指出,标准 early stopping 规则可能在性能平台期提前切断训练,而 grokking 目前仅在少数窄的规则任务中被记录。
作者提出用对抗验证检测数据漂移,给训练集打 0、生产批次打 1 训练分类器,AUC 接近 0.5 说明分布一致,超过约 0.65 则说明特征间的联合关系已变化,并能指出具体是哪些列。
TypeSafe AI 发布 Jev,一个非自回归的校准决策模型,可在低于 500ms 的延迟下并行执行类型化概率微决策,成本远低于通用 LLM。Jev 提供 Noul、Choice、Score 三种原语,用于 GraphRAG 的实体消解、跨本体 schema 映射与边权重标注。文章提出由 Jev 承担 System 1 微决策、LLM 负责 System 2 推理的双引擎架构。
作者把 gpt-6-astra 和 gpt-5-nano 生成的 400 条影评混入 Mendeley 的 200 条真人参考影评,实测 perplexity、近重复相似度和嵌入密度三种 AI 文本检测方法。
实验提出 hRoPE,为段落、句子和 token 索引各设相互独立的旋转通道,以检验 Transformer 的位置编码是否丢失层级信息。在 WikiText-2、OpenWebText 和 Python 源码三个语料上,抹掉真实段落边界会降低跨段注意力,插入假边界则抬高它。
AWS 的 NarrateAI 团队公开了在 Amazon Bedrock 上实现生产级 LLM 质量保障的五种技术,覆盖自适应流水线编排、跨账号多模型故障转移、实时流式评估、复合评估框架和数据准确性验证。
AWS 官方博客给出在 Amazon SageMaker AI 上通过 JumpStart 部署 Qwen3-TTS-12Hz-1.7B-Base 到实时推理端点、并用几秒参考音频做语音克隆的完整步骤。
Datacor 将 Amazon Quick Sight 嵌入 TrackAbout,为气体与焊接分销商提供自助式租赁分析仪表盘与自然语言搜索栏。TrackAbout 客户合计管理 2750 万个资产、每月超 72.5 万张账单,此前租金数据只能靠 IT 生成的报告获取。自然语言问答由 Amazon Q in Quick Sight 驱动。
Amazon SageMaker HyperPod 搭配 Qumulo 的 CNQ 与 Cloud Data Fabric(CDF),让训练集群无需复制数据即可读取另一 AWS Region 的数据集。
在反思自己过度依赖 AI 后,作者改为把 AI 当学习向导,梳理出 10 个 AI 之外的技术概念。前四个是量子计算、后量子密码学(PQC)、分布式系统与边缘计算,其余涵盖云架构、事件驱动架构、零信任架构、数字主权、数据网格与数字孪生。文中引用 McKinsey 数据称,全球量子技术市场未来十年规模最高可达 $100 billion。
GitHub 的 Primer Design System 将所有组件从 CSS-in-JS 迁移到 CSS Modules,到 2024 年 12 月完成,服务端渲染页面耗时减少 55%,组件初始化耗时减少 25%。
作者在系列第二部分对比多步概率预测的两种做法:确定性 rollout 只把预测均值 μ 回喂作为上下文,随机 rollout 则从预测的高斯分布采样后回喂,两者代码只差一行。
作者用纯 Python 实现了纯检索 RAG、确定性动作规划器和混合系统三种版本,在同样的九个任务上各跑一遍,只有混合系统同时通过知识类与知识加动作类任务。系统基于 22 篇文章切出的 334 个 chunk 语料和 TF-IDF 检索,构建过程中作者发现并修复了两个解析器 bug,混合系统一度在纯知识任务上失败。
TypeSafe AI 推出的 System One 模型 Jev 在作者自测的 3,080 条 Banking77 银行客服消息分类任务中准确率 81.1%,比 Qwen3-Coder-Next-80B-A3B 高 4.7 个百分点,两者中位响应时间分别为 245 ms 和 249 ms。
推荐理由:作者用同一批银行客服消息对比 Jev 与 Qwen,并检验置信度阈值和级联回退是否真的有效。
AWS WhisperX DLC 可部署到 Amazon SageMaker AI 实时或异步端点,无需构建自定义镜像。WhisperX 基于 OpenAI Whisper,增加批量推理、wav2vec2 逐词时间戳和说话人分离,支持 json、verbose_json、srt、vtt 输出。实时端点限 60 秒内短音频,长音频和高吞吐批处理建议用异步端点。
平台账户用 Amazon Bedrock AgentCore Gateway 把各业务线账户的 MCP server 聚合成单一 MCP 端点,智能体无需复制数据即可跨账户发现并调用工具,数据只在查询时流出所属账户。
Aderant 通过 Amazon Bedrock 调用 Amazon Nova Lite 构建 Intelligent Ticket Analyzer,为 38 人 SierraOps 团队自动分类、路由工单并补全上下文。
作者分享延长 Claude Code 与 Codex 订阅额度的做法,核心是让 Claude Fable、GPT-6 Astra 做编排,由 Claude Opus、GPT-5.6 SOL 执行子任务。
Ari Joury 在 Towards Data Science 撰文提出,RAG 只是把候选证据交给模型,无法证明模型刚生成的论断得到支持,应把控制单位从文档下沉到原子论断。
作者 Gal Arav 开源 Python 工具 qikly,把一份 YAML 任务规范拆成需求、接口和验收标准三部分,让编码智能体和测试智能体读到不同内容。验收标准在组装编码智能体提示词之前就被代码剥离,任何让标准透出的代码路径都会使项目自身的测试失败,运行 qikly --explain 可对比双方各自看到的任务文件。
作者认为流水线中的必填字段和相似度缓存都会在正确答案为空时返回编造值,并以自建的开源本地 RAG 检索系统为例做了验证。他用自写的西班牙语行政问题对测试 bge-m3,加入仅差一个 token 的改写对照后 AUC 从 0.3556 升到 0.9333,但最低被接受的改写仍低于最高被拒绝的否定句,因此没有可用阈值。
推荐理由:文中记录了作者自建语义缓存的阈值实验与失败细节,并提出可套用到抽取和检索组件的三个自查问题。
HEMA 基于 MCP 和 Amazon Bedrock AgentCore 构建内部 AI 助手 HAL,把分散在门户、wiki 与文档中的知识集中,并在 HAL 聊天、Kiro、Claude 等工具中直接提供答案。此前查一个答案需在 3 或 4 个门户间跳转、有时耗费整个下午,现在可在 IDE 或聊天窗口几秒内完成;当前为只读知识层,下一步将转为可执行操作层。
AWS 在官方博客给出基于 Strands Agents SDK 的对话式视频智能方案,由大模型在运行时决定调用 Amazon Bedrock、Amazon Rekognition 还是 Amazon Transcribe,不再为每类问题预建处理流水线。
OpenCode 可接入 Amazon Bedrock 的开放权重模型,作为终端 AI 编程智能体在本地运行、推理留在 AWS 账户,且无按席位费用。示例模型包括 Moonshot AI Kimi K3、OpenAI GPT-OSS 120B 与 NVIDIA Nemotron 3 Super 120B。
Simon Willison 展示了一个由 Fable 5.1 Medium 构建的交互式 artifact,用实时示例讲解 CSS Shadow roots。示例涵盖样式封装、继承、slots、parts 和 JavaScript 访问。它展示 shadow root 如何创建带私有样式表和元素的隔离 DOM 树,并以特定、受控方式与页面 DOM 交互。
作者在没有 PyTorch 和自动微分的情况下,用纯 NumPy 手写反向传播,复现了 Anthropic 2022 年论文《Toy Models of Superposition》的实验。
TF-IDF 被拆成 tokenization、词表、TF、IDF、Python 实现、PCA 可视化与文本分类,解释文本如何转为数字向量。4 条示例文档中,TF 看词在单篇中的频率,IDF 由 DF 衡量词在全部文档中的稀有度,TF×IDF 得到 TF-IDF。最后列出 TF-IDF 的局限,并转向嵌入向量。
GRPO 让模型对同一问题采样多次作答,用可验证奖励为每个答案打分,再以组内平均奖励为基线比较各次尝试来更新模型,无需单独的 critic。该方法由 DeepSeekMath 工作提出,用以替代传统 PPO 的内存开销,文中用「6 箱每箱 8 件、卖出 6 件、答案 42」的算术题演示打分与优势计算。组内奖励完全一致时优势全为零,模型无法判断该偏好哪次尝试。
作者用 500 局 CartPole 数据训练了一个 13,635 参数的 GRU 世界模型,预测下一步状态变化与是否翻车。该模型单步预测误差为 3.8 毫米车位置和 0.00026 弧度杆角,可信滚动预测视界为 29 步;配合 200 条随机动作序列的规划,100 局全部拿到 500/500。
推荐理由:从 CartPole 出发手写世界模型,对比 DQN 展示同一模型如何零重训切换目标。
OpenAI 将 Habitat 从 Python 库演进为全球分布式存储平台,以支撑超过 10 亿 ChatGPT 用户。该平台每秒需处理 22M 请求。
Google Search 提供三种赛事备战用法:AI Mode 的 Canvas 工具可生成个性化训练计划,连接 YouTube Music 账号后可定制跑步歌单,并可搜索跑鞋、水袋背心等装备。
TRL v1.14 的 AsyncGRPOTrainer 已支持只训练 LoRA 适配器并把它同步到 vLLM,这篇实践在此基础上把训练与推理拆到不同机器上。训练器、两个 vLLM 副本各跑一个 HF Jobs,通过挂载同一个 Storage Bucket 传递适配器而不依赖 NCCL,中间的一个代理负责按 KV 前缀路由 rollout 并向所有副本广播适配器加载。
推荐理由:这篇实践给出跨 Job 的 LoRA 异步 GRPO 配方与代理路由细节,其瓶颈定位方法可迁移到其他异步训练部署。
Hugging Face 用 Gradio Workflow 把 AUTOMATIC1111(stable-diffusion-webui)的多数功能重建为一个工作流画布 Workflow1111,由 11 条媒体流水线和 73 个节点组成。
推荐理由:读者可以看到把 AUTOMATIC1111 式图像流程拆成节点图后,输出如何自动变成 REST 与 MCP 接口。
作者在 Antigravity IDE 中让 Gemini 排查 OnePlus 手机屏幕上持续显示的红色速度调试文本,最终定位到 persist.log.tag 被设为 V 触发了全局 verbose 日志。
作者发布 FundFinderAI,一款面向小型 NGO 的资助搜索工具,用 Gemini 搜索接地实时检索当前开放的资助,并在展示前独立抓取核验每条申请链接(fundfinder-ai.vercel.app)。