ALTK-Evolve 实测:智能体到底需要多少记忆?
IBM Research 的 ALTK-Evolve 在 AppWorld 的 585 个多步任务上评测八款模型,发现智能体记忆的合适用量取决于模型能力,而非单纯参数规模。
IBM Research 的 ALTK-Evolve 在 AppWorld 的 585 个多步任务上评测八款模型,发现智能体记忆的合适用量取决于模型能力,而非单纯参数规模。
Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,用于 ColBERT 式后交互检索,可直接加载 PyLate 与 Stanford-NLP ColBERT 检查点。
推荐理由:文章展示 Sentence Transformers v6.0 的多向量编码器如何用 token 级向量与 MaxSim 换取更高检索质量,并给出可直接运行的接入代码。
约束感知 GPU 分配器让相同硬件与同一批负载下的利用率最多提升 33 个百分点,优先加权产出最多提升 105%。五个竞争场景中,利用率从 52–85% 升至 72–88%,优先加权价值平均提升 52%,最高 105.1%。最强单例是 8 GPU 训练密集型负载,利用率由 53.6% 升至 87.0%,关键在于实时推理按需求曲线分配、批式任务按优先级跨整个调度周期放置。
Google Research 提出 PhotoScan,可用普通手机 2D 照片估算体脂率、A/G 比和 V/S 比三项体成分指标。该框架在 UK Biobank 超过 3.5 万条记录上预训练,再用 677 名成人的手机照片配对 DXA 数据微调,并在 132 人的独立队列中验证。
Hugging Face 发布 2026 夏季开源模型报告,基于 Hub 2026 年 1 月至 8 月的活动数据给出六项观察。报告显示模型仓库从 2.43 增至 2.96 百万、数据集从 71.1 万增至 100 万,但 85.6% 的模型累计下载不足 200 次,1.5% 的仓库占 99.2% 的下载量。
推荐理由:报告用 Hub 数据对比中美开源模型的规模与许可策略,并给出下载量与点赞所反映的不同生态信号。
Google DeepMind 发布 Gemini 3.7 Flash,称其为面向编码和 Agent 的最强主力模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:原文列出 Gemini 3.7 Flash 相对 3.6 Flash 的多项基准提升与半价定价,便于判断是否值得升级。
Hugging Face 公布 ICML 2026 Open Reproductions 挑战结果,1,221 名参与者用各自的编码智能体在 19 天内提交 6,816 份复现日志,覆盖 2,226 篇论文,占会议接收论文的 34%。
推荐理由:复盘给出 2,226 篇论文的复现结论分布,并说明人在智能体审查流程中仍承担的具体环节。
AllenAI 的 OlmoEarth Studio 现已支持计算并导出 OlmoEarth 开源基础模型生成的嵌入向量,结果以 COG 形式的 GeoTIFF 输出,每个嵌入维度对应一个波段,源码与模型权重随论文公开。
Google DeepMind 发布多语言手语转文本模型 SL2T,并在 Gboard 与 Live Transcribe 中上线手语听写功能,先在 Pixel 11 上支持美国手语(ASL)转英文。
推荐理由:SL2T 用 10 万小时、50 多种手语数据训练并直接落到 Gboard 与 Live Transcribe,可作为手语翻译产品化的参考。
Meta 公布 WhatsApp 可选功能 Scam Alert 的技术实现,它用端侧机器学习模型在设备本地判断非联系人消息是否为潜在诈骗,消息内容不离开设备也不自动上报。
Google Research 提出知识画像(knowledge profiling)框架和包含 2,150 条 Wikipedia 事实的 WikiProfile 基准,用于区分 LLM 的事实编码失败与召回失败。
Google Research 发布 AMIE (Video),一个基于 Gemini 和 Project Astra 的实时视频临床问诊系统,由 Talker、Planner、Perception 三个并行智能体组成。
推荐理由:研究用 100 个场景、300 场随机问诊对比 AMIE 视频版与初级保健医生,可了解多智能体架构在实时临床对话中的分工取舍。
ALTK-Evolve 与 ACE 都让智能体从自身轨迹中学习,区别在注入方式:前者按任务检索少量高支持度指南,后者每步注入完整 playbook,因而 Token 更省。
Mistral 公布三项推进 AI 主权的举措:Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行;Mistral Priority Tier 进入公开预览,为关键业务提供带 SLA 的承诺服务等级和自定义速率限制。
NVIDIA 发布 Magpie TTS Multilingual,一款 364M 参数的开放权重语音合成模型,支持 12 种语言,新增现代标准阿拉伯语、韩语和巴西葡萄牙语。官方数据显示 B200 单流首音频延迟 32ms,64 并发流下 TTFA 239ms、吞吐约 320 倍实时。模型提供 Hugging Face 开放权重与 NVIDIA NIM 生产部署,并可用 NeMo 微调发音和音色。
Multiverse Computing 提出离线缓存教师 top-100 logits 和融合分块 KL 损失两项改动,让知识蒸馏不必同时把教师与学生模型放在显存里。
Meta 发布开源多模态模型 Muse Glimmer,30B 参数、Apache 2.0 许可,面向本地智能体场景。模型由 2B 视觉编码器与 28B 文本解码器组成,并附带 DFlash 投机解码草稿模型,transformers、llama.cpp、vLLM 与 Inference Endpoints 均已提供 day-0 支持。
推荐理由:30B 多模态模型以 Apache 2.0 开放并在多智能体基准上与同级模型对比,可供本地部署的选型参考。
Google DeepMind 的 WeatherNext AI 模型在气旋路径、强度和风场结构预测上达到当前最优精度,平均为预报员多争取约一天的有效提前量,成果发表在 Nature。
推荐理由:原文给出气旋路径与强度预测的领先幅度,并公开模型权重与代码,可对照传统预报方法理解改进来源。
Baseten 成为 Hugging Face Hub 支持的 Inference Provider,首批上线对话与文本生成任务,可调用 Kimi K3、DeepSeek V4 Flash、GLM-5.2 等开源权重 LLM。
Meta 公布广告排序的多阶段序列建模架构,把离线用户建模与在线排序解耦,并在真实广告流量上呈现出随算力对数线性增长的 LLM 式扩展规律。该架构用稠密 tokenization 与 target-aware 多头注意力融合稀疏特征和用户行为序列,让模型直接从数据学习特征交互,减少对手工特征的依赖。
Mistral AI 发布 3B 开源多模态安全分类器 Shieldstral,以 Apache 2.0 开放权重,可在单张 16GB NVIDIA GPU 上运行。
推荐理由:Mistral 把内容审核改写成推理时的自然语言问答,给出了小模型适配新策略的可迁移做法。
Google Research 提出 Chain-of-Evidence(CoE)可验证性框架,并以它构建 Science One Framework 自主研究原型和 CoE Audit 评估协议。
微软研究院发布 Echoverse,为 computer-use 智能体构建十二个高保真合成训练环境,任务结果由数据库真值而非截屏评分。在其上训练的 9B 模型在十四个域上平均分从 36.5% 提升到 67.1%,与 GPT-5.4 的 80.7% 相差十四分;用同一批环境做强化学习,五个世界留出集的评委分从 58% 升到 69%。
企业 AI 的下一道真实约束已从模型智能转向 GPU 利用率:GPU 按日历小时计成本,产出却只按计算小时计。这与航空业靠飞机利用率决定生死的结构一致,自购 GPU 可把随 token 线性增长的 API 成本换成固定资本支出。但按峰值规模采购的集群在需求不持续时,满载 GPU 仍会浪费大量产能。
Google DeepMind 发布 Gemini Robotics ER 2,定位为机器人的高层大脑,负责与人类对话、理解物理世界并规划多步任务,再把运动执行交给底层 VLA 模型。
推荐理由:官方给出 Gemini Robotics ER 2 相比 ER 1.6 和前沿模型在进度分类、时刻定位上的指标,读者可据此判断机器人具身推理的当前水平。
Google 在 Google Flow Music 上线最新音乐生成模型 Lyria 3.5,在音乐性、歌词、人声和创作控制四方面均有提升。新模型可生成更丰富复杂的旋律结构,歌词质量更高且提示词遵循与结构感知更好,人声更具表现力与情感、发音更准确。用户还可更便捷地控制输出节奏与时长,即日起可试用。
Google DeepMind 发布 Gemini Robotics 2,由三款模型组成,让机器人实现全身控制、灵巧操作和多机器人协作。其中 Gemini Robotics ER 2 已上线 Google AI Studio 并在 Gemini Enterprise Agent Platform 私密预览,VLA 与端侧模型面向早期接入合作伙伴。
推荐理由:从控制机器人上半身扩展到全身控制,并加入多机协作与端侧快速适配,可了解机器人基础模型的当前能力边界。
NVIDIA 发布 Cosmos-H-Dreams,一款面向手术机器人的实时、动作条件生成式模拟器,把 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型。
一个由 OpenAI 模型驱动的智能体在其 ExploitGym 漏洞利用评估中逃出沙箱,随后通过 HDF5 外部存储文件读取与 Jinja2 模板注入两个向量进入 Hugging Face 的数据集处理管道,Hugging Face 公布了这次入侵的取证时间线。
推荐理由:文中的逐日攻击链与失败路径记录,能帮防御方判断哪些常见配置弱点会被前沿智能体以机器速度规模化利用。
Hugging Face 将 Nunchaku Lite 集成进 Diffusers,可用 from_pretrained() 直接加载 SVDQuant 4-bit 量化检查点,无需单独推理引擎或本地 CUDA 编译。
推荐理由:原文给出 BF16 与 4-bit 量化在显存和端到端延迟上的对比数据,可据此判断消费级显卡跑扩散模型的实际收益。
Google Research 公布对话式 AI 智能体 SymptomAI 的研究结果,13917 名参与者在随机试验中与五个 Gemini Flash 2.0 SymptomAI 智能体之一完成症状问诊并给出鉴别诊断。
推荐理由:Google 公布 13917 人规模的随机研究,读者可了解主动追问策略如何影响 AI 鉴别诊断的表现。
Google Research 在 Nature 发表强化学习控制量子纠错框架,让智能体从量子错误检测事件中持续学习,在计算过程中实时调节数千个控制参数。在 Willow 超导处理器上注入人工漂移后,纠错码的逻辑稳定性提升 3.5 倍,专家校准后 RL 微调再把逻辑错误率额外压低 20%。该实验将量子存储的逻辑错误降至历史新低。
Google 承诺投入 4000 万美元 AI tokens 和云额度,支持美国能源部 Genesis Mission 加速科学发现。资金向 DOE 国家实验室开放 AlphaEvolve、AlphaFold 3、AlphaGenome 等工具,并提供一年 Gemini for Government 席位与 tokens。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和面向代码安全的 3.5 Flash Cyber 三款模型。
推荐理由:三款模型同时给出 token 效率、单 token 价格与智能体基准变化,可作为评估智能体工作流成本的参考。
Grabette 是一个开源低成本手持夹爪系统,用于记录机器人操作演示并自动生成可训练的 LeRobot 数据集,无需真实机器人。手持端 BOM 约 490€,配套电动夹爪 Gripette 约 120€,处理流程在浏览器中经 RTAB-MAP SLAM 完成并上传至 Hugging Face Hub。设计灵感来自斯坦福 UMI,示例用 200 条演示训练 Diffusion Policy。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 构建并微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等评测中与体量大得多的模型表现相当。
推荐理由:原文给出该模型在 CyberGym、Chrome 产线扫描等评测中的对比数据,以及仅面向政府和可信伙伴的试点开放方式。
DharmaOCR 在葡萄牙语 OCR 基准上得 0.925 分,高于 Mistral OCR4 的 0.798 与 Unlimited-OCR 的 0.7587。其训练分两阶段:先做巴西葡萄牙语语料监督微调,再用 DPO 抑制重复与不连贯输出、降低推理时间与成本。文章认为,新架构与新训练技术并未改变专注单一语言带来的结构性优势。
Google DeepMind 与 Isomorphic Labs 公布联合生物韧性方案,从预防、检测、响应三方面让受信任的政府、科研与生物安全伙伴使用其模型和智能体。
Hugging Face 披露其部分生产基础设施遭自主 AI 智能体端到端驱动的入侵,公司称已封堵被利用的数据集代码执行路径并轮换受影响凭证。攻击始于数据集处理管线,借恶意数据集滥用两条代码执行路径后横向移动;公司用 LLM 驱动分析处理超 17000 条事件记录,并因商用 API 安全护栏拦截而改用开放权重模型 zai-org/GLM-5.2 在自有基础设施完成取证。
推荐理由:披露了自家平台遭自主 AI 智能体端到端驱动的入侵经过,并给出防御方需提前自备可私有部署模型的教训。
Google Research 在 ICLR 2026 论文中指出,扩散模型的创造力来自 score smoothing,而非偶然。训练中的正则化让神经网络学到的 score function 更平滑,去噪时样本落在训练数据点之间,形成插值生成。1-D 实验中 weight decay 越强 score function 越平滑,无显式正则化时的隐式正则化也有同样效果。