微软研究院推出 Quine:面向生物学复杂性的 AI 研究系统
微软研究院推出 Quine,一个面向生物学复杂性的 AI 研究系统,由跨序列、结构、功能、细胞状态和影像等模态训练的生物学世界模型,以及连接模型、科学工具、文献与研究者的交互框架组成。
微软研究院推出 Quine,一个面向生物学复杂性的 AI 研究系统,由跨序列、结构、功能、细胞状态和影像等模态训练的生物学世界模型,以及连接模型、科学工具、文献与研究者的交互框架组成。
Google Research 提出 Diffusion Controller 框架,把图像生成的反向去噪重构为连续控制问题,由轻量附加网络在冻结基座模型上施加引导。该框架在 Stable Diffusion v1.4 上以 SFT、RWL、PPO 三种方式评估,用 HPS-v2 衡量人类偏好对齐。其完全解锁版本对基线模型取得 90% 胜率,且无需改动闭源模型内部权重。
研究用往返协议测试 16 个语言模型,发现用自然语言序列化树结构表达式存在有损且不对称的瓶颈,最佳生成-抽取组合准确率 92.9%。交换生成端与抽取端会使准确率变化最多 60.4 个百分点,至少 73.6% 的失败源自生成端,难度由树结构而非模型家族决定。约 3600 条微调样本即可让所有开放权重模型超过未训练的 Gemini-3.1-Pro。
ProvenanceGuard 是面向 MCP 智能体的来源感知事实核查层,在不重训模型的前提下对黑盒智能体答案做后置验证,专门识别事实为真但归错来源的跨源混淆。在 281 条医疗智能体真实轨迹中,专家判定 361 条断言里 139 条不应通过,该方法拦下 138 条,可识别来源时约 86% 选对来源。
Google MaxText 团队在 Cloud TPU 上从头复现了 Ai2 的 Olmo 3 7B 预训练与中期退火,阶段 1、阶段 2 的损失曲线与 Ai2 公开参考在留出评估上对齐。
Google Research 提出 AI video co-director,一个构建在 Gemini 和 Veo 之上的统一多智能体编排框架,用于自动化生成跨镜头连贯的分钟级长视频。
GitHub 与耶鲁气候变化传播项目对 1,039 名 GitHub 用户的调查显示,80% 受访者有兴趣使用帮助写出更节能代码的工具,78% 想要减少软件环境足迹的最佳实践,74% 希望衡量软件或开发流程的影响。
Google Research 提出 MilleMiglia,一个用 C++ 编写的实例生成器,用于为中段物流配送问题生成真实基准,源代码和文档已在 GitHub 发布。中段物流覆盖最长距离且占物流总支出很大部分,但长期缺乏公开高质量数据,物流公司通常将网络拓扑和需求量视为敏感专有信息。MilleMiglia 可生成兼顾隐私的真实数据,模拟货物在配送中心换乘不同车辆、按时间窗接驳的接力运输。
Google 发布生成式 UI(GenUI)教育研究实验,教师可创建贴合自身课程目标的定制互动教学模拟,界面与内容动态生成。同时开放 30 多个英语 STEM 学习互动示例库,覆盖物理、化学、生物、数学,面向初高中,均由 AI 生成、教师审核。
REVERSAL-BENCH 用连续参数 ρ∈[0,1] 控制可逆性并提供重置 Oracle,覆盖 5 个物理引擎的 8 种操作任务。评估多种策略架构后发现可逆性悬崖:ρ 升高时无重置智能体被永久吸入不可恢复状态,而有回合重置的智能体仍稳定学习。该基准套件、带可恢复性标注的多模拟器数据集与重置 Oracle 已发布,另测试了在不可逆失败前介入的安全护盾。
OpenAI 公布了一套用于追踪、调查和披露模型失准的框架,同时给出六份关于模型意外或令人担忧行为的报告。该框架面向模型失准的记录、调查与对外披露三个环节,正文细节尚未随摘要一并提供。
OpenAI 经济研究显示,员工正在传统岗位职责之外使用 AI,以及哪些新活动会成为其工作中反复出现的部分。该研究关注员工如何借此解锁新的工作方式,而非局限于原有角色。
Glyph 是一个生产系统,把列描述生成与列类型标注建模为由状态图编排的协作式 LLM 智能体。Descriptor 从企业 GitHub 按需检索流水线源码来支撑生成。
TS-DFM 用能量导航替代离散流匹配训练中的盲随机跳步:轻量能量罗盘在每个中间点评估候选续写、选出最连贯的一支,且塑造仅在训练期进行,推理成本不变。在 170M 参数语言建模上,8 步学生模型的困惑度比 1024 步教师低 32%、速度快 128×,增益在多种源分布和三种规模递增的评估器上一致。其困惑度优于所有对比的离散生成基线,包括训练数据多 6× 或模型大 5× 的方法。
DACA-GRPO 为扩散语言模型强化学习引入去噪感知信用分配,可作为任意 GRPO 训练器的轻量即插即用增强。在三种 GRPO 基线方法上,它在涵盖数学推理、代码生成、约束满足与 JSON schema 遵循等七个 benchmark 上取得一致提升,最高增益分别为 5.6pp、7.4pp、36.3pp 和 5.9pp。
共享选择性持久记忆架构面向智能体 LLM 系统,只保留任务规范、数据 schema、工具配置与输出约束四类可复用上下文,工作区可按角色访问权限跨用户共享。在三个企业部署场景中任务完成率达 96%,高于无记忆的 79% 与保留完整历史的 71%。零 token 数据刷新免去重复更新的 LLM 重调用,任务耗时降低 14×;摘要驱动生成使单次调用 token 成本降低 97×。
Google Research 提出 Retrieve-for-Train 框架,用离线强化学习把奖励对齐的查询 fan-out 编译成监督信号,蒸馏进仅 53.9M 参数的扩散检索器,实现单次非自回归查询扩展。该框架微调 Gemma3-4B 和 Qwen3-4B,以集合级奖励评估整组结果,绕开零样本 LLM 的语义重复与数百个 CoT 推理 token 带来的自回归延迟。
ALTK-Evolve 新增一致性指南和一致性分析器,在 AppWorld test_normal 上把 GPT-4.1 ReAct 智能体的一致性差距从 24.4pp 收窄到 12.0pp。
Google 发布 AI & Economy ATLAS 新洞察,并上线开放访问的交互式数据体验,可按职业与国家查看 AI 使用率。与 Google DeepMind、MIT FutureTech 合作的研究显示,近半数受访科学家每天使用 AI,每周节省近 7 小时,但验证 AI 输出和临床验证等环节出现瓶颈。数据还显示印度创意行业 AI 使用率为全球平均的 1.6 倍。
OpenAI 表示正在分享一份由 AI 生成的纳维-斯托克斯千禧年难题解答,包含一份说明文档和一份 Lean 形式化证明。该条目目前只有这一句简要描述,未提供更多细节。
推荐理由:AI 生成的纳维-斯托克斯千禧年难题解答以 Lean 形式化证明一并公开,读者可关注机器产出数学证明的呈现方式。
Google Research 用 UK Biobank 欧洲人群数据向 Biobank Japan 迁移学习,评估跨人群多基因风险评分(PRS)的表现。在八项临床性状上,目标人群样本达 15k 以上时混合欧洲数据反而限制精度提升,仅 5,000 样本时混合 UKB 数据仍有增益。遗传相关性高的性状在目标样本 25-40k+ 前仍受益于混合训练,HDL、LDL 和血糖等高度人群特异性性状受益较小。
Google Research 与 HHMI Janelia 等机构合作,在 Cell 发表完整的雄性果蝇大脑与中枢神经系统连接组图谱,包含超 16.6 万个神经元和 1.25 亿个突触连接,是迄今按神经元数量计算最大的脑图谱。
BenchMIRT 是一种在单条 prompt 层面审计 LLM 基准测试的新方法,基于多维 IRT。它用 100 个 LLM、16 个 benchmark、超 34K 道题的结果训练,未被告知各 benchmark 测什么,却独立恢复出安全与通用推理两大维度。分析还发现 BBQ、WMDP 的得分更贴近通用推理而非安全。
Google 提出 MAPL-EMIT 深度学习框架,基于 Swin-S vision transformer 处理 NASA EMIT 卫星高光谱数据,可同时量化甲烷增强、分割羽流范围并定位点源,在专家标注羽流上召回率达 84%。
Google 在 Google Earth AI 下推出实验性研究能力行星预测引擎(PPE),可直接从自然语言查询出发,自动完成地理空间数据检索、特征工程到模型训练与评估的全流程,把原先需要数周的人工数据工程缩短到数分钟。
GlucoFM 是面向连续血糖监测(CGM)的自监督基础模型,双流设计分离慢速血糖趋势与短期偏差。它基于 109,066 小时无标注 CGM 数据预训练,在 14 项队列-任务评估中平均 PR-AUC 比最佳 GluFormer 变体高 5.8 个百分点。餐后血糖响应预测中其 MAE 在 Dexcom 和 Libre 上最低,并具备最佳跨数据集迁移能力。
Google 在 CHI 2026 发布研究原型 AgentHands,将 LLM 的高层推理映射为与语音同步的手势,用于 XR 中空间化的智能体对话。系统通过眼动与场景重建标记物体,由头显本地解析器按词级时间戳把 TTS 与手势动画对齐。在 N=12 的用户研究中,它对照纯语音基线完成兰花养护与 3D 打印机操作任务,空间定位效果显著提升。
Quantization-Aware Healing(QAH)让 GPT-OSS 120B 压缩到 60B、量化为 MXFP4 后,在 9 项基准中 7 项超过其 bfloat16 全精度版本。
Google 的 Biomarker Discovery Framework 把可穿戴传感器数据中候选生物标志物的筛选组织为人类监督下的多智能体迭代研究闭环。在三个队列共 9,279 条参与者观测上,它自动提出 41 个心理健康与 25 个代谢候选数字生物标志物。
Google Research 提出 ME-POIs 框架,将匿名聚合移动性模式与语言模型的地点文本嵌入对齐,生成同时编码地点身份与动态功能的嵌入向量。在公开基准上,该框架对未见地点的访问意图预测相对提升最高 81.9%,价格等级分类提升 75.1%,繁忙度估计准确率提升 24.7%。其流程包含访问对齐、空间多尺度访问传播和文本-移动性协同,用于缓解长尾地点数据稀疏问题。
Hugging Face 发布研究,用三种探测方法量化语音识别中的基准优化现象,评测 11 个开源 ASR 模型后发现部分高分模型会复现 VoxPopuli、LibriSpeech 参考文本里的错误内容,即使音频与之矛盾。
推荐理由:原文用三种探测方法量化 ASR 模型对公开基准的过拟合,并给出开源脚本与榜单入口,可作为自查评测可信度的参考。
IBM Research 的 ALTK-Evolve 在 AppWorld 的 585 个多步任务上评测八款模型,发现智能体记忆的合适用量取决于模型能力,而非单纯参数规模。
Google Research 提出 PhotoScan,可用普通手机 2D 照片估算体脂率、A/G 比和 V/S 比三项体成分指标。该框架在 UK Biobank 超过 3.5 万条记录上预训练,再用 677 名成人的手机照片配对 DXA 数据微调,并在 132 人的独立队列中验证。
Google Research 提出知识画像(knowledge profiling)框架和包含 2,150 条 Wikipedia 事实的 WikiProfile 基准,用于区分 LLM 的事实编码失败与召回失败。
Google Research 发布 AMIE (Video),一个基于 Gemini 和 Project Astra 的实时视频临床问诊系统,由 Talker、Planner、Perception 三个并行智能体组成。
推荐理由:研究用 100 个场景、300 场随机问诊对比 AMIE 视频版与初级保健医生,可了解多智能体架构在实时临床对话中的分工取舍。
ALTK-Evolve 与 ACE 都让智能体从自身轨迹中学习,区别在注入方式:前者按任务检索少量高支持度指南,后者每步注入完整 playbook,因而 Token 更省。
Multiverse Computing 提出离线缓存教师 top-100 logits 和融合分块 KL 损失两项改动,让知识蒸馏不必同时把教师与学生模型放在显存里。
Meta 公布广告排序的多阶段序列建模架构,把离线用户建模与在线排序解耦,并在真实广告流量上呈现出随算力对数线性增长的 LLM 式扩展规律。该架构用稠密 tokenization 与 target-aware 多头注意力融合稀疏特征和用户行为序列,让模型直接从数据学习特征交互,减少对手工特征的依赖。
Google Research 提出 Chain-of-Evidence(CoE)可验证性框架,并以它构建 Science One Framework 自主研究原型和 CoE Audit 评估协议。
微软研究院发布 Echoverse,为 computer-use 智能体构建十二个高保真合成训练环境,任务结果由数据库真值而非截屏评分。在其上训练的 9B 模型在十四个域上平均分从 36.5% 提升到 67.1%,与 GPT-5.4 的 80.7% 相差十四分;用同一批环境做强化学习,五个世界留出集的评委分从 58% 升到 69%。