跳到正文

全部动态

今日 668 条
8月28日周五
  1. Google DeepMind62

    Google DeepMind 发布 Gemini Omni 1.1 Flash,新增场景扩展、首尾帧插值与 4K 放大

    Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者带来场景扩展、首尾帧插值、360p 快速草稿和最高 4K 放大等生成式视频能力,已通过 Gemini API 在 Google AI Studio 上线。

    推荐理由:相较于此前只参考最后一秒,Omni 1.1 把场景扩展的前序上下文提高到 10 秒,便于评估长视频工作流的可行性。

  2. Google Blog:AI65

    Google 在 Search AI Mode 中新增机票价格追踪、积分比价与酒店预订

    Google 为 Search 的 AI Mode 新增机票价格追踪、积分或里程价格查看和酒店预订三项旅行功能。机票价格追踪沿用 Google Flights 的能力,已在 180 多个国家和地区上线,价格来自 300 多家合作航司和旅行网站。

    推荐理由:Google 把机票价格追踪、积分比价和酒店预订接入 Search AI Mode,可看搜索入口向交易环节延伸的落点。

8月27日周四
  1. Google DeepMind44

    Google 试点全球首个双盲 AI 评测,Gemini Flash Lite 参与机密基准测试

    Google 联合新加坡 AI Safety Institute、OpenMined、AVERI 和 MLCommons,试点全球首个针对专有前沿模型的“双盲”评测,把外部评测限制在加密“盒子”内,避免模型提前看到测试题。该评测以 Gemini Flash Lite 在隐私保护环境中运行机密基准,提升评测可信度。其针对的是基准污染问题——模型若提前见过题目,分数会被虚高。

  2. Google Research41

    GlucoFM:面向连续血糖监测的基础模型

    GlucoFM 是面向连续血糖监测(CGM)的自监督基础模型,双流设计分离慢速血糖趋势与短期偏差。它基于 109,066 小时无标注 CGM 数据预训练,在 14 项队列-任务评估中平均 PR-AUC 比最佳 GluFormer 变体高 5.8 个百分点。餐后血糖响应预测中其 MAE 在 Dexcom 和 Libre 上最低,并具备最佳跨数据集迁移能力。

8月26日周三
  1. Google Research34

    AgentHands:为 XR 中空间化智能体对话生成交互式手势

    Google 在 CHI 2026 发布研究原型 AgentHands,将 LLM 的高层推理映射为与语音同步的手势,用于 XR 中空间化的智能体对话。系统通过眼动与场景重建标记物体,由头显本地解析器按词级时间戳把 TTS 与手势动画对齐。在 N=12 的用户研究中,它对照纯语音基线完成兰花养护与 3D 打印机操作任务,空间定位效果显著提升。

8月25日周二
  1. HuggingFace Blog67

    Gradio 推出 gr.Workflow,把 AI 管线变成可运行节点图与 REST API

    Gradio 内置的 gr.Workflow 把 AI 管线变成可运行的节点图,每个节点能单独运行并就地显示中间结果,同一张图同时是 REST API 和一键部署到 Hugging Face Spaces 的入口。

    推荐理由:Gradio 把多步 AI 管线做成可视化节点图,并自动生成 REST 接口与部署入口,读者可据此了解这套搭建方式。

  2. Mistral AI44

    Mistral 与 HUMAIN 宣布战略合作,推进沙特主权 AI

    Mistral 与 HUMAIN 宣布战略合作,将在沙特及中东地区推进主权 AI,覆盖 AI 基础设施、先进模型开发与 AI 解决方案部署。初期聚焦网络安全与语音,并计划开发阿拉伯语表现强劲的前沿模型;Mistral 将探索使用 HUMAIN 的数据中心基础设施。合作规模达数亿欧元,双方还计划在沙特面向受监管行业制定联合市场推广策略。

8月22日周六
8月21日周五
  1. Google Research36

    Google Research:移动性数据如何让语言模型更深入理解地点

    Google Research 提出 ME-POIs 框架,将匿名聚合移动性模式与语言模型的地点文本嵌入对齐,生成同时编码地点身份与动态功能的嵌入向量。在公开基准上,该框架对未见地点的访问意图预测相对提升最高 81.9%,价格等级分类提升 75.1%,繁忙度估计准确率提升 24.7%。其流程包含访问对齐、空间多尺度访问传播和文本-移动性协同,用于缓解长尾地点数据稀疏问题。

  2. HuggingFace Blog62

    Hugging Face 用三种方法检测语音识别基准过拟合,11 个开源 ASR 模型被检出复现错误参考文本

    Hugging Face 发布研究,用三种探测方法量化语音识别中的基准优化现象,评测 11 个开源 ASR 模型后发现部分高分模型会复现 VoxPopuli、LibriSpeech 参考文本里的错误内容,即使音频与之矛盾。

    推荐理由:原文用三种探测方法量化 ASR 模型对公开基准的过拟合,并给出开源脚本与榜单入口,可作为自查评测可信度的参考。

8月20日周四
  1. Google Blog:AI56

    Google 搜索推出 5 项 AI 学习辅助工具

    Google 在 Search 中推出 5 项学习辅助功能,包括交互式可视化、定制练习题、Lens 分步讲解、AI Mode 笔记本和自定义学习文件。练习题支持 ACT、AP、GRE、SAT 等标准化考试,内容来自 The Princeton Review、Careers360、PhysicsWallah 和 Akira Enem 的合作素材,现以英文在全球免费提供。

8月19日周三
8月18日周二
  1. HuggingFace Blog69

    Sentence Transformers v6.0 新增 MultiVectorEncoder,支持 ColBERT 式后交互检索

    Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,用于 ColBERT 式后交互检索,可直接加载 PyLate 与 Stanford-NLP ColBERT 检查点。

    推荐理由:文章展示 Sentence Transformers v6.0 的多向量编码器如何用 token 级向量与 MaxSim 换取更高检索质量,并给出可直接运行的接入代码。

  2. HuggingFace Blog40

    约束感知 GPU 分配器:同一集群利用率提升 33 个百分点,变的是分配顺序

    约束感知 GPU 分配器让相同硬件与同一批负载下的利用率最多提升 33 个百分点,优先加权产出最多提升 105%。五个竞争场景中,利用率从 52–85% 升至 72–88%,优先加权价值平均提升 52%,最高 105.1%。最强单例是 8 GPU 训练密集型负载,利用率由 53.6% 升至 87.0%,关键在于实时推理按需求曲线分配、批式任务按优先级跨整个调度周期放置。

8月17日周一
8月16日周日
  1. Google AI:DEV 作者专属32

    Fetch:扫描狗狗照片,即可聊天、生成护理计划并听它的故事

    Fetch 是一款 AI 狗狗伴侣应用:上传一张照片即可识别最可能的品种,并给出性格、体型、能量水平和护理建议。同一只狗的资料贯穿聊天助手、一键护理计划(可应用内阅读、下载 PDF 或打印)和有声故事书三处;Gemini 承担视觉品种识别、品种相关聊天、结构化护理计划和故事生成,ElevenLabs 提供故事旁白。

8月14日周五
  1. Google AI:DEV 作者专属31

    我做了 Dog Mind:用 Google Gemini 和 ElevenLabs 把狗的照片翻译成情绪与内心独白

    Dog Mind 是一个 AI 网页应用,上传狗照片即可生成品种猜测、情绪评分、肢体语言观察和虚构内心独白。它用 Google Gemini 做多模态分析、ElevenLabs 合成配音,提供六种声音人格和最多三个追问,对话记录 24 小时后过期。代码已在 GitHub 开源,应用部署在 Vercel,定位为娱乐用途。

  2. HuggingFace Blog69

    Hugging Face 发布 2026 夏季开源模型报告,Qwen 衍生模型达 151,448 个

    Hugging Face 发布 2026 夏季开源模型报告,基于 Hub 2026 年 1 月至 8 月的活动数据给出六项观察。报告显示模型仓库从 2.43 增至 2.96 百万、数据集从 71.1 万增至 100 万,但 85.6% 的模型累计下载不足 200 次,1.5% 的仓库占 99.2% 的下载量。

    推荐理由:报告用 Hub 数据对比中美开源模型的规模与许可策略,并给出下载量与点赞所反映的不同生态信号。

8月13日周四
8月12日周三
  1. Google DeepMind72

    Google DeepMind 发布手语转文本模型 SL2T,Gboard 与 Live Transcribe 在 Pixel 11 上线 ASL 听写

    Google DeepMind 发布多语言手语转文本模型 SL2T,并在 Gboard 与 Live Transcribe 中上线手语听写功能,先在 Pixel 11 上支持美国手语(ASL)转英文。

    推荐理由:SL2T 用 10 万小时、50 多种手语数据训练并直接落到 Gboard 与 Live Transcribe,可作为手语翻译产品化的参考。