跳到正文

端侧 AI

跑在手机、电脑与边缘设备上的 AI:小模型、本地推理与端侧芯片的进展。

最新精选

第 1–15 条 · 共 15 条
9月29日周二
9月1日周二
8月12日周三
  1. Google DeepMind72

    Google DeepMind 发布手语转文本模型 SL2T,Gboard 与 Live Transcribe 在 Pixel 11 上线 ASL 听写

    Google DeepMind 发布多语言手语转文本模型 SL2T,并在 Gboard 与 Live Transcribe 中上线手语听写功能,先在 Pixel 11 上支持美国手语(ASL)转英文。

    推荐理由:SL2T 用 10 万小时、50 多种手语数据训练并直接落到 Gboard 与 Live Transcribe,可作为手语翻译产品化的参考。

8月10日周一
  1. HuggingFace Blog79

    Meta 发布开源多模态模型 Muse Glimmer,30B 参数主打本地智能体

    Meta 发布开源多模态模型 Muse Glimmer,30B 参数、Apache 2.0 许可,面向本地智能体场景。模型由 2B 视觉编码器与 28B 文本解码器组成,并附带 DFlash 投机解码草稿模型,transformers、llama.cpp、vLLM 与 Inference Endpoints 均已提供 day-0 支持。

    推荐理由:30B 多模态模型以 Apache 2.0 开放并在多智能体基准上与同级模型对比,可供本地部署的选型参考。

8月4日周二
7月28日周二
  1. Google DeepMind66

    Google DeepMind 发布 Gemini Robotics 2,为机器人带来全身智能

    Google DeepMind 发布 Gemini Robotics 2,由三款模型组成,让机器人实现全身控制、灵巧操作和多机器人协作。其中 Gemini Robotics ER 2 已上线 Google AI Studio 并在 Gemini Enterprise Agent Platform 私密预览,VLA 与端侧模型面向早期接入合作伙伴。

    推荐理由:从控制机器人上半身扩展到全身控制,并加入多机协作与端侧快速适配,可了解机器人基础模型的当前能力边界。

6月11日周四
6月9日周二
  1. Google DeepMind77

    Google DeepMind 发布 Gemma 4 12B 无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,一款无编码器的多模态模型,可在笔记本本地运行。该模型把视觉输入改为单次矩阵乘法的轻量嵌入模块,并去掉音频编码器,将原始音频信号投影到与文本 token 相同的维度,是 Gemma 4 系列首款支持原生音频输入的中等规模模型。

    推荐理由:Gemma 4 12B 用无编码器架构让视觉和音频直接进入 LLM,性能接近 26B MoE 而内存占用不到一半。

6月5日周五
  1. Google Research62

    Google 提出 PHRM 系统,用手机前置摄像头被动监测心率与静息心率

    Google Research 在 Nature 发表研究,提出 PHRM 系统,可在日常使用手机时后台监测心率(HR)与静息心率(RHR)。该系统利用前置摄像头在面部解锁后的数秒内拍摄视频,通过端侧深度学习估计心率,与 ECG 相比 MAPE 低于 10%,符合所有肤色人群的行业精度标准,日 RHR 与 Fitbit Charge 6 相比 MAE 为 4.39 bpm。

    推荐理由:论文公开了 PHRM 的跨肤色误差数据与大样本数据集规模,读者可对照可穿戴设备理解被动健康监测的量化标准。

4月3日周五
2月5日周四
  1. Mistral AI63

    Mistral 发布 Voxtral Transcribe 2,推出实时与批处理两款语音转写模型

    Mistral 发布 Voxtral Transcribe 2 系列两款语音转写模型,包括用于批处理的 Voxtral Mini Transcribe V2 和面向实时场景的 Voxtral Realtime,后者以 Apache 2.0 权重在 Hugging Face 开源。

    推荐理由:Realtime 以 sub-200ms 延迟和 Apache 2.0 权重开源,读者可据此比较实时语音应用的端侧落地成本。

12月3日周三
7月15日周二
  1. Mistral AI65

    Mistral AI 发布语音理解模型 Voxtral,含 24B 和 3B 两个版本

    Mistral AI 发布语音理解模型 Voxtral,提供 24B 和 3B 两个尺寸,均以 Apache 2.0 许可开源,并已上线其 API。模型支持 32k token 上下文,可处理最长 30 分钟的音频转写或 40 分钟的音频理解,还能根据语音意图直接触发函数调用。

    推荐理由:原文对比了开源 ASR 与闭源 API 在成本、部署上的取舍,并给出两档尺寸和 API 定价,可作为语音方案选型参考。

3月17日周一