如何用 LiteRT 与 Gemma 在树莓派上运行端侧 AI
Google 在开发者博客给出在树莓派 5 上用 LiteRT 与 Gemma 运行端侧 AI 的部署指南。据文中数据,Gemma 4 E2B 在 LiteRT-LM 下达到 99 tokens/sec prefill 与 9 tokens/sec decode,峰值内存 1432 MB。
Google 在开发者博客给出在树莓派 5 上用 LiteRT 与 Gemma 运行端侧 AI 的部署指南。据文中数据,Gemma 4 E2B 在 LiteRT-LM 下达到 99 tokens/sec prefill 与 9 tokens/sec decode,峰值内存 1432 MB。
ADK for Kotlin 1.0 正式 GA,与 ADK 1.0 Core 功能对齐并补齐 Android 优先的端侧扩展。框架基于 Kotlin Multiplatform(KMP)核心,可用 LiteRT-LM、ML Kit(beta)端侧运行智能体,经 Firebase AI Logic 编排混合云工作流,以 Room 和 AppSearch 跨进程重启持久化状态。
Google 宣布 Antigravity SDK 支持本地模型工作流,初期可通过 Google AI Edge 的 LiteRT 运行 Gemma 4 26B A4B,在完全离线状态下提供智能体辅助。
推荐理由:Antigravity SDK 把本地模型接入智能体工作流,读者可据此判断离线运行与云端混合编排的成本和隐私取舍。
曼彻斯特大学用 NVIDIA Earth-2 生成式模型训练出覆盖全英的空气污染模型,分辨率 2-3 平方公里,在 Isambard-AI 的单个八卡节点上仅用两天完成训练。
Google 介绍其语言技术已支持 300 多种语言,其中 Gemini 3.5 Live Translate 覆盖 70 种语言、2000 多个语言对,可实时翻译并处理语码转换和情绪线索。
Hugging Face 发布 @huggingface/kernels,一个从 Hugging Face Hub 加载并运行 WebGPU 内核的 JavaScript 库,同时上线 207 个内核,每个内核以独立仓库发布并采用 Apache-2.0 许可。
推荐理由:文中给出与 ORT WebGPU 的算子级对比数据和加载示例,可据此了解浏览器端推理的性能空间。
Liquid AI 发布 LFM2.5-DSpark 草稿模型检查点,覆盖 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 三个模型,通过投机解码在不改变输出质量的前提下最高提升 3.18 倍吞吐。
Google DeepMind 发布多语言手语转文本模型 SL2T,并在 Gboard 与 Live Transcribe 中上线手语听写功能,先在 Pixel 11 上支持美国手语(ASL)转英文。
推荐理由:SL2T 用 10 万小时、50 多种手语数据训练并直接落到 Gboard 与 Live Transcribe,可作为手语翻译产品化的参考。
Meta 公布 WhatsApp 可选功能 Scam Alert 的技术实现,它用端侧机器学习模型在设备本地判断非联系人消息是否为潜在诈骗,消息内容不离开设备也不自动上报。
Meta 发布开源多模态模型 Muse Glimmer,30B 参数、Apache 2.0 许可,面向本地智能体场景。模型由 2B 视觉编码器与 28B 文本解码器组成,并附带 DFlash 投机解码草稿模型,transformers、llama.cpp、vLLM 与 Inference Endpoints 均已提供 day-0 支持。
推荐理由:30B 多模态模型以 Apache 2.0 开放并在多智能体基准上与同级模型对比,可供本地部署的选型参考。
Mistral AI 发布 3B 开源多模态安全分类器 Shieldstral,以 Apache 2.0 开放权重,可在单张 16GB NVIDIA GPU 上运行。
推荐理由:Mistral 把内容审核改写成推理时的自然语言问答,给出了小模型适配新策略的可迁移做法。
Google DeepMind 发布 Gemini Robotics 2,由三款模型组成,让机器人实现全身控制、灵巧操作和多机器人协作。其中 Gemini Robotics ER 2 已上线 Google AI Studio 并在 Gemini Enterprise Agent Platform 私密预览,VLA 与端侧模型面向早期接入合作伙伴。
推荐理由:从控制机器人上半身扩展到全身控制,并加入多机协作与端侧快速适配,可了解机器人基础模型的当前能力边界。
Google Research 提出把 Multi-Token Prediction(MTP)头接到已冻结的 Gemini Nano v3 主干上,无需为每个任务微调独立的草稿模型即可实现端侧文本生成加速。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上推理速度最高提升 4 倍。
推荐理由:原文说明 DiffusionGemma 与 Gemma 4 的分工,前者面向低并发本地推理,并列出速度与质量上的取舍。
Google DeepMind 发布 Gemma 4 12B,一款无编码器的多模态模型,可在笔记本本地运行。该模型把视觉输入改为单次矩阵乘法的轻量嵌入模块,并去掉音频编码器,将原始音频信号投影到与文本 token 相同的维度,是 Gemma 4 系列首款支持原生音频输入的中等规模模型。
推荐理由:Gemma 4 12B 用无编码器架构让视觉和音频直接进入 LLM,性能接近 26B MoE 而内存占用不到一半。
Google Research 在 Nature 发表研究,提出 PHRM 系统,可在日常使用手机时后台监测心率(HR)与静息心率(RHR)。该系统利用前置摄像头在面部解锁后的数秒内拍摄视频,通过端侧深度学习估计心率,与 ECG 相比 MAPE 低于 10%,符合所有肤色人群的行业精度标准,日 RHR 与 Fitbit Charge 6 相比 MAE 为 4.39 bpm。
推荐理由:论文公开了 PHRM 的跨肤色误差数据与大样本数据集规模,读者可对照可穿戴设备理解被动健康监测的量化标准。
Google 公布基于零信任原则的隐私分析方案:新加密协议让设备只需提交单条消息即可完成安全聚合,无需长时间保持在线。该方案集成进 Google 的 confidential federated analytics,并与 TEE 结合形成多层防护,即使 TEE 安全模型失效数据也不会泄露。
Google DeepMind 发布 Gemma 4 开源模型家族,提供 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,采用 Apache 2.0 许可。
推荐理由:原文列出四档尺寸、Arena 排名与 Apache 2.0 许可,便于判断本地部署和微调的硬件与授权取舍。
Mistral 发布 Voxtral Transcribe 2 系列两款语音转写模型,包括用于批处理的 Voxtral Mini Transcribe V2 和面向实时场景的 Voxtral Realtime,后者以 Apache 2.0 权重在 Hugging Face 开源。
推荐理由:Realtime 以 sub-200ms 延迟和 Apache 2.0 权重开源,读者可据此比较实时语音应用的端侧落地成本。
Mistral 发布 Mistral 3 模型家族,包含稀疏 MoE 的 Mistral Large 3(41B 激活、675B 总参数)与三款密集小模型 Ministral 3(3B、8B、14B),全部以 Apache 2.0 开源。
推荐理由:Mistral 3 一并公布参数规模、开源许可与硬件适配方案,读者可据此对照自身部署条件判断选型。
TensorFlow 2.20 发布,tf.lite 模块将弃用,端侧推理开发迁移至独立仓库 LiteRT,新 API 提供 Kotlin 和 C++ 版本。LiteRT 面向 NPU 和 GPU 硬件加速,为 NPU 提供统一接口,并通过零拷贝硬件缓冲减少内存拷贝。
Mistral AI 发布语音理解模型 Voxtral,提供 24B 和 3B 两个尺寸,均以 Apache 2.0 许可开源,并已上线其 API。模型支持 32k token 上下文,可处理最长 30 分钟的音频转写或 40 分钟的音频理解,还能根据语音意图直接触发函数调用。
推荐理由:原文对比了开源 ASR 与闭源 API 在成本、部署上的取舍,并给出两档尺寸和 API 定价,可作为语音方案选型参考。
Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升了文本表现和多模态理解,上下文窗口扩展至最高 128k tokens。
推荐理由:官方列出多模态、长上下文与推理速度指标,可对照 Gemma 3、GPT-4o Mini 判断开源小模型的性能位置。
哈佛大学团队发布 Wake Vision 数据集,约 600 万张图像,规模约为 TinyML 人物检测数据集 VWW 的 100 倍。数据集分为侧重规模的 Large 与侧重标注质量的 Quality 两个训练集,精度较 VWW 最高提升 6.6%,人工标注验证下错误率从 7.8% 降至 2.2%。
TensorFlow 2.18 发布,支持 NumPy 2.0,并带来 LiteRT 仓库、Hermetic CUDA 与 CUDA 更新。TFLite 代码库将迁移至 LiteRT,完成后不再发布 TFLite 二进制版本。二进制包新增计算能力 8.9 的 CUDA kernel,最低支持 Pascal 架构。
XNNPack 为 TensorFlow Lite 的 Fully Connected 和 Convolution 2D 算子加入动态范围量化支持,CPU 推理性能较 fp32 基线提升 4 倍。
TensorFlow Lite 的 XNNPack 后端在 ARM CPU 上启用半精度(FP16)推理,浮点模型端侧推理性能提升 2 倍,现已正式可用。
借助 TensorFlow Lite 的 Flutter 插件,此前用 TensorFlow 训练并转为 TFLite 的强化学习棋盘游戏 Plane Strike 被移植到 Flutter,可在 Android 和 iOS 上运行。
TensorFlow Lite 的 Flutter 插件已正式迁移到 TensorFlow 官方 GitHub 仓库并发布,由 Google 团队直接维护。插件已更新至最新版 TensorFlow Lite,新增实时摄像头目标检测等示例应用,支持移动端、嵌入式、Web 和边缘设备,桌面端支持仍在开发中。
TensorFlow 团队用 Simpleperf 剖析并优化 TFLite 内存 arena 的初始化过程,tensor 分配开销从运行时占比 49.9% 降到 11%,示例模型运行时缩短 25%。
TensorFlow 2.13 与 Keras 2.13 已发布,TensorFlow 2.13 首次提供 Apple Silicon wheels,Keras V3 保存格式成为 .keras 扩展名文件的默认格式。
Google Research 健康 AI 团队展示如何用 TensorFlow Lite 在手机上运行孕龄与胎位评估模型,让只接受几小时培训、没有超声背景的人员通过盲扫协议采集视频就能得到与标准诊疗相当的预测结果。