TensorFlow Lite XNNPack 半精度推理正式可用,ARM CPU 端侧性能翻倍
TensorFlow Lite 的 XNNPack 后端在 ARM CPU 上启用半精度(FP16)推理,浮点模型端侧推理性能提升 2 倍,现已正式可用。
TensorFlow Lite 的 XNNPack 后端在 ARM CPU 上启用半精度(FP16)推理,浮点模型端侧推理性能提升 2 倍,现已正式可用。
TensorFlow 2.15 发布,Linux 上新增通过 pip install tensorflow[and-cuda] 安装 NVIDIA CUDA 库依赖的可选方式,CUDA 升级至 12.2。
TensorFlow v2 通过 DTensor 原生支持分布式 FFT,分片张量可直接传入 tf.signal.fft2d 等既有算子,输出同样保持分片。8xV100 GPU 上的 10K*10K 实验中,两个本地 FFT 算子只占总耗时 15ms 的 3.6%,约为非分布式 fft2d 的 1/3,其余时间主要耗在 ncclAllToAll 数据重排上。
TensorFlow Lite 的 Flutter 插件已正式迁移到 TensorFlow 官方 GitHub 仓库并发布,由 Google 团队直接维护。插件已更新至最新版 TensorFlow Lite,新增实时摄像头目标检测等示例应用,支持移动端、嵌入式、Web 和边缘设备,桌面端支持仍在开发中。
TensorFlow 2.13 与 Keras 2.13 已发布,TensorFlow 2.13 首次提供 Apple Silicon wheels,Keras V3 保存格式成为 .keras 扩展名文件的默认格式。