OTT3R:以 1% 算力实现多视角 3D 重建与快速数据集生成
OTT3R 是一个知识蒸馏框架,把 959M 参数的 π³ 蒸馏成 102M 参数的学生模型,压缩 9.4×、推理最高快 7×,训练算力仅为 VGGT 的 1.6%。
OTT3R 是一个知识蒸馏框架,把 959M 参数的 π³ 蒸馏成 102M 参数的学生模型,压缩 9.4×、推理最高快 7×,训练算力仅为 VGGT 的 1.6%。
研究者提出一种神经符号路由器,把结构化查询交给确定性求解器、只让 SLM 处理开放式应用题,路由逻辑用 L* 语法推断算法学习 DFA。在 Raspberry Pi 4B 的 100 条未测提示上,其路由准确率 100%、总准确率 98.3%,优于 Program-of-Thought 的 72.0%。
PTC-Decoder 是免训练、即插即用的解码器框架,将规划提升为原子工具并在首步推理强制调用,再由确定性有限自动机 TC-Decoder 对工具名施加 token 级硬约束。
TGL-NSGA-II 用预训练教师按难度与类别分层、以 KD-Lite 短程蒸馏打分,并融合高斯过程代理,为受限 TinyML 神经架构搜索提供低保真适应度近似。
Kangwook Lee 团队租下韩国一间网吧(PC bang),招募超过 1000 名真人玩家与早期版本对局,为可在端侧消费级 GPU 上运行的游戏 AI「Ally」收集 on-policy 数据。团队借鉴 DAgger 思路迭代采集轨迹并纠正后继续训练,将模型蒸馏至 2B 参数规模,还针对边缘设备 KV 缓存预算紧张的问题专门开发了上下文压缩算法。
I-Parakeet 将 NVIDIA Parakeet-CTC(0.6B 参数)改为纯整数实现,可在智能手机 NPU 上运行,无需浮点算子或 CPU 回退。关键改动包括整数化相对位置自注意力、minimax 优化的 Swish 近似,以及 BatchNorm 输出的 INT16 网格和重尾激活的百分位校准。
SEA-CLIP-Tiny 是参数量不足 50M 的多语言文本-视觉嵌入模型,面向东南亚语言,用 CLIP-KD 式框架结合区域数据筛选与多语言教师引导。在 7 种东南亚语言上,其平均检索表现在受评学生模型中最佳,R@1、R@5、R@10 分别为 12.9%、31.5%、42.2%。
CSCWD 通过跨尺度通道知识蒸馏,把 YOLO11m-P2 教师的高分辨率空间表征迁移到 YOLO11n 学生,且不改变其推理架构。在 Drone-vs-Bird 协议下,YOLO11n-CSCWD 达 50.17% mAP@0.5 与 59.73% recall,较 CA-YOLO11n baseline 提升 2.92 和 3.55 个百分点。
Google Research 提出把 Multi-Token Prediction(MTP)头接到已冻结的 Gemini Nano v3 主干上,无需为每个任务微调独立的草稿模型即可实现端侧文本生成加速。
Google Research 在 Nature 发表研究,提出 PHRM 系统,可在日常使用手机时后台监测心率(HR)与静息心率(RHR)。该系统利用前置摄像头在面部解锁后的数秒内拍摄视频,通过端侧深度学习估计心率,与 ECG 相比 MAPE 低于 10%,符合所有肤色人群的行业精度标准,日 RHR 与 Fitbit Charge 6 相比 MAE 为 4.39 bpm。
推荐理由:论文公开了 PHRM 的跨肤色误差数据与大样本数据集规模,读者可对照可穿戴设备理解被动健康监测的量化标准。
Google 公布基于零信任原则的隐私分析方案:新加密协议让设备只需提交单条消息即可完成安全聚合,无需长时间保持在线。该方案集成进 Google 的 confidential federated analytics,并与 TEE 结合形成多层防护,即使 TEE 安全模型失效数据也不会泄露。
哈佛大学团队发布 Wake Vision 数据集,约 600 万张图像,规模约为 TinyML 人物检测数据集 VWW 的 100 倍。数据集分为侧重规模的 Large 与侧重标注质量的 Quality 两个训练集,精度较 VWW 最高提升 6.6%,人工标注验证下错误率从 7.8% 降至 2.2%。