Mistral 如何用 LLM as a Judge 评估 RAG 系统
Mistral 展示用 LLM as a Judge 评估 RAG:由 judge LLM 按数值或定性量表为 generator LLM 的答案打分。评判采用 TruLens 的 RAG Triad 三项指标,并通过 Mistral API 近期上线的结构化输出,按自定义 schema 返回可机读的评分与解释。
Mistral 展示用 LLM as a Judge 评估 RAG:由 judge LLM 按数值或定性量表为 generator LLM 的答案打分。评判采用 TruLens 的 RAG Triad 三项指标,并通过 Mistral API 近期上线的结构化输出,按自定义 schema 返回可机读的评分与解释。
Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升了文本表现和多模态理解,上下文窗口扩展至最高 128k tokens。
推荐理由:官方列出多模态、长上下文与推理速度指标,可对照 Gemma 3、GPT-4o Mini 判断开源小模型的性能位置。
TensorFlow 2.19 已发布,LiteRT 的 C++ API 有所调整,tfl.Cast op 运行时内核新增 bfloat16 支持,并停止发布 libtensorflow 包。tf.lite.Interpreter 已给出弃用警告,改指向 ai_edge_litert.interpreter,并将在 TF 2.20 中删除。
Mistral 发布 Mistral OCR,一款以图像和 PDF 为输入、按顺序交错输出文本与图片的 OCR API,并已成为 Le Chat 文档理解的默认模型。
推荐理由:官方列出与 Google Document AI、Azure OCR、Gemini 等模型的横向基准对比,可用于判断文档解析模型的当前水位。
Mistral AI 的 TranscriptToPRDTicket 智能体工作流由 Mistral Large 2 驱动,可把会议转录自动生成 PRD 和开发工单,并写入 Linear、Jira 等项目管理工具。
哈佛大学团队发布 Wake Vision 数据集,约 600 万张图像,规模约为 TinyML 人物检测数据集 VWW 的 100 倍。数据集分为侧重规模的 Large 与侧重标注质量的 Quality 两个训练集,精度较 VWW 最高提升 6.6%,人工标注验证下错误率从 7.8% 降至 2.2%。
TensorFlow 博客发文介绍开源教材 MLSysBook.AI,把机器学习系统工程的五个环节与 TensorFlow 生态工具逐一对齐。
TensorFlow 2.18 发布,支持 NumPy 2.0,并带来 LiteRT 仓库、Hermetic CUDA 与 CUDA 更新。TFLite 代码库将迁移至 LiteRT,完成后不再发布 TFLite 二进制版本。二进制包新增计算能力 8.9 的 CUDA kernel,最低支持 Pascal 架构。
TensorFlow 2.17 发布,为 compute capability 8.9 GPU 新增专用 CUDA 内核,提升 RTX 40 系列、L4、L40 性能。
XNNPack 为 TensorFlow Lite 的 Fully Connected 和 Convolution 2D 算子加入动态范围量化支持,CPU 推理性能较 fp32 基线提升 4 倍。
TensorFlow 2.16 发布,Keras 3 成为默认版本,Windows 上 CPU wheel 改用 Clang 17 编译,并支持 Python 3.12。
TensorFlow GNN 1.0(TF-GNN)发布,这是一个经过生产验证、可大规模构建图神经网络(GNN)的库,支持在 TensorFlow 中建模训练并从大型数据存储抽取输入图。
TensorFlow 发布 Linux x86_64 平台热修复版 2.15.0.post1,解决 2.15.0 因 tensorrt 依赖引发的安装失败。该版本从 pip install tensorflow[and-cuda] 安装方式中移除 tensorrt Python 包依赖,此前用户会收到安装错误或改而装上 2.14。
TensorFlow Lite 的 XNNPack 后端在 ARM CPU 上启用半精度(FP16)推理,浮点模型端侧推理性能提升 2 倍,现已正式可用。
TensorFlow 2.15 发布,Linux 上新增通过 pip install tensorflow[and-cuda] 安装 NVIDIA CUDA 库依赖的可选方式,CUDA 升级至 12.2。
Google 将于 12 月 7 日 9:30 至 13:00 PT 线上举办第三届年度 Women in ML Symposium,需提前 RSVP 报名。议程覆盖生成式 AI 最新进展、隐私保护 AI、驱动模型的加速器与 ML 框架,以及 ML 在多个行业的实际应用,并为初学者到资深从业者分设不同层级的场次。Google Health、Nvidia、Adobe 等机构的行业人士将参与分享。
Spotify 基于 TF-Agents Environment 原语构建离线模拟器,用 Keras 训练的用户模型预测用户对推荐曲目的反应。团队训练并评估了顺序推荐模型、PPG、DQN 和改进的 Action-Head DQN(AH-DQN),以应对大状态与动作空间。线上实验显示离线性能估计与线上结果强相关。
借助 TensorFlow Lite 的 Flutter 插件,此前用 TensorFlow 训练并转为 TFLite 的强化学习棋盘游戏 Plane Strike 被移植到 Flutter,可在 Android 和 iOS 上运行。
People of AI 播客第二季回归,由 Ashley Oldacre 与新搭档 Luiz Gustavo Martins 主持,每周更新一集,本季主题聚焦生成式 AI。
由 Google 与 Tryolabs 合作开发的开源 Python 库 Temporian 面向机器学习时序数据,用于预处理与特征工程。文章以虚构网店的 sales.csv 交易记录为例,用 EventSet 容器及 moving_sum、add_index 算子计算 7 天滚动销售额,再用 TensorFlow Decision Forests 训练周销售额预测模型。
TensorFlow v2 通过 DTensor 原生支持分布式 FFT,分片张量可直接传入 tf.signal.fft2d 等既有算子,输出同样保持分片。8xV100 GPU 上的 10K*10K 实验中,两个本地 FFT 算子只占总耗时 15ms 的 3.6%,约为非分布式 fft2d 的 1/3,其余时间主要耗在 ncclAllToAll 数据重排上。
TensorFlow Lite 的 Flutter 插件已正式迁移到 TensorFlow 官方 GitHub 仓库并发布,由 Google 团队直接维护。插件已更新至最新版 TensorFlow Lite,新增实时摄像头目标检测等示例应用,支持移动端、嵌入式、Web 和边缘设备,桌面端支持仍在开发中。
TensorFlow 团队用 Simpleperf 剖析并优化 TFLite 内存 arena 的初始化过程,tensor 分配开销从运行时占比 49.9% 降到 11%,示例模型运行时缩短 25%。
TensorFlow 2.13 与 Keras 2.13 已发布,TensorFlow 2.13 首次提供 Apple Silicon wheels,Keras V3 保存格式成为 .keras 扩展名文件的默认格式。
Google Research 健康 AI 团队展示如何用 TensorFlow Lite 在手机上运行孕龄与胎位评估模型,让只接受几小时培训、没有超声背景的人员通过盲扫协议采集视频就能得到与标准诊疗相当的预测结果。
Google 用 PaLM API 演示了 LLM 增强推荐系统的四条路径:对话式、序列、评分预测与嵌入向量推荐。对话式和序列推荐分别调用 PaLM API 的 Chat 与 Text 服务,评分预测则用 Text 服务为候选电影打分排序。
TensorFlow 发布新教程,演示如何用 dtreeviz 可视化并解释 TensorFlow Decision Forests 的决策树。教程以 Penguin、Abalone 数据集为例,展示每个决策节点如何切分特征域、叶子节点的样本分布,以及单个测试样本从根到叶的预测路径。dtreeviz 于 2018 年首次发布,是目前最流行的决策树可视化库。
Google 将于 2023 年 6 月 9 日美西时间 10:00-12:15 线上举办首届推荐系统开发者峰会,报名已开放。峰会由 Google 工程师主讲,覆盖 TensorFlow Recommenders、TensorFlow Ranking、TensorFlow Agents 等产品,并分享用 LLM 增强推荐系统、生成式检索等前沿研究。
Jack Clark 的通讯 Import AI 预告即将发布,内容是他本人对意识的看法。该通讯以 Jack Clark 的个人观点为主题,原文未给出更多细节。