跳到正文
原文
HuggingFace Blog·· 2026-07-06AI 评分48

PRX Part 4:我们的数据策略

PRX Part 4: Our Data Strategy

AI 导读

PRX 系列第 4 篇披露其数据策略:预训练语料由公开与内部数据集混合构建,图像经 VLM 重新生成描述,供 7B 模型预训练使用。文本编码器从 T5Gemma 换成 Qwen3-VL 后改为训练中实时计算 text latents,吞吐损失约 3–4%,30 天训练约多 1 天。数据以 Lance 构建、MDS 流式训练,图像统一编码为 JPEG quality 92。

来源:HuggingFace Blog · huggingface.co