HuggingFace Blog·· 2026-07-06AI 评分48
PRX Part 4:我们的数据策略
PRX Part 4: Our Data Strategy
AI 导读
PRX 系列第 4 篇披露其数据策略:预训练语料由公开与内部数据集混合构建,图像经 VLM 重新生成描述,供 7B 模型预训练使用。文本编码器从 T5Gemma 换成 Qwen3-VL 后改为训练中实时计算 text latents,吞吐损失约 3–4%,30 天训练约多 1 天。数据以 Lance 构建、MDS 流式训练,图像统一编码为 JPEG quality 92。
来源:HuggingFace Blog · huggingface.co