新模型涌现,DharmaOCR 的领域专用优势依然成立
DharmaOCR 在葡萄牙语 OCR 基准上得 0.925 分,高于 Mistral OCR4 的 0.798 与 Unlimited-OCR 的 0.7587。其训练分两阶段:先做巴西葡萄牙语语料监督微调,再用 DPO 抑制重复与不连贯输出、降低推理时间与成本。文章认为,新架构与新训练技术并未改变专注单一语言带来的结构性优势。
DharmaOCR 在葡萄牙语 OCR 基准上得 0.925 分,高于 Mistral OCR4 的 0.798 与 Unlimited-OCR 的 0.7587。其训练分两阶段:先做巴西葡萄牙语语料监督微调,再用 DPO 抑制重复与不连贯输出、降低推理时间与成本。文章认为,新架构与新训练技术并未改变专注单一语言带来的结构性优势。