跳到正文
原文
arXiv cs.CL· Thomas Serval·· 8 小时前AI 评分46

隐形语言税:2026 年 LLM tokenizer 中法语与地区语言的 token 溢价,及法语优化原型 Baracoda FR v1.2

The Invisible Language Tax: Token Premiums of French and Regional Languages in 2026 LLM Tokenizers, and a French-Optimized Prototype

AI 导读

研究测量 2026 年主流模型的 7 个 tokenizer,发现法语比英语多消耗 31%–58% 的 token,简体中文在其中 6 个上比法语更省。法国地区及海外语言约为英语 token 数的 1.6–3.3 倍。研究还给出字节级 BPE 原型 Baracoda FR v1.2,在 6 个未参与设计的语料上法语 token 比 Tekken 少 11.5%、英语少 3.7%,但其他语言更差。

来源:arXiv cs.CL · arxiv.org