arXiv:cs.CL(计算语言学,全量分类)· Thomas Serval·· 3 小时前AI 评分44
法语及法国地区语言在 2026 年 LLM 分词器中的 Token 溢价,及一款法语优化原型
The Invisible Language Tax: Token Premiums of French and Regional Languages in 2026 LLM Tokenizers, and a French-Optimized Prototype
AI 导读
研究测量了 OpenAI o200k、Llama 3、Qwen3、DeepSeek V3/V4、Gemma 3、Mistral Tekken 和 Claude 第 5 代共七款 2026 年模型分词器的语言 Token 溢价:法语比英语多耗 31% 至 58% 的 token,简体中文在七个分词器中的六个上比法语更省,法国地区及海外语言则约为英语的 1.6 至 3.3 倍。
来源:arXiv:cs.CL(计算语言学,全量分类) · arxiv.org