跳到正文
热点事件持续更新

研究测量多语言分词溢价并提出法语优化分词器

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月1日,一篇发表于 arXiv cs.CL 分类的研究测量了七款 2026 年模型分词器的语言 Token 溢价,涉及 OpenAI o200k、Llama 3、Qwen3、DeepSeek V3/V4、Gemma 3、Mistral Tekken 和 Claude 第 5 代。结果显示,法语比英语多消耗 31% 至 58% 的 token;简体中文在其中六个分词器上比法语更省;法国地区及海外语言约为英语的 1.6 至 3.3 倍。该研究同时提出了一款法语优化原型分词器。目前进展停留在论文发布阶段。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月1日
  1. arXiv:cs.CL(计算语言学,全量分类)
    法语及法国地区语言在 2026 年 LLM 分词器中的 Token 溢价,及一款法语优化原型

    研究测量了 OpenAI o200k、Llama 3、Qwen3、DeepSeek V3/V4、Gemma 3、Mistral Tekken 和 Claude 第 5 代共七款 2026 年模型分词器的语言 Token 溢价:法语比英语多耗 31% 至 58% 的 token,简体中文在七个分词器中的六个上比法语更省,法国地区及海外语言则约为英语的 1.6 至 3.3 倍。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。