跳到正文
原文
PaperAgent· PaperAgent·· 3天前AI 评分34

Google 牵头 32 位作者发布首篇词元(Token)技术全景综述

原文标题:Google:首篇词元(Token)技术全景综述

AI 导读

Google 牵头、32 位作者、横跨 20 多家机构发布首篇词元化(tokenization)全景综述,指出词元化是决定大模型能力上限、推理成本和跨语言公平性的关键环节,但 2025 年顶会相关论文占比不到 2%。

正文

Tokenization: A Survey for Modern NLP

之前有个梗传遍全网:问大模型「strawberry 里有几个 r」,最先进的模型也会数错。

很多人以为这是模型笨。但这篇谷歌牵头、32 位作者、横跨 20 多家机构的新综述要告诉你:病根不在模型,而在文本进入模型前的第一步——词元化(tokenization)。

视觉文本表示
视觉文本表示

模型读的不是文字,是词元。「strawberry」在模型眼里可能是 str+aw+berry 三块拼图,它从来没逐字母看过这个单词,自然数不出有几个 r。

词元化是大模型管线里最被低估的一环——2025 年顶会相关论文占比不到 2%(NeurIPS、ICLR、ICML和 CL 系列会议)

2020 年以来顶会摘要中提及词元化的比例

但词元化却决定着模型的能力上限、推理成本和全球用户之间的公平性。

词元化是文本与模型内部表示之间的接口

词元化是文本与模型内部表示之间的接口:该段配图

词元器是怎么炼成的

本综述把词元化从「玄学」拆成了一条看得见的流水线。

训练一个词元器分五步:语料+初始字母表 → 归一化 → 预分词 → 训练算法 → 可用的词元器。之后文本进来,走归一化、预分词、切分成词元序列;模型输出时再走反向的「反词元化」还原成文字。

词元器训练、词元化与反词元化的完整流程

核心悬念在第四步「训练算法」。综述给出现代算法的完整家谱,最值得记住的是三派:

现代词元化算法变体对比

  • BPE(字节对编码):自底向上。从单个字节开始,反复合并语料里出现最频繁的相邻词元对。它 1994 年本是数据压缩算法,2016 年被改造进 NLP,如今是大模型的绝对主流。

Scaffold-BPE
Scaffold-BPE
  • Unigram:自顶向下。先准备一个超大词表,再按概率似然往外剪枝,剪掉「删了也不心疼」的词元。

微软:https://arxiv.org/pdf/2508.08424
微软:https://arxiv.org/pdf/2508.08424
  • WordPiece:BPE 的近亲,但合并标准不是频率而是语言模型得分,推理时用 MaxMatch 从左到右贪心匹配最长词元——BERT 家族至今在用它。

词元器是怎么炼成的:该节配图
Fast WordPiece Tokenization

在此之上还有一串改良变体:BPE-Dropout 给合并加随机性、SaGe 引入上下文打分、PathPiece 把所有可能切法建成一张图找最短路径。综述的态度很清醒:这些方法理论上各有所长,但极少有被大规模采用的——不是不好,是换地基的代价太大。

同一段话,贵 54 倍

词元器的词表是按语料分配的:英语数据多,英语词元就切得短而高效;低资源语言则被切得稀碎,同一个意思要用更多词元才能表达。而 API 是按词元计费的——词元越多,钱越多。

综述算了一笔账:用 GPT-4o 生成同一篇《世界人权宣言》,按 $10/百万词元计价,再折算成各国平均时薪的劳动时间——美国用户和缅甸用户之间的差距是 54.3 倍。

GPT-4o 生成《世界人权宣言》的跨语言成本分析

这不是技术细节,是公平性问题:英语用户习以为常的价格,对部分语言使用者意味着完全不同的门槛。研究界已经在补救,比如 PA-BPE 在训练时优先照顾当前压缩率最差的语言,而不是一味追求全局最优——但这类方案目前几乎都停留在论文里。

94% 的模型,在用别人的分词器

最后一组证据来自综述团队做的一次「人口普查」:他们扫了 Hugging Face 上 739,147 个模型,成功加载其中 57.3%,识别出 24,798 个互不相同的分词器。

结论有点扎心:94% 的模型使用的分词器,和别的模型字节级完全相同;被复制最多的前十名覆盖了 32% 的模型,仅 Llama 3.1 一家就占 6.9%。而下载量冠军居然是 2018 年的 BERT 分词器,占全部 279 亿次下载的 23.2%。

前沿闭源模型这边,词表规模普遍涨到 100–275k,几乎清一色 BPE:

主流大模型家族使用的分词器总览

最有意思的是 Claude:官方从不公布细节,社区逆向发现它的行为不符合标准 BPE,反而吻合最短路径算法,而且新一代词表从约 49k 大幅缩到约 16k——这是主流厂商里唯一明显「非主流」的设计。

2022–2025 年 Hugging Face 分词器配置趋势

趋势图还揭示了一个分工:2023 年之后 BPE 彻底统治生成式模型,WordPiece 则固守 BERT 系分类任务;平均词表规模 2023 年后陡增,非拉丁字符词元占比回升——背后是 Qwen、DeepSeek 等中国厂商的多语言词表在推高水位。

最后

综述给出了一张明确的「未开发地图」。词元化是少数还没被卷透、却能同时影响能力、成本和公平性的环节——前沿方向包括字节/字符级模型、动态切分、视觉词元化,目标都是绕开静态词表这个根本限制。

分层字节级语言模型示意

32 位作者在结尾写得很直白:这个领域「还有大量进步空间」。一篇综述本身不解决问题,但它把地基上的裂缝全都标了出来——当 2% 的关注度遇上 100% 的依赖,被低估的就不是某个算法,而是整个环节。

Tokenization: A Survey for Modern NLP  
https://www.alphaxiv.org/abs/2609.tokenization-survey-modern-nlp  

来源:PaperAgent · mp.weixin.qq.com