# 分词

> 将文本切分为模型可处理的最小单位（Token）。

- ID: m05957
- 分类: learn
- 领域: 认知科学

## 定义

将文本切分为模型可处理的最小单位（Token）。Token可以是字、词或词根。模型不理解句子，只理解Token的序列概率。脚手架作用： 信息的颗粒度。你对世界的理解取决于你的“分词”方式。专家能看到“组块”（Chunking），新手只能看到“字母”。提升认知的关键，是升级你大脑中的Tokenizer，把复杂的现象打包成更大的意义单元。

## 机制

NLP 中将文本切分为 token 序列，作为模型输入的最小语义/统计单位（字/词/子词如 BPE）。机制是"离散化 + 概率建模"——模型在 token 序列上学条件概率，token 粒度决定能力与成本。

## 练习

1. 选分词粒度（字/词/子词）。 2. 用语料训练 tokenizer（如 BPE、WordPiece）。 3. 将文本编码为 token id 序列。 4. 模型处理后再解码回文本。

## 脚手架用法

信息的颗粒度。你对世界的理解取决于你的“分词”方式。专家能看到“组块”（Chunking），新手只能看到“字母”。提升认知的关键，是升级你大脑中的Tokenizer，把复杂的现象打包成更大的意义单元。

[阅读网页](https://thinkingmodels.site/entries/detail/m05957)
