2.10 小结
本章介绍了语言处理中词元与词元化的基本概念。我们讨论了词、语素和字符这些语言学层次,介绍了 Unicode 码点与 UTF-8 编码、用于词元化的 BPE 算法、正则表达式,以及用于比较字符串的最小编辑距离算法。下面总结这些内容的要点:
词和语素是实用的表示单位,但很难作出形式化定义。
Unicode 是一种表示字符的系统,能够覆盖用于书写世界各语言的众多文字。
每个字符在内部由一个称为码点的唯一标识符表示,并可以通过 UTF-8 等编码方法写入文件;UTF-8 是一种变长编码。
字节对编码(BPE)是以数据驱动方式归纳词元的标准方法,也是大多数大语言模型的第一步。
BPE 词元通常大致具有词或语素的大小,但也可能小到单个字符。
正则表达式语言是一种强大的模式匹配工具。
正则表达式中的基本操作包括符号析取(
[、]、|)、计数器(*、+和{n,m})、锚点(^、$)、捕获组((、))和替换。两个字符串之间的最小编辑距离,是把一个字符串编辑成另一个字符串所需的最少操作数。最小编辑距离可以通过动态规划计算,同时还能得到两个字符串之间的对齐。