PlayPendium
WordChess · 思考的食粮

教机器认识 149,000 个单词,用 22 种语言

文字游戏需要的不只是一份合法字符串清单。它还需要说明每个词是什么意思,而意义恰恰是最难存储的东西。

本文以英文撰写和编辑。此中文版本由机器翻译生成;凡涉及准确性之处,以英文原文为准。 阅读英文原文 →

01 · 词元及其影子

一个词,以及它的所有形态

WordChess 在 25×25 的棋盘上进行,使用一部收录 148,941 个单词的英语词典6,词条平均长 8.6 个字母,最长的达 27 个字母。这是容易的部分。合法单词清单不过是游戏会接受的一组字符串。有意思的部分在于告诉玩家棋盘上那个字符串是什么意思,而且要同时用二十二种语言来做到。

词典编纂者在词元(lemma)与其屈折形式之间划出一条清晰的界线。词元是你去查的那个词头,例如 run(跑)、house(房子)、be(是)。围绕它运转的是一整套表层形式的词形变化表:runs、ran、running。每个形式都承载着相同的核心意义,只是为不同的语法角色换了装束。3 词典把笔墨花在词元上,让那些影子指回“家”。

一个词投下多少影子,取决于语言。英语是分析型语言:它依靠词序和小小的虚词,因此一个动词很少有超过寥寥几种形式。芬兰语是黏着语,靠把后缀粘到词干上来构建意义。一个芬兰语名词在单数和复数中各有大约十五个格的变化,之后还要叠加物主后缀和附着词;实际的不同形式数量可达数千。4 匈牙利语则把一整个英语短语 in my house(在我的房子里)压缩进一个词:házamban。5

02 · 一部由所有人编写的词典

释义从何而来

释义来自 Wiktionary(维基词典),一部人人都可以编辑的自由词典。它规模庞大且支持多语言:该项目拥有远超一百个活跃的语言版本、数以千万计的词条,由志愿者协作编写,而非由付薪的编辑委员会撰写。1 对于一款以 22 种语言运行的游戏来说,没有任何其他免费词汇资源在覆盖面上能与之相比。

但纸面上的覆盖面,并不等于能够直接读出来的覆盖面。Wiktionary 存储屈折形式的方式,是为了让人类编辑者不必把同一条释义写上一万遍。非词元词条并不写出释义,而是带有一个 form-of(“……的形式”)模板,这是一个小小的指针,实际上是在说:“这是那个词元的某种特定语法形式。”2 smoulders 这个词条并不是一段文字,而是一个模板,渲染出来是“third-person singular simple present form of smoulder”(smoulder〔阴燃〕的第三人称单数一般现在时形式)。1

这些指针并不是可以忽略的零头。在英语 Wiktionary 大约 127 万条释义中,约有 478,000 条——远超三分之一——是“form of”式释义,而不是写出来的词义。1 数据就在那里,只是被折叠起来了。

03 · 是解析问题,而非数据缺口

释义就是把模板展开

所以,真正要紧的挑战从来不是“这个词缺失了”,而是这个词的意义藏在一个模板里,而天真的解析器会把它直接丢掉。WordChess 的释义是这样构建的:读取原始的 Wiktionary 数据转储,逐种语言展开屈折模板,教会解析器每个指针的含义,再把它改写成简明的释义。6

每种语言都把自己的词形藏在不同的机制后面。西班牙语把动词形式藏在 {{forma verbo}} 之后,解析为“verbal form of X”(X 的动词形式)。德语用 {{Grundformverweis Dekl/Konj}} 表示变格和变位形式。芬兰语依赖 {{taivutusmuoto}}。俄语则常常根本不存储形式模板,屈折后的词只是一个简单的重定向(собаки → собака),必须顺着它追溯,才能得到“form of”释义。6 逐一处理这些惯例,覆盖率便大幅跃升。

释义覆盖率,模板展开前 → 展开后
语言之前之后提升
德语45%92%+47
荷兰语58%90%+32
芬兰语54%74%+20
俄语20%70%+50
希腊语15%57%+42

数据取自本项目的设计与构建笔记。百分比指带有可用释义或已解析“form of”释义的词典条目所占比例。

数据从未缺失。它被折叠进了一个指针里,而让机器认识这个词,就意味着学会把它展开。

04 · 对机器而言,“认识一个词”意味着什么

一个字符串,以及关于它的一句话

我们有必要坦诚地看待游戏现在掌握的东西。当 WordChess 显示 собаки 是 собака(“狗”)的一种形式时,它并没有理解任何东西。它只是顺着人类编辑者留下的同样指针,把一个字符串映射到另一个字符串——一条释义。这就是词形还原(lemmatization),自然语言处理中的“老黄牛”:把表层形式还原为其基本形式,让机器需要追踪的不同事物更少。7

这是一种真实而有用的“认识”。它让游戏无需雇用词典编纂者,就能在雅典或阿姆斯特丹回答“这是什么词?”。但这是查表式的认识,而不是理解意义式的认识。释义是一个承诺:人读到它时,会认出这个词。机器持有这个承诺;意义则由读者来补足。

墙在哪里

有些语言碰到了任何解析器都无法突破的天花板,因为根本没有可以展开的数据。匈牙利语词条常常只有词源和一张翻译表,完全没有释义文字,因此即使是完美的读取器也会一无所获。最难的情况集中在语言学上最难的地方:芬兰语和匈牙利语这类会衍生出庞大词形变化表的黏着语,以及西里尔字母和希腊字母文字,这些语言的社区覆盖本来就较薄弱。希腊语从 15% 提升到 57%;它远未达到德语的 92%,这是数据来源的问题,而不是代码的问题。6

Sources & notes
  1. Wikipedia, "Wiktionary", scale, multilingual structure, collaborative editing, and the "form of" definition counts (including the smoulders example). en.wikipedia.org/wiki/Wiktionary
  2. Wiktionary, "Wiktionary:Form-of templates", how non-lemma entries point back to a lemma on the definition line. en.wiktionary.org/wiki/Wiktionary:Form-of_templates
  3. Wikipedia, "Lemma (morphology)", lemma as citation form; the paradigm of inflected forms. en.wikipedia.org/wiki/Lemma_(morphology)
  4. Wikipedia, "Finnish noun cases", the roughly fifteen cases, in singular and plural, before possessive suffixes and clitics stack on top. en.wikipedia.org/wiki/Finnish_noun_cases. Broader context: en.wikipedia.org/wiki/Finnish_grammar
  5. "Morphology of Different Languages," Psychology of Language (BCcampus Open Textbook), analytic vs. agglutinative typology; the házamban example. opentextbc.ca/psyclanguage/chapter/morphology-of-different-languages/
  6. WordChess definition pipeline, template-expansion rules per language (Spanish {{forma verbo}}, German {{Grundformverweis}}, Finnish {{taivutusmuoto}}, Russian redirects) and coverage figures. Measured from this project's design and build notes.
  7. Wikipedia, "Lemmatization", reducing inflected forms to a base form in NLP. en.wikipedia.org/wiki/Lemmatization
  8. Further reading on Wiktionary, [1011.1368] Transformation of Wiktionary entry structure into tables and relations in a relational database schema. arxiv.org.
  9. Further reading on Wiktionary, CEFR vocabulary level as a predictor of user interest in English Wiktionary entries. doi.org.
  10. Further reading on Lemmatization, BioLemmatizer: a lemmatization tool for morphological processing of biomedical text - PMC. ncbi.nlm.nih.gov.
Was this worth reading?
Play WordChess
PlayPendium · About · Contact · Privacy · Terms · Cookies · Accessibility · Copyright · Browse all games · Classic arcade games · © 2026