PlayPendium
WordChess · 思考的食粮

一个字母的数学

Q 值十分,E 值一分。这一个简单的事实背后,藏着一套关于语言的小理论、一个关于信息的论证,以及游戏的字母牌组在西班牙语中与在英语中面貌不同的原因。

E · 1 分 12 枚在袋中
对比
Q · 10 分 1 枚在袋中

本文以英文撰写和编辑。此中文版本由机器翻译生成;凡涉及准确性之处,以英文原文为准。 阅读英文原文 →

01 · 一位建筑师数起了头版

分值是对稀缺度的测量

你在第一回合就会遇到的计分规则,并不是一种审美选择,而是一种测量。20 世纪 30 年代初,一位名叫 Alfred Mosher Butts 的失业建筑师着手设计一款既不纯靠运气、也不纯靠词汇量的文字游戏,他需要一种有原则的方法来为每个字母定价。于是他做了工程师会做的事:计数。Butts 统计了当时各种印刷品中每个字母出现的频率,其中最主要的是《纽约时报》(The New York Times)的头版,此外还有《先驱论坛报》(Herald Tribune)《星期六晚邮报》(The Saturday Evening Post)1

从这些统计中,他同时读出了两个数字。数量——每种字母牌放进袋子里多少枚——反映该字母在真实文字中有多常见。分值则反其道而行:字母越稀有,用到它的出牌就应该得分越高。常见元音只值一分;只出现在外来词和词典偏僻角落里的字母,则拿到游戏的最高分。在英语版游戏中,这个最高分是十分,只有 Q 和 Z 享有;正如 BBC 曾经说过的,Butts “通过测量每个字母在《纽约时报》头版上出现的频率,为每张字母牌算出了分值”。2

02 · 账本

频率,分三栏列出

把字母排成一列,设计便一目了然。随着字母在现实中的出现频率下降,分值几乎单调地上升。E 无处不在,价格低廉;Z 和 Q 几乎无处可寻,身价高昂。

英语字母牌组:数量、分值,以及字母在普通文本中的频率
字母袋中数量分值英语中的频率
E121≈ 12.7%
A91≈ 8.2%
N61≈ 6.7%
D42≈ 4.3%
B23≈ 1.5%
K15≈ 0.8%
X18≈ 0.15%
Q110≈ 0.12%
Z110≈ 0.07%

数量与分值为标准英语牌组;3 频率数据为普通英语文本的通行估计值。4 WordChess 沿袭这一传统,使用带分值的字母牌和按频率加权的字母牌组(英语版为 100 枚:98 枚字母牌和 2 枚空白牌),不过每位玩家都持有一整套牌组,而不是从袋子里抽牌,数据取自游戏的设计文档。

03 · 设计中的张力

稀有到值得奖励,常见到能够出牌

一个简洁的想法在这里撞上了一条硬约束。如果分值只是奖励稀有,那么理想的袋子就会塞满 Q 和 Z,大把的分数等人来拿。但袋子同时也是你必须真正拿来出牌的一手牌。摸到七枚高分怪字母,你就会僵在那里,拼不出一个合法单词。于是数量与分值相互拉扯:袋子里的字母必须大致符合语言实际使用它们的比例,否则游戏就会停滞。

这就是为什么 Q 恰好只有一枚,也是为什么与它几乎形影不离的搭档 U 独占四枚:一枚 Q,袋子里配上四枚 U,好让它有机会找到一枚。这枚孤零零的 Q 之所以珍贵,正是因为它几乎打不出去;而它之所以还能打出去,全靠袋子里其他字母牌是按照现实生活本身的比例分配的。稀缺决定奖励;频率让游戏持续进行。

一枚字母牌的价格,取决于这个字母出现得有多稀少;而袋子里的内容,取决于它出现得有多频繁。这两股力量是同一个事实,只是一个正着读,一个倒着读。

04 · 二十二种语言,二十二套字母牌

为什么西班牙语扔掉了 K

如果说一套公平的字母牌是一种语言字母频率的照片,那么换一种语言,照片就必然改变。事实确实如此,而且一目了然。WordChess 支持 22 种语言,每种语言都重新构建字母牌组,因为为英语调校的分布放到别处就是错的。3

在北美以外销售的西班牙语版本完全去掉了 K 和 W;这两个字母在西班牙语中只出现在外来词里,因此一个忠实的袋子根本不给它们配牌。5 意大利语走得更远,去掉了 J、K、W、X 和 Y,这些字母不属于意大利语的本土拼写,只出现在外来词中。5 在英语袋子里每个只配给一两枚的字母,在另一种语言里不是稀有,而是根本不存在。稀有并不是字母本身的属性,而是字母在某种语言中的属性。

05 · 深层的思想

一个字母的稀有度就是它的信息量

Butts 在还没有相应术语的时候,就已经在测量一样东西,而一位数学家将在大约十五年后把它形式化。1948 年,Claude Shannon(克劳德·香农)以一个精确的论断奠定了信息论的基础:一个符号越难预测,它携带的信息就越多。一个你本可以猜到的字母几乎不告诉你什么;一个出人意料的字母则告诉你很多。稀有就是信息,而信息以比特来度量。6

在 1951 年的论文《印刷英语的预测与熵》(Prediction and Entropy of Printed English)中,香农着手衡量这个量。如果孤立地看待字母,英语每个字母大约有四比特;但如果让读者利用上下文——比如 q 后面几乎必然跟着 u,很少有单词以 v 结尾——真实的信息率就会骤降。香农的预测实验表明,普通英语的熵大约在每字母 0.6 到 1.3 比特之间。6 我们写下的大部分内容都是冗余的;真正起作用的是那些出人意料的字母。

同样的账目早已塑造过一种更早的编码。19 世纪 40 年代,Samuel Morse 和 Alfred Vail 创制他们的电码字母表时,据说 Vail 研究了一家印刷厂的铅字盒,以了解哪些字母使用得最多,然后把最短的信号分配给这些字母:E 是一个点,T 是一个划。7 常用字母配短码;常见字母牌配低分;可预测的内容配少量比特。Morse 要把电线上的时间降到最少,Butts 要平衡一款游戏,香农则为背后的那个数字命了名,但三个人读的是同一本账。原来,一个字母的价值,始终衡量的是它能给你带来多少意外。

Sources & notes
  1. Wikipedia, "Alfred Butts", on Butts deriving his letter counts and values from printed frequency counts: "Butts studied the front page of The New York Times to calculate how frequently each letter of the alphabet is used." Cites Bruce Lambert, "Alfred M. Butts, 93, Is Dead; Inventor of SCRABBLE", The New York Times, 7 April 1993. en.wikipedia.org/wiki/Alfred_Butts. The wider set of sources is from Wikipedia, "Scrabble" (History): Butts tabulated letters from a dictionary, the Saturday Evening Post, the New York Herald Tribune and The New York Times, citing John Tierney, "Humankind Battles for Scrabble Supremacy", The New York Times Magazine, 24 May 1998. en.wikipedia.org/wiki/Scrabble
  2. "Scrabble: Should letter values change?" BBC News Magazine (2013), on Q and Z as the English game’s ten-point tiles and on Butts, who “calculated a value for each tile by measuring how frequently each letter appeared on the front page of the New York Times.” bbc.com/news/magazine-20984707
  3. "Scrabble letter distributions." Wikipedia, the standard English tile counts and point values. en.wikipedia.org/wiki/Scrabble_letter_distributions
  4. Letter-frequency estimates for ordinary English text (E ≈ 12.7%, T ≈ 9.1%, …), as compiled in standard references. See "Letter frequency," Wikipedia. en.wikipedia.org/wiki/Letter_frequency
  5. "Scrabble letter distributions." Wikipedia, Spanish sets outside North America omit K and W; Italian sets omit J, K, W, X and Y, as these occur only in loanwords. en.wikipedia.org/wiki/Scrabble_letter_distributions
  6. Shannon, C. E. "Prediction and Entropy of Printed English." Bell System Technical Journal 30 (1951): 50–64. Estimates the entropy of English at roughly 0.6–1.3 bits per letter with context. princeton.edu/~wbialek/rome/refs/shannon_51.pdf
  7. Cook, J. D. "How efficient is Morse code?", on Morse and Vail assigning the shortest codes to the most frequent letters (E, T). johndcook.com/blog/2017/02/08/how-efficient-is-morse-code
  8. Further reading on Scrabble letter distributions, Scrabble as a tool for Haitian Creole literacy. doi.org.
  9. Further reading on Letter frequency, [1103.2950] Fitting Ranked English and Spanish Letter Frequency Distribution in U.S. and Mexican Presidential Speeches. arxiv.org.
Was this worth reading?
Play WordChess
PlayPendium · About · Contact · Privacy · Terms · Cookies · Accessibility · Copyright · Browse all games · Classic arcade games · © 2026