PlayPendium
WordChess · 생각의 양식

글자 하나의 수학

Q는 10점이고 E는 1점입니다. 이 사실 하나에 언어에 관한 작은 이론, 정보에 관한 논증, 그리고 스페인어판 게임의 타일 세트가 영어판과 다르게 생긴 이유가 숨어 있습니다.

E · 1점 12 주머니 속 타일 수
대
Q · 10점 1 주머니 속 타일 수

영어로 집필하고 편집했습니다. 이 한국어 판은 기계 번역으로 만들어졌으며, 정확성이 중요한 경우에는 영어 원문이 기준이 됩니다. 영어 원문 읽기 →

01 · 건축가가 1면을 세다

점수는 희소성의 측정값이다

첫 턴에 마주치는 채점 규칙은 미적인 선택이 아닙니다. 그것은 측정입니다. 1930년대 초, 일자리를 잃은 건축가 Alfred Mosher Butts는 순전히 운도 아니고 순전히 어휘력도 아닌 단어 게임을 만들기로 했고, 각 글자에 값을 매길 원칙 있는 방법이 필요했습니다. 그래서 그는 엔지니어가 하는 일을 했습니다. 셌습니다. Butts는 당대의 인쇄물에서 각 글자가 얼마나 자주 나오는지 집계했는데, 그 중심에는 The New York Times의 1면이 있었고 Herald Tribune과 The Saturday Evening Post도 함께였습니다. 1

그 집계에서 그는 두 개의 숫자를 한꺼번에 읽어 냈습니다. 개수, 즉 각 타일이 주머니에 몇 개 들어가는지는 그 글자가 실제 글에서 얼마나 흔한지를 따릅니다. 점수는 반대로 갑니다. 글자가 드물수록 그것을 쓴 수가 더 많은 점수를 받아야 합니다. 흔한 모음은 1점을 받고, 외래어나 사전의 어색한 구석에서만 나타나는 글자는 게임의 최고점을 받습니다. 영어판에서 그 최고점은 10점이며, Q와 Z만이 그 값을 지닙니다. BBC가 한때 표현했듯, Butts는 “각 글자가 New York Times 1면에 얼마나 자주 나오는지를 측정해 각 타일의 값을 계산했습니다.” 2

02 · 장부

세 개의 열로 본 빈도

글자들을 줄 세워 보면 설계가 모습을 드러냅니다. 실제 세계의 빈도가 낮아질수록 점수는 거의 단조롭게 올라갑니다. E는 어디에나 있고 싸며, Z와 Q는 거의 어디에도 없고 비쌉니다.

영어 타일 세트: 개수, 점수, 일반 텍스트에서의 글자 빈도
글자주머니 속 타일 수점수영어에서의 빈도
E121≈ 12.7%
A91≈ 8.2%
N61≈ 6.7%
D42≈ 4.3%
B23≈ 1.5%
K15≈ 0.8%
X18≈ 0.15%
Q110≈ 0.12%
Z110≈ 0.07%

개수와 점수는 표준 영어 세트의 것이며, 3 빈도 수치는 일반 영어 텍스트에 대한 통상적인 추정치입니다. 4 WordChess는 이 전통을 따라 점수가 매겨진 타일과 빈도에 따라 가중된 타일 세트(영어판은 글자 98개와 블랭크 2개, 모두 100개)를 사용하지만, 주머니에서 뽑는 대신 각 플레이어가 완전한 한 세트를 쥡니다. 게임 설계 문서에서 측정했습니다.

03 · 설계 속의 긴장

보상할 만큼 드물고, 둘 수 있을 만큼 흔하게

여기서 깔끔한 발상이 까다로운 제약과 만납니다. 점수가 단순히 희소성에 보상하는 것이라면, 이상적인 주머니는 Q와 Z로 가득 차 엄청난 점수가 주인을 기다리고 있을 것입니다. 그러나 주머니는 실제로 단어를 두어야 하는 패이기도 합니다. 고득점의 괴짜 글자 일곱 개를 뽑으면 합법적인 단어 하나 만들지 못한 채 얼어붙게 됩니다. 그래서 개수는 점수와 반대 방향으로 당깁니다. 주머니는 언어가 글자를 쓰는 비율과 대략 같은 비율로 글자를 담아야 하며, 그렇지 않으면 게임이 멈춥니다.

그래서 Q는 정확히 하나뿐이고, 그와 거의 떨어질 수 없는 짝인 U는 네 개의 타일을 받습니다. Q 하나, 그리고 그것이 짝을 찾을 기회를 주기 위해 주머니에 든 U 네 개입니다. 외로운 Q가 귀한 것은 그것이 거의 둘 수 없는 글자이기 때문이며, 그나마 둘 수 있는 것도 주머니의 다른 타일들이 삶 그 자체의 비율로 나뉘어 있기 때문입니다. 희소성은 보상을 정하고, 빈도는 게임을 굴러가게 합니다.

타일의 값은 그 글자가 얼마나 드물게 나오는가로 정해지지만, 주머니의 내용물은 그 글자가 얼마나 자주 나오는가로 정해집니다. 두 힘은 같은 사실을 앞에서, 그리고 뒤에서 읽은 것입니다.

04 · 스물두 개 언어, 스물두 개 타일 세트

스페인어는 왜 K를 버리는가

공정한 타일 세트가 한 언어의 글자 빈도를 찍은 사진이라면, 언어를 바꾸면 사진도 바뀌어야 합니다. 실제로 눈에 띄게 바뀝니다. WordChess는 22개 언어로 운영되며, 영어에 맞춘 분포는 다른 언어에서는 그냥 틀리기 때문에 타일 세트는 언어마다 새로 짜입니다. 3

북미 밖에서 판매되는 스페인어 세트에는 K와 W가 아예 빠져 있습니다. 이 글자들은 스페인어에서 외래어에만 나오므로, 충실한 주머니는 이들에게 타일을 하나도 주지 않습니다. 5 이탈리아어는 한 걸음 더 나아가 J, K, W, X, Y를 뺍니다. 이 글자들은 이탈리아어 고유의 철자법에 속하지 않고 외래어에만 나타납니다. 5 영어 주머니가 한두 개씩만 배급하는 글자들이, 다른 언어에서는 드문 것이 아니라 아예 없습니다. 희소성은 글자의 성질이 아닙니다. 그것은 어떤 언어 안에서의 글자의 성질입니다.

05 · 깊은 생각

글자의 희소성은 곧 그 글자의 정보량이다

Butts는 그것을 가리킬 어휘도 없이, 한 수학자가 15년쯤 뒤에 형식화할 무언가를 측정하고 있었습니다. 1948년 Claude Shannon은 정확한 주장 하나 위에 정보 이론을 세웠습니다. 기호가 예측하기 어려울수록 더 많은 정보를 담는다는 것입니다. 짐작할 수 있었던 글자는 알려 주는 것이 적고, 뜻밖의 글자는 많은 것을 알려 줍니다. 희소성이 곧 정보이며, 정보는 비트로 측정됩니다. 6

1951년 논문 Prediction and Entropy of Printed English(인쇄된 영어의 예측과 엔트로피)에서 Shannon은 그 양을 재는 일에 나섰습니다. 글자를 따로따로 다루면 영어는 글자당 대략 4비트에 이릅니다. 그러나 독자가 문맥을 활용하게 하면, 즉 q 뒤에는 거의 틀림없이 u가 오고 v로 끝나는 단어는 드물다는 사실 등을 쓰게 하면, 실제 비율은 급락합니다. Shannon의 예측 실험은 일반 영어의 엔트로피를 글자당 0.6에서 1.3비트 사이로 추정했습니다. 6 우리가 쓰는 것의 대부분은 중복이며, 진짜 일은 뜻밖의 글자들이 합니다.

같은 셈법은 그보다 앞선 부호 하나를 이미 빚어냈습니다. 1840년대에 Samuel Morse와 Alfred Vail이 자신들의 부호 체계를 만들 때, Vail은 인쇄소의 활자 상자를 살펴 어떤 글자가 가장 많이 쓰이는지 알아낸 다음, 그 글자들에 가장 짧은 신호를 주었다고 합니다. E에는 점 하나, T에는 선 하나였습니다. 7 잦은 글자에는 짧은 부호, 흔한 타일에는 낮은 점수, 예측 가능한 것에는 적은 비트. Morse는 전선 위의 시간을 최소화했고, Butts는 게임의 균형을 잡았고, Shannon은 그 밑에 있는 숫자에 이름을 붙였지만, 셋 모두 같은 장부를 읽고 있었습니다. 알고 보면 글자의 가치는 언제나 그것이 얼마나 여러분을 놀라게 할 수 있는가의 척도였습니다.

Sources & notes
  1. Wikipedia, "Alfred Butts", on Butts deriving his letter counts and values from printed frequency counts: "Butts studied the front page of The New York Times to calculate how frequently each letter of the alphabet is used." Cites Bruce Lambert, "Alfred M. Butts, 93, Is Dead; Inventor of SCRABBLE", The New York Times, 7 April 1993. en.wikipedia.org/wiki/Alfred_Butts. The wider set of sources is from Wikipedia, "Scrabble" (History): Butts tabulated letters from a dictionary, the Saturday Evening Post, the New York Herald Tribune and The New York Times, citing John Tierney, "Humankind Battles for Scrabble Supremacy", The New York Times Magazine, 24 May 1998. en.wikipedia.org/wiki/Scrabble
  2. "Scrabble: Should letter values change?" BBC News Magazine (2013), on Q and Z as the English game’s ten-point tiles and on Butts, who “calculated a value for each tile by measuring how frequently each letter appeared on the front page of the New York Times.” bbc.com/news/magazine-20984707
  3. "Scrabble letter distributions." Wikipedia, the standard English tile counts and point values. en.wikipedia.org/wiki/Scrabble_letter_distributions
  4. Letter-frequency estimates for ordinary English text (E ≈ 12.7%, T ≈ 9.1%, …), as compiled in standard references. See "Letter frequency," Wikipedia. en.wikipedia.org/wiki/Letter_frequency
  5. "Scrabble letter distributions." Wikipedia, Spanish sets outside North America omit K and W; Italian sets omit J, K, W, X and Y, as these occur only in loanwords. en.wikipedia.org/wiki/Scrabble_letter_distributions
  6. Shannon, C. E. "Prediction and Entropy of Printed English." Bell System Technical Journal 30 (1951): 50–64. Estimates the entropy of English at roughly 0.6–1.3 bits per letter with context. princeton.edu/~wbialek/rome/refs/shannon_51.pdf
  7. Cook, J. D. "How efficient is Morse code?", on Morse and Vail assigning the shortest codes to the most frequent letters (E, T). johndcook.com/blog/2017/02/08/how-efficient-is-morse-code
  8. Further reading on Scrabble letter distributions, Scrabble as a tool for Haitian Creole literacy. doi.org.
  9. Further reading on Letter frequency, [1103.2950] Fitting Ranked English and Spanish Letter Frequency Distribution in U.S. and Mexican Presidential Speeches. arxiv.org.
Was this worth reading?
Play WordChess
PlayPendium · About · Contact · Privacy · Terms · Cookies · Accessibility · Copyright · Browse all games · Classic arcade games · © 2026