PlayPendium
WordChess · Food for Thought

22개 언어로 기계에게 149,000개의 단어를 가르치다

단어 게임에는 합법적인 문자열 목록만으로는 부족하다. 각 문자열이 무엇을 의미하는지를 말해야 하며, 의미는 저장하기 가장 어려운 것이다.

01 · The 원형(lemma) 과 그 그림자

하나의 단어와 그것이 취하는 모든 형태

WordChess는 148,941단어 영어 사전6을 갖춘 25×25 보드에서 플레이된다. 항목의 평균 길이는 8.6글자이며, 일부는 25글자에 이른다. 이것은 쉬운 부분이다. 합법적인 단어 목록은 게임이 받아들일 문자열의 집합에 불과하다. 흥미로운 부분은 보드 위의 문자열이 무엇을 의미하는지를 플레이어에게 알려주는 것이며, 이를 22개 언어에 걸쳐 동시에 수행하는 것이다.

사전학자들은 선명한 선을 긋 lemma 그리고 그 굴절된 형태들. 레마는 사용자가 찾아보는 머리말이다. run, house, be. 그 주위를 표면 형태들의 패러다임이 돌고 있다: runs, ran, running. 각각은 동일한 핵심 의미를 지니며, 서로 다른 문법적 역할에 맞게 차려입은 것이다.3 사전은 그 산문을 레마에 쓰이고, 그림자들에겐 집으로 돌아가도록 맡긴다.

단어가 얼마나 많은 그림자를 드리우느냐는 언어에 달려 있다. 영어는 분석형언어이다: 어순과 작은 보조 단어에 의존하므로, 동사는 드물게도 몇 가지 형태를 넘지 않는다. 핀란드어교착형언어로, 어간에 접미사를 붙여 의미를 구성한다. 하나의 핀란드어 명사 일부 15개의 격에 따라 변화한다, 단수와 복수에서, 소유격 어미와 준사(부사)가 겹쳐 쌓인다; 구별되는 형태의 실질적 수는 수천 개에 달한다.4 헝가리어는 영어 문구 전체를, 내 집에서, 하나의 단어로 압축한다. házamban.5

02 · 모두가 함께 쓰는 사전

정의가 머무는 곳

정의는 Wiktionary, 누구나 편집할 수 있는 무료 사전에서 가져온다. 이 사전은 거대하고 다국어적이다: 이 프로젝트는 100개가 넘는 활성 언어판과 수천만 개의 항목을 포괄하며, 유료 편집위원회가 아닌 자원봉사자들이 협력하여 작성한다.1 22개 언어로 작동하는 게임에 있어, 다른 무료 어휘집 중 이보다 범위가 넓은 것은 없다.

그러나 종이 위의 포괄성은 소리 내어 읽을 수 있는 포괄성이 아니다. Wiktionary는 인간 편집자가 동일한 주석을 1만 번씩 쓰지 않도록 굴절된 형태를 저장한다. 정의를 명시하는 대신, 비-원형(lemma) 항목은 형태 템플릿, 즉 "이것은 해당 원형의 특정 문법적 형태이다"라고 사실상 말하는 작은 가리키기(포인터)를 포함한다.2 The entry for smoulders 은 산문이 아닙니다. "smoulder의 3인칭 단수 현재형"으로 렌더링되는 템플릿입니다.1

이러한 포인터들은 단순한 반올림 오차가 아닙니다. 영어 위키낱말사전에 따르면, 약 127만 개의 정의 중 약 478,000개, 즉 3분의 1을 훨씬 넘는 부분이 서술된 의미 대신 "형식(form of)" 정의입니다.1 데이터는 이미 존재합니다. 다만 접혀 있을 뿐입니다.

03 · A parsing problem, not a data gap

The gloss is unfolding the template

따라서 중요한 도전 과제는 결코 "단어가 누락되었다"는 것이 아니었습니다. 그 단어의 의미가 단순한 파서는 버려버릴 템플릿 안에 숨어 있다는 것이었습니다. WordChess의 정의는 raw Wiktionary dumps and expanding the inflection templates 언어별로 읽어가며, 파서에게 각 포인터가 무엇을 의미하는지 가르치고 이를 평이한 해설로 다시 작성하는 방식으로 구축되었습니다.6

모든 언어는 서로 다른 메커니즘 뒤에 그 형태를 숨기고 있습니다. 스페인어는 동사 형태를 {{forma verbo}}, "X의 동사 형태"로 해석됩니다. 독일어는 {{Grundformverweis Dekl/Konj}} 변형되고 굴절된 형태에 사용합니다. 핀란드어는 {{taivutusmuoto}}. 러시아어는 아예 형태 템플릿을 저장하지 않는 경우가 많으며, 굴절된 단어는 맨 리다이렉트 (собаки → собака)를 따라가야만 "형태" 주석을 회복할 수 있다.6 각 관례를 처리하면 커버리지가 급격히 상승한다.

템플릿 확장 전후의 정의 커버리지
언어증가분
독일어45%92%+47
네덜란드어58%90%+32
핀란드어54%74%+20
러시아어20%70%+50
그리스어15%57%+42

이 프로젝트의 설계 및 구축 노트에서 측정. 백분율은 사용 가능한 정의나 해결된 "형태" 주석을 가진 사전 항목의 비율이다.

데이터는 결코 누락된 적이 없었다. 그것은 포인터 안에 접혀 있었고, 기계에게 그 단어를 의미하는 것은 그것을 펼치는 법을 배우는 것이었다.

04 · 기계에게 "단어를 안다"는 것의 의미

문자열과 그에 대한 문장

게임이 현재 무엇을 담고 있는지에 대해 솔직해지는 것이 중요하다. WordChess가 собакисобака, "개"의 한 형태라고 표시할 때, 그것은 아무것도 이해하지 못한 것이다. 그것은 인간 편집자가 남겨둔 동일한 포인터를 따라 하나의 문자열을 다른 문자열, 즉 주석(gloss)으로 매핑한 것에 불과하다. 이는 lemmatization, 즉 자연어 처리의 핵심 작업이다. 표면 형태를 기본 형태로 줄여 기계가 추적해야 할 개별 항목의 수를 줄이는 것이다.7

이것은 실제적이고 유용한 종류의 지식이다. 이를 통해 게임은 사전 편집자를 고용하지 않고도 아테네나 암스테르담에서 "이 단어는 무엇인가?"라는 질문에 답할 수 있다. 그러나 이것은 의미로서의 지식이 아니라 조회(lookup)로서의 지식이다. 주석은 그것을 읽는 사람이 그 단어를 인식할 것이라는 약속이다. 기계는 그 약속을 보유하고, 독자는 의미를 공급한다.

벽이 있는 곳

일부 언어는 파서가 들어올 수 없는 한계에 부딪힌다. 이는 데이터를 펼쳐낼 자료가 단순히 존재하지 않기 때문이다. 헝가리어 항목은 종종 어원과 번역 표만 담고 있으며 정의 본문이 전혀 없어, 완벽한 독자조차 빈손으로 돌아온다. 가장 어려운 사례들은 언어학이 가장 어려운 곳에 집중된다. 핀란드어와 헝가리어와 같은 접합어는 거대한 굴절을 생성하며, 키릴 문자와 그리스 문자는 커뮤니티 커버리지가 처음부터 더 얇다. 그리스어는 15%에서 57%로 상승했지만, 독일어의 92%에 훨씬 못 미친다는 사실은 코드에 관한 것이 아니라 소스에 관한 사실이다. 6

출처 & 참고
  1. Wikipedia, "Wiktionary", 규모, 다국어 구조, 협업 편집, 그리고 "form of" 정의 개수( smoulders 예시 포함). en.wikipedia.org/wiki/Wiktionary
  2. Wiktionary, "Wiktionary:Form-of templates", 비(非)원형(lemma) 항목이 정의 줄에서 원형(lemma)으로 돌아가 가리키는 방식. en.wiktionary.org/wiki/Wiktionary:Form-of_templates
  3. 위키백과, "Lemma (morphology)", 인용 형태로 쓰이는 레마; 굴절된 형태들의 패러다임. en.wikipedia.org/wiki/Lemma_(morphology)
  4. 위키백과, "Finnish noun cases", 소유 접미사와 클리틱이 쌓이기 전, 단수와 복수에서 대략 15개의 격. en.wikipedia.org/wiki/Finnish_noun_cases. 더 넓은 맥락: en.wikipedia.org/wiki/Finnish_grammar
  5. "Morphology of Different Languages," Psychology of Language (BCcampus Open Textbook), 분석형과 접합형 유형론; házamban 예시. opentextbc.ca/psyclanguage/chapter/morphology-of-different-languages/
  6. WordChess 정의 파이프라인, 언어별 템플릿 확장 규칙 (스페인어 {{forma verbo}}, 독일어 {{Grundformverweis}}, 핀란드어 {{taivutusmuoto}}, 러시아 리디렉션) 및 커버리지 수치. 본 프로젝트의 설계 및 빌드 노트에서 측정.
  7. Wikipedia, "Lemmatization", NLP에서 굴절된 형태를 기본 형태로 축소하는 것. en.wikipedia.org/wiki/Lemmatization
  8. Wiktionary에 대한 추가 읽을거리, [1011.1368] Wiktionary 항목 구조를 관계형 데이터베이스 스키마의 테이블과 관계로 변환. arxiv.org.
  9. Wiktionary에 대한 추가 읽을거리, 영어 Wiktionary 항목에 대한 사용자 관심도의 예측 변수로서의 CEFR 어휘 수준. doi.org.
  10. Lemmatization에 대한 추가 읽을거리, BioLemmatizer: 생물의학 텍스트의 형태론적 처리를 위한 레마티제이션 도구 - PMC. ncbi.nlm.nih.gov.
Was this worth reading?
← Back to WordChess
PlayPendium · About · Contact · Privacy · Terms · Cookies · Accessibility · Copyright · Browse all games · Inspirations · © 2026