Início › Como esta lista foi construída

Como esta lista foi construída

A lista de 100 palavras não é questão de gosto. São os 100 lemas alemães mais frequentes medidos no Leipzig Corpora Collection, e tudo o que é preciso para verificar isso — o código, a tabela forma-lema e a saída bruta — acompanha o site.

A classificação vem do Leipzig Corpora Collection, um projeto de corpora de longa data da Universidade de Leipzig. Foram usados dois corpora para que nenhum gênero decida sozinho o resultado:

CorpusConteúdoOcorrências
deu_mixed-typical_2011_1Mmixed genres, 20116,437,637
deu_news_2023_1Mnews, 202314,979,650

O que foi contado

Leipzig publica contagens de formas flexionadas, não de lemas: ist, sind, war e bin são contados separadamente. Uma lista de vocabulário precisa de lemas, então as formas são agrupadas com uma tabela explícita e regras aplicadas de forma consistente:

O que este método não consegue fazer

Três limitações assumidas, porque um número sem ressalvas é um número em que não se deve confiar:

Verifique você mesmo

Os scripts que produzem esta classificação acompanham o site: corpus/lemmas.py contém a tabela forma → lema, corpus/rank.py calcula o ranque e a cobertura, e corpus/ranked.json é a saída, com o detalhamento por corpus de cada lema. Baixe os dois corpora de Leipzig, rode os scripts e você deve obter exatamente estes números.

Cobertura, medida

Quanto do alemão escrito comum você cobre, conforme o número de lemas aprendidos:

N primeiros lemasmixed genres, 2011news, 2023
1028%26.2%
5043.2%43.2%
10049.1%49.6%
15052.2%52.8%
20054.1%55%

A curva achata rápido, e esse é todo o argumento desta página: os primeiros cem lemas dão a você cerca de metade do texto corrente, enquanto os cem seguintes acrescentam apenas alguns pontos.

Experimente

Todas as 182 palavras estão no treinador gratuito: cartões, múltipla escolha, escuta e revisão espaçada. Sem conta.

Abrir o treinador →

Outros guias