Como esta lista foi construída
A lista de 100 palavras não é questão de gosto. São os 100 lemas alemães mais frequentes medidos no Leipzig Corpora Collection, e tudo o que é preciso para verificar isso — o código, a tabela forma-lema e a saída bruta — acompanha o site.
A classificação vem do Leipzig Corpora Collection, um projeto de corpora de longa data da Universidade de Leipzig. Foram usados dois corpora para que nenhum gênero decida sozinho o resultado:
| Corpus | Conteúdo | Ocorrências |
|---|---|---|
| deu_mixed-typical_2011_1M | mixed genres, 2011 | 6,437,637 |
| deu_news_2023_1M | news, 2023 | 14,979,650 |
O que foi contado
Leipzig publica contagens de formas flexionadas, não de lemas: ist, sind, war e bin são contados separadamente. Uma lista de vocabulário precisa de lemas, então as formas são agrupadas com uma tabela explícita e regras aplicadas de forma consistente:
- Cada forma é atribuída a no máximo um lema, de modo que nada é contado duas vezes.
- Cada corpus é convertido em ocorrências por milhão de palavras e depois os dois são calculados na média, para que o corpus maior não simplesmente se sobreponha ao menor.
- Contrações preposição + artigo (im, am, zum, vom, beim, ins) contam para a preposição.
- Nomes próprios — países, cidades, partidos, meses, dias da semana — são excluídos. Aparecem muito em textos jornalísticos, mas são um artefato do material de origem, não vocabulário geral.
- A pontuação fica fora do denominador: uma cifra de cobertura se refere a palavras, não a pontos finais.
O que este método não consegue fazer
Três limitações assumidas, porque um número sem ressalvas é um número em que não se deve confiar:
- O alemão é ambíguo e o corpus não é anotado. sie é “ela”, “eles” e o “senhor/senhora” formal; die é ao mesmo tempo artigo e pronome relativo. Sem anotação gramatical não dá para separar, então cada forma ambígua é atribuída à leitura dominante e essa decisão fica registrada nos dados de origem.
- Escrito, não falado. Ambos os corpora são alemão escrito. Na fala do dia a dia, ich e du subiriam e werden desceria. A cifra de cobertura descreve o alemão escrito comum.
- O gênero jornalístico transparece. Prozent, Euro e Uhr chegam ao top 100 em parte porque textos de notícias são cheios de números e horários. Foram mantidos — são palavras alemãs normais — mas é por isso que estão ali.
Verifique você mesmo
Os scripts que produzem esta classificação acompanham o site: corpus/lemmas.py contém a tabela forma → lema, corpus/rank.py calcula o ranque e a cobertura, e corpus/ranked.json é a saída, com o detalhamento por corpus de cada lema. Baixe os dois corpora de Leipzig, rode os scripts e você deve obter exatamente estes números.
Cobertura, medida
Quanto do alemão escrito comum você cobre, conforme o número de lemas aprendidos:
| N primeiros lemas | mixed genres, 2011 | news, 2023 |
|---|---|---|
| 10 | 28% | 26.2% |
| 50 | 43.2% | 43.2% |
| 100 | 49.1% | 49.6% |
| 150 | 52.2% | 52.8% |
| 200 | 54.1% | 55% |
A curva achata rápido, e esse é todo o argumento desta página: os primeiros cem lemas dão a você cerca de metade do texto corrente, enquanto os cem seguintes acrescentam apenas alguns pontos.
Experimente
Todas as 182 palavras estão no treinador gratuito: cartões, múltipla escolha, escuta e revisão espaçada. Sem conta.