Inicio › Cómo se construyó esta lista

Cómo se construyó esta lista

La lista de 100 palabras no es cuestión de gusto. Son los 100 lemas alemanes más frecuentes medidos en el Leipzig Corpora Collection, y todo lo necesario para comprobarlo —el código, la tabla forma-lema y la salida en bruto— se incluye con el sitio.

La clasificación procede del Leipzig Corpora Collection, un proyecto de corpus de larga trayectoria de la Universidad de Leipzig. Se usaron dos corpus para que ningún género decida por sí solo el resultado:

CorpusContenidoApariciones
deu_mixed-typical_2011_1Mmixed genres, 20116,437,637
deu_news_2023_1Mnews, 202314,979,650

Qué se contó

Leipzig publica recuentos de formas flexionadas, no de lemas: ist, sind, war y bin se cuentan por separado. Una lista de vocabulario necesita lemas, así que las formas se agrupan con una tabla explícita y reglas aplicadas de forma coherente:

Qué no puede hacer este método

Tres limitaciones asumidas, porque una cifra sin matices es una cifra de la que conviene desconfiar:

Compruébalo tú mismo

Los scripts que producen esta clasificación se incluyen con el sitio: corpus/lemmas.py contiene la tabla forma → lema, corpus/rank.py calcula el ranking y la cobertura, y corpus/ranked.json es la salida, con el desglose por corpus de cada lema. Descarga los dos corpus de Leipzig, ejecuta los scripts y deberías obtener exactamente estas cifras.

Cobertura, medida

Qué parte del alemán escrito corriente cubres, según el número de lemas aprendidos:

N primeros lemasmixed genres, 2011news, 2023
1028%26.2%
5043.2%43.2%
10049.1%49.6%
15052.2%52.8%
20054.1%55%

La curva se aplana deprisa, y ese es todo el argumento de esta página: los primeros cien lemas te dan aproximadamente la mitad del texto corriente, mientras que los cien siguientes solo añaden unos pocos puntos.

Pruébalo

Las 182 palabras están en el entrenador gratuito: tarjetas, opción múltiple, escucha y repaso espaciado. Sin cuenta.

Abrir el entrenador →

Otras guías