Cómo se construyó esta lista
La lista de 100 palabras no es cuestión de gusto. Son los 100 lemas alemanes más frecuentes medidos en el Leipzig Corpora Collection, y todo lo necesario para comprobarlo —el código, la tabla forma-lema y la salida en bruto— se incluye con el sitio.
La clasificación procede del Leipzig Corpora Collection, un proyecto de corpus de larga trayectoria de la Universidad de Leipzig. Se usaron dos corpus para que ningún género decida por sí solo el resultado:
| Corpus | Contenido | Apariciones |
|---|---|---|
| deu_mixed-typical_2011_1M | mixed genres, 2011 | 6,437,637 |
| deu_news_2023_1M | news, 2023 | 14,979,650 |
Qué se contó
Leipzig publica recuentos de formas flexionadas, no de lemas: ist, sind, war y bin se cuentan por separado. Una lista de vocabulario necesita lemas, así que las formas se agrupan con una tabla explícita y reglas aplicadas de forma coherente:
- Cada forma se asigna a como máximo un lema, de modo que nada se cuenta dos veces.
- Cada corpus se convierte a apariciones por millón de palabras y luego se promedian ambos, para que el corpus mayor no se imponga sin más al menor.
- Las contracciones preposición + artículo (im, am, zum, vom, beim, ins) se cuentan con la preposición.
- Los nombres propios —países, ciudades, partidos, meses, días de la semana— se excluyen. Aparecen mucho en prensa, pero son un artefacto del material de origen, no vocabulario general.
- La puntuación se excluye del denominador: una cifra de cobertura se refiere a palabras, no a puntos.
Qué no puede hacer este método
Tres limitaciones asumidas, porque una cifra sin matices es una cifra de la que conviene desconfiar:
- El alemán es ambiguo y el corpus no está etiquetado. sie es «ella», «ellos» y el «usted» formal; die es artículo y pronombre relativo a la vez. Sin etiquetado gramatical no se pueden separar, así que cada forma ambigua se asigna a su lectura dominante y esa decisión queda registrada en los datos de origen.
- Escrito, no hablado. Ambos corpus son alemán escrito. En el habla cotidiana ich y du subirían y werden bajaría. La cifra de cobertura describe el alemán escrito corriente.
- El género periodístico se nota. Prozent, Euro y Uhr llegan al top 100 en parte porque la prensa está llena de cifras y horas. Se mantuvieron —son palabras alemanas normales— pero por eso están ahí.
Compruébalo tú mismo
Los scripts que producen esta clasificación se incluyen con el sitio: corpus/lemmas.py contiene la tabla forma → lema, corpus/rank.py calcula el ranking y la cobertura, y corpus/ranked.json es la salida, con el desglose por corpus de cada lema. Descarga los dos corpus de Leipzig, ejecuta los scripts y deberías obtener exactamente estas cifras.
Cobertura, medida
Qué parte del alemán escrito corriente cubres, según el número de lemas aprendidos:
| N primeros lemas | mixed genres, 2011 | news, 2023 |
|---|---|---|
| 10 | 28% | 26.2% |
| 50 | 43.2% | 43.2% |
| 100 | 49.1% | 49.6% |
| 150 | 52.2% | 52.8% |
| 200 | 54.1% | 55% |
La curva se aplana deprisa, y ese es todo el argumento de esta página: los primeros cien lemas te dan aproximadamente la mitad del texto corriente, mientras que los cien siguientes solo añaden unos pocos puntos.
Pruébalo
Las 182 palabras están en el entrenador gratuito: tarjetas, opción múltiple, escucha y repaso espaciado. Sin cuenta.