Comment cette liste a été construite
La liste de 100 mots n'est pas affaire de goût. Ce sont les 100 lemmes allemands les plus fréquents mesurés dans le Leipzig Corpora Collection, et tout ce qu'il faut pour vérifier cette affirmation — le code, la table forme-lemme et la sortie brute — est fourni avec le site.
Le classement provient du Leipzig Corpora Collection, un projet de corpus de longue haleine de l'université de Leipzig. Deux corpus ont été utilisés afin qu'aucun genre ne décide seul du résultat :
| Corpus | Contenu | Occurrences |
|---|---|---|
| deu_mixed-typical_2011_1M | mixed genres, 2011 | 6,437,637 |
| deu_news_2023_1M | news, 2023 | 14,979,650 |
Ce qui a été compté
Leipzig publie des comptages de formes fléchies, pas de lemmes : ist, sind, war et bin sont comptés séparément. Une liste de vocabulaire a besoin de lemmes ; les formes sont donc regroupées selon une table explicite, avec des règles appliquées de façon constante :
- Chaque forme est attribuée à au plus un lemme : rien n'est compté deux fois.
- Chaque corpus est converti en occurrences par million de mots, puis les deux sont moyennés, pour que le plus grand corpus ne l'emporte pas simplement sur l'autre.
- Les contractions préposition + article (im, am, zum, vom, beim, ins) sont comptées avec la préposition.
- Les noms propres — pays, villes, partis, mois, jours de la semaine — sont exclus. Ils sont fréquents dans la presse mais relèvent du matériau source, pas du vocabulaire général.
- La ponctuation est exclue du dénominateur : un taux de couverture porte sur des mots, pas sur des points.
Ce que cette méthode ne peut pas faire
Trois limites assumées, car un chiffre sans réserves est un chiffre auquel il ne faut pas se fier :
- L'allemand est ambigu et le corpus n'est pas annoté. sie signifie « elle », « ils » et le « vous » de politesse ; die est à la fois article et pronom relatif. Sans annotation grammaticale, impossible de les séparer : chaque forme ambiguë est attribuée à sa lecture dominante, et ce choix est consigné dans les données source.
- De l'écrit, pas de l'oral. Les deux corpus sont de l'allemand écrit. À l'oral, ich et du seraient plus haut et werden plus bas. Le taux de couverture décrit l'allemand écrit ordinaire.
- Le genre journalistique transparaît. Prozent, Euro et Uhr entrent dans le top 100 en partie parce que la presse est pleine de chiffres et d'horaires. Ils ont été conservés — ce sont de vrais mots allemands — mais voilà pourquoi ils sont là.
Vérifiez vous-même
Les scripts qui produisent ce classement sont fournis avec le site : corpus/lemmas.py contient la table forme → lemme, corpus/rank.py calcule le classement et la couverture, et corpus/ranked.json en est la sortie, avec le détail par corpus pour chaque lemme. Téléchargez les deux corpus chez Leipzig, exécutez les scripts, et vous devez retrouver exactement ces chiffres.
Couverture, mesurée
Quelle part de l'allemand écrit ordinaire vous couvrez, selon le nombre de lemmes appris :
| N premiers lemmes | mixed genres, 2011 | news, 2023 |
|---|---|---|
| 10 | 28% | 26.2% |
| 50 | 43.2% | 43.2% |
| 100 | 49.1% | 49.6% |
| 150 | 52.2% | 52.8% |
| 200 | 54.1% | 55% |
La courbe s'aplatit vite, et c'est tout l'argument de cette page : les cent premiers lemmes vous donnent environ la moitié du texte courant, tandis que les cent suivants n'ajoutent que quelques points.
Essayer
Les 182 mots sont dans l'entraîneur gratuit : cartes, choix multiple, écoute et révision espacée. Sans compte.