Come è stata costruita questa lista
La lista di 100 parole non è questione di gusto. Sono i 100 lemmi tedeschi più frequenti misurati nel Leipzig Corpora Collection, e tutto il necessario per verificarlo — il codice, la tabella forma-lemma e l'output grezzo — è incluso nel sito.
La classifica proviene dal Leipzig Corpora Collection, un progetto di corpora di lunga data dell'Università di Lipsia. Sono stati usati due corpora perché nessun genere decida da solo il risultato:
| Corpus | Contenuto | Occorrenze |
|---|---|---|
| deu_mixed-typical_2011_1M | mixed genres, 2011 | 6,437,637 |
| deu_news_2023_1M | news, 2023 | 14,979,650 |
Che cosa è stato contato
Lipsia pubblica conteggi di forme flesse, non di lemmi: ist, sind, war e bin sono contati separatamente. Una lista di vocabolario ha bisogno di lemmi, quindi le forme sono raggruppate con una tabella esplicita e regole applicate in modo coerente:
- Ogni forma è assegnata ad al massimo un lemma, così nulla viene contato due volte.
- Ogni corpus è convertito in occorrenze per milione di parole, poi i due vengono mediati, così il corpus più grande non sovrasta semplicemente il più piccolo.
- Le contrazioni preposizione + articolo (im, am, zum, vom, beim, ins) sono conteggiate con la preposizione.
- I nomi propri — paesi, città, partiti, mesi, giorni della settimana — sono esclusi. Sono frequenti nella stampa ma sono un artefatto del materiale di partenza, non vocabolario generale.
- La punteggiatura è esclusa dal denominatore: una cifra di copertura riguarda parole, non punti fermi.
Che cosa questo metodo non può fare
Tre limiti dichiarati, perché un numero senza riserve è un numero di cui non fidarsi:
- Il tedesco è ambiguo e il corpus non è annotato. sie è “lei”, “loro” e il “Lei” di cortesia; die è insieme articolo e pronome relativo. Senza annotazione grammaticale non si possono separare, quindi ogni forma ambigua è assegnata alla lettura dominante e la scelta è registrata nei dati di origine.
- Scritto, non parlato. Entrambi i corpora sono tedesco scritto. Nel parlato ich e du salirebbero e werden scenderebbe. La cifra di copertura descrive il tedesco scritto ordinario.
- Il genere giornalistico traspare. Prozent, Euro e Uhr entrano nella top 100 anche perché la stampa è piena di cifre e orari. Sono stati mantenuti — sono normali parole tedesche — ma è per questo che sono lì.
Verifica tu stesso
Gli script che producono questa classifica sono inclusi nel sito: corpus/lemmas.py contiene la tabella forma → lemma, corpus/rank.py calcola classifica e copertura, e corpus/ranked.json è l'output, con il dettaglio per corpus di ogni lemma. Scarica i due corpora da Lipsia, esegui gli script e dovresti ottenere esattamente questi numeri.
Copertura, misurata
Quanta parte del tedesco scritto ordinario copri, in base al numero di lemmi imparati:
| Primi N lemmi | mixed genres, 2011 | news, 2023 |
|---|---|---|
| 10 | 28% | 26.2% |
| 50 | 43.2% | 43.2% |
| 100 | 49.1% | 49.6% |
| 150 | 52.2% | 52.8% |
| 200 | 54.1% | 55% |
La curva si appiattisce in fretta, ed è tutto l'argomento di questa pagina: i primi cento lemmi ti danno circa metà del testo corrente, mentre i cento successivi aggiungono solo pochi punti.
Provalo
Tutte le 182 parole sono nell'esercitatore gratuito: flashcard, scelta multipla, ascolto e ripasso a intervalli. Senza account.