Home › Come è stata costruita questa lista

Come è stata costruita questa lista

La lista di 100 parole non è questione di gusto. Sono i 100 lemmi tedeschi più frequenti misurati nel Leipzig Corpora Collection, e tutto il necessario per verificarlo — il codice, la tabella forma-lemma e l'output grezzo — è incluso nel sito.

La classifica proviene dal Leipzig Corpora Collection, un progetto di corpora di lunga data dell'Università di Lipsia. Sono stati usati due corpora perché nessun genere decida da solo il risultato:

CorpusContenutoOccorrenze
deu_mixed-typical_2011_1Mmixed genres, 20116,437,637
deu_news_2023_1Mnews, 202314,979,650

Che cosa è stato contato

Lipsia pubblica conteggi di forme flesse, non di lemmi: ist, sind, war e bin sono contati separatamente. Una lista di vocabolario ha bisogno di lemmi, quindi le forme sono raggruppate con una tabella esplicita e regole applicate in modo coerente:

Che cosa questo metodo non può fare

Tre limiti dichiarati, perché un numero senza riserve è un numero di cui non fidarsi:

Verifica tu stesso

Gli script che producono questa classifica sono inclusi nel sito: corpus/lemmas.py contiene la tabella forma → lemma, corpus/rank.py calcola classifica e copertura, e corpus/ranked.json è l'output, con il dettaglio per corpus di ogni lemma. Scarica i due corpora da Lipsia, esegui gli script e dovresti ottenere esattamente questi numeri.

Copertura, misurata

Quanta parte del tedesco scritto ordinario copri, in base al numero di lemmi imparati:

Primi N lemmimixed genres, 2011news, 2023
1028%26.2%
5043.2%43.2%
10049.1%49.6%
15052.2%52.8%
20054.1%55%

La curva si appiattisce in fretta, ed è tutto l'argomento di questa pagina: i primi cento lemmi ti danno circa metà del testo corrente, mentre i cento successivi aggiungono solo pochi punti.

Provalo

Tutte le 182 parole sono nell'esercitatore gratuito: flashcard, scelta multipla, ascolto e ripasso a intervalli. Senza account.

Apri l'esercitatore →

Altre guide