Strumenti Utente

Strumenti Sito


distribuzione_delle_frequenze_senza_nltk

Differenze

Queste sono le differenze tra la revisione selezionata e la versione attuale della pagina.

Link a questa pagina di confronto

Entrambe le parti precedenti la revisione Revisione precedente
Prossima revisione
Revisione precedente
distribuzione_delle_frequenze_senza_nltk [2021/06/02 18:07]
31.156.199.251
distribuzione_delle_frequenze_senza_nltk [2021/06/02 18:15] (versione attuale)
admin
Linea 1: Linea 1:
-====== Distribuzione delle frequenze senza NLTK ======+====== Distribuzione delle frequenze ======
 Esemplificazione su una singola frase. Si noti, innanzitutto, la funzione set(), che crea un insieme privo di elementi ripetuti. La lunghezza della frase 'splittata' equivale al numero di parole-token (occorrenze), mentre la lunghezza dell'insieme ottenuto attraverso la funzione set() equivale al numero di parole-type (forme). Si noti, inoltre, la sintassi della riga 10 detta 'comprensione di lista' (ingl. 'list comprehension', cf. [[http://docs.python.org/2/tutorial/datastructures.html#list-comprehensions|documentazione]]). Esemplificazione su una singola frase. Si noti, innanzitutto, la funzione set(), che crea un insieme privo di elementi ripetuti. La lunghezza della frase 'splittata' equivale al numero di parole-token (occorrenze), mentre la lunghezza dell'insieme ottenuto attraverso la funzione set() equivale al numero di parole-type (forme). Si noti, inoltre, la sintassi della riga 10 detta 'comprensione di lista' (ingl. 'list comprehension', cf. [[http://docs.python.org/2/tutorial/datastructures.html#list-comprehensions|documentazione]]).
 <code python> <code python>
Linea 32: Linea 32:
 import matplotlib.pyplot as plt import matplotlib.pyplot as plt
 with open('testi/collodi_pinocchio.txt', mode='r', encoding='iso-8859-1') as f: testo = f.read() with open('testi/collodi_pinocchio.txt', mode='r', encoding='iso-8859-1') as f: testo = f.read()
-testo=testo[1758:]+testo=testo[1704:]
 testo=re.sub("'","' ", testo) testo=re.sub("'","' ", testo)
 testo=re.sub("([^\.]+)([\.,;:\!-]+)","\g<1> \g<2>", testo) testo=re.sub("([^\.]+)([\.,;:\!-]+)","\g<1> \g<2>", testo)
distribuzione_delle_frequenze_senza_nltk.1622657247.txt.gz · Ultima modifica: 2021/06/02 18:07 da 31.156.199.251