Насколько мне известно, вам будет трудно сохранить n-граммы различной длины одновременно с токенизацией, но вы можете найти эти n-граммы, как показано здесь . Затем вы можете заменить элементы в корпусе, которые вы хотите, в виде n-грамм на какой-нибудь присоединяющийся символ, например, тире.
Это пример решения, но, вероятно, есть много способов добраться до него. Важное замечание: Я предоставил способ найти нграммы, которые являются общими в тексте (вам, вероятно, понадобится больше 1, поэтому я поместил туда переменную, чтобы вы могли решить, сколько нграмм собрать. Вы могли бы хотеть различное число для каждого вида, но я пока дал только 1 переменную.) Это может пропустить ngram, которые вы считаете важными. Для этого вы можете добавить те, которые хотите найти, к user_grams
. Они будут добавлены в поиск.
import nltk
#an example corpus
corpus='''A big tantrum runs in my family 4x a day, every week.
A big tantrum is lame. A big tantrum causes strife. It runs in my family
because of our complicated history. Every week is a lot though. Every week
I dread the tantrum. Every week...Here is another ngram I like a lot'''.lower()
#tokenize the corpus
corpus_tokens = nltk.word_tokenize(corpus)
#create ngrams from n=2 to 5
bigrams = list(nltk.ngrams(corpus_tokens,2))
trigrams = list(nltk.ngrams(corpus_tokens,3))
fourgrams = list(nltk.ngrams(corpus_tokens,4))
fivegrams = list(nltk.ngrams(corpus_tokens,5))
В этом разделе приведены общие нграммы до пяти_грамм.
#if you change this to zero you will only get the user chosen ngrams
n_most_common=1 #how many of the most common n-grams do you want.
fdist_bigrams = nltk.FreqDist(bigrams).most_common(n_most_common) #n most common bigrams
fdist_trigrams = nltk.FreqDist(trigrams).most_common(n_most_common) #n most common trigrams
fdist_fourgrams = nltk.FreqDist(fourgrams).most_common(n_most_common) #n most common four grams
fdist_fivegrams = nltk.FreqDist(fivegrams).most_common(n_most_common) #n most common five grams
#concat the ngrams together
fdist_bigrams=[x[0][0]+' '+x[0][1] for x in fdist_bigrams]
fdist_trigrams=[x[0][0]+' '+x[0][1]+' '+x[0][2] for x in fdist_trigrams]
fdist_fourgrams=[x[0][0]+' '+x[0][1]+' '+x[0][2]+' '+x[0][3] for x in fdist_fourgrams]
fdist_fivegrams=[x[0][0]+' '+x[0][1]+' '+x[0][2]+' '+x[0][3]+' '+x[0][4] for x in fdist_fivegrams]
#next 4 lines create a single list with important ngrams
В этом разделе вы можете добавить свои собственные нграммы в список
#Another option here would be to make your own list of the ones you want
#in this example I add some user ngrams to the ones found above
user_grams=['ngram1 I like', 'ngram 2', 'another ngram I like a lot']
user_grams=[x.lower() for x in user_grams]
И эта последняя часть выполняет обработку, чтобы вы снова могли токенизироваться и получать нграммы как токены.
#initialize the corpus that will have combined ngrams
#here we go through the ngrams we found and replace them in the corpus with
#version connected with dashes. That way we can find them when we tokenize.
for gram in n_grams:
gram_r=gram.replace(' ','-')
corpus_ngrams=corpus_ngrams.replace(gram, gram.replace(' ','-'))
#retokenize the new corpus so we can find the ngrams
corpus_ngrams_tokens= nltk.word_tokenize(corpus_ngrams)
Out: ['a-big-tantrum', 'runs-in-my-family', '4x', 'a', 'day', ',', 'every-week', '.', 'a-big-tantrum', 'is', 'lame', '.', 'a-big-tantrum', 'causes', 'strife', '.', 'it', 'runs-in-my-family', 'because', 'of', 'our', 'complicated', 'history', '.', 'every-week', 'is', 'a', 'lot', 'though', '.', 'every-week', 'i', 'dread', 'the', 'tantrum', '.', 'every-week', '...']
Я думаю, что это действительно очень хороший вопрос.