Как разбить абзац по предложениям в Python - PullRequest
9 голосов
/ 28 февраля 2012

Мне нужно разобрать предложения из абзаца в Python. Существует ли существующий пакет для этого, или я должен пытаться использовать здесь регулярные выражения?

Ответы [ 2 ]

31 голосов
/ 28 февраля 2012

Модуль nltk.tokenize предназначен для этого и обрабатывает крайние случаи. Например:

>>> from nltk import tokenize
>>> p = "Good morning Dr. Adams. The patient is waiting for you in room number 3."
>>> tokenize.sent_tokenize(p)
['Good morning Dr. Adams.', 'The patient is waiting for you in room number 3.']
0 голосов
/ 28 февраля 2012

Вот как я получаю первые n предложений:

def get_first_n_sentence(text, n):
    endsentence = ".?!"
    sentences = itertools.groupby(text, lambda x: any(x.endswith(punct) for punct in endsentence))
    for number,(truth, sentence) in enumerate(sentences):
        if truth:
            first_n_sentences = previous+''.join(sentence).replace('\n',' ')
        previous = ''.join(sentence)
        if number>=2*n: break #

    return first_n_sentences

Ссылка: http://www.daniweb.com/software-development/python/threads/303844

...