Python - как вернуться к циклу, используя + = - PullRequest
0 голосов
/ 29 ноября 2018

У меня проблема с циклом for, который я написал, я не могу заставить цикл for вернуться к первому оператору for:

def output(query,page,max_page):
    """
    Parameters:
        query: a string
        max_page: maximum pages to be crawled per day, integer

    Returns:
    List of news dictionaries in a list: [[{...},{...}..],[{...},]]
    """
    news_dicts_all = []
    news_dicts = []
    # best to concatenate urls here
    date_range = get_dates()
    for date in get_dates():
        s_date = date.replace(".","")
        while page < max_page:
            url = "https://search.naver.com/search.naver?where=news&query=" + query + "&sort=0&ds=" + date + "&de=" + date + "&nso=so%3Ar%2Cp%3Afrom" + s_date + "to" + s_date + "%2Ca%3A&start=" + str(page)
            header = {'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/58.0.3029.110 Safari/537.36'}
            req = requests.get(url,headers=header)
            cont = req.content
            soup = BeautifulSoup(cont, 'html.parser')
            for urls in soup.select("._sp_each_url"):
                try:
                    if urls["href"].startswith("https://news.naver.com"):
                        news_detail = get_news(urls["href"])
                        adict = dict()
                        adict["title"] = news_detail[0]
                        adict["date"] = news_detail[1]
                        adict["company"] = news_detail[3]
                        adict["text"] = news_detail[2]
                        news_dicts.append(adict)
                except Exception as e:
                    continue
            page += 10
        news_dicts_all.append(news_dicts)
    return news_dicts_all

Я выполнил код, и кажется, чтоpage += возвращает код обратно в часть "while", но не вернется к части for date in get_dates() после того, как страница достигнет max_page.

По сути, я бы хотел, чтобы код возвращалсяfor date in get_dates() после того, как оно достигнет max_page, но я не знаю, как я могу заставить эту работу.

1 Ответ

0 голосов
/ 29 ноября 2018

Вы никогда не сбрасываете page, поэтому, когда он переходит на следующую дату в цикле for, page > max_page уже имеет значение true, поэтому он полностью пропускает цикл while.

Вам нужно будет сделать что-то вродеизмените ваш page аргумент на start_page, затем page = start_page в начале вашего цикла for.

Добро пожаловать на сайт PullRequest, где вы можете задавать вопросы и получать ответы от других членов сообщества.
...