Заменить Селен Запросы в динамической форме - PullRequest
0 голосов
/ 11 декабря 2018

Я хочу webscrap эту страницу динамической формы, я сейчас использую Selenium для этого и получаю некоторые результаты.

Мои вопросы:

1) ЭтоМожно ли заменить код Selenium + WebDriver каким-нибудь запросом POST?(Я работал с запросами раньше, но только когда API доступен ... Я не могу понять, как отменить код этой формы)

2) Есть ли лучший способ очистить страницу результатовполучить только стол?(В моем примере переменная «data» результата - беспорядок, но в любом случае я получил последнее значение, которое было основной целью скрипта)

3) Любые рекомендации?

Myкод:

from selenium import webdriver
import pandas as pd

from bs4 import BeautifulSoup

def get_tables(htmldoc):
    soup = BeautifulSoup(htmldoc)
    return soup.findAll('table')

driver = webdriver.Chrome()
driver.get("http://dgasatel.mop.cl/visita_new.asp")
estacion1 = driver.find_element_by_name("estacion1")
estacion1.send_keys("08370007-6")
driver.find_element_by_xpath("//input[@name='chk_estacion1a' and @value='08370007-6_29']").click()
driver.find_element_by_xpath("//input[@name='period' and @value='1d']").click()
driver.find_element_by_xpath("//input[@name='tiporep' and @value='I']").click()
driver.find_element_by_name("button22").click()

data = pd.read_html(driver.page_source)

print(data[4].tail(1).iloc[0][2])

Заранее спасибо.

1 Ответ

0 голосов
/ 12 декабря 2018

Короткий ответ на ваш вопрос: да, вы можете использовать библиотеку запросов для отправки запросов.Например, вы можете легко открыть инспектор в своем браузере и скопировать запрос, используя следующий сайт:

https://curl.trillworks.com/

Затем вы можете передать response.text в BeautifulSoup для анализатаблицы, которые вы хотите.

Когда я делаю это с сайтом в вашем примере, я получаю следующее:

import requests

cookies = {
    'ASPSESSIONIDCQTTBCRB': 'BFDPGLCCEJMKPFKGJJFHKHFC',
}

headers = {
    'Connection': 'keep-alive',
    'Pragma': 'no-cache',
    'Cache-Control': 'no-cache',
    'Origin': 'http://dgasatel.mop.cl',
    'Upgrade-Insecure-Requests': '1',
    'Content-Type': 'application/x-www-form-urlencoded',
    'User-Agent': 'Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/70.0.3538.110 Safari/537.36',
    'Accept': 'text/html,application/xhtml+xml,application/xml;q=0.9,image/webp,image/apng,*/*;q=0.8',
    'Referer': 'http://dgasatel.mop.cl/filtro_paramxestac_new.asp',
    'Accept-Encoding': 'gzip, deflate',
    'Accept-Language': 'en-US,en;q=0.9',
}

data = {
  'estacion1': '-1',
  'estacion2': '-1',
  'estacion3': '-1',
  'accion': 'refresca',
  'tipo': 'ANO',
  'fecha_fin': '11/12/2018',
  'hora_fin': '0',
  'period': '1d',
  'fecha_ini': '11/12/2018',
  'fecha_finP': '11/12/2018',
  'UserID': 'nobody',
  'EsDL1': '0',
  'EsDL2': '0',
  'EsDL3': '0'
}

response = 
requests.post(
    'http://dgasatel.mop.cl/filtro_paramxestac_new.asp',
    headers=headers, cookies=cookies, data=data)

Для очистки данных, я рекомендую вам сопоставить точки данных, которые вы хотитев словарь или в CSV с циклами.

for table in data:
    if table.tail(1) and table.tail(1).iloc:
        print(table.tail(1).iloc[0][2])
...