Готовимся к сканированию

Веб-скрапинг на Python

Thomas Laetsch

Data Scientist, NYU

Работаем с Response

Selector и Response:

  • Response поддерживает все инструменты, изученные с Selector:
    • методы xpath и css в сочетании с методами extract и extract_first.
  • Response также хранит URL, по которому был загружен HTML-код.
  • Response позволяет переходить с сайта на сайт, обеспечивая «обход» веб-страниц при скрапинге.
Веб-скрапинг на Python

Что мы уже знаем!

  • Метод xpath работает как Selector
response.xpath( '//div/span[@class="bio"]' )
  • Метод css работает как Selector
response.css( 'div > span.bio' )
  • Цепочки вызовов работают как в Selector
response.xpath('//div').css('span.bio')
  • Извлечение данных работает как в Selector
response.xpath('//div').css('span.bio').extract()
response.xpath('//div').css('span.bio').extract_first()
Веб-скрапинг на Python

Что нам ещё предстоит узнать

  • response хранит URL в переменной response url.
response.url
>>> 'http://www.DataCamp.com/courses/all'
  • response позволяет «следовать» по новой ссылке с помощью метода follow()
# next_url is the string path of the next url we want to scrape
response.follow( next_url )
  • Подробнее о follow мы поговорим позже.
Веб-скрапинг на Python

Внутри Response

Веб-скрапинг на Python

Preparing Video For Download...