Готуємося до crawl

Вебскрапінг у Python

Thomas Laetsch

Data Scientist, NYU

Давайте відповімо

Selector vs Response:

  • Об'єкт Response має всі інструменти, які ми вивчали з Selectors:
    • методи xpath і css, а далі методи extract та extract_first.
  • Об'єкт Response також зберігає адресу сторінки (url), з якої завантажено HTML.
  • Об'єкт Response допомагає переходити між сторінками, щоб ми могли «crawl» інтернет під час скрейпінгу.
Вебскрапінг у Python

Що ми знаємо!

  • Метод xpath працює як Selector
response.xpath( '//div/span[@class=\"bio\"]' )
  • Метод css працює як Selector
response.css( 'div > span.bio' )
  • Ланцюжки працюють як у Selector
response.xpath('//div').css('span.bio')
  • Витяг даних працює як у Selector
response.xpath('//div').css('span.bio').extract()
response.xpath('//div').css('span.bio').extract_first()
Вебскрапінг у Python

Чого ми не знаємо

  • response зберігає URL у змінній response url.
response.url
>>> 'http://www.DataCamp.com/courses/all'
  • response дозволяє «follow» перейти за новим посиланням методом follow()
# next_url — це рядок-шлях до наступного url для скрейпінгу
response.follow( next_url )
  • Більше про follow — далі.
Вебскрапінг у Python

У відповідь

Вебскрапінг у Python

Preparing Video For Download...