Przygotowanie do crawlowania

Web Scraping w Pythonie

Thomas Laetsch

Data Scientist, NYU

Response w praktyce

Selector a Response:

  • Response posiada wszystkie narzędzia znane z Selectorów:
    • Metody xpath i css oraz metody extract i extract_first.
  • Response śledzi URL, z którego załadowano kod HTML.
  • Response umożliwia przechodzenie między stronami, dzięki czemu możemy „crawlować" sieć podczas scrapowania.
Web Scraping w Pythonie

Co już wiemy!

  • Metoda xpath działa jak Selector
response.xpath( '//div/span[@class="bio"]' )
  • Metoda css działa jak Selector
response.css( 'div > span.bio' )
  • Łączenie metod działa jak w Selectorze
response.xpath('//div').css('span.bio')
  • Ekstrakcja danych działa jak w Selectorze
response.xpath('//div').css('span.bio').extract()
response.xpath('//div').css('span.bio').extract_first()
Web Scraping w Pythonie

Czego jeszcze nie wiemy

  • response przechowuje URL w zmiennej response url.
response.url
>>> 'http://www.DataCamp.com/courses/all'
  • response pozwala „śledzić" nowy link metodą follow()
# next_url is the string path of the next url we want to scrape
response.follow( next_url )
  • Więcej o follow omówimy później.
Web Scraping w Pythonie

W Response

Web Scraping w Pythonie

Preparing Video For Download...