Redo att krypa

Webbskrapning i Python

Thomas Laetsch

Data Scientist, NYU

Låt oss svara

Selector vs Response:

  • Response har alla verktyg vi lärt oss med Selectors:
    • metoderna xpath och css följt av metoderna extract och extract_first.
  • Response håller också reda på url:en varifrån HTML-koden laddades.
  • Response hjälper oss att navigera mellan sidor så att vi kan "krypa" över webben medan vi skrapar.
Webbskrapning i Python

Det vi redan kan!

  • xpath method works like a Selector
response.xpath( '//div/span[@class="bio"]' )
  • css method works like a Selector
response.css( 'div > span.bio' )
  • Chaining works like a Selector
response.xpath('//div').css('span.bio')
  • Data extraction works like a Selector
response.xpath('//div').css('span.bio').extract()
response.xpath('//div').css('span.bio').extract_first()
Webbskrapning i Python

Det vi ännu inte kan

  • response håller reda på URL:en via variabeln response url.
response.url
>>> 'http://www.DataCamp.com/courses/all'
  • response låter oss "följa" en ny länk med metoden follow()
# next_url is the string path of the next url we want to scrape
response.follow( next_url )
  • Vi lär oss mer om follow senare.
Webbskrapning i Python

I Response

Webbskrapning i Python

Preparing Video For Download...