Pregătire pentru crawling

Web Scraping în Python

Thomas Laetsch

Data Scientist, NYU

Despre Response

Selector vs Response:

  • Response include toate instrumentele pe care le-am învățat cu Selectorii:
    • metodele xpath și css urmate de metodele extract și extract_first.
  • Response reține URL-ul de unde a fost încărcat codul HTML.
  • Response ne ajută să navigăm de la un site la altul, pentru a „crawla" web-ul în timp ce extragem date.
Web Scraping în Python

Ce știm deja!

  • Metoda xpath funcționează ca un Selector
response.xpath( '//div/span[@class="bio"]' )
  • Metoda css funcționează ca un Selector
response.css( 'div > span.bio' )
  • Înlănțuirea funcționează ca un Selector
response.xpath('//div').css('span.bio')
  • Extragerea datelor funcționează ca un Selector
response.xpath('//div').css('span.bio').extract()
response.xpath('//div').css('span.bio').extract_first()
Web Scraping în Python

Ce nu știm încă

  • response reține URL-ul în variabila response url.
response.url
>>> 'http://www.DataCamp.com/courses/all'
  • response ne permite să „urmărim" un nou link cu metoda follow()
# next_url este calea string a următorului url pe care vrem să-l extragem
response.follow( next_url )
  • Vom afla mai multe despre follow ulterior.
Web Scraping în Python

În Response

Web Scraping în Python

Preparing Video For Download...