Připravujeme se na procházení webu

Web Scraping v Pythonu

Thomas Laetsch

Data Scientist, NYU

Odpověď na vše

Selector vs Response:

  • Response disponuje všemi nástroji, které jsme se naučili se Selectory:
    • metody xpath a css následované metodami extract a extract_first.
  • Response také uchovává URL adresu, ze které byl načten HTML kód.
  • Response umožňuje přecházet mezi stránkami, abychom mohli web „procházet" při scrapování.
Web Scraping v Pythonu

Co již umíme!

  • Metoda xpath funguje jako Selector
response.xpath( '//div/span[@class="bio"]' )
  • Metoda css funguje jako Selector
response.css( 'div > span.bio' )
  • Řetězení funguje jako u Selectoru
response.xpath('//div').css('span.bio')
  • Extrakce dat funguje jako u Selectoru
response.xpath('//div').css('span.bio').extract()
response.xpath('//div').css('span.bio').extract_first()
Web Scraping v Pythonu

Co ještě nevíme

  • response uchovává URL adresu v proměnné response url.
response.url
>>> 'http://www.DataCamp.com/courses/all'
  • response umožňuje „následovat" nový odkaz pomocí metody follow()
# next_url is the string path of the next url we want to scrape
response.follow( next_url )
  • Více o follow se dozvíme později.
Web Scraping v Pythonu

V odpovědi

Web Scraping v Pythonu

Preparing Video For Download...