Extraction de données Web en Python
Thomas Laetsch
Data Scientist, NYU
Selector vs Response :
xpath et css, puis extract et extract_first.xpath fonctionne comme un Selectorresponse.xpath( '//div/span[@class=\"bio\"]' )
css fonctionne comme un Selectorresponse.css( 'div > span.bio' )
response.xpath('//div').css('span.bio')
response.xpath('//div').css('span.bio').extract()
response.xpath('//div').css('span.bio').extract_first()
response conserve l'URL dans la variable response.url.response.url
>>> 'http://www.DataCamp.com/courses/all'
response permet de « suivre » un nouveau lien avec la méthode follow()# next_url est le chemin (chaîne) de la prochaine URL à extraire
response.follow( next_url )
follow plus en détail plus tard.Extraction de données Web en Python