Préparer l'exploration

Extraction de données Web en Python

Thomas Laetsch

Data Scientist, NYU

Répondons

Selector vs Response :

  • L'objet Response offre tous les outils vus avec les Selectors :
    • Méthodes xpath et css, puis extract et extract_first.
  • L'objet Response conserve l'URL source d'où provient le code HTML.
  • L'objet Response permet de passer d'un site à l'autre pour « crawler » le Web pendant l'extraction.
Extraction de données Web en Python

Ce que nous savons !

  • La méthode xpath fonctionne comme un Selector
response.xpath( '//div/span[@class=\"bio\"]' )
  • La méthode css fonctionne comme un Selector
response.css( 'div > span.bio' )
  • L'enchaînement fonctionne comme un Selector
response.xpath('//div').css('span.bio')
  • L'extraction de données fonctionne comme un Selector
response.xpath('//div').css('span.bio').extract()
response.xpath('//div').css('span.bio').extract_first()
Extraction de données Web en Python

Ce que nous ignorons

  • response conserve l'URL dans la variable response.url.
response.url
>>> 'http://www.DataCamp.com/courses/all'
  • response permet de « suivre » un nouveau lien avec la méthode follow()
# next_url est le chemin (chaîne) de la prochaine URL à extraire
response.follow( next_url )
  • Nous verrons follow plus en détail plus tard.
Extraction de données Web en Python

En réponse

Extraction de données Web en Python

Preparing Video For Download...