Notions couvertes
- Chapitre 1 : introduction au HTML et à l'extraction Web
- Chapitre 2 : navigation et sélection avec CSS
- Technologies Web de base et comment les exploiter pour l'extraction
- Le paquet
rvest
- Chapitre 3 : sélection avancée avec XPATH
- Fonctions XPATH comme
position() ou text()
- Sélection de nœuds selon l'entourage (p. ex. enfants)
- Chapitre 4 : pratiques exemplaires d'extraction
- En arrière-plan : HTTP (et le paquet
httr)
- Bonnes pratiques : limitation du débit et identification des agents utilisateurs