Attribute and Text Selection

Web Scraping in Python

Thomas Laetsch

Data Scientist, NYU

You Must have Guts to use your Colon

xpath = '//div[@id="uid"]/a/@href'

css_locator = 'div#uid > a::attr(href)'

<p id="p-example">
  Hello world! 
  Try <a href="http://www.datacamp.com">DataCamp</a> today!
</p>

sel.xpath('//p[@id="p-example"]/text()').extract()

# result: ['\n Hello world!\n Try ', ' today!\n']

sel.xpath('//p[@id="p-example"]//text()').extract()

# result: ['\n Hello world!\n Try ', 'DataCamp', ' today!\n']

<p id="p-example">
  Hello world! 
  Try <a href="http://www.datacamp.com">DataCamp</a> today!
</p>

sel.css('p#p-example::text').extract()

# result: ['\n Hello world!\n Try ', ' today!\n']

sel.css('p#p-example ::text').extract()

# result: ['\n Hello world!\n Try ', 'DataCamp', ' today!\n']

Web Scraping in Python