Lokatory CSS

Web Scraping w Pythonie

Thomas Laetsch

Data Scientist, NYU

Kamień z Rosetty CSS

  • / zastępujemy > (z wyjątkiem pierwszego znaku)
    • XPath: /html/body/div
    • Lokator CSS: html > body > div
  • // zastępujemy spacją (z wyjątkiem pierwszego znaku)
    • XPath: //div/span//p
    • Lokator CSS: div > span p
  • [N] zastępujemy :nth-of-type(N)
    • XPath: //div/p[2]
    • Lokator CSS: div > p:nth-of-type(2)
Web Scraping w Pythonie

Kamień z Rosetty CSS

XPATH

xpath = '/html/body//div/p[2]'

CSS

css = 'html > body div > p:nth-of-type(2)'
Web Scraping w Pythonie

Atrybuty w CSS

  • Aby znaleźć element po klasie, użyj kropki .
    • Przykład: p.class-1 wybiera wszystkie elementy akapitu należące do class-1
  • Aby znaleźć element po id, użyj krzyżyka #
    • Przykład: div#uid wybiera element div z id równym uid
Web Scraping w Pythonie

Atrybuty w CSS

Wybierz elementy akapitu w klasie class1:

css_locator = 'div#uid > p.class1'

Wybierz wszystkie elementy, których atrybut class należy do class1:

css_locator = '.class1'
Web Scraping w Pythonie

Status klasy

css = '.class1'

Wybór klasy – XPath tylko klasa.png

Web Scraping w Pythonie

Status klasy

xpath = '//*[@class="class1"]'

Wybór klasy – XPath równość.png

Web Scraping w Pythonie

Status klasy

xpath = '//*[contains(@class,"class1")]'

Wybór klasy – XPath contains.png

Web Scraping w Pythonie

Selektory CSS

from scrapy import Selector 

html = '''
<html>
  <body>
    <div class="hello datacamp">
      <p>Hello World!</p>
    </div>
    <p>Enjoy DataCamp!</p>
  </body>
</html>
''' 
sel = Selector( text = html )
>>> sel.css("div > p")
out: [<Selector xpath='...' data='<p>Hello World!</p>'>] 

>>> sel.css("div > p").extract()
out: [ '<p>Hello World!</p>' ]
Web Scraping w Pythonie

Do zobaczenia z CSS!

Web Scraping w Pythonie

Preparing Video For Download...