Python में Web Scraping
Thomas Laetsch
Data Scientist, NYU
/ को > से बदलें (पहला अक्षर छोड़कर)/html/body/divhtml > body > div// को खाली स्पेस से बदलें (पहला अक्षर छोड़कर)//div/span//pdiv > span p[N] को :nth-of-type(N) से बदलें//div/p[2]div > p:nth-of-type(2)XPATH
xpath = '/html/body//div/p[2]'
CSS
css = 'html > body div > p:nth-of-type(2)'
. का उपयोग करेंp.class-1 उन सभी पैराग्राफ एलिमेंट्स को चुनता है जो class-1 में हैं# का उपयोग करेंdiv#uid वह div एलिमेंट चुनता है जिसका id uid हैclass1 क्लास के भीतर पैराग्राफ एलिमेंट्स चुनें:
css_locator = 'div#uid > p.class1'
सभी एलिमेंट्स चुनें जिनका class attribute class1 है:
css_locator = '.class1'
css = '.class1'

xpath = '//*[@class="class1"]'

xpath = '//*[contains(@class,"class1")]'

from scrapy import Selector
html = '''
<html>
<body>
<div class="hello datacamp">
<p>Hello World!</p>
</div>
<p>Enjoy DataCamp!</p>
</body>
</html>
'''
sel = Selector( text = html )
>>> sel.css("div > p")
out: [<Selector xpath='...' data='<p>Hello World!</p>'>]
>>> sel.css("div > p").extract()
out: [ '<p>Hello World!</p>' ]
Python में Web Scraping