Python में Web Scraping
Thomas Laetsch
Data Scientist, NYU
from scrapy import Selector
html = '''
<html>
<body>
<div class="hello datacamp">
<p>Hello World!</p>
</div>
<p>Enjoy DataCamp!</p>
</body>
</html>
'''
sel = Selector( text = html )
html कोड वाली string से scrapy Selector ऑब्जेक्ट बनाया गया
selector sel ने पूरे html डॉक्यूमेंट को चुना है
Selector में xpath कॉल का उपयोग कर html कोड के खास हिस्सों के नए Selector बना सकते हैं
रिटर्न वैल्यू Selector ऑब्जेक्ट्स की SelectorList होती है
sel.xpath("//p")# outputs the SelectorList: [<Selector xpath='//p' data='<p>Hello World!</p>'>, <Selector xpath='//p' data='<p>Enjoy DataCamp!</p>'>]
extract() मेथड का उपयोग करें>>> sel.xpath("//p")out: [<Selector xpath='//p' data='<p>Hello World!</p>'>, <Selector xpath='//p' data='<p>Enjoy DataCamp!</p>'>]
>>> sel.xpath("//p").extract()out: [ '<p>Hello World!</p>', '<p>Enjoy DataCamp!</p>' ]
extract_first() का उपयोग करें>>> sel.xpath("//p").extract_first()out: '<p>Hello World!</p>'
ps = sel.xpath('//p')second_p = ps[1]
second_p.extract()out: '<p>Enjoy DataCamp!</p>'
Python में Web Scraping