क्रॉल करने की तैयारी

Python में Web Scraping

Thomas Laetsch

Data Scientist, NYU

आइए Response देखें

Selector बनाम Response:

  • Response में Selectors के सारे टूल होते हैं:
    • xpath और css मेथड, जिनके बाद extract और extract_first मेथड आते हैं.
  • Response उस url का हिसाब रखता है जहाँ से HTML लोड हुआ.
  • Response हमें एक साइट से दूसरी पर ले जाने में मदद करता है, ताकि स्क्रैपिंग करते समय हम वेब को "crawl" कर सकें.
Python में Web Scraping

हमें क्या पता है!

  • xpath मेथड Selector जैसा ही काम करता है
response.xpath( '//div/span[@class="bio"]' )
  • css मेथड Selector जैसा ही काम करता है
response.css( 'div > span.bio' )
  • Chaining Selector जैसी ही होती है
response.xpath('//div').css('span.bio')
  • Data extraction Selector जैसी ही होती है
response.xpath('//div').css('span.bio').extract()
response.xpath('//div').css('span.bio').extract_first()
Python में Web Scraping

जो अभी नहीं पता

  • response में URL, response की url वैरिएबल में रहता है।
response.url
>>> 'http://www.DataCamp.com/courses/all'
  • response हमें follow() मेथड से नया लिंक "follow" करने देता है
# next_url वह string path है जिसका अगला url हमें स्क्रैप करना है
response.follow( next_url )
  • follow के बारे में और आगे सीखेंगे।
Python में Web Scraping

In Response

Python में Web Scraping

Preparing Video For Download...