準備開始抓取

Python 網頁爬蟲

Thomas Laetsch

Data Scientist, NYU

來操作 Response

Selector 與 Response:

  • Response 具備我們用過的 Selector 工具:
    • xpathcss 方法,後接 extractextract_first 方法。
  • Response 也會記錄載入該 HTML 的網址。
  • Response 協助我們在網站間移動,讓我們在爬取時能「爬行」全站。
Python 網頁爬蟲

已知重點

  • xpath 方法與 Selector 用法相同
response.xpath( '//div/span[@class=\"bio\"]' )
  • css 方法與 Selector 用法相同
response.css( 'div > span.bio' )
  • 串接(chaining)與 Selector 用法相同
response.xpath('//div').css('span.bio')
  • 資料擷取與 Selector 用法相同
response.xpath('//div').css('span.bio').extract()
response.xpath('//div').css('span.bio').extract_first()
Python 網頁爬蟲

尚未了解

  • response 會在 response.url 變數中記錄 URL。
response.url
>>> 'http://www.DataCamp.com/courses/all'
  • response 讓我們用 follow() 方法「跟隨」新連結
# next_url 是我們想爬取的下一個網址字串路徑
response.follow( next_url )
  • 之後我們會更深入介紹 follow
Python 網頁爬蟲

回應重點

Python 網頁爬蟲

Preparing Video For Download...