准备开始抓取

Python Web 爬取

Thomas Laetsch

Data Scientist, NYU

开始使用 Response

Selector 与 Response:

  • Response 拥有我们在 Selector 中学到的所有工具:
    • xpathcss 方法,配合 extractextract_first
  • Response 还会记录加载该 HTML 的 URL。
  • Response 帮助我们从一个站点跳到另一个站点,实现"爬取"。
Python Web 爬取

我们已知的!

  • xpath 方法的用法与 Selector 相同
response.xpath( '//div/span[@class="bio"]' )
  • css 方法的用法与 Selector 相同
response.css( 'div > span.bio' )
  • 链式调用与 Selector 相同
response.xpath('//div').css('span.bio')
  • 数据提取与 Selector 相同
response.xpath('//div').css('span.bio').extract()
response.xpath('//div').css('span.bio').extract_first()
Python Web 爬取

我们未知的

  • responseresponse.url 变量中记录 URL。
response.url
>>> 'http://www.DataCamp.com/courses/all'
  • response 可用 follow() 方法"跟进"新链接
# next_url 是下一页要抓取的字符串路径
response.follow( next_url )
  • 稍后我们会更深入学习 follow
Python Web 爬取

关于 Response

Python Web 爬取

Preparing Video For Download...