크롤링 준비하기

Python으로 하는 웹 스크레이핑

Thomas Laetsch

Data Scientist, NYU

Response 살펴보기

Selector vs Response:

  • Response에는 Selector에서 배운 도구가 모두 있습니다:
    • xpathcss 메서드, 그리고 이어지는 extract, extract_first 메서드.
  • Response는 HTML이 로드된 URL을 기록합니다.
  • Response는 사이트 간 이동을 도와 웹을 "크롤링"하게 해 줍니다.
Python으로 하는 웹 스크레이핑

이미 아는 것

  • xpath 메서드는 Selector처럼 동작합니다
response.xpath( '//div/span[@class="bio"]' )
  • css 메서드는 Selector처럼 동작합니다
response.css( 'div > span.bio' )
  • 체이닝도 Selector처럼 됩니다
response.xpath('//div').css('span.bio')
  • 데이터 추출도 Selector와 같습니다
response.xpath('//div').css('span.bio').extract()
response.xpath('//div').css('span.bio').extract_first()
Python으로 하는 웹 스크레이핑

아직 모르는 것

  • response는 응답의 url 변수로 URL을 보관합니다.
response.url
>>> 'http://www.DataCamp.com/courses/all'
  • responsefollow() 메서드로 새 링크를 "따라갈" 수 있게 합니다
# next_url은 스크레이핑할 다음 url의 문자열 경로입니다
response.follow( next_url )
  • follow는 이후에 더 배웁니다.
Python으로 하는 웹 스크레이핑

Response에서

Python으로 하는 웹 스크레이핑

Preparing Video For Download...