クロールの準備

Pythonで学ぶWebスクレイピング

Thomas Laetsch

Data Scientist, NYU

Response を使う

Selector と Response の違い:

  • Response には Selector で学んだツールがすべてあります:
    • xpathcss、続く extractextract_first
  • Response は HTML を取得した URL を保持 します。
  • Response は サイト間の移動を支援し、スクレイピングしながら「クロール」できます。
Pythonで学ぶWebスクレイピング

ここまでのまとめ

  • xpath は Selector と同様に動作します
response.xpath( '//div/span[@class="bio"]' )
  • css も Selector と同様に動作します
response.css( 'div > span.bio' )
  • メソッドの連結も Selector と同様です
response.xpath('//div').css('span.bio')
  • データ抽出も Selector と同様です
response.xpath('//div').css('span.bio').extract()
response.xpath('//div').css('span.bio').extract_first()
Pythonで学ぶWebスクレイピング

まだ知らないこと

  • response は URL を response.url に保持します。
response.url
>>> 'http://www.DataCamp.com/courses/all'
  • responsefollow() で新しいリンクを「追跡」できます
# next_url は次にスクレイプしたい URL の文字列パス
response.follow( next_url )
  • follow については後ほど詳しく学びます。
Pythonで学ぶWebスクレイピング

Response で

Pythonで学ぶWebスクレイピング

Preparing Video For Download...