XPath 導覽

Python 網頁爬蟲

Thomas Laetsch

Data Scientist, NYU

斜線與括號

  • 單斜線 / 只往前看
  • 雙斜線 // 往前看所有後代
  • 方括號 [] 用來鎖定特定元素
Python 網頁爬蟲

要不要加括號

XPath 中選到 body

xpath = '/html/body'
xpath = '/html[1]/body[1]'
  • 兩者選到相同元素
Python 網頁爬蟲

Body 裡的 P

xpath = '/html/body/p'

選到 body 下的 p

Python 網頁爬蟲

div 與第 2 個 p

xpath = '/html/body/div/p'

選到 div 下的 p

xpath = '/html/body/div/p[2]'

選到 div 下的第 2 個 p

Python 網頁爬蟲

雙斜線搭配括號

xpath = '//p'

選到所有 p

xpath = '//p[1]'

每個層級的第 1 個 p

Python 網頁爬蟲

萬用字元

xpath = '/html/body/*'

選到 body 的所有子節點

  • 星號 * 是「萬用字元」
Python 網頁爬蟲

Xposé

Python 網頁爬蟲

Preparing Video For Download...