HTTP požadavky pro import souborů z webu

Intermediate Importing Data in Python

Hugo Bowne-Anderson

Data Scientist at DataCamp

URL

  • Uniform/Universal Resource Locator
  • Odkazy na webové zdroje
  • Zaměření: webové adresy
  • Součásti:
    • Identifikátor protokolu – http:
    • Název zdroje – datacamp.com
  • Jednoznačně určují webové adresy
Intermediate Importing Data in Python

HTTP

  • HyperText Transfer Protocol
  • Základ datové komunikace na webu
  • HTTPS – bezpečnější forma HTTP
  • Návštěva webu = odeslání HTTP požadavku
    • Požadavek GET
  • urlretrieve() provádí požadavek GET
  • HTML – HyperText Markup Language
Intermediate Importing Data in Python

Požadavky GET pomocí urllib

from urllib.request import urlopen, Request
url = "https://www.wikipedia.org/"
request = Request(url)
response = urlopen(request)
html = response.read()
response.close()
Intermediate Importing Data in Python

Požadavky GET pomocí requests

ch_1_2.026.png

  • Využíváno organizacemi jako „vláda Jejího Veličenstva, Amazon, Google, Twilio, NPR, Obama for America, Twitter, Sony a federální instituce USA, které si nepřejí být jmenovány“
Intermediate Importing Data in Python

Požadavky GET pomocí requests

  • Jeden z nejstahovanějších balíčků Pythonu
import requests
url = "https://www.wikipedia.org/"
r = requests.get(url)
text = r.text
Intermediate Importing Data in Python

Pojďme procvičovat!

Intermediate Importing Data in Python

Preparing Video For Download...