HTTP-запросы для импорта файлов из интернета

Импорт данных в Python: средний уровень

Hugo Bowne-Anderson

Data Scientist at DataCamp

URL

  • Uniform/Universal Resource Locator
  • Ссылки на веб-ресурсы
  • Фокус: веб-адреса
  • Составные части:
    • Идентификатор протокола — http:
    • Имя ресурса — datacamp.com
  • Однозначно определяют веб-адреса
Импорт данных в Python: средний уровень

HTTP

  • HyperText Transfer Protocol
  • Основа обмена данными в интернете
  • HTTPS — более защищённая версия HTTP
  • Переход на сайт = отправка HTTP-запроса
    • GET-запрос
  • urlretrieve() выполняет GET-запрос
  • HTML — HyperText Markup Language
Импорт данных в Python: средний уровень

GET-запросы с помощью urllib

from urllib.request import urlopen, Request
url = "https://www.wikipedia.org/"
request = Request(url)
response = urlopen(request)
html = response.read()
response.close()
Импорт данных в Python: средний уровень

GET-запросы с помощью requests

ch_1_2.026.png

  • Используется «правительством Её Величества, Amazon, Google, Twilio, NPR, Obama for America, Twitter, Sony и федеральными учреждениями США, предпочитающими остаться неназванными»
Импорт данных в Python: средний уровень

GET-запросы с помощью requests

  • Один из самых загружаемых пакетов Python
import requests
url = "https://www.wikipedia.org/"
r = requests.get(url)
text = r.text
Импорт данных в Python: средний уровень

Давайте потренируемся!

Импорт данных в Python: средний уровень

Preparing Video For Download...