Natura żądań HTTP

Web Scraping w R

Timo Grossenbacher

Instructor

Protokół HTTP

Schemat przedstawiający komunikację przeglądarek z serwerami

1 https://developer.mozilla.org/en-US/docs/Web/HTTP/Overview
Web Scraping w R

Anatomia żądań

Żądanie jest wysyłane do serwera WWW

Przykładowe żądanie

Typowe kody statusu: 200 (OK), 404 (NOT FOUND), 3xx (przekierowania), 5xx (błędy serwera)

Odpowiedź jest odbierana od serwera WWW

Odpowiadająca odpowiedź

1 https://developer.mozilla.org/en-US/docs/Web/HTTP/Overview
Web Scraping w R

Metody żądań: GET i POST

  • GET: Służy do pobierania zasobu bez przesyłania danych (GET /index.html)
  • POST: Służy do wysyłania danych do serwera, np. po wypełnieniu formularza
POST /test HTTP/1.1
Host: foo.example
Content-Type: application/x-www-form-urlencoded
Content-Length: 27

field1=value1&field2=value2

Żądania POST również otrzymują odpowiedź!

1 https://developer.mozilla.org/en-US/docs/Web/HTTP/Methods/POST
Web Scraping w R

Żądania HTTP z httr

library(httr)
GET('https://httpbin.org')
Response [https://httpbin.org/]
  Date: 2020-09-19 13:02
  Status: 200
  Content-Type: text/html; charset=utf-8
  Size: 9.59 kB
<!DOCTYPE html>
<html lang="en">

<head>
    <meta charset="UTF-8">
    ...
Web Scraping w R

Żądania HTTP z httr

library(httr)
response <- GET('https://httpbin.org')
content(response)
{html_document}
<html lang="en">
[1] <head>\n<meta http-equiv="Content-Type" content="text/html; charset=UTF ...
[2] <body>\n    <a href="https://github.com/requests/httpbin" class="github ...
Web Scraping w R

Czas na ćwiczenia!

Web Scraping w R

Preparing Video For Download...