Filtrowanie tweetów

Analiza danych z mediów społecznościowych w R

Vivek Vijayaraghavan

Data Science Coach

Przegląd lekcji

  • Filtrowanie według elementów tweeta
    • Pobieranie oryginalnych tweetów
    • Język tweeta
    • Popularne tweety na podstawie minimalnej liczby retweetów i polubień
Analiza danych z mediów społecznościowych w R

Filtrowanie oryginalnych tweetów

  • Oryginalny tweet to wpis zamieszczony przez użytkownika Twittera
  • Nie jest retweetem, cytatem ani odpowiedzią
  • Oryginalne tweety zapewniają niepowtarzalność treści
  • Pomaga utrzymać zaangażowanie użytkowników
Analiza danych z mediów społecznościowych w R

Filtrowanie oryginalnych tweetów

  • -filter służy do pobierania oryginalnych tweetów
  • -filter:retweets wyklucza wszystkie retweety
  • -filter:quote filtruje cytowane tweety
  • -filter:replies wyklucza tweety będące odpowiedziami
Analiza danych z mediów społecznościowych w R

Tweety bez filtrów

  • Pobieranie tweetów o "digital marketing" bez żadnych filtrów
# Extract 100 tweets on "digital marketing"
tweets_all <- search_tweets("digital marketing", n = 100)
Analiza danych z mediów społecznościowych w R

Tweety bez filtrów

  • Sprawdzenie liczby wartości w kolumnach reply_to_screen_name, is_quote, is_retweet
# Check for count of replies
library(plyr)
count(tweets_all$reply_to_screen_name)
x               freq
<fct>          <int>
blairaasmith      2            
javiergosende     1            
juanburgos        1            
WhutTheHale       2            
NA               94
Analiza danych z mediów społecznościowych w R

Tweety bez filtrów

# Check for count of quotes
count(tweets_all$is_quote)
x        freq
<lgl>    <int>
FALSE     98            
TRUE       2
Analiza danych z mediów społecznościowych w R

Tweety bez filtrów

# Check for count of retweets
count(tweets_all$is_retweet)
x         freq
<lgl>    <int>
FALSE      61            
TRUE       39
Analiza danych z mediów społecznościowych w R

Wykluczanie retweetów, cytatów i odpowiedzi

  • Pobieranie tweetów o "digital marketing" z użyciem -filter
# Apply the '-filter'
tweets_org <- search_tweets("digital marketing 
                            -filter:retweets 
                            -filter:quote 
                            -filter:replies", 
                            n = 100)
Analiza danych z mediów społecznościowych w R

Wykluczanie retweetów, cytatów i odpowiedzi

  • Sprawdzenie, czy odpowiedzi, cytaty i retweety są wykluczone
# Check for count of replies
library(plyr)
count(tweets_org$reply_to_screen_name)
x         freq
<lgl>    <int>
NA         100
Analiza danych z mediów społecznościowych w R

Wykluczanie retweetów, cytatów i odpowiedzi

# Check for count of quotes
library(plyr)
count(tweets_org$is_quote)

x         freq
<lgl>    <int>
FALSE     100
# Check for count of retweets
library(plyr)
count(tweets_org$is_retweet)
x         freq
<lgl>    <int>
FALSE     100
Analiza danych z mediów społecznościowych w R

Filtrowanie tweetów według języka

  • lang filtruje tweety według języka
  • Dopasowuje tweety w określonym języku

Kody języków Twittera dla wybranych języków

Analiza danych z mediów społecznościowych w R

Filtrowanie tweetów według języka

# Filter and extract tweets posted in Spanish
tweets_lang <- search_tweets("brand marketing", lang = "es")
Analiza danych z mediów społecznościowych w R

Filtrowanie tweetów według języka

View(tweets_lang)

Tweety pobrane w języku hiszpańskim

Analiza danych z mediów społecznościowych w R

Filtrowanie tweetów według języka

head(tweets_lang$lang)
[1] "es" "es" "es" "es" "es" "es"
Analiza danych z mediów społecznościowych w R

Filtrowanie według liczby retweetów i polubień

  • min_faves: filtruje tweety z minimalną liczbą polubień
  • min_retweets: filtruje tweety z minimalną liczbą retweetów
  • Operator AND sprawdza oba warunki jednocześnie
Analiza danych z mediów społecznościowych w R

Filtrowanie według liczby retweetów i polubień

# Extract tweets with minimum 100 favorites and retweets 
tweets_pop <- search_tweets("bitcoin min_faves:100 AND
                            min_retweets:100")
Analiza danych z mediów społecznościowych w R

Filtrowanie według liczby retweetów i polubień

# Create a data frame to check retweet and favorite counts
counts <- tweets_pop[c("retweet_count", "favorite_count")]
head(counts)
retweet_count    favorite_count
    <int>              <int>
1    162                833
2    141                894    
3    164                1128
4    395                1346    
5    475                2271
6    270                1654
Analiza danych z mediów społecznościowych w R

Filtrowanie według liczby retweetów i polubień

# View the tweets
head(tweets_pop$text)
text    
<chr>
1    As we continue to build the Bakkt Bitcoin Futures contract, we reached a
2    BREAKING: The United States is considering entering into a "currency pact"
3    REMINDER: The Bitcoin ETF will eventually get approved.\n\nNot a question
4    [New Post] Bitcoin is becoming much more important in Hong Kong and India.
5    Reports are surfacing that some Hong Kong ATMs have run out of cash as
6    Bitcoin is the most transparent currency ever created.
Analiza danych z mediów społecznościowych w R

Czas na ćwiczenia!

Analiza danych z mediów społecznościowych w R

Preparing Video For Download...