Datenverarbeitung in der Shell
Susan Sun
Data Person
csvstack: stapelt die Zeilen aus zwei oder mehr CSV-Dateien
Dokumentation:
csvstack -h
usage: csvstack [-h] [-d DELIMITER] [-t] [-q QUOTECHAR] [-u {0,1,2,3}] [-b]
[-p ESCAPECHAR] [-z FIELD_SIZE_LIMIT] [-e ENCODING] [-S] [-H]
[-n GROUP_NAME] [--filenames]
Zwei ähnliche Dateien Spotify_Rank6.csv und Spotify_Rank7.csv zu einer zusammenführen.
Datenvorschau zur Schema-Prüfung:
csvlook Spotify_Rank6.csv
| track_id | popularity |
| ---------------------- | ---------- |
| 7JYCpIzpoidDOnnmxmHwtj | 6 |
| 0mmFibEg5NuULMwTVN2tRU | 6 |
csvlook Spotify_Rank7.csv
| track_id | popularity |
| ---------------------- | ---------- |
| 118GQ70Sp6pMqn6w1oKuki | 7 |
| 6S7cr72a7a8RVAXzDCRj6m | 7 |
Syntax:
csvstack Spotify_Rank6.csv Spotify_Rank7.csv > Spotify_AllRanks.csv
csvlook Spotify_AllRanks.csv
| track_id | popularity |
| ---------------------- | ---------- |
| 7JYCpIzpoidDOnnmxmHwtj | 6 |
| 0mmFibEg5NuULMwTVN2tRU | 6 |
| 118GQ70Sp6pMqn6w1oKuki | 7 |
| 6S7cr72a7a8RVAXzDCRj6m | 7 |
csvstack -g "Rank6","Rank7" \
Spotify_Rank6.csv Spotify_Rank7.csv > Spotify_AllRanks.csv
csvlook Spotify_AllRanks.csv
| group | track_id | popularity |
| ----- | ---------------------- | ---------- |
| Rank6 | 7JYCpIzpoidDOnnmxmHwtj | 6 |
| Rank6 | 0mmFibEg5NuULMwTVN2tRU | 6 |
| Rank7 | 118GQ70Sp6pMqn6w1oKuki | 7 |
| Rank7 | 6S7cr72a7a8RVAXzDCRj6m | 7 |
csvstack -g "Rank6","Rank7" -n "source" \
Spotify_Rank6.csv Spotify_Rank7.csv > Spotify_AllRanks.csv
csvlook Spotify_AllRanks.csv
| source| track_id | popularity |
| ----- | ---------------------- | ---------- |
| Rank6 | 7JYCpIzpoidDOnnmxmHwtj | 6 |
| Rank6 | 0mmFibEg5NuULMwTVN2tRU | 6 |
| Rank7 | 118GQ70Sp6pMqn6w1oKuki | 7 |
| Rank7 | 6S7cr72a7a8RVAXzDCRj6m | 7 |
; verbindet Befehle und führt sie nacheinander aus
csvlook SpotifyData_All.csv; csvstat SpotifyData_All.csv
&& verbindet Befehle, führt den 2. aber nur aus, wenn der 1. erfolgreich war
csvlook SpotifyData_All.csv && csvstat SpotifyData_All data.csv
> leitet die Ausgabe des 1. Befehls an den beim 2. angegebenen Ort um
in2csv SpotifyData.xlsx > SpotifyData.csv
| verwendet die Ausgabe des 1. Befehls als Eingabe für den 2.
Beispiel:
Die Ausgabe von csvcut ist nicht gut formatiert:
csvcut -c "track_id","danceability" Spotify_MusicAttributes.csv
track_id,danceability
118GQ70Sp6pMqn6w1oKuki,0.787
6S7cr72a7a8RVAXzDCRj6m,0.777
7h2qWpMJzIVtiP30E8VDW4,0.795
3KVQFxJ5CWOcbxdpPYdi4o,0.815
Beispiel (Fortsetzung):
Formatiere die Ausgabe von csvcut neu, indem du sie per Pipe als Eingabe an csvlook übergibst:
csvcut -c "track_id","danceability" Spotify_Popularity.csv | csvlook
| track_id | danceability |
| ---------------------- | ------------ |
| 118GQ70Sp6pMqn6w1oKuki | 0.787 |
| 6S7cr72a7a8RVAXzDCRj6m | 0.777 |
| 7h2qWpMJzIVtiP30E8VDW4 | 0.796 |
| 3KVQFxJ5CWOcbxdpPYdi4o | 0.815 |
Datenverarbeitung in der Shell