Опрацювання даних у Shell
Susan Sun
Data Person
csvkit:
Встановіть csvkit за допомогою менеджера пакетів Python pip:
pip install csvkit
Оновіть csvkit до останньої версії:
pip install --upgrade csvkit
Повні інструкції:
Документація в інтернеті: https://csvkit.readthedocs.io/en/latest/tutorial.html

Документація в інтернеті:
https://csvkit.readthedocs.io/en/latest/scripts/in2csv.html
Документація в командному рядку:
in2csv --helpin2csv -h
usage: in2csv [-h] [-d DELIMITER] [-t] [-q QUOTECHAR] [-u {0,1,2,3}] [-b]
[-p ESCAPECHAR] [-z FIELD_SIZE_LIMIT] [-e ENCODING] [-L LOCALE]
[-S] [--blanks] [--date-format DATE_FORMAT]
[--datetime-format DATETIME_FORMAT] [-H] [-K SKIP_LINES] [-v]
Синтаксис:
in2csv SpotifyData.xlsx > SpotifyData.csv
Виводить перший аркуш Excel у консоль і не зберігає файл
in2csv SpotifyData.xlsx
> перенаправляє вивід і зберігає його в новий файл SpotifyData.csv
> SpotifyData.csv
Використайте параметр --names або -n, щоб вивести всі назви аркушів у SpotifyData.xlsx.
in2csv -n SpotifyData.xlsx
Worksheet1_Popularity
Worksheet2_MusicAttributes
Скористайтеся параметром --sheet і вкажіть аркуш "Worksheet1_Popularity" для конвертації.
in2csv SpotifyData.xlsx --sheet "Worksheet1_Popularity" > Spotify_Popularity.csv
in2csv не виводить логи в консоль.
in2csv SpotifyData.xlsx --sheet "Worksheet1_Popularity" > Spotify_Popularity.csv
Перевірка:
ls
SpotifyData.xlsx Spotify_Popularity.csv backup bin
csvlook: відображає CSV у командному рядку у сумісному з Markdown, фіксованоширинному форматі
Документація:
csvlook -h
usage: csvlook [-h] [-d DELIMITER] [-t] [-q QUOTECHAR] [-u {0,1,2,3}] [-b]
[-p ESCAPECHAR] [-z FIELD_SIZE_LIMIT] [-e ENCODING] [-L LOCALE]
[-S] [--blanks] [--date-format DATE_FORMAT]
Синтаксис:
csvlook Spotify_Popularity.csv
| track_id | popularity |
| ---------------------- | ---------- |
| 118GQ70Sp6pMqn6w1oKuki | 7 |
| 6S7cr72a7a8RVAXzDCRj6m | 7 |
| 7h2qWpMJzIVtiP30E8VDW4 | 7 |
| 3KVQFxJ5CWOcbxdpPYdi4o | 7 |
| 0JjNrI1xmsTfhaiU1R6OVc | 7 |
| 3HjTcZt29JUHg5m60QhlMw | 7 |
csvstat: виводить описову зведену статистику для всіх стовпців CSV (напр., середнє, медіана, кількість унікальних значень)
Документація:
csvstat -h
usage: csvstat [-h] [-d DELIMITER] [-t] [-q QUOTECHAR] [-u {0,1,2,3}] [-b]
[-p ESCAPECHAR] [-z FIELD_SIZE_LIMIT] [-e ENCODING] [-S] [-H]
[-K SKIP_LINES] [-v] [-l] [--zero] [-V] [--csv] [-n]
Синтаксис:
csvstat Spotify_Popularity.csv
1. "track_id"
Type of data: Text
Contains null values: False
Unique values: 24
Longest value: 22 characters
Most common values: 118GQ70Sp6pMqn6w1oKuki (1x)
6S7cr72a7a8RVAXzDCRj6m (1x)
Опрацювання даних у Shell