शेल में डेटा प्रोसेसिंग
Susan Sun
Data Person
csvkit:
Python पैकेज मैनेजर pip से csvkit इंस्टॉल करें:
pip install csvkit
csvkit को लेटेस्ट वर्ज़न में अपग्रेड करें:
pip install --upgrade csvkit
पूरी निर्देशिका:
वेब-आधारित डॉक्यूमेंटेशन: https://csvkit.readthedocs.io/en/latest/tutorial.html

वेब-आधारित डॉक्यूमेंटेशन:
https://csvkit.readthedocs.io/en/latest/scripts/in2csv.html
कमांड लाइन-आधारित डॉक्यूमेंटेशन:
in2csv --helpin2csv -h
usage: in2csv [-h] [-d DELIMITER] [-t] [-q QUOTECHAR] [-u {0,1,2,3}] [-b]
[-p ESCAPECHAR] [-z FIELD_SIZE_LIMIT] [-e ENCODING] [-L LOCALE]
[-S] [--blanks] [--date-format DATE_FORMAT]
[--datetime-format DATETIME_FORMAT] [-H] [-K SKIP_LINES] [-v]
सिंटैक्स:
in2csv SpotifyData.xlsx > SpotifyData.csv
Excel की पहली शीट कंसोल पर प्रिंट होती है और सेव नहीं होती
in2csv SpotifyData.xlsx
> आउटपुट रीडायरेक्ट कर उसे नई फाइल SpotifyData.csv में सेव करता है
> SpotifyData.csv
SpotifyData.xlsx की सभी शीट के नाम प्रिंट करने के लिए --names या -n ऑप्शन उपयोग करें।
in2csv -n SpotifyData.xlsx
Worksheet1_Popularity
Worksheet2_MusicAttributes
कन्वर्ट करने के लिए शीट "Worksheet1_Popularity" के साथ --sheet ऑप्शन दें।
in2csv SpotifyData.xlsx --sheet "Worksheet1_Popularity" > Spotify_Popularity.csv
in2csv कंसोल पर लॉग्स प्रिंट नहीं करता।
in2csv SpotifyData.xlsx --sheet "Worksheet1_Popularity" > Spotify_Popularity.csv
सैनिटी चेक:
ls
SpotifyData.xlsx Spotify_Popularity.csv backup bin
csvlook: CSV को कमांड लाइन पर Markdown-कम्पैटिबल, फिक्स्ड-विथ्ट फॉर्मेट में रेंडर करता है
डॉक्यूमेंटेशन:
csvlook -h
usage: csvlook [-h] [-d DELIMITER] [-t] [-q QUOTECHAR] [-u {0,1,2,3}] [-b]
[-p ESCAPECHAR] [-z FIELD_SIZE_LIMIT] [-e ENCODING] [-L LOCALE]
[-S] [--blanks] [--date-format DATE_FORMAT]
सिंटैक्स:
csvlook Spotify_Popularity.csv
| track_id | popularity |
| ---------------------- | ---------- |
| 118GQ70Sp6pMqn6w1oKuki | 7 |
| 6S7cr72a7a8RVAXzDCRj6m | 7 |
| 7h2qWpMJzIVtiP30E8VDW4 | 7 |
| 3KVQFxJ5CWOcbxdpPYdi4o | 7 |
| 0JjNrI1xmsTfhaiU1R6OVc | 7 |
| 3HjTcZt29JUHg5m60QhlMw | 7 |
csvstat: CSV की सभी कॉलम्स पर वर्णनात्मक सार-सांख्यिकी प्रिंट करता है (जैसे mean, median, unique values की गिनती)
डॉक्यूमेंटेशन:
csvstat -h
usage: csvstat [-h] [-d DELIMITER] [-t] [-q QUOTECHAR] [-u {0,1,2,3}] [-b]
[-p ESCAPECHAR] [-z FIELD_SIZE_LIMIT] [-e ENCODING] [-S] [-H]
[-K SKIP_LINES] [-v] [-l] [--zero] [-V] [--csv] [-n]
सिंटैक्स:
csvstat Spotify_Popularity.csv
1. "track_id"
Type of data: Text
Contains null values: False
Unique values: 24
Longest value: 22 characters
Most common values: 118GQ70Sp6pMqn6w1oKuki (1x)
6S7cr72a7a8RVAXzDCRj6m (1x)
शेल में डेटा प्रोसेसिंग