csvkit के साथ डेटा स्टैक करना और कमांड्स चेन करना

शेल में डेटा प्रोसेसिंग

Susan Sun

Data Person

csvstack: कई CSV फाइलें स्टैक करना

csvstack: दो या अधिक CSV फाइलों की पंक्तियाँ एक साथ स्टैक करता है

Documentation:

csvstack -h
usage: csvstack [-h] [-d DELIMITER] [-t] [-q QUOTECHAR] [-u {0,1,2,3}] [-b]
                [-p ESCAPECHAR] [-z FIELD_SIZE_LIMIT] [-e ENCODING] [-S] [-H]
                [-n GROUP_NAME] [--filenames]
शेल में डेटा प्रोसेसिंग

csvstack: कई CSV फाइलें स्टैक करना

दो समान फाइलें Spotify_Rank6.csv और Spotify_Rank7.csv को एक फाइल में स्टैक करें।

स्कीमा जाँचने के लिए डेटा प्रीव्यू करें:

csvlook Spotify_Rank6.csv
| track_id               | popularity |
| ---------------------- | ---------- |
| 7JYCpIzpoidDOnnmxmHwtj |          6 |
| 0mmFibEg5NuULMwTVN2tRU |          6 |
शेल में डेटा प्रोसेसिंग

csvstack: कई CSV फाइलें स्टैक करना

csvlook Spotify_Rank7.csv
| track_id               | popularity |
| ---------------------- | ---------- |
| 118GQ70Sp6pMqn6w1oKuki |          7 |
| 6S7cr72a7a8RVAXzDCRj6m |          7 |
शेल में डेटा प्रोसेसिंग

csvstack: कई CSV फाइलें स्टैक करना

Syntax:

csvstack Spotify_Rank6.csv Spotify_Rank7.csv > Spotify_AllRanks.csv
csvlook Spotify_AllRanks.csv
| track_id               | popularity |
| ---------------------- | ---------- |
| 7JYCpIzpoidDOnnmxmHwtj |          6 |
| 0mmFibEg5NuULMwTVN2tRU |          6 |
| 118GQ70Sp6pMqn6w1oKuki |          7 |
| 6S7cr72a7a8RVAXzDCRj6m |          7 |
शेल में डेटा प्रोसेसिंग

csvstack: कई CSV फाइलें स्टैक करना

csvstack -g "Rank6","Rank7" \ 
Spotify_Rank6.csv Spotify_Rank7.csv > Spotify_AllRanks.csv
csvlook Spotify_AllRanks.csv
| group | track_id               | popularity |
| ----- | ---------------------- | ---------- |
| Rank6 | 7JYCpIzpoidDOnnmxmHwtj |          6 |
| Rank6 | 0mmFibEg5NuULMwTVN2tRU |          6 |
| Rank7 | 118GQ70Sp6pMqn6w1oKuki |          7 |
| Rank7 | 6S7cr72a7a8RVAXzDCRj6m |          7 |
शेल में डेटा प्रोसेसिंग

csvstack: कई CSV फाइलें स्टैक करना

csvstack -g "Rank6","Rank7" -n "source" \
Spotify_Rank6.csv Spotify_Rank7.csv > Spotify_AllRanks.csv
csvlook Spotify_AllRanks.csv
| source| track_id               | popularity |
| ----- | ---------------------- | ---------- |
| Rank6 | 7JYCpIzpoidDOnnmxmHwtj |          6 |
| Rank6 | 0mmFibEg5NuULMwTVN2tRU |          6 |
| Rank7 | 118GQ70Sp6pMqn6w1oKuki |          7 |
| Rank7 | 6S7cr72a7a8RVAXzDCRj6m |          7 |
शेल में डेटा प्रोसेसिंग

कमांड-लाइन कमांड्स चेन करना

; कमांड्स को जोड़ता है और क्रमवार चलाता है

csvlook SpotifyData_All.csv; csvstat SpotifyData_All.csv

&& कमांड्स को जोड़ता है, पर 2nd कमांड तभी चलेगा जब 1st सफल हो

csvlook SpotifyData_All.csv && csvstat SpotifyData_All data.csv
शेल में डेटा प्रोसेसिंग

कमांड-लाइन कमांड्स चेन करना

> 1st कमांड का आउटपुट 2nd में बताई जगह पर रीडायरेक्ट करता है

in2csv SpotifyData.xlsx > SpotifyData.csv
शेल में डेटा प्रोसेसिंग

कमांड-लाइन कमांड्स चेन करना

| 1st कमांड का आउटपुट 2nd कमांड के इनपुट के रूप में उपयोग करता है

उदाहरण:

csvcut का आउटपुट अच्छी तरह फॉर्मैट नहीं है:

csvcut -c "track_id","danceability" Spotify_MusicAttributes.csv
track_id,danceability
118GQ70Sp6pMqn6w1oKuki,0.787
6S7cr72a7a8RVAXzDCRj6m,0.777
7h2qWpMJzIVtiP30E8VDW4,0.795
3KVQFxJ5CWOcbxdpPYdi4o,0.815
शेल में डेटा प्रोसेसिंग

कमांड-लाइन कमांड्स चेन करना

उदाहरण (जारी):

csvcut के आउटपुट को पाइप कर csvlook में इनपुट देकर दोबारा फॉर्मैट करें:

csvcut -c "track_id","danceability"  Spotify_Popularity.csv | csvlook
| track_id               | danceability |
| ---------------------- | ------------ |
| 118GQ70Sp6pMqn6w1oKuki |        0.787 |
| 6S7cr72a7a8RVAXzDCRj6m |        0.777 |
| 7h2qWpMJzIVtiP30E8VDW4 |        0.796 |
| 3KVQFxJ5CWOcbxdpPYdi4o |        0.815 |
शेल में डेटा प्रोसेसिंग

चलो सब कुछ साथ में आज़माएँ!

शेल में डेटा प्रोसेसिंग

Preparing Video For Download...