शेल में डेटा प्रोसेसिंग
Susan Sun
Data Person
हम मूल डेटा फ़ाइल का एक सबसेट बना सकते हैं:
csvcut: कॉलम नाम या पोज़िशन से डेटा फ़िल्टर करता है
csvgrep: सटीक मिलान, पैटर्न मैचिंग, या regex से रो वैल्यू द्वारा फ़िल्टर करता है
csvcut: कॉलम नाम या कॉलम पोज़िशन से CSV फ़ाइलों को फ़िल्टर और ट्रंकैट करता है
Documentation:
csvcut -h
usage: csvcut [-h] [-d DELIMITER] [-t] [-q QUOTECHAR] [-u {0,1,2,3}] [-b]
[-p ESCAPECHAR] [-z FIELD_SIZE_LIMIT] [-e ENCODING] [-S] [-H]
[-K SKIP_LINES] [-v] [-l] [--zero] [-V] [-n] [-c COLUMNS]
--names या -n विकल्प का उपयोग करके Spotify_MusicAttributes.csv में सभी कॉलम नाम प्रिंट करें।
csvcut -n Spotify_MusicAttributes.csv
1: track_id
2: danceability
3: duration_ms
1: track_id
2: danceability
3: duration_ms
डेटा का पहला कॉलम, पोज़िशन से रिटर्न करता है:
csvcut -c 1 Spotify_MusicAttributes.csv
track_id
118GQ70Sp6pMqn6w1oKuki
6S7cr72a7a8RVAXzDCRj6m
1: track_id
2: danceability
3: duration_ms
डेटा का केवल पहला कॉलम, नाम से रिटर्न करता है:
csvcut -c "track_id" Spotify_MusicAttributes.csv
track_id
118GQ70Sp6pMqn6w1oKuki
6S7cr72a7a8RVAXzDCRj6m
1: track_id
2: danceability
3: duration_ms
डेटा के दूसरा और तीसरा कॉलम, पोज़िशन से रिटर्न करता है:
csvcut -c 2,3 Spotify_MusicAttributes.csv
danceability,duration_ms
0.787,124016.0
0.777,128016.0
0.795999999999999,132742.0
1: track_id
2: danceability
3: duration_ms
डेटा के दूसरा और तीसरा कॉलम, नाम से रिटर्न करता है:
csvcut -c "danceability","duration_ms" Spotify_MusicAttributes.csv
danceability,duration_ms
0.787,124016.0
0.777,128016.0
0.795999999999999,132742.0
csvgrep:
-m: फ़िल्टर करने हेतु सटीक रो वैल्यू दें
-r: regex पैटर्न दें
-f: किसी फ़ाइल के पाथ के साथ दें
Documentation:
csvgrep -h
Spotify_Popularity.csv में ढूँढें जहाँ track_id = 5RCPsfzmEpTXMCTNk7wEfQ
csvgrep -c "track_id" -m 5RCPsfzmEpTXMCTNk7wEfQ Spotify_Popularity.csv
track_id,popularity
5RCPsfzmEpTXMCTNk7wEfQ,7.0
csvgrep -c 1 -m 5RCPsfzmEpTXMCTNk7wEfQ Spotify_Popularity.csv
track_id,popularity
5RCPsfzmEpTXMCTNk7wEfQ,7.0
शेल में डेटा प्रोसेसिंग