csvkit का उपयोग करके डेटा फ़िल्टर करना

शेल में डेटा प्रोसेसिंग

Susan Sun

Data Person

डेटा फ़िल्टर करना क्या होता है?

हम मूल डेटा फ़ाइल का एक सबसेट बना सकते हैं:

  1. कॉलम द्वारा डेटा फ़िल्टर करना
  2. रो द्वारा डेटा फ़िल्टर करना

csvcut: कॉलम नाम या पोज़िशन से डेटा फ़िल्टर करता है

csvgrep: सटीक मिलान, पैटर्न मैचिंग, या regex से रो वैल्यू द्वारा फ़िल्टर करता है

शेल में डेटा प्रोसेसिंग

csvcut: कॉलम द्वारा डेटा फ़िल्टर करना

csvcut: कॉलम नाम या कॉलम पोज़िशन से CSV फ़ाइलों को फ़िल्टर और ट्रंकैट करता है

Documentation:

csvcut -h
usage: csvcut [-h] [-d DELIMITER] [-t] [-q QUOTECHAR] [-u {0,1,2,3}] [-b]
              [-p ESCAPECHAR] [-z FIELD_SIZE_LIMIT] [-e ENCODING] [-S] [-H]
              [-K SKIP_LINES] [-v] [-l] [--zero] [-V] [-n] [-c COLUMNS]
शेल में डेटा प्रोसेसिंग

csvcut: कॉलम द्वारा डेटा फ़िल्टर करना

--names या -n विकल्प का उपयोग करके Spotify_MusicAttributes.csv में सभी कॉलम नाम प्रिंट करें।

csvcut -n Spotify_MusicAttributes.csv
  1: track_id
  2: danceability
  3: duration_ms
शेल में डेटा प्रोसेसिंग

csvcut: कॉलम द्वारा डेटा फ़िल्टर करना

  1: track_id
  2: danceability
  3: duration_ms

डेटा का पहला कॉलम, पोज़िशन से रिटर्न करता है:

csvcut -c 1 Spotify_MusicAttributes.csv
track_id
118GQ70Sp6pMqn6w1oKuki
6S7cr72a7a8RVAXzDCRj6m
शेल में डेटा प्रोसेसिंग

csvcut: कॉलम द्वारा डेटा फ़िल्टर करना

  1: track_id
  2: danceability
  3: duration_ms

डेटा का केवल पहला कॉलम, नाम से रिटर्न करता है:

csvcut -c "track_id" Spotify_MusicAttributes.csv
track_id
118GQ70Sp6pMqn6w1oKuki
6S7cr72a7a8RVAXzDCRj6m
शेल में डेटा प्रोसेसिंग

csvcut: कॉलम द्वारा डेटा फ़िल्टर करना

  1: track_id
  2: danceability
  3: duration_ms

डेटा के दूसरा और तीसरा कॉलम, पोज़िशन से रिटर्न करता है:

csvcut -c 2,3 Spotify_MusicAttributes.csv
danceability,duration_ms
0.787,124016.0
0.777,128016.0
0.795999999999999,132742.0
शेल में डेटा प्रोसेसिंग

csvcut: कॉलम द्वारा डेटा फ़िल्टर करना

  1: track_id
  2: danceability
  3: duration_ms

डेटा के दूसरा और तीसरा कॉलम, नाम से रिटर्न करता है:

csvcut -c "danceability","duration_ms" Spotify_MusicAttributes.csv
danceability,duration_ms
0.787,124016.0
0.777,128016.0
0.795999999999999,132742.0
शेल में डेटा प्रोसेसिंग

csvgrep: रो वैल्यू से डेटा फ़िल्टर करना

csvgrep:

  • रो के आधार पर फ़िल्टर करता है, सटीक मिलान या regex फज़ी मैचिंग से
  • इन्हीं विकल्पों में से किसी एक के साथ उपयोग करें:

-m: फ़िल्टर करने हेतु सटीक रो वैल्यू दें

-r: regex पैटर्न दें

-f: किसी फ़ाइल के पाथ के साथ दें

Documentation:

csvgrep -h
शेल में डेटा प्रोसेसिंग

csvgrep: रो वैल्यू से डेटा फ़िल्टर करना

Spotify_Popularity.csv में ढूँढें जहाँ track_id = 5RCPsfzmEpTXMCTNk7wEfQ

csvgrep -c "track_id" -m 5RCPsfzmEpTXMCTNk7wEfQ Spotify_Popularity.csv
track_id,popularity
5RCPsfzmEpTXMCTNk7wEfQ,7.0
csvgrep -c 1 -m 5RCPsfzmEpTXMCTNk7wEfQ Spotify_Popularity.csv
track_id,popularity
5RCPsfzmEpTXMCTNk7wEfQ,7.0
शेल में डेटा प्रोसेसिंग

आइए csvkit से डेटा फ़िल्टरिंग करें!

शेल में डेटा प्रोसेसिंग

Preparing Video For Download...