iotools 첫 번째 살펴보기: 데이터 가져오기

R에서 확장 가능한 데이터 처리

Simon Urbanek

Member of R-Core, Lead Inventive Scientist, AT&T Labs Research

청크 단위 처리

  1. 데이터 조각 로드
  2. 네이티브 객체로 변환
  3. 연산 수행 및 결과 저장

모든 데이터가 처리될 때까지 1~3 반복

R에서 확장 가능한 데이터 처리

데이터 가져오기

  • 데이터 로드는 처리보다 시간이 더 걸리는 경우가 많으며, 두 단계로 진행됨
    • 디스크에서 데이터를 가져오는 것은 상대적으로 느린 작업
    • 원시 데이터를 네이티브 R 객체로 변환
R에서 확장 가능한 데이터 처리

iotools로 데이터 가져오기

iotools 패키지에서는 데이터의 물리적 로드와 R 객체로의 파싱이 분리되어 유연성과 성능을 향상시킵니다.

R에서 확장 가능한 데이터 처리

iotools: 데이터 가져오기

  • readAsRaw()는 전체 데이터를 원시 벡터로 읽음
  • read.chunk()는 데이터를 청크 단위로 원시 벡터에 읽음
R에서 확장 가능한 데이터 처리

iotools: 데이터 파싱

  • mstrsplit()은 원시 데이터를 행렬로 변환
  • dstrsplit()은 원시 데이터를 데이터 프레임으로 변환
R에서 확장 가능한 데이터 처리

iotools: 데이터 로드 및 파싱

read.delim.raw() = readAsRaw() + dstrsplit()

R에서 확장 가능한 데이터 처리

청크 단위 처리

  • 전체 데이터를 가져올 필요 없음
  • 데이터 소스에서 "청크" 단위로 행 읽기
  • 중간 구조 없음
R에서 확장 가능한 데이터 처리

파일 연결

# Open a file connection
fc <- file("data-file.csv", "rb")
# Read the first line if the data has a header
readLines(fc, n = 1)
....
# Code to import and parse the data
....
# Close the file connection
close(fc)
R에서 확장 가능한 데이터 처리

연습해 봅시다!

R에서 확장 가능한 데이터 처리

Preparing Video For Download...