DataStore가 더 빠른 이유
1. SQL 푸시다운
2. 컬럼 프루닝
3. 지연 평가
벤치마크: DataStore와 pandas 비교
테스트 환경
- 데이터: 1,000만 행
- 하드웨어: 일반 노트북
- 파일 포맷: CSV
결과
핵심 인사이트
- GroupBy 작업: DataStore가 최대 19.93배 더 빠름
- 복잡한 파이프라인: DataStore가 5~6배 더 빠름 (SQL 푸시다운의 이점)
- 단순한 슬라이스 작업: 성능이 비슷하며 차이가 미미함
- 가장 적합한 사용 사례: groupby/집계를 포함하는 다단계 작업
- zero-copy:
to_df()에는 데이터 변환 오버헤드가 없음
DataStore가 강점을 발휘하는 경우
대규모 집계
복잡한 파이프라인
대용량 파일 처리
여러 컬럼에 대한 작업
pandas와 성능이 비슷한 경우
소규모 데이터셋 (<1,000행)
간단한 슬라이싱 연산
사용자 정의 Python 람다 함수
중요DataStore가 “더 느린” 경우에도 성능은 일반적으로 pandas와 거의 비슷한 수준이며, 실제 사용에서는 차이가 거의 없습니다. 복잡한 작업에서는 DataStore의 장점이 이러한 예외적인 경우를 훨씬 상회합니다.실행을 세밀하게 제어하려면 실행 엔진 구성을 참조하십시오.
zero-copy DataFrame 통합
to_df()는 사실상 비용이 들지 않습니다 - 직렬화나 메모리 복사가 없습니다- pandas DataFrame에서 DataStore를 생성하는 작업은 즉시 이루어집니다
- DataStore와 pandas 뷰는 메모리를 공유합니다