Por que o DataStore é mais rápido
1. Pushdown de SQL
2. Poda de colunas
3. Avaliação preguiçosa
Benchmark: DataStore vs pandas
Ambiente de teste
- Dados: 10 milhões de linhas
- Hardware: notebook padrão
- Formato de arquivo: CSV
Resultados
Principais conclusões
- Operações de GroupBy: DataStore até 19,93x mais rápido
- Pipelines complexos: DataStore 5-6x mais rápido (benefício do pushdown de SQL)
- Operações simples de fatiamento: desempenho comparável - diferença insignificante
- Melhor caso de uso: operações em várias etapas com groupby/agregação
- Zero-copy:
to_df()não tem sobrecarga de conversão de dados
Quando o DataStore se destaca
Agregações pesadas
Pipelines Complexos
Processamento de arquivos grandes
Operações em várias colunas
Quando o pandas é competitivo
Pequenos conjuntos de dados (<1.000 linhas)
Operações simples de fatiamento
Funções lambda personalizadas em Python
ImportanteMesmo em cenários em que o DataStore é “mais lento”, o desempenho normalmente é comparável ao do pandas — a diferença é insignificante na prática. As vantagens do DataStore em operações complexas superam amplamente esses casos pontuais.Para ter um controle mais detalhado da execução, consulte Configuração do mecanismo de execução.
Integração zero-copy com DataFrame
to_df()é praticamente gratuito — sem serialização nem cópia de memória- Criar um DataStore a partir de um DataFrame do pandas é instantâneo
- A memória é compartilhada entre o DataStore e as visualizações do pandas