Principais recursos
- Compatibilidade com pandas: 209 métodos de DataFrame do pandas, 56 métodos
.str, 42+ métodos.dt - Otimização de SQL: as operações são convertidas automaticamente em consultas SQL otimizadas
- Avaliação preguiçosa: as operações são adiadas até que os resultados sejam necessários
- 630+ métodos de API: API abrangente para manipulação de dados
- Extensões do ClickHouse: acessores adicionais (
.arr,.json,.url,.ip,.geo) não disponíveis no pandas
Arquitetura
- Encadeamento preguiçoso de operações: as operações são registradas, não executadas imediatamente
- Seleção inteligente de engine: o QueryPlanner direciona cada segmento para o engine ideal (chDB para SQL, Pandas para operações complexas)
- Cache intermediário: os resultados são armazenados em cache a cada etapa para uma exploração iterativa mais rápida
Migração com uma única linha a partir do Pandas
Comparação de desempenho
Benchmark com 10M linhas. Veja o script de benchmark e o Guia de desempenho para mais detalhes.
Quando usar DataStore
- Estiver trabalhando com grandes conjuntos de dados (milhões de linhas)
- Estiver realizando agregações e operações de groupby
- Estiver consultando dados de arquivos, bancos de dados ou armazenamento em nuvem
- Estiver criando pipelines de dados complexos
- Quiser a API do pandas com melhor desempenho
- Preferir escrever SQL diretamente
- Precisar de controle mais refinado sobre a execução de consultas
- Estiver trabalhando com recursos específicos do ClickHouse não expostos na API do pandas
Comparação de funcionalidades
Estatísticas da API
Primeiros passos
- guia de início rápido - Instalação e uso básico
- Migração do Pandas - Guia de migração passo a passo
Referência da API
- Métodos de fábrica - Criação do DataStore a partir de várias fontes
- Construção de consultas - Operações de consulta em estilo SQL
- Compatibilidade com pandas - Todos os 209 métodos compatíveis com pandas
- Acessores - Acessores String, DateTime, Array, JSON, URL, IP e Geo
- Agregação - Funções de agregação e de janela
- Operações de E/S - Leitura e gravação de dados
Tópicos avançados
- Modelo de Execução - Avaliação preguiçosa e cache
- Referência da classe - Referência completa da API
Configuração e depuração
- Configuração - Todas as opções de configuração
- Modo de desempenho - Modo SQL-first para máxima taxa de transferência
- Depuração - Explain, profiling e logging
Guias para usuários do Pandas
- Cookbook do Pandas - Padrões comuns
- Principais diferenças - Diferenças importantes em relação ao pandas
- Guia de desempenho - Dicas de otimização
- SQL para usuários do Pandas - Entenda o SQL por trás das operações do pandas
Exemplo rápido
Próximos passos
- Está começando a usar o DataStore? Comece com o Guia de início rápido
- Usa pandas? Leia o Guia de migração
- Quer saber mais? Explore a Referência da API