Saltar al contenido principal
Esta guía le ayuda a migrar su código actual de pandas a DataStore para obtener un mejor rendimiento sin perder compatibilidad.

La migración en una sola línea

La migración más sencilla consiste en cambiar la instrucción import:
¡Eso es todo! La mayor parte del código de pandas funciona sin cambios.

Migración paso a paso

1

Instala chDB

2

Cambia la importación

3

Prueba tu código

Ejecuta tu código actual. La mayoría de las operaciones funcionan sin cambios:
4

Ten en cuenta las diferencias

Algunas operaciones se comportan de manera diferente. Consulta Diferencias clave a continuación.

Lo que funciona sin cambios

Carga de datos

Filtrado

Selección

GroupBy y agregación

Ordenación

Operaciones con cadenas de texto

Operaciones de DateTime

Operaciones de E/S


Diferencias principales

1. Evaluación diferida

Las operaciones de DataStore se realizan de forma diferida: no se ejecutan hasta que se necesitan los resultados. pandas:
DataStore:

2. Tipos de retorno

3. No existe el parámetro inplace

DataStore no admite inplace=True. Usa siempre el valor devuelto: pandas:
DataStore:

4. Comparación de DataStores

pandas no reconoce los objetos DataStore, así que usa to_pandas() para compararlos:

5. Orden de las filas

DataStore puede no conservar el orden de las filas en fuentes de datos como archivos o bases de datos SQL. Use una ordenación explícita:

Patrones de migración

Patrón 1: Lectura-análisis-escritura

Patrón 2: DataFrame con operaciones de pandas

Si necesitas funciones específicas de pandas, haz la conversión al final:

Patrón 3: Flujo de trabajo mixto


Comparación de rendimiento

DataStore es significativamente más rápido con conjuntos de datos grandes: benchmark con 10M de filas

Solución de problemas de la migración

Problema: La operación no funciona

Es posible que algunas operaciones de pandas no sean compatibles. Comprueba lo siguiente:
  1. ¿La operación aparece en la lista de compatibilidad?
  2. Prueba a convertirlo primero a pandas: ds.to_df().operation()

Problema: Resultados diferentes

Activa el registro de depuración para entender qué ocurre:

Problema: rendimiento lento

Revise su patrón de ejecución:

Problema: Desajustes de tipos

DataStore puede inferir los tipos de manera distinta:

Estrategia de migración gradual

Semana 1: Comprobar la compatibilidad

Semana 2: Cambiar scripts sencillos

Empieza con scripts que:
  • Lean archivos grandes
  • Hagan filtrado y agregación
  • No usen funciones apply personalizadas

Semana 3: Aborda casos complejos

Para scripts con funciones personalizadas:

Semana 4: Migración completa

Cambie todos los scripts para que importen DataStore.

Preguntas frecuentes

¿Puedo usar tanto pandas como DataStore?

¡Sí! Puedes convertir entre ambos libremente:

¿Seguirán pasando mis pruebas?

La mayoría de las pruebas deberían seguir pasando. Para las pruebas de comparación, convierta a pandas:

¿Puedo usar DataStore en Jupyter?

Sí. DataStore funciona en los notebooks de Jupyter:

¿Cómo puedo reportar problemas?

Si encuentras problemas de compatibilidad, repórtalos aquí: https://github.com/chdb-io/chdb/issues
Última modificación el 19 de junio de 2026