Glosario
¿Qué es Parquet?
Apache Parquet es un formato de archivo abierto, columnar y comprimido para guardar datos en forma de tabla. Guarda cada columna por separado junto con su esquema, lo que permite leer solo las columnas que una consulta necesita y responder mucho más rápido que con CSV.
También: Apache Parquet · formato columnar
Cómo funciona
En un CSV los datos se guardan fila por fila, como texto. Para sumar una sola columna hay que leer el archivo entero. Parquet guarda los valores de cada columna juntos y comprimidos, así que una consulta que usa 3 columnas de 50 lee una fracción del archivo.
Además guarda el tipo de cada columna (fecha, número, texto), lo que evita errores típicos de CSV como fechas leídas como texto. Es un proyecto de la Apache Software Foundation y lo leen herramientas como Spark, DuckDB, BigQuery y Snowflake.
Preguntas frecuentes
¿Parquet reemplaza a una base de datos?
No: es un formato de archivo para análisis, no para cargar o actualizar registros uno por uno como hace una base de datos transaccional.
¿Puedo abrir un Parquet en Excel?
No directamente. Se lee con herramientas de datos como DuckDB, Python o un warehouse, o con un servicio como Trada que te deja consultarlo en lenguaje natural.
Términos relacionados
- Texto a SQL
Texto a SQL (en inglés, text-to-SQL) es la técnica que convierte una pregunta escrita en lenguaje natural, como «¿cuánto vendimos en septiembre?», en una consulta SQL que se ejecuta sobre una base de datos. Hoy se hace con modelos de lenguaje que leen el esquema de la base y escriben la consulta.
- Capa semántica
Una capa semántica es un conjunto de definiciones de negocio (métricas, dimensiones y relaciones) que traduce las tablas de una base de datos a conceptos como «ventas netas» o «cliente activo». Sirve para que cada consulta, tablero o asistente de IA calcule esos conceptos de la misma manera.
Tus datos ya tienen las respuestas.
Conectá tu primera fuente en minutos y hacé tu primera pregunta hoy.
¿Son un equipo o una empresa? Agendá una demo