Aprender por tareas

De cero a una consulta útil.

Empieza por abrir un archivo. Cuando quieras combinar fuentes o repetir un análisis, avanza hacia SQL. No necesitas aprender todo el producto de una vez.

Tarea 1

Abrir un archivo

Úsalo cuando quieres reemplazar la sesión actual y trabajar con una fuente principal. Admite Parquet, CSV/TSV, Excel, JSON/NDJSON, Arrow/Feather y datos R.

  1. Selecciona Abrir archivo o presiona Ctrl+O.
  2. Elige el archivo; OliMat lo registra como tabla data.
  3. La primera página aparece en Datos & SQL y el resto de módulos se prepara con su esquema.
Para archivos grandes: Parquet ofrece el mejor equilibrio entre velocidad, tipos y tamaño.
Tarea 2

Abrir carpeta o dataset

Recorre una carpeta y crea una tabla por archivo soportado. Los archivos pueden ser CSV y Parquet y tener estructuras diferentes; no se concatenan automáticamente.

carpeta/
├─ capturas.parquet  → tabla capturas
├─ especies.csv      → tabla especies
└─ puertos.xlsx      → tabla puertos

Es la opción correcta cuando la carpeta representa un proyecto completo. Si contiene particiones del mismo dataset, verifica nombres y estructura antes de decidir si deseas consultarlas juntas.

Tarea 3

Agregar archivo como tabla

Conserva el workspace actual y suma una nueva fuente. En el árbol izquierdo puedes expandir columnas, buscar, copiar nombres y generar un SELECT.

SELECT c.fecha, e.nombre, c.captura_kg
FROM capturas c
LEFT JOIN especies e
  ON c.especie_id = e.especie_id;

Aprender JOIN paso a paso

Proyecto portable

Guardar y volver a abrir un workspace .pvpw

Un proyecto portable guarda snapshots Parquet de las tablas abiertas junto con la consulta, tabla activa, favoritos, historial y diccionario. Así puedes continuar en otra PC aunque los archivos originales o la conexión Oracle ya no estén disponibles.

  1. Después de preparar tus tablas, elige Archivo ▸ Guardar workspace o presiona Ctrl+S.
  2. Guarda el archivo .pvpw; espera a que termine la operación antes de copiarlo.
  3. Ábrelo con Archivo ▸ Abrir workspace o, desde la versión 4.49, con doble clic si instalaste la asociación.
Privacidad: el proyecto contiene una copia de los datos de sus tablas. Trátalo con el mismo nivel de confidencialidad que los archivos originales.
Excel real

Excel con varias hojas, títulos y cabeceras combinadas

Al abrir un libro con más de una hoja aparece un selector con el nombre y tamaño de cada una (las hojas de solo-gráfico se excluyen automáticamente). Cada hoja marcada se convierte en su propia tabla — y puedes hacer JOIN entre hojas.

  1. Abre el .xlsx; marca las hojas que te interesan.
  2. Si una hoja tiene un título o filas sueltas encima de la tabla, indica el Rango (p. ej. A5:H200) empezando en la fila de cabecera.
  3. Acepta: cada hoja queda como tabla independiente del workspace.
Casos especiales: los gráficos incrustados se ignoran (los datos se leen igual); una tabla dinámica se lee como la foto estática de sus valores visibles; y si la cabecera tiene grupos combinados de dos niveles, las columnas repetidas se renombran (kg, kg_1) — el nombre del grupo superior se pierde: renómbralas después si lo necesitas.
Centro de trabajo

Datos & SQL

Editor SQL y resultados paginados

Consulta real sobre 85 000 filas sintéticas. El grid muestra solo la página visible.

  • Editor: escribe SQL DuckDB y ejecuta con Ctrl+Enter.
  • SQL efectivo: enseña cómo los filtros y el orden modifican la consulta.
  • Grid: ordena, filtra, busca y pagina sin dibujar millones de filas.
  • Rápidas: crea SELECT, COUNT, resumen, top valores, nulos o muestras.
  • Plan: usa EXPLAIN ANALYZE para entender consultas pesadas.
Sin SQL

Filtrar sin escribir SQL

El botón 🧩 Filtro visual (en Datos & SQL) arma la consulta por ti y te la muestra: la forma más rápida de aprender viendo.

  1. Pulsa 🧩 Filtro visual y elige columna, operador y valor. El desplegable de valor carga los valores más frecuentes de esa columna.
  2. Añade más condiciones y decide si deben cumplirse todas (Y) o alguna (O).
  3. Observa el SQL generado en la parte inferior y pulsa ▶ Aplicar filtro.
Los operadores se adaptan al tipo de columna: «contiene», «empieza con» o «en lista» para texto; rangos y comparaciones para números y fechas.
Módulos Esquema y Estadísticas

Revisar estructura y resumen de la tabla

  1. Abre Esquema y confirma que cada nombre y tipo coincide con lo esperado.
  2. Usa el buscador del árbol para localizar columnas; con clic derecho puedes copiar el nombre, generar un SELECT, renombrar o activar una tabla.
  3. Abre Estadísticas para revisar filas, columnas, cardinalidad y resúmenes numéricos.
  4. Si un tipo no representa el contenido, vuelve a Datos & SQL y crea una conversión segura con TRY_CAST.
Orden útil: valida primero la estructura y después interpreta anomalías. Así evitas confundir un tipo mal leído con un problema del dato.
Módulo Calidad

Investigar advertencias de calidad

Advertencias de calidad con explicación

Selecciona una advertencia para leer su significado y abrir los registros afectados.

  1. Entra en Calidad y ejecuta el análisis de la tabla activa.
  2. Selecciona una advertencia de nulos, duplicados, vacíos, espacios, tipos mixtos o atípicos.
  3. Lee la explicación y abre las filas afectadas en Datos & SQL.
  4. Decide con conocimiento del dominio si se trata de un error o de un valor válido.
Un atípico no siempre es un error. La herramienta lo señala para que lo investigues; la decisión depende del dominio.
Validación continua

Reglas de calidad que se recuerdan

En la pestaña Calidad, sección «Reglas de calidad guardadas»: define tus propias validaciones una vez y revalídalas cada vez que llegue una versión nueva del archivo.

  1. Pulsa + Regla y elige columna y tipo: sin nulos, valores únicos, rango numérico, patrón (regex), lista de valores permitidos o longitud máxima.
  2. Pulsa ▶ Validar reglas: cada regla muestra ✓ o el número y porcentaje de violaciones.
  3. Doble clic en una regla incumplida abre las filas afectadas en Datos & SQL, listas para corregir o exportar.
Las reglas se guardan por tabla en tu equipo: al reabrir el mismo archivo, siguen ahí.
Informe

Perfil completo en un clic

En la pestaña Perfil, el botón 📋 Perfil completo (HTML) genera una ficha técnica de todas las columnas: tipo, % de nulos, únicos, mínimo/máximo, media, cuartiles y valores más frecuentes.

  1. Pulsa el botón y elige dónde guardar el informe.
  2. Se abre automáticamente en tu navegador; es un único archivo HTML autocontenido.
  3. Adjúntalo a un correo, un repositorio o un expediente: se ve bien en claro y oscuro y no necesita internet.
Módulo Dashboard

Obtener una primera lectura automática

Dashboard automático con distribuciones y categorías

El contenido se adapta a los tipos de las columnas de la tabla activa.

  1. Selecciona una tabla en el árbol y abre Dashboard.
  2. Revisa distribuciones numéricas, categorías principales y series temporales disponibles.
  3. Usa un hallazgo para decidir qué columna perfilar o qué filtro aplicar.
  4. Formaliza el análisis importante en Datos & SQL para repetirlo.
Módulo Pivot

Crear una tabla dinámica

  1. Abre Pivot y selecciona una columna para Filas.
  2. Opcionalmente elige una columna de Columnas para cruzar categorías o periodos.
  3. Selecciona la Medida y la agregación: suma, promedio, conteo, mínimo o máximo.
  4. Ejecuta, revisa totales y exporta el resultado si forma parte del entregable.
Si aparecen demasiadas columnas, reduce categorías con un filtro previo o agrupa periodos antes de pivotear.
Módulo Gráfico X-Y

Visualizar una relación o distribución

  1. Abre Gráfico X-Y y elige las variables de los ejes.
  2. Selecciona el tipo de gráfico disponible y, si corresponde, una columna para agrupar o colorear.
  3. Ajusta el tamaño de muestra para equilibrar detalle y velocidad.
  4. Interpreta el patrón junto con los perfiles de ambas columnas; no confundas asociación con causalidad.
Módulo Correlación

Calcular Pearson o Spearman

Matriz de correlación y pares principales

La matriz resume fuerza y signo; el detalle permite revisar la forma de la relación.

  1. Abre Correlación y selecciona las columnas numéricas relevantes.
  2. Usa Pearson para relaciones lineales o Spearman para relaciones monotónicas por rango.
  3. Ejecuta y ordena los pares por valor absoluto.
  4. Abre un par en dispersión y comprueba atípicos, grupos o formas no lineales.
Correlación no demuestra causalidad. Es una herramienta para priorizar preguntas, no para cerrar conclusiones.
Módulo Comparar

Comparar dos tablas o entregas

  1. Agrega ambas fuentes al workspace y dales nombres inequívocos.
  2. En Comparar, selecciona tabla base y tabla candidata.
  3. Ejecuta y revisa diferencias de columnas, tipos, filas y nulos.
  4. Para localizar registros concretos, usa un JOIN o ANTI JOIN por la clave en Datos & SQL.

Aprender JOIN y ANTI JOIN

Módulo Diccionario

Documentar columnas y conservar el contexto

  1. Abre Diccionario y selecciona la tabla.
  2. Completa descripción, unidad, dominio de valores u observaciones para cada columna.
  3. Exporta el diccionario cuando necesites compartirlo fuera de OliMat.
  4. Guarda el workspace .pvpw para conservar el diccionario junto con tablas y consultas.
Geoespacial

Crear un mapa y filtrar un área

Mapa con grilla y capa del Perú

Grilla ponderada por captura y departamentos cargados desde Shapefile.

  1. Elige las columnas de latitud y longitud; pueden venir como texto convertible.
  2. Selecciona Puntos o Densidad (grilla).
  3. Opcionalmente elige una variable numérica y agregación.
  4. En Tiempo, elige una fecha y ajusta inicio/fin.
  5. Usa Seleccionar para caja, lazo, círculo o polígono y envía el filtro a resultados.
  6. Usa Medir para distancia, radio, perímetro o área.

La grilla puede ser adaptativa a la pantalla o usar un tamaño aproximado en kilómetros. Más resolución crea más celdas; aumenta gradualmente para no saturar el mapa.

Sin conexión

Usar el mapa sin internet y exportarlo a PNG

Cada zona del mapa que visitas queda guardada automáticamente en tu equipo y se reutiliza también sin conexión. No hay nada que descargar por adelantado: la política de OpenStreetMap prohíbe las descargas masivas de áreas, y lo que sí permite (y exige) es exactamente este caché de navegación.

  1. Con internet, navega por la zona de trabajo en los niveles de zoom que vayas a usar.
  2. Pulsa 📴 Offline para ver cuánto ocupa tu caché local.
  3. Listo: esas zonas funcionarán sin conexión en tus próximas sesiones.

Para llevar el mapa a un informe: Exportar → 🖼 Exportar imagen (PNG). La imagen incluye la leyenda de densidad, una barra de escala y la atribución del proveedor: lista para pegar en Word o en una presentación.

Los mapas disponibles (OpenStreetMap, OpenTopoMap, CyclOSM y HOT) son de datos abiertos con atribución. La vista satelital se retiró de esta versión: requiere una licencia/clave del proveedor y volverá cuando el proyecto la incorpore formalmente.
Datos de R

Abrir RDS o RData sin tener R

Un .rds puede contener una tabla o una lista con decenas de ellas. La app las cataloga sin cargarlas y convierte solo lo que eliges.

  1. Abre el archivo .rds/.RData como cualquier otro.
  2. Si contiene varias tablas, aparece el catálogo con nombre, filas y columnas de cada una: marca las que necesitas.
  3. Cada tabla elegida se convierte a Parquet en caché y queda disponible para SQL, mapa, perfil y exportación.
Factores, fechas y horas de R conservan su tipo. Funciona con compresión gzip, bzip2, xz y zstd (R ≥ 4.5).
Codificación

CSV con acentos que otras herramientas rechazan

Los CSV exportados por Excel, Oracle o sistemas antiguos suelen venir en Latin-1/Windows-1252 (o UTF-16 desde SQL Server/PowerShell) y fallan en visores que esperan UTF-8. Aquí no hay nada que configurar:

  1. Abre el CSV normalmente.
  2. Si no es UTF-8, la app detecta la codificación por los bytes y reintenta sola.
  3. La Ñ, las tildes y símbolos como € aparecen correctos, y la vista queda configurada para el resto de la sesión.
Estructuras

JSON anidado sin multiplicaciones inesperadas

Un viaje con una actividad, una especie, 20 biométricos y 15 biológicos permanece como una fila con arrays anidados. El visor de celda permite expandir cada rama.

Solo obtendrás 300 combinaciones si haces explícitamente un producto entre ambos arrays. Para mantener relaciones separadas, aplana cada array en una consulta o tabla distinta.

-- Aplanar solo biométricos
SELECT viaje_id, actividad.unnest AS actividad,
       biometrico.unnest AS biometrico
FROM data,
UNNEST(sp_actividad) AS actividad,
UNNEST(actividad.sp_especie) AS especie,
UNNEST(especie.sp_biometrico) AS biometrico;
Conexión Oracle

Importar una consulta o exportar una tabla

  1. Elige Importar desde Oracle y completa host, puerto, servicio y usuario. La contraseña se usa para la sesión y no se guarda.
  2. Prueba la conexión y ejecuta una consulta limitada a las columnas y filas necesarias.
  3. Asigna un nombre a la tabla importada; desde ese momento funciona como cualquier tabla local.
  4. Para devolver un resultado, elige Exportar a Oracle, revisa destino y permisos y confirma la operación.
Modo thin: no requiere Oracle Instant Client. No incluyas contraseñas en consultas guardadas ni en capturas de pantalla.
Entrega

Exportar resultados

Las exportaciones parten de la consulta efectiva, no solo de la página visible. Elige Parquet para conservar tipos y rendimiento, Excel para intercambio manual, CSV para compatibilidad, GeoJSON para GIS, Arrow/Feather para ciencia de datos o SQLite para entregar una base portátil. También puedes crear sentencias SQL INSERT o enviar el resultado directamente a Oracle.

SQL INSERT: se escribe por bloques para proteger la memoria, pero genera archivos muy grandes. Para millones de filas, Parquet, CSV o SQLite suelen ser opciones más prácticas.
Operación segura

Errores, cancelación y rendimiento

  • Una consulta inválida muestra el mensaje de DuckDB y mantiene la aplicación abierta.
  • TRY_CAST evita que un solo texto incorrecto rompa conversiones numéricas o de fecha.
  • La paginación protege la interfaz; evita exportar millones de INSERT si Parquet o CSV sirven mejor.
  • En JOIN grandes, selecciona solo columnas necesarias y filtra antes cuando sea posible.