Glosario de datos y DataOps, en español.
35 términos definidos en dos o tres frases. Cuando una definición nombra a la plataforma, describe lo que existe hoy.
Práctica
- DataOps
- La práctica de tratar los datos como se trata el código fuente: cada cambio queda registrado, cada transformación es reproducible, cada versión se puede recuperar y los procesos corren solos, con reglas de fallo y avisos. No es una funcionalidad; es la forma en que se produce cada cifra. Ver más
- Gobierno de datos Gobernanza de datos
- Las reglas y los registros que permiten responder, de cualquier dato, de dónde proviene, quién lo modificó, qué reglas se le aplicaron, qué versión se usa, qué calidad tiene y quién puede consumirlo. «Gobernanza» es la traducción directa de data governance; «gobierno» es la forma usual en Latinoamérica. Ver más
- Linaje de datos Data lineage
- El registro del recorrido de una cifra: de qué origen y qué versión salió, qué reglas se le aplicaron, en qué modelo se calculó, qué depende de ella y quién la consumió. Se registra cuando ocurre cada paso; no se reconstruye después. Ver más
- Trazabilidad
- La capacidad de seguir el rastro de un dato desde su origen hasta donde se consume. El linaje es la forma concreta que toma la trazabilidad; el registro de auditoría la complementa con quién hizo qué. Ver más
- Análisis de impacto
- El linaje leído hacia adelante: a dónde va un dato y qué se rompe si cambia. En la plataforma, antes de borrar un dataset se listan los modelos que dependen de él, y un modelo avisa cuando una de sus fuentes tiene versión nueva. Ver más
- Protección de datos
- Decidir quién ve los datos, ocultar lo sensible antes de compartirlos, guardarlos donde nadie más los alcance, no exponerlos a terceros sin necesidad y borrarlos cuando ya no deben existir. Ver más
- Reproducibilidad
- Que ejecutar hoy el mismo cálculo sobre los mismos datos de entrada produzca exactamente el mismo resultado que la primera vez. Exige versionar tres cosas a la vez: los datos de entrada, las reglas aplicadas y el resultado publicado. Ver más
Arquitectura
- Arquitectura Medallion
- Una organización de los datos en tres capas de calidad creciente: Bronze conserva el dato tal como llegó, Silver el dato limpio y validado según reglas declaradas, y Gold el dato modelado y listo para consumo. Cada capa es reproducible y auditable. Ver más
- Bronze
- La capa de entrada: cada carga —un archivo, una tabla de una conexión— entra como una versión numerada, con su perfil de calidad, y el original nunca se modifica. Ver más
- Silver
- La capa limpia: el resultado de aplicar una receta sobre una versión de Bronze. Guarda las métricas de antes y después, el informe de calidad y el rastro de reglas aplicadas. Ver más
- Gold
- La capa modelada: cruces, filtros y columnas elegidas sobre datos de Silver, sin código o con SQL. Cada ejecución es una versión con la fuente de cada columna y su historial, y es lo que consumen Power BI, Excel, la API y los tableros. Ver más
- Dataset Conjunto de datos
- Una tabla con historia: la cadena de versiones que nace de una carga y sus limpiezas. Se organiza en colecciones dentro de un espacio de trabajo. Ver más
- Espacio de trabajo Workspace
- El contenedor donde un equipo guarda sus datasets, recetas, modelos y tableros, con sus propios miembros y roles. Una organización puede tener varios; los datos de uno no se ven desde otro. Ver más
- Colección
- Una carpeta con nombre y descripción dentro del espacio, que agrupa datasets y modelos. Se puede compartir por concesión con alguien de la organización que no pertenece al espacio, y se le pueden emitir tokens con alcance. Ver más
Calidad
- Perfilado Profiling
- El análisis automático de cada columna al cargar: tipo inferido con su certeza, vacíos, valores únicos, rangos, valores frecuentes, inconsistencias de formato y atípicos. Es lo que la plataforma entiende del dato antes de transformarlo. Ver más
- Score de calidad
- Una cifra de 0 a 100 que combina cinco dimensiones con pesos fijos: completitud (35), consistencia (25), integridad de filas (20), validez (10) y atípicos (10). Bandas: Excelente desde 85, Bueno desde 65, Regular desde 45. Un score alto significa bien formado, no verdadero. Ver más
- Completitud
- El porcentaje de celdas con un valor real. La dimensión de más peso en el score: un promedio calculado sobre una columna con el 30 % vacía no está incompleto, está equivocado. Ver más
- Consistencia
- Que el mismo concepto se escriba igual en todas partes. «Bogotá», «BOGOTA» y «Bogota D.C.» son una ciudad para una persona y tres para un sistema. Ver más
- Receta
- Una secuencia guardada de transformaciones que se reaplica igual cada vez. Cada ejecución conserva la configuración exacta que corrió, y se puede compartir con roles de propietario, editor o ejecutor. Ver más
- Normalizar
- Llevar valores que representan lo mismo a una sola forma: mayúsculas, tildes, espacios, formatos de fecha y de número. No borra datos: deja de fragmentarlos. Ver más
- Deduplicar
- Eliminar registros repetidos según una clave y un criterio de cuál sobrevive. Los duplicados reales casi nunca son idénticos; por eso se normaliza antes de deduplicar. Ver más
- Ofuscar Enmascarar, anonimizar
- Ocultar datos sensibles antes de compartir: enmascarar, codificar de forma irreversible, suprimir o aleatorizar, por tipo de dato. En la plataforma es una transformación más de la receta y queda en la auditoría. Ver más
- Dígito de verificación
- El número final de un documento tributario que se calcula a partir de los demás y permite detectar errores de digitación. NIT, RUT, RFC, CUIT, CPF, CNPJ y RUC tienen cada uno su fórmula. Ver más
Operación
- Versionado de datos
- Conservar cada estado anterior de la información en lugar de sobrescribirlo. Cada carga, cada limpieza y cada ejecución de un modelo genera una versión nueva y la anterior permanece. Es lo que permite reproducir una cifra tal como se publicó. Ver más
- Automatización Pipeline
- Un proceso que limpia un dataset con una receta y refresca los modelos que dependen de él, con agenda diaria, semanal o mensual, política de fallos y suscriptores que reciben avisos. Ver más
- Flujo
- Un lienzo que encadena conexiones, automatizaciones y modelos Gold. Un paso espera a todos sus antecesores; si uno falla, los que dependían de él se omiten explicando por qué. Ver más
- Conexión Conector
- Un origen del que la plataforma trae datos y los mantiene al día: OneDrive, SharePoint, Google Drive, SQL Server, Databricks, Snowflake, los sensores de MQTT ATS o un agente dentro de su red. Ver más
- Agente
- Un servicio que se instala en un servidor Windows de su red, trae tablas de SQL Server y archivos de carpetas compartidas y los sube por una conexión saliente cifrada. No abre puertos ni requiere VPN, y nunca envía sus credenciales. Ver más
- Carga incremental Marca de agua, watermark
- Traer solo las filas nuevas desde la última corrida, usando una columna de actualización como marca. Existe para el agente on-premise y para los sensores de MQTT ATS, que usan la hora de cada lectura; en Databricks y Snowflake está en construcción. Ver más
- MQTT IoT, sensores
- El protocolo con el que sensores y controladores publican sus lecturas en un servidor intermedio, el broker. La plataforma trae esas lecturas desde MQTT ATS —el histórico y después solo lo nuevo— sin que nadie exporte un CSV, y no publica nada en los dispositivos. Ver más
- Registro de auditoría
- La lista inmutable de acciones: quién hizo qué, cuándo y desde qué dirección. En la plataforma solo se inserta; la aplicación no puede modificar ni borrar una entrada, y ninguna lleva secretos. Ver más
- Token con alcance
- La credencial con la que Power BI, Python u otro sistema leen un modelo. Lleva grabado su alcance —el espacio o una colección—, vence obligatoriamente, se muestra una sola vez y se revoca sin vuelta atrás. Cada lectura queda registrada. Ver más
- Feed OData
- El estándar que Power BI y Excel leen de forma nativa: publica el esquema de una colección y sirve las filas de sus modelos por páginas. Se autentica con un token. Ver más
- Parquet
- Un formato de archivo columnar y tipado: cada columna conserva su tipo, así que entra directo a Python, Databricks o cualquier motor analítico sin conversión. La plataforma lo usa en Bronze y lo ofrece como descarga. Ver más
- Editor y Visor
- Los dos roles de trabajo dentro de un espacio, además del Propietario. El Editor carga, configura, ejecuta y descarga; el Visor solo lee y consulta el registro. Los planes se cobran por Editores; los Visores no cuentan. Ver más
Los términos, en la práctica.
Plan gratuito para ver el linaje, las versiones y el registro de auditoría con sus propios datos.