Práctica 03 · Plataformas de Datos

    Pipelines que convierten eventos crudos en decisiones.

    Pipelines streaming y batch, warehouses modelados en dbt y dashboards de BI que el liderazgo realmente abre los lunes.

    Proof
    Millones
    de eventos diarios ingeridos
    < 15 min
    frescura en KPIs críticos
    100%
    de pipelines bajo contract tests
    El brief

    La calidad de dato es un contrato, no una limpieza.

    La mayoría de las plataformas de datos falla en el productor: nadie prometió el esquema, nadie es dueño de la frescura, y nadie alerta cuando los números se desvían. Tratamos a la calidad como contrato upstream exigido en la ingesta, no como misión de rescate downstream.

    De pipelines de evento en tiempo real a warehouses modelados en dbt y BI ejecutivo, construimos la plataforma que hace que el liderazgo confíe en los dashboards — y que ingeniería confíe en las alertas.

    Lo que te llevás

    Entregables y la postura operativa que compran.

    Entregables tangibles
    • Pipelines de ingesta con contratos de esquema y SLOs de frescura
    • Capa de warehouse modelada en dbt con lineage documentado
    • Dashboards de BI (Metabase / Superset / Looker) conectados a stakeholders
    • Alertas de calidad de dato atadas a dueños de negocio
    • Grafo de lineage y documentación de control de acceso
    • Ritual de data review onboardeado con el liderazgo
    Qué cambia en operación
    Lun. 9am

    el liderazgo abre el dashboard sin pedir a analistas

    < 15 min

    p95 de frescura en KPIs críticos

    Alerta

    dispara upstream cuando el productor rompe el esquema — no después

    Fuente única

    una definición de métrica, un dueño

    Capacidades

    Qué construimos en el stack.

    Hacé clic en una capacidad para ver cómo la abordamos.

    Cómo la abordamos

    Pipelines en tiempo real

    Ingesta streaming con schema enforcement, detección de anomalía y SLOs de frescura.

    • Kafka Connect / Debezium para CDC, Materialize / Flink para derivaciones
    • Contract tests en todo productor con gating en CI
    • Alertas de frescura y anomalía de volumen ruteadas a dueños
    • Tooling de replay para correcciones retroactivas
    Cómo la abordamos

    Data warehousing

    Warehouse modelado en dbt con cargas incrementales, SCDs y particionamiento.

    • Modelado en capas: staging → intermediate → marts
    • Materializaciones incrementales con manejo de datos atrasados
    • Lineage documentado en dbt docs, publicado a stakeholders
    • Particionamiento y clustering con conciencia de costo
    Cómo la abordamos

    Business intelligence

    Dashboards ejecutivos con drill-down, digests por email programados y vistas mobile-first.

    • Una métrica, una definición, un dueño
    • Drill-downs que coinciden con cómo el liderazgo pregunta de verdad
    • Digests programados por email para quienes no abren dashboards
    • Analytics embebidos en superficies de producto cuando aporta
    Cómo la abordamos

    Gobernanza de datos

    Lineage, controles de acceso, audit logs y SLOs de calidad con alerta al dueño.

    • Lineage a nivel de columna publicado a stakeholders
    • Acceso basado en rol en la capa de warehouse (RLS donde se soporta)
    • Audit logs de quién consultó qué, retenidos para compliance
    • Los SLOs de calidad pertenecen al productor upstream
    Workflow

    Del descubrimiento de fuentes al ritual de data review.

    Cinco etapas — todas terminan con alguien firmando qué es ‘suficientemente bueno’.

    1. Semana 1–2 · Discovery

      Mapeo de fuentes & descubrimiento de preguntas

      Entrevistamos a quienes hacen las preguntas y a quienes las responden — y mapeamos las fuentes de dato necesarias para cerrar el gap.

      DeliverableMapa de fuentes + lista de preguntas-KPI
    2. Semana 2–4 · Contratos

      Contratos de esquema & SLOs de frescura

      Para cada fuente definimos contrato de esquema, SLO de frescura, dueño y política de alerta — exigidos en CI en el productor.

      DeliverableRegistry de contratos + doc de SLOs
    3. Semana 4–8 · Pipelines

      Build streaming + batch con gates de calidad

      Pipelines de ingesta, validación y transformación con gates de calidad que fallan ruidosamente y rutean alerta al dueño.

      DeliverablePipelines en producción + dashboards de calidad
    4. Semana 6–10 · Warehouse

      Modelado dbt con lineage documentado

      Modelos dbt en capas, lineage publicado y definiciones de métrica documentadas — para que el warehouse sea navegable, no arqueológico.

      DeliverableProyecto dbt + docs de lineage
    5. Semana 10–12 · BI & ritual

      Dashboards con ritual de data review

      Dashboards ejecutivos entregados con data review semanal en el calendario — porque un dashboard que nadie abre no paga el alquiler.

      DeliverableDashboards de BI + ritual de review onboardeado
    Arquitectura

    Cómo el dato fluye del evento a la decisión.

    Contratos en el productor, lineage por el warehouse, ownership en el dashboard.

    EventsApp DBsSaaS APIsLogsSOURCESCONTRACT GATEIngestionSchema · freshness · ownerCI fails on breachDBT MODELSStagingIntermediateMartsdocumented lineageWarehouseBigQuerySnowflakeDECISIONSBI dashboards · digests

    Fuentes → ingesta + contratos → staging → marts dbt → warehouse → dashboards de BI.

    Tecnología

    Herramientas que elegimos primero.

    Defaults — no dogmas. Elegimos el stack más chico que responde tus preguntas a tiempo.

    Ingesta
    • Kafka Connect
    • Debezium
    • Airbyte
    • Fivetran
    Procesamiento
    • Apache Airflow
    • dbt
    • Spark
    • Flink
    Warehouse
    • BigQuery
    • Snowflake
    • Redshift
    • PostgreSQL
    Streaming
    • Kafka
    • Materialize
    • Redpanda
    BI & viz
    • Metabase
    • Apache Superset
    • Looker
    • Grafana
    Cómo trabajamos

    Tres formatos, un compromiso con ownership.

    Elegí el formato que entre en tu equipo — todos terminan con tu equipo dueño del warehouse.

    Modelo de engagement

    Build con alcance fijo · Sprint de rescate · Retainer

    Un build de plataforma greenfield, un sprint para rescatar un pipeline detenido, o un retainer para trabajo continuo de datos — como equipo externo.

    Timeline típico

    8–12 semanas hasta el primer corte

    Del discovery a dashboards en vivo con ritual semanal de data review onboardeado.

    Propiedad

    100% tuyo, siempre

    Warehouse, modelos, código fuente, propiedad intelectual y runbooks se transfieren a ti. Sin lock-in, y sin personas que gestionar.

    FAQ

    Preguntas que escuchamos antes del kickoff.

    Si la tuya no está, preguntala directo.

    Iniciar un proyecto de datos

    ¿Listo para datos en los que podés confiar?

    Contanos las fuentes, las preguntas y la cadencia. Volvemos con una forma y un timeline.