INGENIERÍA DE DATOS AGÉNTICA

Pipelines de punta a punta

Del ETL al data pipeline agéntico
— y las tres superficies para conducir el mismo motor
Maestría en Analítica de Datos
Dr. Maikel Y. Leyva-Vázquez · Universidad Politécnica Salesiana · agosto de 2026

Quién los va a acompañar

Y por dónde pueden verificar cualquier cosa que yo afirme en clase
Dr. Maikel Yelandi Leyva Vázquez
Formación

Doctor en Ciencias Técnicas — Universidad de las Ciencias Informáticas, La Habana (2013)
Máster en Bioinformática (INSTEC) · Ingeniero en Ciencias Informáticas

Docencia e investigación

Coordinador Académico de Posgrado — Universidad Bolivariana del Ecuador
Investigador colaborador — Universidad de Guayaquil · Universidad Bernardo O'Higgins, Chile

Dirección editorial

Editor-in-Chief — Neutrosophic Sets and Systems (University of New Mexico, Scopus Q1)
Editor-in-Chief — Neutrosophic Computing and Machine Learning

«La herramienta se elige por el problema, nunca al revés.» Es lo único que les voy a pedir desde el primer día.
No leer la diapositiva. El punto de ponerla no es el currículum: es que sepan dónde verificar. En una materia cuyo eje es «no acepte una salida sin auditarla», sería incoherente pedir que me crean a mí sin darles la fuente. Decirlo así, en voz alta: todo lo que yo afirme en clase se puede contrastar en esos enlaces, y si encuentran una discrepancia, quiero saberla. Deliberadamente no hay índice h en la diapositiva. Ante estudiantes de maestría el índice h no construye autoridad; la construye el criterio de trabajo que anuncia la línea de abajo. Quien quiera el número lo tiene a un clic.

La materia

Análisis, Explotación y Visualización de Datos · 409754 · Maestría en Analítica de Datos
Unidad 1
Captura y extracción con procesos ETL

Del portal de datos abiertos al tablero. Pentaho para el pipeline declarado, DuckDB para verificarlo y agentes para acelerarlo.

Termina en un dato limpio del que usted responde.

Unidad 2
Fundamentos de IA en gestión documental

Enseñarle a una máquina a leer: OCR, extracción estructurada, clasificación y un archivo al que se le pregunta en lenguaje natural.

Termina en un expediente que cita su fuente.

El recorrido completo:  documento o portal  →  OCR o ETL  →  base de datos  →  archivo consultable
25 %Arquitectura
20 %Calidad
20 %Gobernanza
15 %Reproducibilidad
10 %Eficiencia
10 %Criterio
Fíjense en el reparto: arquitectura, gobernanza y criterio pesan más que el hecho de que el proceso corra. Correr es el mínimo, no el logro.
Dos cosas que conviene que queden dichas hoy y no en la semana seis. La primera: las dos unidades no son dos materias pegadas. Es un solo recorrido, del documento crudo al dato consultable, y el proyecto integrador lo atraviesa entero. La segunda: mirar la fila de porcentajes en voz alta. Que el pipeline corra no da puntos: es la condición de entrada. Los puntos están en por qué eligió esa arquitectura, qué hizo con los datos personales y qué decidió no automatizar.

Ocho palabras que vamos a usar todo el semestre

No hace falta memorizarlas hoy. Sí hace falta que ninguna les suene rara en la semana tres
Data pipeline

El género. Traer datos, procesarlos y dejarlos donde generen un producto.

ETL / ELT

Dos secuencias posibles de ese pipeline. Cambia dónde se transforma, no qué se hace.

Bronze · silver · gold

Tres estados del dato: crudo, conformado y listo para decidir. No son tres carpetas.

Completitud ≠ validez

Una columna sin un solo hueco puede estar llena de valores que no son datos.

Centinela

Un valor que finge ser dato: «SIN DATO», «N/A», 9999-12-31. Pasa cualquier control de nulos.

Integridad referencial

Un pago a nombre de alguien que no aparece matriculado es un huérfano. Alguien decide qué hacer con él.

Reproducibilidad

Si no se puede volver a correr y dar lo mismo, no es un pipeline: es una anécdota.

Harness

Lo que le da manos al modelo: abrir archivos, ejecutar, verificar. Antigravity y agy son harnesses.

Las tres primeras ordenan el vocabulario. Las cinco restantes son las que más veces vamos a discutir: son las que separan un pipeline correcto de una conclusión correcta.
No explicar las ocho ahora: se quema la clase. Leerlas rápido y anunciar que cada una va a aparecer con un caso concreto. Las dos que conviene marcar hoy son «completitud ≠ validez» y «centinela», porque el Taller 1 se juega ahí: la columna de fecha de matrícula no tiene un solo nulo y aun así cinco de sus valores no son fechas. Si entienden eso, entendieron el curso. «Harness» está en la lista para que la palabra no les suene rara cuando aparezca en la diapositiva del ecosistema.

Ingeniería de datos agéntica

Construir pipelines de punta a punta con IA:
qué automatiza cada superficie y qué sigue siendo suyo

Ecosistema para Analítica de Datos
Encuadre: no vamos a aprender una herramienta, vamos a discutir un cambio en la división del trabajo entre analista y máquina.

El ecosistema, en cuatro capas

Sale una herramienta casi todos los días. No hace falta conocerlas: hace falta saber en qué capa caen
Modelos
El cerebro

Reciben texto, imagen o audio y devuelven texto.

Claude · GPT · Grok
Kimi · Gemini

Harnesses
Las manos

Le dan al modelo acceso real: abrir, ejecutar, verificar.

Claude Code · Codex
OpenCode · Gemini CLI
Antigravity · agy

Asistentes
El acompañamiento

Agentes que siguen el trabajo de forma continua.

Hermes · OpenClaw

Orquestadores
La coordinación

Coordinan varios agentes a la vez.

Orca · Herder · Crowbot

Un pipeline ETL no es ninguna de las cuatro: es una aplicación — lo que usted construye usando las capas.
Taxonomía tomada del video de Fazt Code, «Cómo categorizo todas las herramientas de IA que surgen» (25-ago-2026). El valor no está en la lista de nombres, que caduca en semanas, sino en el criterio: de cualquier herramienta nueva, preguntar si piensa, si actúa, si acompaña o si coordina. Insistir en la caja inferior: la pregunta «¿el ETL agéntico reemplaza a Pentaho?» está mal planteada, porque compara una aplicación con una herramienta.

Qué vamos a usar en esta materia

Cada elección es de disponibilidad y de gobernanza, no de moda
Modelo
Familia Gemini
El motor por defecto de Antigravity. Contexto largo y multimodal: hace falta para leer un PDF escaneado y un CSV en la misma sesión.
Harness
Antigravity 2.0 · IDE · agy CLI
Las tres superficies del mismo motor, y las tres se instalan: se despacha en la app, se verifica en el IDE, se automatiza en la terminal.
Asistentes
Ninguno
Se explican para que reconozcan la capa. Hermes y OpenClaw acompañan trabajo continuo; en diez semanas no hay continuidad que acompañar.
Orquestadores
Ninguno
Orca, Herder o Crowbot coordinan flotas de agentes. Con 18 estudiantes y un portátil cada uno, la coordinación la hacen ustedes.
Y una quinta cosa que no es capa: OpenRouter. Es una pasarela de modelos — un conmutador que deja cambiar de cerebro sin tocar el harness.
Dos confusiones frecuentes que conviene decir en voz alta: 1) agy NO es un orquestador. Es un harness, la misma capa que Antigravity y que Gemini CLI: lo que hace es darle manos a un modelo. Que pueda lanzar subagentes no lo mueve de capa. 2) OpenRouter tampoco es un orquestador. Es una pasarela: un único punto de acceso a muchos modelos. No coordina agentes, conmuta cerebros. Si algún estudiante los ubica en la capa 4, ésta es la corrección. La prueba es la pregunta del criterio: ¿coordina a otros agentes? No.

ETL ya no es el marco. Es un caso particular

El género es el data pipeline; ETL y ELT son dos de sus secuencias posibles
ETL
Transformar antes de guardar

Se extrae, se transforma en un motor aparte y recién después se carga.

Es lo que dice el sílabo y lo que hace Pentaho. Sigue siendo válido.

ELT
Guardar y transformar dentro

Se carga primero al almacén y la transformación ocurre allí, en SQL.

Es lo que haremos con DuckDB: el archivo se consulta donde está.

Pipeline agéntico
Objetivo declarado

El orden deja de fijarse por adelantado: se declara el resultado y el agente arma el camino.

No siempre cabe en tres letras.

«El flujo extraer-transformar-cargar es una subcategoría de un data pipeline.»
Needham, Hunger y Simons, DuckDB in Action, cap. 8 — el libro obligatorio de la materia
Aquí se corrige la letra del sílabo sin contradecirla. El sílabo dice ETL porque ETL fue el nombre de la práctica durante veinte años. El libro del curso dice, textualmente, que ETL es una SUBCATEGORÍA de un data pipeline. Pregunta para la clase: si cargamos el CSV en DuckDB y transformamos allí, ¿qué letra va primero? La respuesta correcta es que la pregunta está mal planteada. Elegir entre ETL y ELT es decidir dónde gastar el cómputo, no qué es el trabajo. No presentarlo como que el sílabo está equivocado: presentarlo como que ETL es el caso que le dio nombre a la familia.

Un pipeline de punta a punta, con IA en cada tramo

El agente entra en los cuatro tramos. La decisión de la fila de abajo, en ninguno
Ingestión
Transformación
Orquestación
Producto
EL AGENTE EJECUTA
Descarga, APIs, PDF, XLSX
SQL en DuckDB, joins, reglas
Orden, dependencias, reejecución
Tablero, informe, archivo consultable
USTED DECIDE
Elegir la fuente y su licencia
Definir la unidad de análisis
Fijar qué corre y cuándo
Juzgar si el resultado tiene sentido
El agente cubre la fila de arriba de punta a punta. La de abajo no depende del archivo: depende de la pregunta.
Esta es la diapositiva que da nombre a la sesión. «De punta a punta» no significa «sin humano»: significa que ya no queda un tramo del pipeline donde el agente no pueda entrar. Lo que no cambia es quién firma. Conectar con la Fase 0: el diagnóstico con DuckDB es lo que convierte la fila de abajo en algo verificable y no en una opinión. Sin línea base, cuando el agente afirme cuántos duplicados hay, usted no tiene con qué contradecirlo.

Tres formas de conducir al mismo agente

Cambia la interfaz y el ritmo de trabajo, no el motor que ejecuta
Agent Manager
Asíncrono
  • Usted define objetivos, no escribe código
  • Hasta 5 agentes en paralelo
  • Avisa cuando necesita input
  • Entrega Artifacts revisables
Editor / IDE
Síncrono
  • Fork de VS Code: extensiones y atajos
  • Árbol de archivos, terminal, diffs
  • Autocompletado y comandos en lenguaje natural
  • Agente contextual en panel lateral
agy · CLI
Terminal / headless
  • Binario único, sin interfaz gráfica
  • Subagentes y comandos de barra
  • Invocable desde un script o pipeline
  • Sesiones exportables a la app
Las tres leen y escriben los mismos archivos, y comparten permisos y skills. El Manager migra a una app autónoma: Antigravity 2.0.
Insistir: no son herramientas rivales. Apunte las tres a la misma carpeta y lo que escribe una aparece en las otras. Lo que no se comparte es el historial de conversación.

Cuatro superficies, un solo motor

Todas comparten el mismo agent harness: los permisos y las skills se sincronizan entre ellas
Antigravity 2.0
App de escritorio

Torre de control. Agentes en paralelo, tareas programadas.

INSTALADO
Antigravity IDE
Editor

Fork de VS Code. Inspección, diffs, terminal, extensiones.

INSTALADO
agy
CLI en terminal

Mismo motor sin GUI. Subagentes y comandos de barra.

PENDIENTE
SDK
Librería Python

Construir agentes propios sobre el mismo runtime.

OPCIONAL
Existen dos superficies más — Managed Agents API y Gemini Enterprise — orientadas a despliegue en servidor.
El punto conceptual: el agente ya no vive dentro de una aplicación. La aplicación es solo la ventana por la que uno lo mira. Mencionar que el Agent Manager dentro del IDE será descontinuado en favor de la app 2.0.

En qué cambia el trabajo

Agent ManagerEditor / IDEagy · CLI
Su rolArquitecto, supervisorAnalista, revisorOperador, automatizador
RitmoAsíncrono, en paraleloSíncrono, secuencialSíncrono o headless
Unidad de trabajoTarea completaArchivo, celda, líneaComando o sesión
Ve el detalleNo — resumen y artefactosSí — todo el estadoSí — diffs y logs en texto
ReproducibleConversación: no se re-ejecutaScript: deterministaInvocable desde un pipeline
La última fila es la que decide si un análisis es publicable: un chat no se versiona ni se audita.
La última fila es la que más importa para producción académica: un chat no se versiona ni se audita.

Cuánta correa darle al agente

Cuatro modos configurables — la decisión no es técnica, es de gobernanza
1Strict

Pide permiso antes de casi cada acción. Lento, pero nada ocurre sin que usted lo vea.

2Review-driven

Trabaja solo y se detiene en los puntos de decisión. Es el modo recomendado por defecto.

3Agent-driven

Nunca solicita revisión. Corre de principio a fin y presenta el resultado.

4Custom

Usted define qué clases de acción requieren aprobación explícita.

Más autonomía no es mejor ni peor: mueve el punto donde usted asume el riesgo.
Demo: mostrar esta misma pantalla en vivo. Preguntar a la clase cuál elegirían para un análisis que va a publicarse.

La asimetría del oráculo

Por qué la autonomía rinde distinto en desarrollo que en analítica
Desarrollo de software
¿Funciona?
  • El código compila o no compila
  • Los tests pasan o fallan
  • La página carga o no carga
  • El agente cierra su propio ciclo
Verificación automatizable
Analítica de datos
¿Es verdad?
  • Un análisis equivocado corre perfectamente
  • Un modelo mal especificado da R² alto
  • Una muestra truncada da coeficientes limpios
  • Nadie cierra el ciclo salvo usted
Verificación irreductiblemente humana
Esta es la diapositiva bisagra. El navegador integrado de Antigravity verifica que el botón funcione. Nada verifica que la inferencia sea válida.

El código corre. La conclusión está invertida.

Admisiones de posgrado, UC Berkeley, 1973 — tasa de admisión (%)
TOTAL
Depto A
Depto B
Depto C
Depto D
Depto E
Depto F
HombresMujeres
Agregado

Los hombres son admitidos más que las mujeres.

Por departamento

En cuatro de seis, las mujeres son admitidas más. El sesgo estaba en a qué departamento se postulaba.

Ningún test unitario atrapa esto.

Paradoja de Simpson. Cada paso del cómputo es correcto. El agente puede ejecutarlo todo bien y reportar lo contrario de lo que ocurre. Aquí es donde se abre el IDE.

Lo que el agente no le va a decir

Cinco preguntas que ningún resumen automático contesta solo
1¿Cuántos nulos por columna?El agente reporta la salida final, no lo que descartó en el camino.
2¿Cambió la N?Un dropna() silencioso altera la muestra sin aparecer en el reporte.
3¿Hay censura a la derecha?Datos que siguen actualizándose sesgan cualquier tasa calculada sobre ellos.
4¿Qué versión del archivo usó?Solo el árbol de archivos y el diff lo confirman.
5¿Qué imputó y con qué supuesto?El agente reporta todo con confianza uniforme: no separa lo que sabe de lo que supuso.
La quinta es la más profunda: colapsar la indeterminación en el reporte. El agente no distingue entre dato observado y valor imputado.

El marco 4D: cómo se trabaja con un agente

Cuatro competencias. Las cuatro se califican en esta materia, aunque no lleven ese nombre en la rúbrica
Delegación
Delegation

Decidir qué se le entrega y qué no.

En esta materia

Es la fila «usted decide» del pipeline. Los 12 pagos huérfanos no se delegan: son una regla de negocio sobre dinero.

Descripción
Description

Decirle con precisión qué se quiere.

En esta materia

La plantilla del prompt analítico: objetivo, fuentes, claves, reglas, criterios de calidad, destino y política de errores.

Discernimiento
Discernment

Juzgar lo que vuelve.

En esta materia

Las cinco preguntas de la diapositiva anterior. Y el caso Berkeley: el cómputo correcto con la conclusión invertida.

Diligencia
Diligence

Responder por el resultado.

En esta materia

El acta de descartes: declarar qué se perdió y por qué. El pipeline lo corre el agente; la firma es suya.

La certificación «AI Fluency: Framework & Foundations» está en el aula como tarea. No es un trámite: es el vocabulario de esta unidad.
Marco de Rick Dakan (Ringling College) y Joseph Feller (University College Cork) con Anthropic · CC BY-NC-SA 4.0
Esta diapositiva es la respuesta a la anterior. Allí quedó el problema —lo que el agente no le va a decir—; aquí está el marco para hacer algo con él. Lo que conviene subrayar: de las cuatro competencias, la que casi nadie entrena es la primera. Todo el mundo cree que el problema es escribir mejores prompts (Descripción), y el problema real suele ser haber delegado algo que no debía delegarse. Aclarar la atribución si alguien pregunta: el marco no es de Anthropic en solitario. Lo formularon Rick Dakan y Joseph Feller en colaboración con Anthropic, y está publicado con licencia abierta. La certificación del aula es gratuita. Enlazar con la rúbrica: Gobernanza (20 %) es Delegación y Diligencia; Pensamiento crítico (10 %) es Discernimiento.

El agente dentro del pipeline

La captura y extracción dejan de ser scripts que se escriben y pasan a ser objetivos que se declaran
Extracción
Limpieza
Transformación
Carga
Verificación
▸ EL AGENTE EJECUTA
Descarga, paginación de API, scraping, lectura de PDF y XLSX
Tipos, duplicados, encoding, normalización de nombres
Joins, agregaciones, derivación de variables
Escritura a CSV, Parquet, base de datos
Conteos, rangos, pruebas de integridad
▸ USTED DECIDE
Elegir la fuente y su licencia
Decidir qué hacer con los nulos
Definir la unidad de análisis
Fijar el esquema final
Juzgar si el resultado tiene sentido
Ninguna decisión de la banda inferior es automatizable: todas dependen de la pregunta, no del archivo.
El punto: ninguna de las decisiones de la fila inferior es automatizable, porque todas dependen de la pregunta de investigación, no del archivo.

Caso: Datos Abiertos Ecuador

datosabiertos.gob.ec — cerca de 400 conjuntos de datos de unas 70 instituciones públicas
Un solo objetivo

Descarga el conjunto de personas desaparecidas del portal de datos abiertos. Perfila nulos por columna, normaliza provincias, calcula tasa de localización por año y provincia, y entrega un dashboard HTML con el script reproducible.

Un objetivo en lenguaje natural sustituye a un pipeline de varios archivos.

1
Subagente 1

Descarga y perfila: filas, columnas, nulos, rangos de fecha

2
Subagente 2

Normaliza y transforma: provincias, tipos, variables derivadas

3
Subagente 3

Visualiza y documenta: gráficos, dashboard, script final

Los tres corren en paralelo con contextos aislados. Ninguno contamina la ventana del agente principal.
El dataset de personas desaparecidas del Ministerio del Interior está publicado en ese portal. Advertir la censura a la derecha: los registros recientes siguen actualizándose, lo que sesga la tasa de localización.

Gestión documental y analítica de texto

El mismo motor aplicado a información que no viene en filas y columnas
Extracción estructurada

De PDF, actas y oficios a un CSV con campos definidos por usted

Clasificación y etiquetado

Asignar categorías a un corpus según un esquema propio, no genérico

Resumen con trazabilidad

Síntesis que cita el documento y la página de cada afirmación

Análisis de sentimiento

Sobre respuestas abiertas de encuestas o reclamos ciudadanos

Búsqueda semántica

Preguntar al archivo en lenguaje natural en vez de abrir carpetas

Detección de divergencias

Contrastar versiones de un mismo documento y señalar diferencias

La cautela cambia de forma: en texto no hay una N que verificar. Lo que hay que auditar es qué quedó fuera del corpus.
Enlazar con el encuentro previsto sobre análisis de texto y sentimientos. La pregunta de control en texto no es cuántos nulos, sino qué documentos no llegaron al corpus y por qué.

El IDE no desaparece: cambia de función

Antes
80 % escribir
20 % inspeccionar

Mucho tiempo dentro del editor,
bajo valor por minuto.

Ahora
~0 % escribir
100 % inspeccionar

Poco tiempo dentro del editor,
valor por minuto altísimo.

Cuanto más autónomo el agente, más necesaria la superficie de inspección humana.
El tiempo total en el IDE baja mucho. El valor por minuto dentro del IDE sube muchísimo. No es lo mismo que volverse irrelevante.

Cómo llevarlo al aula

Un recorrido de 25 minutos que atraviesa las tres superficies
1DespacharEn Antigravity 2.0: lanzar una tarea real sobre el CSV. Mientras corre, explicar la anatomía del prompt analítico usando el que se acaba de escribir.
2Revisar el ArtifactVolver al resultado y preguntar a la clase: quién confía en esto, y qué verificaría antes de firmarlo.
3Abrir el IDEBuscar en los datos lo que el agente no reportó. Con el caso Berkeley el hallazgo está garantizado.
4Cerrar en terminalCorrer agy sobre la misma carpeta: mismo motor, sin interfaz. Deja planteado el encuentro de agentes CLI.
Tener una conversación ya ejecutada de respaldo: las cuotas del plan gratuito se agotan rápido.
El paso 3 es el núcleo de la clase: el agente hizo todo bien y la conclusión estaba invertida. El paso 4 solo necesita 2 minutos.

Instalación de las tres superficies

Todo sale de antigravity.google/download — cada producto se descarga por separado
Antigravity 2.0
Agent Manager
  • Instalador para su sistema desde la página de descarga
  • Iniciar sesión con cuenta Google
  • Open Folder → apuntar a la carpeta del proyecto

Ícono con fondo blanco

Antigravity IDE
Editor
  • Sección Antigravity IDE de la misma página
  • Se instala junto a la 2.0, no la reemplaza
  • Botón Open IDE salta entre ambas

Ícono con rejilla negra

agy
CLI
  • PowerShell: irm .../cli/install.ps1 | iex
  • macOS/Linux: curl -fsSL .../cli/install.sh | bash
  • Abrir terminal nueva → agy --version

Binario único, sin admin

Requisitos: Windows 10 (64 bits) o superior, macOS 12+, Linux con glibc 2.28+. Chrome instalado y cuenta Gmail personal para el agente de navegador.
Si ya tenían Antigravity 1.x, la actualización convierte la app en 2.0 y pregunta si desean conservar el IDE: hay que responder que sí. Los dos íconos se distinguen por el fondo.

El agente automatizó
la producción,
no la responsabilidad.

Despache en el Manager. Verifique en el IDE. Firme usted.
Cierre. Enlazar con los tres modos de uso del LLM: delegación, auditable, revisor. La herramienta cambia el modo por defecto; la elección sigue siendo del analista.
← → avanzar · N notas · S vista docente · O índice · F pantalla completa

Notas del orador