INGENIERÍA DE DATOS AGÉNTICA
Pipelines de punta a punta
Del ETL al data pipeline agéntico
— y las tres superficies para conducir el mismo motor
Maestría en Analítica de Datos
Dr. Maikel Y. Leyva-Vázquez · Universidad Politécnica Salesiana · agosto de 2026
Quién los va a acompañar
Y por dónde pueden verificar cualquier cosa que yo afirme en clase
Dr. Maikel Yelandi Leyva Vázquez
Formación
Doctor en Ciencias Técnicas — Universidad de las Ciencias Informáticas, La Habana (2013)
Máster en Bioinformática (INSTEC) · Ingeniero en Ciencias Informáticas
Docencia e investigación
Coordinador Académico de Posgrado — Universidad Bolivariana del Ecuador
Investigador colaborador — Universidad de Guayaquil · Universidad Bernardo O'Higgins, Chile
Dirección editorial
Editor-in-Chief — Neutrosophic Sets and Systems (University of New Mexico, Scopus Q1)
Editor-in-Chief — Neutrosophic Computing and Machine Learning
«La herramienta se elige por el problema, nunca al revés.» Es lo único que les voy a pedir desde el primer día.
No leer la diapositiva. El punto de ponerla no es el currículum: es que sepan dónde verificar. En una materia cuyo eje es «no acepte una salida sin auditarla», sería incoherente pedir que me crean a mí sin darles la fuente.
Decirlo así, en voz alta: todo lo que yo afirme en clase se puede contrastar en esos enlaces, y si encuentran una discrepancia, quiero saberla.
Deliberadamente no hay índice h en la diapositiva. Ante estudiantes de maestría el índice h no construye autoridad; la construye el criterio de trabajo que anuncia la línea de abajo. Quien quiera el número lo tiene a un clic.
La materia
Análisis, Explotación y Visualización de Datos · 409754 · Maestría en Analítica de Datos
Unidad 1
Captura y extracción con procesos ETL
Del portal de datos abiertos al tablero. Pentaho para el pipeline declarado, DuckDB para verificarlo y agentes para acelerarlo.
Termina en un dato limpio del que usted responde.
Unidad 2
Fundamentos de IA en gestión documental
Enseñarle a una máquina a leer: OCR, extracción estructurada, clasificación y un archivo al que se le pregunta en lenguaje natural.
Termina en un expediente que cita su fuente.
El recorrido completo: documento o portal → OCR o ETL → base de datos → archivo consultable
25 %Arquitectura
20 %Calidad
20 %Gobernanza
15 %Reproducibilidad
10 %Eficiencia
10 %Criterio
Dos cosas que conviene que queden dichas hoy y no en la semana seis.
La primera: las dos unidades no son dos materias pegadas. Es un solo recorrido, del documento crudo al dato consultable, y el proyecto integrador lo atraviesa entero.
La segunda: mirar la fila de porcentajes en voz alta. Que el pipeline corra no da puntos: es la condición de entrada. Los puntos están en por qué eligió esa arquitectura, qué hizo con los datos personales y qué decidió no automatizar.
Ocho palabras que vamos a usar todo el semestre
No hace falta memorizarlas hoy. Sí hace falta que ninguna les suene rara en la semana tres
Data pipeline
El género. Traer datos, procesarlos y dejarlos donde generen un producto.
ETL / ELT
Dos secuencias posibles de ese pipeline. Cambia dónde se transforma, no qué se hace.
Bronze · silver · gold
Tres estados del dato: crudo, conformado y listo para decidir. No son tres carpetas.
Completitud ≠ validez
Una columna sin un solo hueco puede estar llena de valores que no son datos.
Centinela
Un valor que finge ser dato: «SIN DATO», «N/A», 9999-12-31. Pasa cualquier control de nulos.
Integridad referencial
Un pago a nombre de alguien que no aparece matriculado es un huérfano. Alguien decide qué hacer con él.
Reproducibilidad
Si no se puede volver a correr y dar lo mismo, no es un pipeline: es una anécdota.
Harness
Lo que le da manos al modelo: abrir archivos, ejecutar, verificar. Antigravity y agy son harnesses.
No explicar las ocho ahora: se quema la clase. Leerlas rápido y anunciar que cada una va a aparecer con un caso concreto.
Las dos que conviene marcar hoy son «completitud ≠ validez» y «centinela», porque el Taller 1 se juega ahí: la columna de fecha de matrícula no tiene un solo nulo y aun así cinco de sus valores no son fechas. Si entienden eso, entendieron el curso.
«Harness» está en la lista para que la palabra no les suene rara cuando aparezca en la diapositiva del ecosistema.
Ingeniería de datos agéntica
Construir pipelines de punta a punta con IA:
qué automatiza cada superficie y qué sigue siendo suyo
Ecosistema para Analítica de Datos
Encuadre: no vamos a aprender una herramienta, vamos a discutir un cambio en la división del trabajo entre analista y máquina.
El ecosistema, en cuatro capas
Sale una herramienta casi todos los días. No hace falta conocerlas: hace falta saber en qué capa caen
Modelos
El cerebro
Reciben texto, imagen o audio y devuelven texto.
Claude · GPT · Grok
Kimi · Gemini
Harnesses
Las manos
Le dan al modelo acceso real: abrir, ejecutar, verificar.
Claude Code · Codex
OpenCode · Gemini CLI
Antigravity · agy
Asistentes
El acompañamiento
Agentes que siguen el trabajo de forma continua.
Hermes · OpenClaw
Orquestadores
La coordinación
Coordinan varios agentes a la vez.
Orca · Herder · Crowbot
Un pipeline ETL no es ninguna de las cuatro: es una aplicación — lo que usted construye usando las capas.
Taxonomía tomada del video de Fazt Code, «Cómo categorizo todas las herramientas de IA que surgen» (25-ago-2026).
El valor no está en la lista de nombres, que caduca en semanas, sino en el criterio: de cualquier herramienta nueva, preguntar si piensa, si actúa, si acompaña o si coordina.
Insistir en la caja inferior: la pregunta «¿el ETL agéntico reemplaza a Pentaho?» está mal planteada, porque compara una aplicación con una herramienta.
Qué vamos a usar en esta materia
Cada elección es de disponibilidad y de gobernanza, no de moda
El motor por defecto de Antigravity. Contexto largo y multimodal: hace falta para leer un PDF escaneado y un CSV en la misma sesión.
Harness
Antigravity 2.0 · IDE · agy CLI
Las tres superficies del mismo motor, y las tres se instalan: se despacha en la app, se verifica en el IDE, se automatiza en la terminal.
Se explican para que reconozcan la capa. Hermes y OpenClaw acompañan trabajo continuo; en diez semanas no hay continuidad que acompañar.
Orca, Herder o Crowbot coordinan flotas de agentes. Con 18 estudiantes y un portátil cada uno, la coordinación la hacen ustedes.
Y una quinta cosa que no es capa: OpenRouter. Es una pasarela de modelos — un conmutador que deja cambiar de cerebro sin tocar el harness.
Dos confusiones frecuentes que conviene decir en voz alta:
1) agy NO es un orquestador. Es un harness, la misma capa que Antigravity y que Gemini CLI: lo que hace es darle manos a un modelo. Que pueda lanzar subagentes no lo mueve de capa.
2) OpenRouter tampoco es un orquestador. Es una pasarela: un único punto de acceso a muchos modelos. No coordina agentes, conmuta cerebros.
Si algún estudiante los ubica en la capa 4, ésta es la corrección. La prueba es la pregunta del criterio: ¿coordina a otros agentes? No.
ETL ya no es el marco. Es un caso particular
El género es el data pipeline; ETL y ELT son dos de sus secuencias posibles
ETL
Transformar antes de guardar
Se extrae, se transforma en un motor aparte y recién después se carga.
Es lo que dice el sílabo y lo que hace Pentaho. Sigue siendo válido.
ELT
Guardar y transformar dentro
Se carga primero al almacén y la transformación ocurre allí, en SQL.
Es lo que haremos con DuckDB: el archivo se consulta donde está.
Pipeline agéntico
Objetivo declarado
El orden deja de fijarse por adelantado: se declara el resultado y el agente arma el camino.
No siempre cabe en tres letras.
«El flujo extraer-transformar-cargar es una subcategoría de un data pipeline.»
Needham, Hunger y Simons, DuckDB in Action, cap. 8 — el libro obligatorio de la materia
Aquí se corrige la letra del sílabo sin contradecirla. El sílabo dice ETL porque ETL fue el nombre de la práctica durante veinte años. El libro del curso dice, textualmente, que ETL es una SUBCATEGORÍA de un data pipeline.
Pregunta para la clase: si cargamos el CSV en DuckDB y transformamos allí, ¿qué letra va primero? La respuesta correcta es que la pregunta está mal planteada. Elegir entre ETL y ELT es decidir dónde gastar el cómputo, no qué es el trabajo.
No presentarlo como que el sílabo está equivocado: presentarlo como que ETL es el caso que le dio nombre a la familia.
Un pipeline de punta a punta, con IA en cada tramo
El agente entra en los cuatro tramos. La decisión de la fila de abajo, en ninguno
Ingestión
Transformación
Orquestación
Producto
EL AGENTE EJECUTA
Descarga, APIs, PDF, XLSX
SQL en DuckDB, joins, reglas
Orden, dependencias, reejecución
Tablero, informe, archivo consultable
USTED DECIDE
Elegir la fuente y su licencia
Definir la unidad de análisis
Fijar qué corre y cuándo
Juzgar si el resultado tiene sentido
Esta es la diapositiva que da nombre a la sesión. «De punta a punta» no significa «sin humano»: significa que ya no queda un tramo del pipeline donde el agente no pueda entrar. Lo que no cambia es quién firma.
Conectar con la Fase 0: el diagnóstico con DuckDB es lo que convierte la fila de abajo en algo verificable y no en una opinión. Sin línea base, cuando el agente afirme cuántos duplicados hay, usted no tiene con qué contradecirlo.
Tres formas de conducir al mismo agente
Cambia la interfaz y el ritmo de trabajo, no el motor que ejecuta
Agent Manager
Asíncrono
- Usted define objetivos, no escribe código
- Hasta 5 agentes en paralelo
- Avisa cuando necesita input
- Entrega Artifacts revisables
Editor / IDE
Síncrono
- Fork de VS Code: extensiones y atajos
- Árbol de archivos, terminal, diffs
- Autocompletado y comandos en lenguaje natural
- Agente contextual en panel lateral
agy · CLI
Terminal / headless
- Binario único, sin interfaz gráfica
- Subagentes y comandos de barra
- Invocable desde un script o pipeline
- Sesiones exportables a la app
Insistir: no son herramientas rivales. Apunte las tres a la misma carpeta y lo que escribe una aparece en las otras. Lo que no se comparte es el historial de conversación.
Cuatro superficies, un solo motor
Todas comparten el mismo agent harness: los permisos y las skills se sincronizan entre ellas
Antigravity 2.0
App de escritorio
Torre de control. Agentes en paralelo, tareas programadas.
INSTALADO
Antigravity IDE
Editor
Fork de VS Code. Inspección, diffs, terminal, extensiones.
INSTALADO
agy
CLI en terminal
Mismo motor sin GUI. Subagentes y comandos de barra.
PENDIENTE
SDK
Librería Python
Construir agentes propios sobre el mismo runtime.
OPCIONAL
El punto conceptual: el agente ya no vive dentro de una aplicación. La aplicación es solo la ventana por la que uno lo mira. Mencionar que el Agent Manager dentro del IDE será descontinuado en favor de la app 2.0.
En qué cambia el trabajo
| Agent Manager | Editor / IDE | agy · CLI |
| Su rol | Arquitecto, supervisor | Analista, revisor | Operador, automatizador |
| Ritmo | Asíncrono, en paralelo | Síncrono, secuencial | Síncrono o headless |
| Unidad de trabajo | Tarea completa | Archivo, celda, línea | Comando o sesión |
| Ve el detalle | No — resumen y artefactos | Sí — todo el estado | Sí — diffs y logs en texto |
| Reproducible | Conversación: no se re-ejecuta | Script: determinista | Invocable desde un pipeline |
La última fila es la que más importa para producción académica: un chat no se versiona ni se audita.
Cuánta correa darle al agente
Cuatro modos configurables — la decisión no es técnica, es de gobernanza
1Strict
Pide permiso antes de casi cada acción. Lento, pero nada ocurre sin que usted lo vea.
2Review-driven
Trabaja solo y se detiene en los puntos de decisión. Es el modo recomendado por defecto.
3Agent-driven
Nunca solicita revisión. Corre de principio a fin y presenta el resultado.
4Custom
Usted define qué clases de acción requieren aprobación explícita.
Demo: mostrar esta misma pantalla en vivo. Preguntar a la clase cuál elegirían para un análisis que va a publicarse.
La asimetría del oráculo
Por qué la autonomía rinde distinto en desarrollo que en analítica
Desarrollo de software
¿Funciona?
- El código compila o no compila
- Los tests pasan o fallan
- La página carga o no carga
- El agente cierra su propio ciclo
Verificación automatizable
Analítica de datos
¿Es verdad?
- Un análisis equivocado corre perfectamente
- Un modelo mal especificado da R² alto
- Una muestra truncada da coeficientes limpios
- Nadie cierra el ciclo salvo usted
Verificación irreductiblemente humana
Esta es la diapositiva bisagra. El navegador integrado de Antigravity verifica que el botón funcione. Nada verifica que la inferencia sea válida.
El código corre. La conclusión está invertida.
Admisiones de posgrado, UC Berkeley, 1973 — tasa de admisión (%)
TOTAL
Depto A
Depto B
Depto C
Depto D
Depto E
Depto F
HombresMujeres
Agregado
Los hombres son admitidos más que las mujeres.
Por departamento
En cuatro de seis, las mujeres son admitidas más. El sesgo estaba en a qué departamento se postulaba.
Ningún test unitario atrapa esto.
Paradoja de Simpson. Cada paso del cómputo es correcto. El agente puede ejecutarlo todo bien y reportar lo contrario de lo que ocurre. Aquí es donde se abre el IDE.
Lo que el agente no le va a decir
Cinco preguntas que ningún resumen automático contesta solo
1¿Cuántos nulos por columna?El agente reporta la salida final, no lo que descartó en el camino.
2¿Cambió la N?Un dropna() silencioso altera la muestra sin aparecer en el reporte.
3¿Hay censura a la derecha?Datos que siguen actualizándose sesgan cualquier tasa calculada sobre ellos.
4¿Qué versión del archivo usó?Solo el árbol de archivos y el diff lo confirman.
5¿Qué imputó y con qué supuesto?El agente reporta todo con confianza uniforme: no separa lo que sabe de lo que supuso.
La quinta es la más profunda: colapsar la indeterminación en el reporte. El agente no distingue entre dato observado y valor imputado.
El marco 4D: cómo se trabaja con un agente
Cuatro competencias. Las cuatro se califican en esta materia, aunque no lleven ese nombre en la rúbrica
Delegación
Delegation
Decidir qué se le entrega y qué no.
En esta materia
Es la fila «usted decide» del pipeline. Los 12 pagos huérfanos no se delegan: son una regla de negocio sobre dinero.
Descripción
Description
Decirle con precisión qué se quiere.
En esta materia
La plantilla del prompt analítico: objetivo, fuentes, claves, reglas, criterios de calidad, destino y política de errores.
Discernimiento
Discernment
Juzgar lo que vuelve.
En esta materia
Las cinco preguntas de la diapositiva anterior. Y el caso Berkeley: el cómputo correcto con la conclusión invertida.
Diligencia
Diligence
Responder por el resultado.
En esta materia
El acta de descartes: declarar qué se perdió y por qué. El pipeline lo corre el agente; la firma es suya.
La certificación «AI Fluency: Framework & Foundations» está en el aula como tarea. No es un trámite: es el vocabulario de esta unidad.
Marco de Rick Dakan (Ringling College) y Joseph Feller (University College Cork) con Anthropic · CC BY-NC-SA 4.0
Esta diapositiva es la respuesta a la anterior. Allí quedó el problema —lo que el agente no le va a decir—; aquí está el marco para hacer algo con él.
Lo que conviene subrayar: de las cuatro competencias, la que casi nadie entrena es la primera. Todo el mundo cree que el problema es escribir mejores prompts (Descripción), y el problema real suele ser haber delegado algo que no debía delegarse.
Aclarar la atribución si alguien pregunta: el marco no es de Anthropic en solitario. Lo formularon Rick Dakan y Joseph Feller en colaboración con Anthropic, y está publicado con licencia abierta. La certificación del aula es gratuita.
Enlazar con la rúbrica: Gobernanza (20 %) es Delegación y Diligencia; Pensamiento crítico (10 %) es Discernimiento.
El agente dentro del pipeline
La captura y extracción dejan de ser scripts que se escriben y pasan a ser objetivos que se declaran
Extracción
Limpieza
Transformación
Carga
Verificación
▸ EL AGENTE EJECUTA
Descarga, paginación de API, scraping, lectura de PDF y XLSX
Tipos, duplicados, encoding, normalización de nombres
Joins, agregaciones, derivación de variables
Escritura a CSV, Parquet, base de datos
Conteos, rangos, pruebas de integridad
▸ USTED DECIDE
Elegir la fuente y su licencia
Decidir qué hacer con los nulos
Definir la unidad de análisis
Fijar el esquema final
Juzgar si el resultado tiene sentido
El punto: ninguna de las decisiones de la fila inferior es automatizable, porque todas dependen de la pregunta de investigación, no del archivo.
Caso: Datos Abiertos Ecuador
datosabiertos.gob.ec — cerca de 400 conjuntos de datos de unas 70 instituciones públicas
Un solo objetivo
Descarga el conjunto de personas desaparecidas del portal de datos abiertos. Perfila nulos por columna, normaliza provincias, calcula tasa de localización por año y provincia, y entrega un dashboard HTML con el script reproducible.
Un objetivo en lenguaje natural sustituye a un pipeline de varios archivos.
1Subagente 1
Descarga y perfila: filas, columnas, nulos, rangos de fecha
2Subagente 2
Normaliza y transforma: provincias, tipos, variables derivadas
3Subagente 3
Visualiza y documenta: gráficos, dashboard, script final
El dataset de personas desaparecidas del Ministerio del Interior está publicado en ese portal. Advertir la censura a la derecha: los registros recientes siguen actualizándose, lo que sesga la tasa de localización.
Gestión documental y analítica de texto
El mismo motor aplicado a información que no viene en filas y columnas
Extracción estructurada
De PDF, actas y oficios a un CSV con campos definidos por usted
Clasificación y etiquetado
Asignar categorías a un corpus según un esquema propio, no genérico
Resumen con trazabilidad
Síntesis que cita el documento y la página de cada afirmación
Análisis de sentimiento
Sobre respuestas abiertas de encuestas o reclamos ciudadanos
Búsqueda semántica
Preguntar al archivo en lenguaje natural en vez de abrir carpetas
Detección de divergencias
Contrastar versiones de un mismo documento y señalar diferencias
Enlazar con el encuentro previsto sobre análisis de texto y sentimientos. La pregunta de control en texto no es cuántos nulos, sino qué documentos no llegaron al corpus y por qué.
El IDE no desaparece: cambia de función
Antes
80 % escribir
20 % inspeccionar
Mucho tiempo dentro del editor,
bajo valor por minuto.
Ahora
~0 % escribir
100 % inspeccionar
Poco tiempo dentro del editor,
valor por minuto altísimo.
Cuanto más autónomo el agente, más necesaria la superficie de inspección humana.
El tiempo total en el IDE baja mucho. El valor por minuto dentro del IDE sube muchísimo. No es lo mismo que volverse irrelevante.
Cómo llevarlo al aula
Un recorrido de 25 minutos que atraviesa las tres superficies
1DespacharEn Antigravity 2.0: lanzar una tarea real sobre el CSV. Mientras corre, explicar la anatomía del prompt analítico usando el que se acaba de escribir.
2Revisar el ArtifactVolver al resultado y preguntar a la clase: quién confía en esto, y qué verificaría antes de firmarlo.
3Abrir el IDEBuscar en los datos lo que el agente no reportó. Con el caso Berkeley el hallazgo está garantizado.
4Cerrar en terminalCorrer agy sobre la misma carpeta: mismo motor, sin interfaz. Deja planteado el encuentro de agentes CLI.
El paso 3 es el núcleo de la clase: el agente hizo todo bien y la conclusión estaba invertida. El paso 4 solo necesita 2 minutos.
Instalación de las tres superficies
Todo sale de antigravity.google/download — cada producto se descarga por separado
Antigravity 2.0
Agent Manager
- Instalador para su sistema desde la página de descarga
- Iniciar sesión con cuenta Google
- Open Folder → apuntar a la carpeta del proyecto
Ícono con fondo blanco
Antigravity IDE
Editor
- Sección Antigravity IDE de la misma página
- Se instala junto a la 2.0, no la reemplaza
- Botón Open IDE salta entre ambas
Ícono con rejilla negra
agy
CLI
- PowerShell:
irm .../cli/install.ps1 | iex - macOS/Linux:
curl -fsSL .../cli/install.sh | bash - Abrir terminal nueva →
agy --version
Binario único, sin admin
Si ya tenían Antigravity 1.x, la actualización convierte la app en 2.0 y pregunta si desean conservar el IDE: hay que responder que sí. Los dos íconos se distinguen por el fondo.
El agente automatizó
la producción,
no la responsabilidad.
Despache en el Manager. Verifique en el IDE. Firme usted.
Cierre. Enlazar con los tres modos de uso del LLM: delegación, auditable, revisor. La herramienta cambia el modo por defecto; la elección sigue siendo del analista.