Gastón Echenique · Senior Data Engineer

Pipelines que aguantan producción real.

Diseño la infraestructura primero, después los modelos que corren sobre ella. AWS, Azure, Databricks.

Qué construyo
Pipelines de datos
Sistemas batch y streaming diseñados para ingesta y procesamiento confiables.
Plataformas de datos
Arquitecturas lakehouse, modelos de datos y capas de almacenamiento.
Infraestructura
IaC, CI/CD, orquestación y entornos reproducibles.
Sistemas inteligentes
Agentes, tool calling y workflows de datos con LLMs.

Kage no Kaji (影の鍛冶) es "el herrero de las sombras": mi afinidad por Japón, la estética dark/metal y un guiño a Dark Aria, llevados al oficio. Kaji (鍛冶) es forja: fuego, martillo y disciplina hasta que el metal aguanta el golpe. Así pienso la ingeniería de datos: entran datos crudos, la infraestructura los templa, salen productos de datos confiables, construidos para no romperse en producción.

datos crudos
infraestructura
productos de datos confiables
Sobre mí

Senior Data Engineer con base en oceanografía física y sistemas geoespaciales. Empecé mi carrera en la Armada Argentina trabajando con datos hidrográficos y cartas náuticas (formatos S-57/S-100), después pasé por Google X diseñando pipelines de datos agrícolas geoespaciales. Hoy diseño y opero infraestructura de datos en producción para clientes de salud, energía y farma, con foco en AWS, Azure y Databricks. Fuera del trabajo ando aprendiendo a manejarme en skate, mi costado más inesperado. Doy clases en GeoDojo y sigo sumando certificaciones (AWS AI Practitioner, en camino a Claude Certified Architect).

Senior Data Engineer / ML Engineer
2022 — presente
Diseño y opero infraestructura de datos en producción para clientes de salud, energía y farma.
Data Engineer
2021 — 2022
Pipelines de datos geoespaciales para agricultura.
Hidrografía y cartografía náutica
2005 — 2021
Oceanografía y cartas náuticas (S-57/S-100) en el Servicio de Hidrografía Naval — el origen de mi carrera en datos.
Docente
2023 — presente
Principios de ingeniería
Infraestructura primero — construir la plataforma antes de optimizar lo que corre sobre ella.
Reproducibilidad — si solo funciona en mi máquina, no funciona.
La falla es parte del diseño — retries, idempotencia, validación y observabilidad importan.
Productos de datos, no scripts — un pipeline tiene que tener un propósito, una interfaz y un consumidor.
Proyectos
Proyecto
Medallion pipeline en Databricks
Terraform + CI/CD, mismo repo para dev, corriendo y forkeado por otros devs.
Proyecto
Asesor de turismo — Azure Databricks
5 fuentes heterogéneas, Medallion multi-fuente, agente con tool calling + mapa en vivo.
Proyecto
Streaming de satélites en Databricks
SGP4 + Event Hubs + Structured Streaming, Medallion en tiempo real con dashboard nativo en vivo.
Proyecto
Lakebase Multiformato — OLTP en Databricks
5 formatos heterogéneos ingestados a Lakebase (Postgres gestionado), consultables en vivo desde Unity Catalog vía Lakehouse Federation.
Proyecto
Pokedex Agent — Agente Claude con MCP en Databricks
Terraform + Medallion con Data Quality gate, MCP server propio sobre Unity Catalog y agente Claude (Profesor Oak) con hooks y tool_choice reales.
Próximamente
Data Contract Enforcer
Validación de esquemas, cuarentena de registros defectuosos y alertas, con dbt + Great Expectations/Soda Core.