Sistemas agénticos en producción con guardrails deterministas.
Kevin
Bayter
Construyo sistemas de IA que sobreviven a producción.
AI Engineer y líder técnico. Modernizo plataformas críticas de pagos y alto tráfico en Mercado Libre y WOM Colombia, y diseño agentes con guardrails deterministas donde un error no es opción.
Competencias
Del diseño de agentes con guardrails deterministas a plataformas de pagos resilientes: profundidad en todo el stack.
Flujos reactivos y transaccionales de alto tráfico.
Políglota con foco en JVM, Go y TypeScript.
Infraestructura como código, on-premise y multi-cloud.
Diagnóstico rápido y aplicaciones endurecidas.
Calidad automatizada de la UI a la base de datos.
Infraestructura
Construí desde cero la plataforma on-premise del equipo: un clúster Kubernetes gestionado de forma declarativa, con gateway de APIs, TLS automático, datos en alta disponibilidad y observabilidad completa. Todo lo que ves animado abajo corre en producción.
- Gateway de APIs con autenticación, rate-limiting y TLS automático emitido por cert-manager.
- Postgres en alta disponibilidad con operador, Redis para caché y colas, y registry privado de imágenes firmadas.
- Prometheus y Grafana con métricas, dashboards y alertas para cada servicio del clúster.
La plataforma de despliegues
Diseñé y construí la plataforma interna con la que despliega todo el equipo: de un push a producción con entornos efímeros, secretos gestionados, un bot en el chat y auditoría de cada paso.
Deploy de extremo a extremo
Un push dispara el pipeline completo: build con tests, imagen firmada en el registry privado, despliegue a un namespace efímero aislado, smoke tests automáticos y promoción a producción.
- Cada feature obtiene su propio entorno efímero con URL propia, creado y destruido automáticamente.
- Nada llega a producción sin pasar los smoke tests del entorno efímero.
- Rollback a la versión anterior en un clic, con historial completo.
Gestión de secretos
Los secretos viven cifrados en un almacén central con acceso por rol y se inyectan en los pods en tiempo de despliegue. Nunca tocan un repositorio y se enmascaran en cualquier log.
- Rotación de credenciales sin tocar código ni redesplegar a mano.
- Cada servicio solo ve los secretos que le corresponden.
- Auditoría de quién accedió a qué y cuándo.
El bot de despliegues
Un bot integrado en el chat del equipo ejecuta despliegues, rollbacks y consultas de estado con un comando. Valida permisos contra la plataforma y responde con el resultado del rollout en tiempo real.
- Desplegar desde el chat elimina fricción: sin abrir consolas ni dashboards.
- Permisos por rol: cada quien solo puede operar sus servicios.
- Notifica proactivamente incidentes de salud de los despliegues.
Arquitectura interna
UI web y bot hablan con un API central; los trabajos pesados (builds, rollouts, smoke tests) corren en workers asíncronos coordinados con colas Redis, desplegando tanto al clúster on-premise como a EKS en la nube.
- Multi-destino: el mismo flujo despliega a on-premise y a la nube.
- Workers asíncronos: la UI nunca se bloquea esperando un rollout.
- Todo evento queda en un log de auditoría inmutable.
Cómo la construí
Spec-driven development con orquestación de agentes de IA: cada funcionalidad nace de un spec ejecutable que varios agentes implementan en paralelo, con puertas de calidad deterministas antes de llegar a producción.
- El spec define el objetivo y los criterios de aceptación antes de escribir código.
- Varios agentes de IA trabajan en paralelo, cada uno con una parte del spec.
- Nada se fusiona sin pasar tests, lint de arquitectura y revisión humana.
Calidad y entrega
Cómo pruebo y entrego software: E2E con Playwright contra el build real y pipelines de CI/CD con calidad en paralelo, del commit al despliegue.
E2E con Playwright
Los smoke tests E2E corren contra el build real de producción servido en local, con el backend mockeado dentro del propio navegador: rápidos, deterministas y sin depender de entornos externos. El flujo crítico completo se verifica en un navegador de verdad antes de cada merge.
- Capa separada de los unit tests: prueba el build empaquetado, no el código fuente.
- Trace y screenshots se guardan solo cuando algo falla — artefactos ligeros, depuración completa.
- Los mismos tests bloquean el merge en CI: si el flujo crítico se rompe, no se integra.
Pipelines de CI/CD
Frontend y backend comparten la misma filosofía: calidad en paralelo (lint, unit, e2e, análisis estático y umbral de cobertura), build de imagen sin privilegios y despliegue a través de la plantilla compartida de la plataforma — que también aporta el job de rollback.
- Jobs de calidad en paralelo con caché por rama: feedback en minutos, no en horas.
- Nada se despliega sin pasar el stage de calidad completo.
- Plantilla común de la plataforma: deploy y rollback idénticos en todos los repositorios.
Objetivos cumplidos
Resultados medibles de la infraestructura y la plataforma, verificados en producción.
Trayectoria
Mi historia como un git log: la rama main es experiencia, learn es educación. Haz clic en cada commit para ver el detalle.
Lidero la modernización de la capa de pagos e integraciones con servicios core del negocio (APISIX, manejo de secretos, observabilidad), usando Redis para caché e idempotencia en flujos transaccionales críticos.
- Creé la plataforma interna de despliegues adoptada por todo el equipo: orquesta Kubernetes on-premise y AWS/EKS, IaC, secretos y trazabilidad de cambios entre ambientes.
- Estandaricé la entrega de software para múltiples equipos con rollouts auditables de extremo a extremo, reduciendo fricción y errores manuales en producción.
- Impulso la adopción de IA en el ciclo de ingeniería: revisión de código asistida, análisis de alertas y automatización de tareas operativas.
- Apoyo la evolución del ecosistema BSS y de pagos con foco en resiliencia, escalabilidad y continuidad operativa.
Certificación en computación en la nube con AWS y Azure: arquitectura, servicios administrados y buenas prácticas multi-cloud.
- Diseño de arquitecturas cloud y estrategias de despliegue multi-cloud.
Desarrollé soluciones backend y front-end con Go, Node.js, TypeScript y Next.js para automatizar flujos internos y mejorar la experiencia de usuarios y equipos operativos.
- Integré herramientas de observabilidad y gestión de incidentes (Datadog, New Relic, Grafana, Opsgenie), reduciendo tiempos de diagnóstico y respuesta.
- Trabajé en servicios de alto tráfico usando Redis como caché distribuido, almacenamiento de sesiones y rate limiting para proteger APIs críticas.
- Colaboré en automatizaciones con IA para análisis de alertas y generación de tickets, mejorando la productividad del equipo.
- Apliqué prácticas de seguridad en el ciclo de desarrollo: validaciones, revisiones y pruebas para aplicaciones sensibles.
Formación en ingeniería de sistemas cursada en paralelo a mi carrera profesional, con proyectos reales de software.
- Sistema de gestión de tickets para operaciones aeroportuarias.
- App de gestión de membresías de gimnasio con pagos y seguimiento.
- Librería dinámica con la API de ChatGPT para automatizar generación de SEO en sitios web.
Bootcamp intensivo de desarrollo full-stack con tecnologías modernas y metodologías ágiles.
- Múltiples proyectos full-stack con React, Node.js y PostgreSQL; APIs REST y trabajo en equipo ágil.
Soporte técnico de software y hardware, atención de tickets de empresas aliadas y soluciones por conexión remota.
- Reduje el downtime de sistemas con mantenimiento y monitoreo proactivo; documenté procedimientos técnicos.
Proyectos
Sistemas reales en producción que demuestran arquitectura, IA aplicada y criterio de ingeniería.
TuRenta AI
turenta.tax ↗Plataforma open source que automatiza la declaración de renta en Colombia (formulario 210): agentes de IA extraen los datos de la exógena y los certificados, entrevistan al usuario y un motor fiscal 100% determinista liquida el impuesto — en un dominio donde una alucinación es un problema legal.
- Arquitectura hexagonal con fronteras forzadas por ESLint y tests de arquitectura.
- Golden test que reproduce casilla por casilla una declaración real como garantía de exactitud.
- Workers asíncronos con Redis para colas, rate limiting y sesiones.
Plataforma de despliegues
Plataforma interna adoptada por todo el equipo de desarrollo: orquesta despliegues a Kubernetes on-premise y AWS/EKS, gestiona infraestructura como código, secretos y trazabilidad de cambios entre ambientes, con rollouts auditables de extremo a extremo.
Feedback360
Plataforma completa de gestión de feedback profesional: equipos con niveles de visibilidad (público, privado, corporativo), notificaciones en tiempo real, login con Google y OTP, gestión de objetivos y dashboard administrativo.
Hablemos
¿Buscas un AI Engineer que también sepa operar pagos, Kubernetes y observabilidad en producción? Escríbeme.