Carlos Hernández

Head of AI Platform Engineering · San Salvador
UTC−6 · ES / EN

Construyo las plataformas sobre las que corren sistemas LLM — observables, versionadas, costeadas, borrables.

Ocho años en infraestructura de producción — DevOps y plataforma a escala, y los equipos detrás — ahora apuntados a la IA en producción. Dos carriles que se refuerzan: lidero AI Platform Engineering en EsePlus / Alilo, y construyo plataformas de entrega y de agentes como DevOps engineer en Deckers Brands. Lo escaso no es ninguna de las dos mitades — es aplicar disciplina de plataforma a sistemas que son no deterministas por naturaleza.
I En producción
Motores de IA agnósticos y componibles
Construidos en EsePlus / Alilo · Head of AI Platform Engineering
Dos motores de IA que diseñé y de los que soy dueño end-to-end, expuestos como APIs agnósticas y componibles para que el equipo de producto los arme en experiencias. Uno es un backend generativo async que convierte documentos subidos en microlearning corporativo — un pipeline multi-etapa que coordina análisis de documentos, generación de contenido y diseño de actividades, con manejo de backpressure y feedback en streaming. El otro es un asistente conversacional RAG multi-tenant — hybrid retrieval y reranking, estrategias modernas de embeddings, un runtime de agente con tool calling multimodal, y un stack de seguridad defense-in-depth validado por regresión adversarial automatizada.
Resultados: 95% → 99.5% de disponibilidad · 20%+ de reducción de costo cloud · ~90% de ahorro de tokens en reintentos de validación · sub-3s de latencia p50 · cero jailbreaks en testing adversarial.
Clarytia — IA de conocimiento interno verificable
Producto propio · diseñado, construido y auditado en solitario
Una plataforma RAG multi-tenant que convierte los documentos de una empresa en un asistente que responde con la fuente, la página y un nivel de confianza — y dice "no lo sé" en vez de improvisar. Aislamiento por base de datos por tenant, así que "borrá todo lo de este cliente" es un DROP, no una consulta que hay que rezar para que cubra todas las tablas. Cinco carriles de ranking fusionados por Reciprocal Rank Fusion en una sola consulta SQL — sin servicio de búsqueda externo, sin un salto de red más. El control de acceso se aplica dentro de la ruta de recuperación, no como filtro posterior. Y hace algo que casi ninguna herramienta de conocimiento hace: cuando genuinamente no puede responder, eso se vuelve un vacío de conocimiento agrupado y nombrado — te dice qué le falta a tu documentación, rankeado por cuánta gente distinta chocó con eso.
Resultados: 2,814 tests automatizados con >90% de cobertura · 37 architecture decision records · 105 endpoints de API · cero fugas en un red team generativo que corre como gate en cada deploy · construido en 5 meses, autor único.
Plataforma self-service de agentes SRE
Cliente enterprise · detalles bajo NDA
Una plataforma que provisiona un agente de respuesta a incidentes con alcance por equipo — sus integraciones, sus permisos y su comportamiento — desde un solo bloque de configuración. Dar de alta un equipo es un merge request, no un proyecto. La parte que más defendería: los playbooks y las instrucciones permanentes del agente se entregan como paquetes versionados pineados por agente, así que cambiar cómo se comporta un agente es un diff revisado con aprobador — no un pegado en una caja de texto de consola que nadie puede auditar ni revertir. Toda integración es de solo lectura por construcción: el agente recomienda, los humanos actúan.
La apuesta de fondo: lo que controlás no es el modelo — es el contexto del modelo y sus instrucciones. La plataforma no opera ningún modelo propio, a propósito.
Plataforma compartida de entrega CI/CD
Cliente enterprise · detalles bajo NDA
No un pipeline — una plataforma de entrega. Una biblioteca de componentes CI/CD reutilizables (instalación, linting, testing, build, deploy) que cualquier repositorio de la organización consume con tres líneas de configuración, con tres repositorios consumidores corriendo sobre ella en producción. Despliegue ruteado por rama a sandboxes por equipo, métricas DORA instrumentadas de punta a punta, y un refactor de rendimiento que salió de medir en vez de intuir: el quality gate se movió aguas abajo, porque el build nunca leyó la salida del lint — el lint bloquea la publicación, no la compilación.
Resultados: −52% de wall clock del pipeline · −54% de tiempo de runner · −62% de jobs por pipeline — medido p50 sobre una ventana de 14 días, no una corrida con suerte.

El trabajo marcado bajo NDA se describe solo por sus patrones de ingeniería y sus resultados. El estate del cliente, la topología de infraestructura, los términos con proveedores y las cifras de costo se quedan donde corresponde.

II Field notes
Jul '26 El modelo corre en tu navegador ES
5 min

El clasificador ganador pesa 1,3 MB, así que corre en el navegador — sin servidor, $0 de servir, y datos bancarios que nunca salen del dispositivo. Por qué dónde corre un modelo decide más que cuál modelo es, y los $3.024 al año que cuesta una GPU dedicada para ser la opción menos precisa.

Jul '26 El transformer no valió la pena ES
5 min

Hice fine-tuning de DistilBERT contra un modelo lineal. En texto limpio McNemar dio p=1,00 — un empate técnico, que significaba que el benchmark había dejado de medir. Así que lo rompí con ruido realista, y ganó el modelo 356× más pequeño. La redundancia le ganó a la sofisticación.

Jun '26 Cuándo gana lo clásico ES
4 min

Multipliqué los datos de entrenamiento por 7.4× y el F1 se movió cuatro centésimas de punto. Un benchmark NLP controlado sobre qué limita de verdad un problema — y el modelo más barato que le queda ganándole al impresionante que no justifica su costo.

Jun '26 Un jailbreak es un regression test, no una sorpresa ES
6 min

Casi toda la seguridad de IA en producción es una sola frase sin probar. Lo que cambió cuando empecé a tratar cada ataque que funcionaba —fictional-framing, override de instrucciones, inyección— como un regression test que corre para siempre. 442 casos, cero pasan.

Jun '26 "Deletable": la palabra más importante en sistemas LLM ES
6 min

Puedes borrar el documento. Sus embeddings, cached answers y summaries se quedan. Las cuatro capas de la deletability, la decisión de arquitectura que vuelve "borra todo" una sola línea, y el cache que sobrevivió a un tenant que creí borrado.

May '26 Los prompts merecen migraciones, no improvisación ES
5 min

Las migraciones de schema tienen versionado, rollback y un historial. La mayoría de los prompts en producción no. Qué cambió cuando empecé a tratarlos igual, y dónde se rompió primero.

III Investigación
NLP comparativo para clasificación de transacciones
Tesis de máster · Universitat de Barcelona (OBS) · defensa Sep 2026
Evaluación comparativa de cuatro enfoques de NLP para la categorización automática de transacciones bancarias — desde baselines clásicos (TF-IDF + SVM, XGBoost) y redes neuronales basadas en embeddings hasta fine-tuning de transformers (DistilBERT), juzgados por precisión, robustez a texto ruidoso, significancia estadística y costo total de propiedad. Ganó el modelo lineal: empata al transformer en texto limpio, le gana bajo ruido, y se despliega como un modelo ONNX de 1,3 MB que corre en el navegador. Leer las field notes →
IV Charlas
Cursor + MCP — when your IDE knows your stack
Charla técnica interna · Grabación disponible
2026.02
V Workshop

Construcciones paralelas. De menor alcance que el trabajo de arriba, acá porque las mismas disciplinas aparecen en cualquier tamaño.

Cadence
Un planner local-first que casa GTD con time blocking. Lo construí porque toda app de productividad o pelea con tu método o asume que todavía no tienes uno. Funciona offline, sincroniza entre dispositivos vía Realtime, ⌘K hace todo.
Next.js · Supabase · TypeScript · cadence.carloshdez.com
Fitness Dashboard
Un tracker personal de entrenamiento y composición corporal — rutina dividida, metas de recomposición, progreso observable. El dashboard que quería pero no encontraba como app.
React · Tailwind · personal
VI Sobre mí

Soy Head of AI Platform Engineering en El Salvador. Trabajo desde el mismo escritorio donde empecé en infraestructura cloud hace ocho años. Los sistemas crecieron, los equipos detrás también — pero los principios no. Solo cambió la capa donde los aplico.

Me importan los sistemas que puedes operar, no solo demostrar. Los prompts que fallan en voz alta. La observabilidad que sobrevive a la tercera guardia on-call. Las líneas de costo que no explotan la primera vez que una feature agarra tracción.

Fuera del trabajo pago, construyo herramientas pequeñas para mi propia vida — casi siempre con las mismas disciplinas, porque no sé construir software de otra forma.