Carlos Hernández
Construyo las plataformas sobre las que corren sistemas LLM — observables, versionadas, costeadas, borrables.
DROP, no una consulta que hay que rezar para que cubra todas las tablas. Cinco carriles de ranking fusionados por Reciprocal Rank Fusion en una sola consulta SQL — sin servicio de búsqueda externo, sin un salto de red más. El control de acceso se aplica dentro de la ruta de recuperación, no como filtro posterior. Y hace algo que casi ninguna herramienta de conocimiento hace: cuando genuinamente no puede responder, eso se vuelve un vacío de conocimiento agrupado y nombrado — te dice qué le falta a tu documentación, rankeado por cuánta gente distinta chocó con eso.
El trabajo marcado bajo NDA se describe solo por sus patrones de ingeniería y sus resultados. El estate del cliente, la topología de infraestructura, los términos con proveedores y las cifras de costo se quedan donde corresponde.
El clasificador ganador pesa 1,3 MB, así que corre en el navegador — sin servidor, $0 de servir, y datos bancarios que nunca salen del dispositivo. Por qué dónde corre un modelo decide más que cuál modelo es, y los $3.024 al año que cuesta una GPU dedicada para ser la opción menos precisa.
Jul '26 El transformer no valió la penaHice fine-tuning de DistilBERT contra un modelo lineal. En texto limpio McNemar dio p=1,00 — un empate técnico, que significaba que el benchmark había dejado de medir. Así que lo rompí con ruido realista, y ganó el modelo 356× más pequeño. La redundancia le ganó a la sofisticación.
Jun '26 Cuándo gana lo clásicoMultipliqué los datos de entrenamiento por 7.4× y el F1 se movió cuatro centésimas de punto. Un benchmark NLP controlado sobre qué limita de verdad un problema — y el modelo más barato que le queda ganándole al impresionante que no justifica su costo.
Jun '26 Un jailbreak es un regression test, no una sorpresaCasi toda la seguridad de IA en producción es una sola frase sin probar. Lo que cambió cuando empecé a tratar cada ataque que funcionaba —fictional-framing, override de instrucciones, inyección— como un regression test que corre para siempre. 442 casos, cero pasan.
Jun '26 "Deletable": la palabra más importante en sistemas LLMPuedes borrar el documento. Sus embeddings, cached answers y summaries se quedan. Las cuatro capas de la deletability, la decisión de arquitectura que vuelve "borra todo" una sola línea, y el cache que sobrevivió a un tenant que creí borrado.
May '26 Los prompts merecen migraciones, no improvisaciónLas migraciones de schema tienen versionado, rollback y un historial. La mayoría de los prompts en producción no. Qué cambió cuando empecé a tratarlos igual, y dónde se rompió primero.
Construcciones paralelas. De menor alcance que el trabajo de arriba, acá porque las mismas disciplinas aparecen en cualquier tamaño.
Soy Head of AI Platform Engineering en El Salvador. Trabajo desde el mismo escritorio donde empecé en infraestructura cloud hace ocho años. Los sistemas crecieron, los equipos detrás también — pero los principios no. Solo cambió la capa donde los aplico.
Me importan los sistemas que puedes operar, no solo demostrar. Los prompts que fallan en voz alta. La observabilidad que sobrevive a la tercera guardia on-call. Las líneas de costo que no explotan la primera vez que una feature agarra tracción.
Fuera del trabajo pago, construyo herramientas pequeñas para mi propia vida — casi siempre con las mismas disciplinas, porque no sé construir software de otra forma.