Plataforma & Infra de LLM

Los cimientos que hacen que todo lo demás parezca fácil.

Un agente impresiona en la demo; la plataforma sostiene en producción. La parte del stack que nadie tuitea es la que decide si el sistema sobrevive: el gateway que unifica providers con metering y fallback, los datos que reconcilian al centavo antes del cutover, el deploy que ocurre sin mí en el teclado. Yo construyo esa capa primero — y por eso consigo enviar todo lo demás rápido.

Gateway Multi-LLM API OpenAI-compatible SSE Streaming Metering & Billing PostgreSQL · pgvector ETL & Migración de Datos Kafka · RabbitMQ Auto-Deploy (DigitalOcean) Tuning de Queries Telemetría de Costo Gateway Multi-LLM API OpenAI-compatible SSE Streaming Metering & Billing PostgreSQL · pgvector ETL & Migración de Datos Kafka · RabbitMQ Auto-Deploy (DigitalOcean) Tuning de Queries Telemetría de Costo
0 Providers tras una única API
0 Registros/día procesados en batch
~99,9% Uptime multi-año en producción
0 Recorte del tiempo de query en Bradesco

El centro de mi plataforma es Railter: un gateway OpenAI-compatible que unifica Claude, GPT y Gemini tras una única API, con auth por key, metering, billing y retry/fallback. Ningún producto mío habla con un provider directamente — cuando nace una app nueva, ya nace con observabilidad de costo, SSE streaming y fallback gratis. Cambiar de modelo es config, no refactor.

La economía de LLM es disciplina de infra, no optimización de fin de mes. El routing por tier (GLM → Sonnet → Opus) elige el modelo más barato que sostiene la calidad, con traba de escalación en código y telemetría de costo por sesión de worker. El eval harness participa de la decisión: el tier solo cambia cuando el dato muestra que hace falta.

Debajo de eso, el lastre enterprise: en Monument migré decenas de clientes con pipelines idempotentes reconciliados al centavo; en YOUSE integré microservicios en una malla Kafka de 50+ servicios; en Bradesco procesé 1M de registros/día en batch con tuning que cortó 60% del tiempo de query; en DETRAN mantuve 99,9% de uptime durante años. Hoy ese repertorio opera una fleet de apps Rails en DigitalOcean — auto-deploy con migrations, cluster Postgres compartido y el hábito de dimensionar el pool de conexiones antes de que se vuelva incidente.

Arquitectura

La columna vertebral: todas las apps hablan con Railter — una API, tres providers — y viven sobre la misma base de Postgres, colas y auto-deploy en DigitalOcean.

Bajo esta lente

Infra · Gateway de LLM Producción

Railter

Gateway interno de LLM. OpenAI-compatible, SSE streaming, usage & billing por key.

Visto como plataforma, Railter es la pieza que paga el alquiler: un único contrato de API para todo el ecosistema, con costo, streaming y fallback resueltos una sola vez. Un producto nuevo no elige SDK, no gestiona keys de provider, no reimplementa retry — apunta al gateway y hereda la infraestructura entera.

Impacto
  • Una API OpenAI-compatible frente a Claude, GPT y Gemini
  • Metering y billing por key — costo visible por producto
  • Retry, fallback y SSE resueltos en el gateway, no en cada app
Stack
Rails 8 API OpenAI-compatible SSE Streaming Routing Multi-LLM Usage Metering
Economía · Multi-LLM Producción · Privado

Economy Routing

Routing de costo entre tiers de modelo con traba de escalación y eval harness.

Bajo el lente de infra, el economy routing es capacity planning de inteligencia: qué tier de modelo atiende cada clase de tarea al menor costo, con prueba de calidad vía eval harness y traba de escalación en código. Es la diferencia entre una factura de LLM que asusta a fin de mes y un costo previsible por sesión.

Impacto
  • Routing por tier (GLM → Sonnet → Opus) con traba de escalación
  • Costo por sesión de worker medido, no estimado
  • El eval harness decide el cambio de tier con datos, no con fe
Stack
OpenRouter Multi-LLM (GLM · Claude) Eval Harness Ruby on Rails 8
Data · Migración Entregado

Plataforma de Migración Monument

Migraciones enterprise reconciliadas al centavo, con Claude Code como driver de desarrollo.

La migración enterprise es infra de datos bajo presión: schemas heterogéneos de plataformas competidoras, cálculo financiero de verdad — intereses, multas, amortización — y un único criterio de aceptación: cuadrar al centavo antes del cutover. Pipelines idempotentes con validación multi-nivel convirtieron eso en rutina, no heroísmo.

Impacto
  • Pipelines idempotentes: correr de nuevo nunca empeora el estado
  • Validación multi-nivel: unidad, cliente, facility, período
  • Reconciliación financiera al centavo como gate de cutover
Stack
TypeScript / Node.js MySQL AWS Claude Code
Flagship · Multi-Agente · MCP Producción · Privado

Bailder

Orquestador multi-agente personal. WhatsApp-native, workers autónomos de Claude Code, safety tier-enforced.

Bajo el lente de infra, Bailder es una fleet: bootstrap de proyecto nuevo (repo → DB → DNS → deploy) en 1 tool call, auto-deploy que corre migrations solo después del health check y varias apps conviviendo en el mismo cluster Postgres — con las cicatrices convertidas en regla, como dimensionar el pool de conexiones antes del incidente.

Impacto
  • Bootstrap completo de una app nueva en 1 tool call
  • Auto-deploy con migrations automáticas post-health-check
  • Multi-app en cluster Postgres compartido, pools dimensionados
Stack
Ruby on Rails 8 Claude Code SDK MCP (Playwright) Multi-LLM (OpenRouter) Solid Queue WhatsApp Cloud API DigitalOcean (auto-deploy)

La trayectoria, releída

Ago 2025 – May 2026

Senior Data Migration Engineer · AI-Augmented

Monument (Remoto, EE.UU.)

  • Decenas de clientes enterprise migrados con reconciliación financiera al centavo
  • Pipelines idempotentes + validación multi-nivel como contrato de calidad del cutover
Claude Code TypeScript Node.js MySQL AWS
Nov 2022 – May 2023

Senior Software Engineer (Consultor)

META | YOUSE — Seguros Digitales de Caixa (Remoto)

  • Microservicios integrados en una malla event-driven Kafka con 50+ servicios
  • Migración de datos legacy crítica para el risk assessment de la mayor aseguradora digital del país
Node.js Ruby React AWS (S3, RDS, ECS) Kafka
Nov 2020 – Nov 2021

Java Software Developer

MJV Technology & Innovation | Bradesco Seguros (Remoto)

  • Batch async de hasta 1M de registros/día con ETL en Apache Airflow
  • Tuning de PostgreSQL (índices, particiones, queries) recortando 60% del tiempo promedio
Java Spring Boot PostgreSQL Apache Airflow
Ene 2017 – Nov 2020

Java Developer

PSG | DETRAN — Depto. de Tránsito (Remoto)

  • 99,9% de uptime multi-año en un sistema gubernamental de infracciones
  • Escala multi-millón de vehículos integrada a múltiples APIs públicas
Java Spring Boot PostgreSQL Heroku

Las herramientas de esta lente

📊

Datos & Vector Stores

Modelado, tuning de queries, RAG sobre datos propietarios. pgvector-first, aprendido con cicatrices de producción.

PostgreSQL (tuning · partitioning) pgvector / RAG BigQuery · Looker Elasticsearch MongoDB · MySQL ETL & Migración de Datos

Cloud & DevOps

Infra opinada. Auto-deploy desde git, observabilidad que sobrevive apagones, patrones cost-aware multi-tenant.

DigitalOcean (App Platform · DBs) AWS (S3, RDS, ECS, Lambda) Docker · Compose Kubernetes GitHub Actions · GitLab CI Systemd Auto-Deploy
🏗

Sistemas Distribuidos

Arquitecturas event-driven, bounded contexts, mensajería async-first. Escalé monolitos a servicios del modo correcto.

Event-Driven Architecture Kafka · RabbitMQ Microservicios · DDD CQRS / Event Sourcing System Design

Backend & APIs

APIs robustas y sistemas escalables con enfoque en corrección, rendimiento y sanidad operacional.

Ruby on Rails 8 Python (FastAPI) Node.js / TypeScript REST · GraphQL · SSE Sidekiq · Solid Queue Background Jobs

¿Tu stack de IA necesita cimientos?

Gateway multi-LLM, datos a escala y arquitectura agéntica — como rol de plataforma o consultoría de arquitectura de solución.

SB
Sérgio Brito
Online
👤 Sobre Mí 📚 Proyectos 💻 GitHub Contactar