Plataforma & Infra de LLM

A fundação que deixa todo o resto parecer fácil.

Agente impressiona em demo; plataforma sustenta em produção. A parte do stack que ninguém tuíta é a que decide se o sistema sobrevive: o gateway que unifica providers com metering e fallback, os dados que reconciliam ao centavo antes do cutover, o deploy que acontece sem mim no teclado. Eu construo essa camada primeiro — e é por isso que consigo shippar o resto rápido.

Gateway Multi-LLM API OpenAI-compatible SSE Streaming Metering & Billing PostgreSQL · pgvector ETL & Migração de Dados Kafka · RabbitMQ Auto-Deploy (DigitalOcean) Tuning de Queries Telemetria de Custo Gateway Multi-LLM API OpenAI-compatible SSE Streaming Metering & Billing PostgreSQL · pgvector ETL & Migração de Dados Kafka · RabbitMQ Auto-Deploy (DigitalOcean) Tuning de Queries Telemetria de Custo
0 Providers atrás de uma única API
0 Registros/dia processados em batch
~99,9% Uptime multi-ano em produção
0 Corte no tempo de query no Bradesco

O centro da minha plataforma é o Railter: um gateway OpenAI-compatible que unifica Claude, GPT e Gemini atrás de uma única API, com auth por chave, metering, billing e retry/fallback. Nenhum produto meu fala com provider diretamente — quando nasce um app novo, ele já nasce com observabilidade de custo, streaming SSE e fallback de graça. Trocar de modelo é config, não refactor.

Economia de LLM é disciplina de infra, não otimização de fim de mês. O roteamento por tier (GLM → Sonnet → Opus) escolhe o modelo mais barato que segura a qualidade, com trava de escalação em código e telemetria de custo por sessão de worker. O eval harness participa da decisão: tier só muda quando o dado mostra que precisa.

Embaixo disso, o lastro enterprise: na Monument, migrei dezenas de clientes com pipelines idempotentes reconciliados ao centavo; na YOUSE, integrei microserviços numa malha Kafka de 50+ serviços; no Bradesco, processei 1M de registros/dia em batch com tuning que cortou 60% do tempo de query; no DETRAN, mantive 99,9% de uptime por anos. Hoje esse repertório opera uma fleet de apps Rails na DigitalOcean — auto-deploy com migrations, cluster Postgres compartilhado e o hábito de dimensionar pool de conexão antes que ele vire incidente.

Arquitetura

A espinha dorsal: todos os apps falam com o Railter — uma API, três providers — e vivem na mesma fundação de Postgres, filas e auto-deploy na DigitalOcean.

Sob esta lente

Infra · Gateway de LLM Produção

Railter

Gateway interno de LLM. OpenAI-compatible, SSE streaming, usage & billing por chave.

Visto como plataforma, o Railter é a peça que paga o aluguel: um único contrato de API pra todo o ecossistema, com custo, streaming e fallback resolvidos uma vez só. Produto novo não escolhe SDK, não gerencia chave de provider, não reimplementa retry — aponta pro gateway e herda a infraestrutura inteira.

Impacto
  • Uma API OpenAI-compatible na frente de Claude, GPT e Gemini
  • Metering e billing por chave — custo visível por produto
  • Retry, fallback e SSE resolvidos no gateway, não em cada app
Stack
Rails 8 API OpenAI-compatible SSE Streaming Roteamento Multi-LLM Usage Metering
Economia · Multi-LLM Produção · Privado

Economy Routing

Roteamento de custo entre tiers de modelo com trava de escalação e eval harness.

Na lente de infra, o economy routing é capacity planning de inteligência: qual tier de modelo atende cada classe de tarefa pelo menor custo, com prova de qualidade via eval harness e trava de escalação em código. É a diferença entre conta de LLM que assusta no fim do mês e custo previsível por sessão.

Impacto
  • Routing por tier (GLM → Sonnet → Opus) com trava de escalação
  • Custo por sessão de worker medido, não estimado
  • Eval harness decide mudança de tier com dado, não com fé
Stack
OpenRouter Multi-LLM (GLM · Claude) Eval Harness Ruby on Rails 8
Data · Migração Entregue

Plataforma de Migração Monument

Migrações enterprise reconciliadas ao centavo, com Claude Code como driver de desenvolvimento.

Migração enterprise é infra de dados sob pressão: schemas heterogêneos de plataformas concorrentes, cálculo financeiro de verdade — juros, multas, amortização — e um único critério de aceite: bater ao centavo antes do cutover. Pipelines idempotentes com validação multi-nível transformaram isso em rotina, não heroísmo.

Impacto
  • Pipelines idempotentes: rodar de novo nunca piora o estado
  • Validação multi-nível: unidade, cliente, facility, período
  • Reconciliação financeira ao centavo como gate de cutover
Stack
TypeScript / Node.js MySQL AWS Claude Code
Flagship · Multi-Agente · MCP Produção · Privado

Bailder

Orquestrador multi-agente pessoal. WhatsApp-native, workers autônomos de Claude Code, safety tier-enforced.

Sob a lente de infra, o Bailder é uma fleet: bootstrap de projeto novo (repo → DB → DNS → deploy) em 1 tool call, auto-deploy que roda migrations sozinho depois do health check e vários apps convivendo no mesmo cluster Postgres — com as cicatrizes viradas em regra, como dimensionar pool de conexões antes do incidente.

Impacto
  • Bootstrap completo de app novo em 1 tool call
  • Auto-deploy com migrations automáticas pós-health-check
  • Multi-app em cluster Postgres compartilhado, pools dimensionados
Stack
Ruby on Rails 8 Claude Code SDK MCP (Playwright) Multi-LLM (OpenRouter) Solid Queue WhatsApp Cloud API DigitalOcean (auto-deploy)

A trajetória, re-lida

Ago 2025 – Mai 2026

Senior Data Migration Engineer · AI-Augmented

Monument (Remoto, EUA)

  • Dezenas de clientes enterprise migrados com reconciliação financeira ao centavo
  • Pipelines idempotentes + validação multi-nível como contrato de qualidade do cutover
Claude Code TypeScript Node.js MySQL AWS
Nov 2022 – Mai 2023

Senior Software Engineer (Consultor)

META | YOUSE — Seguros Digitais da Caixa (Remoto)

  • Microserviços integrados numa malha event-driven Kafka com 50+ serviços
  • Migração de dados legados crítica pro risk assessment da maior seguradora digital do país
Node.js Ruby React AWS (S3, RDS, ECS) Kafka
Nov 2020 – Nov 2021

Java Software Developer

MJV Technology & Innovation | Bradesco Seguros (Remoto)

  • Batch async de até 1M registros/dia com ETL em Apache Airflow
  • Tuning de PostgreSQL (índice, partição, query) cortando 60% do tempo médio
Java Spring Boot PostgreSQL Apache Airflow
Jan 2017 – Nov 2020

Java Developer

PSG | DETRAN — Depto. de Trânsito (Remoto)

  • 99,9% de uptime multi-ano em sistema governamental de infrações
  • Escala multi-milhão de veículos integrada a múltiplas APIs públicas
Java Spring Boot PostgreSQL Heroku

O ferramental desta lente

📊

Dados & Vector Stores

Modelagem, tuning de queries, RAG sobre dados proprietários. pgvector-first, aprendido com cicatrizes de produção.

PostgreSQL (tuning · particionamento) pgvector / RAG BigQuery · Looker Elasticsearch MongoDB · MySQL ETL & Migração de Dados

Cloud & DevOps

Infra opinativa. Auto-deploy do git, observabilidade que sobrevive a apagão, padrões cost-aware multi-tenant.

DigitalOcean (App Platform · DBs) AWS (S3, RDS, ECS, Lambda) Docker · Compose Kubernetes GitHub Actions · GitLab CI Systemd Auto-Deploy
🏗

Sistemas Distribuídos

Arquiteturas event-driven, bounded contexts, mensageria async-first. Escalei monolitos pra serviços do jeito certo.

Event-Driven Architecture Kafka · RabbitMQ Microserviços · DDD CQRS / Event Sourcing System Design

Backend & APIs

APIs robustas e sistemas escaláveis com foco em correção, performance e sanidade operacional.

Ruby on Rails 8 Python (FastAPI) Node.js / TypeScript REST · GraphQL · SSE Sidekiq · Solid Queue Background Jobs

Sua stack de IA precisa de fundação?

Gateway multi-LLM, dados em escala e arquitetura agêntica — como vaga de plataforma ou consultoria de arquitetura de solução.

SB
Sérgio Brito
Online
👤 Sobre 📚 Projetos 💻 GitHub Entrar em Contato