Como o Constellation estruturou um gateway comercial para LLMs, RAG e fine-tuning
Conheça o caso Constellation: uma plataforma de LLM com API gateway, aliases de modelos, RAG, LoRA, distribuição em marketplaces e billing por token.
O Constellation foi criado para resolver um problema diferente de um chatbot tradicional: como transformar modelos de linguagem em um produto comercial distribuível por API, app próprio e canais parceiros, mantendo controle sobre autenticação, modelos, contexto, cobrança e operação. A ideia era construir uma camada de infraestrutura para vender e operar LLMs com governança.
A plataforma foi desenhada como um monorepo com API core em Cloudflare Workers, app próprio em Expo, worker de distribuição para OpenRouter e marketplaces, operações de fine-tune/LoRA e automações de segurança no Cloudflare. Essa divisão permitiu separar o runtime crítico de IA das experiências de produto e dos canais externos, sem duplicar regra de negócio.
Gateway LLM compatível com Chat Completions
No núcleo do projeto, estruturei uma API compatível com o padrão chat/completions, protegida por API keys, autenticação multi-tenant e medição de uso. O gateway expõe aliases públicos, como giovannicocco/legal-2.5, giovannicocco/sales-2.4, giovannicocco/gdpr-1.0, giovannicocco/contracts-1.6 e outros modelos por domínio, enquanto mantém os modelos reais de provedor isolados da interface pública.
Esse desenho permite vender modelos por caso de uso sem amarrar o cliente ao ID técnico do provedor. Se a infraestrutura interna mudar, o alias público continua estável. Também foi implementado controle para não expor provider model IDs quando a estratégia do produto exige catálogo fechado.
RAG por alias e ingestão assíncrona
A camada de conhecimento foi estruturada com upload de documentos, R2, filas, embeddings e Vectorize. Cada alias pode apontar para um rag_profile específico, como jurídico, vendas, contratos, compliance, suporte, procurement, imobiliário ou financeiro. Na prática, isso permite separar bases de conhecimento por tenant e por perfil de uso, evitando misturar contexto entre clientes ou entre modelos.
O pipeline de ingestão trabalha de forma assíncrona: o arquivo entra no R2, vira job em fila, passa por extração de texto, chunking, embedding e indexação vetorial. Para documentos ricos, a arquitetura prevê conversão para Markdown via Workers AI quando disponível; para formatos simples, usa fallback de texto. No runtime, o chat recupera os trechos mais relevantes e injeta contexto controlado no prompt do modelo.
LoRA, fine-tuning e catálogo de modelos
Além do RAG, o Constellation ganhou uma área operacional para fine-tuning com LoRA. Foi criado um registry de aliases que conecta alias público, modelo base, perfil RAG e adapter de fine-tune. Com isso, o time consegue criar, listar, subir adapters e gerar os mapas de ambiente usados pelo gateway.
Essa camada prepara a plataforma para evoluir de prompts e RAG para modelos especializados por domínio. Um alias de vendas, por exemplo, pode começar usando o mesmo modelo base dos demais e depois receber um LoRA próprio sem quebrar contrato de API, billing ou experiência do cliente.
Distribuição, billing e canais parceiros
Também estruturei um worker de distribuição para canais como OpenRouter e marketplaces. Ele recebe payloads no formato OpenAI, normaliza entrada e saída, aplica segredo compartilhado e encaminha a chamada para o core com headers de canal, provedor e request externo. Isso permite medir tráfego de API direta, app, OpenRouter e marketplaces de forma separada.
A monetização foi desenhada com billing híbrido: assinatura para o app, cobrança por token na API direta via Stripe Billing for LLM Tokens, créditos/prepaid e settlement local para parceiros. O runtime registra uso, custo, saldo, canal, provedor e eventos de cobrança, criando base para operação financeira, relatórios e governança.
O resultado foi uma infraestrutura completa de LLM: catálogo de modelos por domínio, API compatível com o mercado, RAG por perfil, caminho para LoRA/fine-tuning, app multi-plataforma, distribuição em marketplaces, metering por canal e billing. O Constellation deixou de ser apenas uma interface de IA e passou a funcionar como uma plataforma para empacotar, operar e monetizar modelos de linguagem.
Continue Lendo
Como integrar a implementação de IA na empresa à sua operação real
Descubra como a implementação de IA na empresa pode automatizar processos, conectar dados e reduzir custos. Saiba como aplicar IA na operação real.
Escale produtos digitais com custo mínimo usando arquitetura serverless
Descubra como a arquitetura serverless com Next.js e Cloudflare Workers reduz custos e acelera o lançamento de produtos digitais escaláveis.
Estruturando modelos de receita para produtos digitais de alta escala
Aprenda como eu desenho modelos de receita para produtos digitais. Veja exemplos reais de SaaS, AdTech e como otimizar o billing para crescer.