Clientes16 de maio de 20263 min read

Como o Constellation estruturou um gateway comercial para LLMs, RAG e fine-tuning

Conheça o caso Constellation: uma plataforma de LLM com API gateway, aliases de modelos, RAG, LoRA, distribuição em marketplaces e billing por token.

Giovanni Cocco
Giovanni CoccoEngenharia de IA & Arquitetura de Sistemas

O Constellation foi criado para resolver um problema diferente de um chatbot tradicional: como transformar modelos de linguagem em um produto comercial distribuível por API, app próprio e canais parceiros, mantendo controle sobre autenticação, modelos, contexto, cobrança e operação. A ideia era construir uma camada de infraestrutura para vender e operar LLMs com governança.

A plataforma foi desenhada como um monorepo com API core em Cloudflare Workers, app próprio em Expo, worker de distribuição para OpenRouter e marketplaces, operações de fine-tune/LoRA e automações de segurança no Cloudflare. Essa divisão permitiu separar o runtime crítico de IA das experiências de produto e dos canais externos, sem duplicar regra de negócio.

Gateway LLM compatível com Chat Completions

No núcleo do projeto, estruturei uma API compatível com o padrão chat/completions, protegida por API keys, autenticação multi-tenant e medição de uso. O gateway expõe aliases públicos, como giovannicocco/legal-2.5, giovannicocco/sales-2.4, giovannicocco/gdpr-1.0, giovannicocco/contracts-1.6 e outros modelos por domínio, enquanto mantém os modelos reais de provedor isolados da interface pública.

Esse desenho permite vender modelos por caso de uso sem amarrar o cliente ao ID técnico do provedor. Se a infraestrutura interna mudar, o alias público continua estável. Também foi implementado controle para não expor provider model IDs quando a estratégia do produto exige catálogo fechado.

RAG por alias e ingestão assíncrona

A camada de conhecimento foi estruturada com upload de documentos, R2, filas, embeddings e Vectorize. Cada alias pode apontar para um rag_profile específico, como jurídico, vendas, contratos, compliance, suporte, procurement, imobiliário ou financeiro. Na prática, isso permite separar bases de conhecimento por tenant e por perfil de uso, evitando misturar contexto entre clientes ou entre modelos.

O pipeline de ingestão trabalha de forma assíncrona: o arquivo entra no R2, vira job em fila, passa por extração de texto, chunking, embedding e indexação vetorial. Para documentos ricos, a arquitetura prevê conversão para Markdown via Workers AI quando disponível; para formatos simples, usa fallback de texto. No runtime, o chat recupera os trechos mais relevantes e injeta contexto controlado no prompt do modelo.

LoRA, fine-tuning e catálogo de modelos

Além do RAG, o Constellation ganhou uma área operacional para fine-tuning com LoRA. Foi criado um registry de aliases que conecta alias público, modelo base, perfil RAG e adapter de fine-tune. Com isso, o time consegue criar, listar, subir adapters e gerar os mapas de ambiente usados pelo gateway.

Essa camada prepara a plataforma para evoluir de prompts e RAG para modelos especializados por domínio. Um alias de vendas, por exemplo, pode começar usando o mesmo modelo base dos demais e depois receber um LoRA próprio sem quebrar contrato de API, billing ou experiência do cliente.

Distribuição, billing e canais parceiros

Também estruturei um worker de distribuição para canais como OpenRouter e marketplaces. Ele recebe payloads no formato OpenAI, normaliza entrada e saída, aplica segredo compartilhado e encaminha a chamada para o core com headers de canal, provedor e request externo. Isso permite medir tráfego de API direta, app, OpenRouter e marketplaces de forma separada.

A monetização foi desenhada com billing híbrido: assinatura para o app, cobrança por token na API direta via Stripe Billing for LLM Tokens, créditos/prepaid e settlement local para parceiros. O runtime registra uso, custo, saldo, canal, provedor e eventos de cobrança, criando base para operação financeira, relatórios e governança.

O resultado foi uma infraestrutura completa de LLM: catálogo de modelos por domínio, API compatível com o mercado, RAG por perfil, caminho para LoRA/fine-tuning, app multi-plataforma, distribuição em marketplaces, metering por canal e billing. O Constellation deixou de ser apenas uma interface de IA e passou a funcionar como uma plataforma para empacotar, operar e monetizar modelos de linguagem.

Tags:#constellation#llm#ai gateway#rag#lora#fine tuning#cloudflare workers#vectorize#stripe#clientes
ARTIGOS RELACIONADOS

Continue Lendo

Pronto para aplicar essas estratégias na sua organização?

Transformamos frameworks de pesquisa e teses de engenharia em arquiteturas de IA em produção com governança, segurança e alta performance.