Clientes
Cómo Constellation estructuró una puerta de enlace comercial para LLM, RAG y puesta a punto
Constellation se creó para resolver un problema diferente al de un chatbot tradicional: cómo transformar modelos de lenguaje en un producto comercial distribuible a través de API, aplicación propia y canales de socios, manteniendo al mismo tiempo el control sobre la autenticación, los modelos, el contexto, la facturación y la operación. La idea era construir una capa de infraestructura para vender y operar LLM con gobernanza.
La plataforma fue diseñada como un monorepo con una API central en Cloudflare Workers, su propia aplicación en Expo, trabajador de distribución para OpenRouter y mercados, operaciones de ajuste/LoRA y automatizaciones de seguridad en Cloudflare. Esta división hizo posible separar el tiempo de ejecución crítico de la IA de las experiencias de productos y los canales externos, sin duplicar las reglas comerciales.
LLM Gateway compatible con finalizaciones de chat
Como núcleo del proyecto, estructuré una API compatible con el estándar chat/completions, protegida por claves API, autenticación multiinquilino y medición de uso. La puerta de enlace expone alias públicos como giovannicocco/legal-2.5, giovannicocco/sales-2.4, giovannicocco/gdpr-1.0, giovannicocco/contracts-1.6 y otras plantillas por dominio, mientras mantiene las plantillas de proveedor reales aisladas de la interfaz pública.
Este diseño le permite vender modelos por caso de uso sin vincular al cliente con la identificación técnica del proveedor. Si la infraestructura interna cambia, el alias público permanece estable. También se implementó control para no exponer los ID de los modelos de proveedores cuando la estrategia del producto requiere un catálogo cerrado.
RAG por alias e ingestión asincrónica
La capa de conocimiento se estructuró con carga de documentos, R2, colas, incrustaciones y Vectorize. Cada alias puede apuntar a un "rag_profile" específico, como legal, ventas, contratos, cumplimiento, soporte, adquisiciones, bienes raíces o finanzas. En la práctica, esto permite separar las bases de conocimiento por inquilino y por perfil de uso, evitando mezclar contexto entre clientes o entre modelos.
La canalización de ingesta funciona de forma asincrónica: el archivo ingresa a R2, se convierte en un trabajo en cola, pasa por extracción de texto, fragmentación, incrustación e indexación de vectores. Para documentos enriquecidos, la arquitectura proporciona conversión a Markdown a través de Workers AI cuando esté disponible; para formatos simples, utilice texto alternativo. En tiempo de ejecución, el chat recupera los fragmentos más relevantes e inyecta contexto controlado en el mensaje de la plantilla.
LoRA, puesta a punto y catálogo de modelos
Además del RAG, el Constellation obtuvo un área operativa para realizar ajustes con LoRA. Se creó un registro de alias que conecta el alias público, el modelo base, el perfil RAG y el adaptador de ajuste. Con esto, el equipo puede crear, enumerar, cargar adaptadores y generar mapas de entorno utilizados por la puerta de enlace.
Esta capa prepara la plataforma para evolucionar desde indicaciones y RAG hasta modelos especializados en dominios. Un alias de ventas, por ejemplo, puede comenzar a usar el mismo modelo base que los demás y luego recibir su propia LoRA sin romper un contrato de API, facturación o experiencia del cliente.
Canales de distribución, facturación y socios
También estructuré un trabajador de distribución para canales como OpenRouter y Marketplaces. Recibe cargas útiles en formato OpenAI, normaliza la entrada y la salida, aplica un secreto compartido y reenvía la llamada al núcleo con encabezados de canal, proveedor y solicitud externa. Esto le permite medir el tráfico desde API directa, aplicaciones, OpenRouter y mercados por separado.La monetización se diseñó con facturación híbrida: suscripción para la aplicación, cobro de tokens en la API directa a través de Stripe Billing para tokens LLM, créditos/prepago y liquidación local para socios. El tiempo de ejecución registra el uso, el costo, el saldo, el canal, el proveedor y los eventos de facturación, creando la base para las operaciones financieras, los informes y la gobernanza.
El resultado fue una infraestructura LLM completa: catálogo de modelos por dominio, API compatible con el mercado, RAG por perfil, ruta hacia LoRA/ajuste, aplicación multiplataforma, distribución en mercados, medición por canal y facturación. Constellation pasó de ser solo una interfaz de inteligencia artificial a funcionar como una plataforma para empaquetar, operar y monetizar modelos de lenguaje.
También te puede interesar
Cómo integrar la implementación de IA empresarial en su operación real
Descubra cómo implementar IA en su empresa puede automatizar procesos, conectar datos y reducir costos. Aprenda a aplicar la IA en operaciones reales.
Arquitectura y nubeEscale productos digitales con un costo mínimo utilizando una arquitectura sin servidor
Descubra cómo la arquitectura sin servidor con Next.js y Cloudflare Workers reduce los costos y acelera el lanzamiento de productos digitales escalables.
Ingresos y monetizaciónEstructuración de modelos de ingresos para productos digitales de alta escala
Aprenda cómo diseño modelos de ingresos para productos digitales. Vea ejemplos reales de SaaS, AdTech y cómo optimizar la facturación para crecer.