OpenQCore · Pila Multimodal

Una pila.
Cuatro modalidades. Control de producción.

Multimodal Stack unifica texto, voz, imagen y vídeo en una arquitectura de ejecución con inteligencia de enrutamiento, cadenas de fallback de proveedores y contratos de respuesta estables.

Texto + Voz + Imagen + VídeoEnrutador de decisionesMatriz de tiempo de esperaCadenas de fallbackTransmisión / No transmisiónContrato de salida unificado

Matriz de decisiones

Enrutamiento centrado en la intención a través de las modalidades.

PulseDecisionRouter clasifica la intención del usuario y envía la ejecución a la vía correcta: chat, generación/edición/análisis de imágenes, generación de vídeo o llamada a herramienta.

Modalidad

Texto

Live Route Preview

Patrón de activación

intención conversacional predeterminada

Ruta

chat

Motor / Proveedor

Pulse + Chat Runtime

Tiempos de espera del proveedor

Presupuestos de latencia por tipo de carga de trabajo

Imagen

120s

Presupuesto de generación rápida

Vídeo

300s

Ventana de renderizado de larga duración

OCR

45s

Presupuesto de extracción de documentos

Identidad

90s

Presupuesto del flujo KYC

Fraude

45s

Presupuesto de análisis de riesgo

Cadenas de fallback

Enrutamiento de fiabilidad del proveedor

Imagen: openai

openai
replicate

Imagen: replicate

replicate
openai

Vídeo

ltx_video

OCR

google_vision
PrimaryFallback HopExecution Target

Rutas de ejecución

Dos modos de entrega, un núcleo de orquestación.

Ruta de streaming

  • El motor devuelve un generador asíncrono para el flujo de tokens/eventos
  • StreamProcessor envuelve la entrega SSE
  • Los controles de tiempo de espera y de bloqueo permanecen activos
  • La respuesta final concluye con una limpieza determinista

Ruta sin streaming

  • Ejecución única con tiempo de espera + disyuntor (circuit breaker)
  • Ensamblaje de la carga útil estructurada (content/images/files/videos)
  • Contabilidad de uso y métricas de duración
  • ResponseBuilder devuelve una respuesta JSON canónica

Contrato de salida unificado

Un único envoltorio de respuesta para todas las modalidades.

El tiempo de ejecución devuelve un contrato consistente que mantiene la representación en el frontend predecible en salidas mixtas de texto, archivos, imágenes y vídeo.

imágenes

Artefactos de imagen generados o analizados mapeados en un arreglo consistente.

archivos

Adjuntos, archivos OCR y documentos generados unificados para el renderizado del cliente.

vídeos

Salidas de generación de vídeo expuestas a través del mismo modelo de carga útil de respuesta.

Despliega productos multimodales con confianza a nivel del tiempo de ejecución.

Construye una vez para texto, voz, imagen y vídeo con controles de producción para enrutamiento, fallback, observabilidad y contratos de salida estables.