OpenQCore · Multimodal Stack

Uma Stack.
Quatro modalidades. Controle de produção.

O Multimodal Stack unifica texto, voz, imagem e vídeo em uma única arquitetura de execução, com roteamento inteligente, cadeias de fallback entre provedores e contratos de resposta estáveis.

Texto + Voz + Imagem + VídeoRoteador de decisõesMatriz de timeoutsCadeias de fallbackStreaming / Não streamingContrato de Saída Unificada

Matriz de Decisão

Roteamento centrado na intenção entre modalidades.

A PulseDecisionRouter classifica a intenção do usuário e encaminha a execução para a via adequada: chat, geração/edição/análise de imagem, geração de vídeo ou chamada a uma ferramenta.

Modalidade

Texto

Live Route Preview

Padrão de gatilho

intenção conversacional padrão

Rota

chat

Engine / Fornecedor

Pulse + Chat Runtime

Tempos limite do provedor

Orçamentos de latência por tipo de carga de trabalho

Imagem

120s

Orçamento para geração rápida

Vídeo

300s

Janela de renderização de longa duração

OCR

45s

Orçamento para extração de documentos

Identidade

90s

Orçamento para fluxo KYC

Fraude

45s

Orçamento para análise de risco

Cadeias de fallback

Roteamento de confiabilidade do provedor

Imagem: openai

openai
replicate

Imagem: replicate

replicate
openai

Vídeo

ltx_video

OCR

google_vision
PrimaryFallback HopExecution Target

Caminhos de execução

Dois modos de entrega, um núcleo de orquestração.

Caminho de streaming

  • Engine retorna gerador assíncrono para fluxo de tokens/eventos
  • StreamProcessor encapsula a entrega via SSE
  • Controles de timeout e de bloqueio permanecem ativos
  • A resposta final encerra com limpeza determinística

Caminho sem streaming

  • Execução única com timeout e circuit breaker
  • Montagem de payload estruturado (conteúdo/imagens/arquivos/vídeos)
  • Contabilização de uso e métricas de duração
  • ResponseBuilder retorna resposta JSON canônica

Contrato de Saída Unificado

Um envelope de resposta único para todas as modalidades.

O runtime fornece um contrato consistente que mantém a renderização no frontend previsível em saídas mistas de texto, arquivos, imagens e vídeo.

imagens

Artefatos de imagem gerados ou analisados, mapeados em um array consistente.

arquivos

Anexos, arquivos OCR e documentos gerados unificados para renderização no cliente.

vídeos

Saídas de geração de vídeo expostas pelo mesmo modelo de payload da resposta.

Lance produtos multimodais com a confiança do nível de runtime.

Desenvolva uma vez para texto, voz, imagem e vídeo, com controles de produção para roteamento, fallback, observabilidade e contratos de saída estáveis.