OpenQCore · Stack Multimodale

Un unico stack.
Quattro modalità. Controllo in produzione.

Multimodal Stack unifica testo, voce, immagini e video in un'unica architettura di esecuzione con routing intelligente, catene di fallback dei provider e contratti di risposta stabili.

Testo + Voce + Immagine + VideoRouter decisionaleMatrice dei timeoutCatene di fallbackStreaming / Non-StreamingContratto di output unificato

Matrice decisionale

Routing incentrato sull'intento tra le modalità.

PulseDecisionRouter classifica l'intento dell'utente e invia l'esecuzione alla corsia corretta: chat, generazione/modifica/analisi di immagini, generazione video o chiamata a strumenti.

Modalità

Testo

Live Route Preview

Pattern di trigger

intento conversazionale predefinito

Percorso

chat

Motore / Provider

Pulse + Chat Runtime

Timeout dei provider

Budget di latenza per tipo di carico di lavoro

Immagine

120s

Budget di generazione veloce

Video

300s

Finestra di rendering di lunga durata

OCR

45s

Budget per l'estrazione dei documenti

Identità

90s

Budget per il flusso KYC

Frode

45s

Budget per l'analisi del rischio

Catene di fallback

Instradamento in base all'affidabilità del provider

Immagine: openai

openai
replicate

Immagine: replicate

replicate
openai

Video

ltx_video

OCR

google_vision
PrimaryFallback HopExecution Target

Percorsi di esecuzione

Due modalità di erogazione, un unico nucleo di orchestrazione.

Percorso in streaming

  • Il motore restituisce un generatore asincrono per il flusso di token/eventi
  • StreamProcessor incapsula la consegna SSE
  • I controlli di timeout e di blocco restano attivi
  • La risposta finale si conclude con una pulizia deterministica

Percorso non in streaming

  • Esecuzione singola con timeout + interruttore di circuito
  • Assemblaggio del payload strutturato (content/images/files/videos)
  • Rendicontazione dell'utilizzo e metriche di durata
  • ResponseBuilder restituisce una risposta JSON canonica

Contratto di output unificato

Un unico involucro di risposta per tutte le modalità.

Il runtime restituisce un contratto coerente che mantiene il rendering del frontend prevedibile attraverso output misti di testo, file, immagine e video.

immagini

Artefatti di immagine generati o analizzati mappati in un array coerente.

file

Allegati, file OCR e documenti generati unificati per il rendering lato client.

video

Output di generazione video esposti tramite lo stesso modello di payload di risposta.

Rilascia prodotti multimodali con fiducia a livello di runtime.

Costruisci una volta per testo, voce, immagine e video con controlli di produzione per instradamento, fallback, osservabilità e contratti di output stabili.