OpenQCore · Multimodaler Stack

Ein Stack.
Vier Modalitäten. Produktionssteuerung.

Der Multimodal Stack vereinigt Text, Sprache, Bild und Video in einer Ausführungsarchitektur mit Routing-Intelligenz, Provider-Fallback-Ketten und stabilen Antwortverträgen.

Text + Sprache + Bild + VideoEntscheidungs-RouterTimeout-MatrixFallback-KettenStreaming / Nicht-StreamingEinheitlicher Ausgabevertrag

Entscheidungsmatrix

Intent-basiertes Routing über Modalitäten.

Die PulseDecisionRouter-Klasse klassifiziert die Nutzerintention und leitet die Ausführung in die richtige Spur weiter: Chat, Bildgenerierung/-bearbeitung/-analyse, Videoerzeugung oder Tool-Aufruf.

Modalität

Text

Live Route Preview

Trigger-Muster

Standard-Konversationsabsicht

Route

Chat

Engine / Anbieter

Pulse + Chat-Laufzeit

Provider-Zeitüberschreitungen

Latenzbudgets nach Workload-Typ

Bild

120s

Budget für schnelle Generierung

Video

300s

Langes Renderfenster

OCR

45s

Budget für Dokumentenextraktion

Identität

90s

Budget für KYC-Ablauf

Betrug

45s

Budget für Risikoanalyse

Fallback-Ketten

Provider-Zuverlässigkeitsrouting

Bild: openai

openai
replicate

Bild: replicate

replicate
openai

Video

ltx_video

OCR

google_vision
PrimaryFallback HopExecution Target

Ausführungspfade

Zwei Bereitstellungsmodi, ein Orchestrierungskern.

Streaming-Pfad

  • Engine liefert asynchronen Generator für Token-/Ereignisfluss
  • StreamProcessor kapselt SSE-Auslieferung
  • Timeout- und Sperrsteuerungen bleiben aktiv
  • Finale Antwort schließt mit deterministischer Bereinigung ab

Nicht-Streaming-Pfad

  • Einmalige Ausführung mit Timeout + Circuit-Breaker
  • Strukturierte Payload-Zusammenstellung (Inhalte/Bilder/Dateien/Videos)
  • Nutzungsabrechnung und Laufzeit-Metriken
  • ResponseBuilder gibt eine kanonische JSON-Antwort zurück

Einheitlicher Ausgabevertrag

Eine einzige Antworthülle für alle Modalitäten.

Die Laufzeit liefert ein konsistentes Vertragsmodell, das das Frontend-Rendering über gemischte Text-, Datei-, Bild- und Videoausgaben hinweg vorhersehbar macht.

Bilder

Erzeugte oder analysierte Bildartefakte, die in einem konsistenten Array abgebildet sind.

Dateien

Anhänge, OCR-Dateien und generierte Dokumente für die Client-Darstellung vereinheitlicht.

Videos

Video-Generierungsausgaben, die über dasselbe Antwort-Payload-Modell bereitgestellt werden.

Setzen Sie multimodale Produkte mit verlässlicher Laufzeit in Produktion.

Einmal entwickeln für Text, Sprache, Bild und Video – mit Produktionskontrollen für Routing, Fallback, Beobachtbarkeit und stabile Ausgabeverträge.