OpenQCore · Realtime Runtime

Génération I · Noyau d'exécution à faible latence

Realtime Runtime.
Exécution IA à faible latence.

Realtime Runtime est la colonne vertébrale d'exécution d'OpenQCore pour les systèmes de chat en production, combinant validation, contrôle de la rétropression, déduplication, verrous distribués et orchestration résiliente des réponses.

Stratégie de charge

Avec gestion de la rétropression

Modes d'exécution

Streaming + Non-streaming

Contrôles de sécurité

Verrou + Disjoncteur + Déduplication

Persistance des messages

Utilisateur + Assistant : sauvegarde durable

Cycle de vie de la requête

Exécution déterministe de l'entrée au nettoyage.

Chaque requête suit un cycle de vie protégé : validation, protection contre la surcharge, vérifications de déduplication, acquisition de verrou, exécution du runtime, persistance et nettoyage déterministe.

Étape 01

Construire la trace et le contexte de la requête

Étape 02

Suivre la requête en attente + évaluer la charge du système

Étape 03

Valider la charge utile, les pièces jointes et l'accès à la session

Étape 04

Conserver le dernier message utilisateur (si la session existe)

Étape 05

Vérification de déduplication pour les requêtes non-streaming

Étape 06

Acquérir un verrou distribué et exécuter le runtime

Étape 07

Conserver le message de l'assistant et mettre en cache la réponse

Étape 08

Libérer le verrou et retirer le suivi des éléments en attente dans le bloc finally

Plan de contrôle d'exécution

Primitives de résilience qui maintiennent la stabilité de l'exécution.

Intégration du Circuit Breaker

L'exécution du runtime est consciente du disjoncteur pour isoler les pannes en aval et protéger la disponibilité globale du système.

Verrouillage distribué

Une clé de verrouillage à portée empêche le traitement en double en cours pour la même identité de requête.

Gestion de la contre-pression

Les requêtes en attente sont suivies en continu et les états de charge critiques déclenchent un rejet contrôlé 503.

Chemins d'exécution

Différents chemins de réponse pour différents objectifs de latence.

Chemin de streaming

  • Optimisé pour la livraison immédiate des tokens
  • Renvoie directement StreamingResponse
  • Contourne le chemin de retour du cache de déduplication
  • Toujours protégé par validation + verrou + nettoyage

Chemin non-streaming

  • Vérifie le cache de déduplication avant l'exécution
  • Exécute le runtime et extrait le contenu/charge utile final
  • Conserve la sortie de l'assistant pour la continuité de la session
  • Stocke la sortie du modèle dans le cache de déduplication lorsque possible

Observabilité et sécurité

Opérations traçables avec un comportement d'exécution mesurable.

  • Journalisation d'événements structurés (démarrage, complétion, nettoyage, erreurs)
  • Propagation de Trace ID + Request ID par exécution
  • Compteurs métriques pour les requêtes, les rejets et les classes d'erreurs
  • Mappage d'HTTPException avec gestion contrôlée des statuts
  • Finalisation garantie pour la libération des verrous et le nettoyage des éléments en attente

Exécutez des charges de travail IA en production avec une confiance en temps réel.

Adoptez une architecture runtime conçue pour une faible latence, un nettoyage déterministe, un contrôle d'exécution résilient et une fiabilité opérationnelle.