OpenQCore · Realtime Runtime

Generación I · Núcleo de Ejecución de Baja Latencia

Realtime Runtime.
Ejecución de IA de baja latencia.

Realtime Runtime es la columna vertebral de ejecución de OpenQCore para sistemas de chat de producción, combinando validación, control de backpressure, deduplicación, bloqueos distribuidos y orquestación resiliente de respuestas.

Estrategia de carga

Con protección contra sobrecarga

Modos de ejecución

Con y sin streaming

Controles de seguridad

Bloqueo + Disyuntores + Deduplicación

Persistencia de mensajes

Guardado duradero de usuario y asistente

Ciclo de vida de la solicitud

Ejecución determinista desde el ingreso hasta la limpieza.

Cada solicitud sigue un ciclo de vida protegido: validación, protección contra sobrecarga, comprobaciones de duplicados, adquisición de bloqueo, ejecución en tiempo de ejecución, persistencia y limpieza determinista.

Etapa 01

Construir traza y contexto de la solicitud

Etapa 02

Rastrear solicitud pendiente + evaluar la carga del sistema

Etapa 03

Validar la carga útil, los adjuntos y el acceso a la sesión

Etapa 04

Persistir el último mensaje del usuario (si la sesión existe)

Etapa 05

Comprobación de duplicados para solicitudes no streaming

Etapa 06

Adquirir bloqueo distribuido y ejecutar el runtime

Etapa 07

Persistir el mensaje del asistente y almacenar en caché la respuesta

Etapa 08

Liberar el bloqueo y dejar de rastrear pendientes en el bloque finally

Plano de control del runtime

Primitivas de resiliencia que mantienen la ejecución estable.

Integración de Circuit Breaker

La ejecución del runtime es consciente del breaker para aislar fallos aguas abajo y proteger la disponibilidad general del sistema.

Bloqueo distribuido

Una clave de bloqueo con alcance evita el procesamiento duplicado en curso para la misma identidad de solicitud.

Gestión de retropresión

Las solicitudes pendientes se rastrean continuamente y los estados de carga críticos provocan rechazos 503 controlados.

Rutas de ejecución

Diferentes rutas de respuesta para distintos objetivos de latencia.

Ruta de streaming

  • Optimizada para entrega inmediata de tokens
  • Devuelve StreamingResponse directamente
  • Omite la ruta de retorno de la caché de deduplicación
  • Aún protegido por validación + bloqueo + limpieza

Ruta no streaming

  • Comprueba la caché de deduplicación antes de la ejecución
  • Ejecuta el runtime y extrae el contenido/carga útil final
  • Persiste la salida del asistente para la continuidad de la sesión
  • Almacena la salida del modelo en la caché de deduplicación cuando es posible

Observabilidad y seguridad

Operaciones trazables con comportamiento del runtime medible.

  • Registro de eventos estructurado (inicio, finalización, limpieza, errores)
  • Propagación de Trace ID + Request ID por ejecución
  • Contadores métricos para solicitudes, rechazos y clases de error
  • Mapeo de HTTPException con manejo controlado de códigos de estado
  • Finalización garantizada para la liberación de bloqueos y la limpieza de pendientes

Ejecute cargas de trabajo de IA en producción con confianza en tiempo real.

Adopte una arquitectura de runtime diseñada para baja latencia, limpieza determinista, flujo de control resiliente y fiabilidad operativa.