Saltar al contenido principal

Observabilidad

El operador recibe un tablero, un conjunto de alertas con destino configurable y acceso a los registros. Esta página describe qué mide cada uno y qué hacer cuando suena.

Tableros

  • GPU: utilización, memoria, temperatura y consumo por dispositivo; uso por laboratorio y por modelo en servicio. Es la misma información que el administrador del Cliente ve resumida en el Panel de infraestructura.
  • Colas: trabajos en espera, admitidos y desplazados por cola; tiempo medio de espera.
  • Plataforma: estado de cada componente, errores por servicio, latencia de la API.
  • InferNode: peticiones, tokens y créditos por Cliente y por modelo; errores por proveedor.

Alertas

Las alertas se agrupan por severidad y llegan a un canal por severidad (por defecto dos canales de chat, uno para warning y otro para critical; se pueden enrutar a correo, Teams u otro webhook). Cada una tiene un tiempo de confirmación (durante) para no avisar por picos de segundos.

AlertaCondiciónDuranteSeveridadQué revisar
Componente reiniciándoseUn servicio de la plataforma reinicia en bucle.2 minCríticaRegistros del componente; casi siempre una configuración o un secreto que dejó de ser válido.
Componente sin réplicas listasUn servicio de la plataforma no está listo.5 minAvisoEstado del clúster; si dura, escalar a Saptiva.
Réplicas no coinciden / despliegue atascadoUn despliegue no alcanza sus réplicas o no progresa.10 / 15 minAvisoSuele acompañar a una actualización a medias; ver Actualización.
Cuota casi llena / llenaUn laboratorio consume más del umbral de su presupuesto o lo agota.15 minInformativaNada que arreglar en la plataforma: es el laboratorio de un usuario. Avisar al administrador del Cliente si se repite (Cuotas).
Latencia alta en el ingresop95 de las peticiones por encima de 2 s en una ruta.15 minAvisoCarga de GPU o modelo saturado; correlacionar con el tablero de InferNode.
Latencia alta en autenticaciónLa verificación de sesión tarda más de lo normal.5 minAvisoProveedor de identidad lento o base de datos de identidad cargada.
Tasa de errores altaMás de un umbral de respuestas 5xx en rutas de la plataforma (una regla aparte para la ruta de laboratorios).5 / 15 minCríticaRegistros del servicio que responde 5xx; si es InferNode, el proveedor del modelo.
Certificado por caducarUn certificado expone menos de 21 días de vigencia.30 minAvisoRenovar. Los certificados del Cliente no se renuevan solos: se cargan en el almacén de secretos.
Certificado críticoMenos de 7 días.30 minCríticaRenovar ya para evitar una caída visible a los usuarios.
Volumen casi llenoUn volumen supera el 85 % de uso.5 minAvisoSi es de un laboratorio, avisar al dueño; si es del catálogo de modelos o de artefactos, ampliar o limpiar.
Secreto sin sincronizarUn secreto del almacén no se pudo leer en 15 min.15 minCríticaConectividad o credencial del almacén de secretos; hasta resolverlo, las rotaciones no se aplican.
Envío de métricas fallidoLas métricas no se están archivando.10 minCríticaAlmacenamiento de objetos del clúster.
Escalado automático inactivo o imposibleUn servicio no puede escalar.15 minAvisoFalta de capacidad de CPU o memoria en los nodos.
Desalojos de podsEl nodo expulsó procesos por falta de recursos.InmediataAvisoPresión de memoria o disco en un nodo; revisar qué laboratorio la provocó.
Fallos de página de memoriaUn nodo pagina a disco a ritmo alto.60 minAvisoNodo sobrecargado; mover carga o ampliar memoria.
Respaldo fallidoEl respaldo diario no terminó.CríticaProcedimiento de respaldo (Actualización y respaldo).

Dos alertas que no están en el conjunto base y conviene pedir en instalaciones con muchos laboratorios: trabajos esperando GPU más de un tiempo fijo, y una GPU que deja de reportar métricas. Ambas se derivan de los datos del tablero de GPU.

Cómo reportar un problema a Saptiva

Un reporte con estos datos se resuelve sin idas y vueltas:

  1. Qué alerta o síntoma, con hora y zona horaria.
  2. Cliente y, si aplica, laboratorio o flujo afectado.
  3. El identificador de petición (X-Request-Id de InferNode) o de ejecución (visible en la traza del workflow).
  4. Captura del tablero o del mensaje en Studio.

Registros

Los registros de la plataforma se conservan en el clúster por un periodo configurable (por defecto 14 días) y pueden enviarse al sistema de registros del Cliente. Cada petición a InferNode y cada ejecución de workflow llevan un identificador que aparece en los registros y en las respuestas al usuario, para correlacionar reportes.

Siguiente paso