Observabilidad
El operador recibe un tablero, un conjunto de alertas con destino configurable y acceso a los registros. Esta página describe qué mide cada uno y qué hacer cuando suena.
Tableros
- GPU: utilización, memoria, temperatura y consumo por dispositivo; uso por laboratorio y por modelo en servicio. Es la misma información que el administrador del Cliente ve resumida en el Panel de infraestructura.
- Colas: trabajos en espera, admitidos y desplazados por cola; tiempo medio de espera.
- Plataforma: estado de cada componente, errores por servicio, latencia de la API.
- InferNode: peticiones, tokens y créditos por Cliente y por modelo; errores por proveedor.
Alertas
Las alertas se agrupan por severidad y llegan a un canal por severidad (por defecto dos canales de chat, uno para warning y otro para critical; se pueden enrutar a correo, Teams u otro webhook). Cada una tiene un tiempo de confirmación (durante) para no avisar por picos de segundos.
| Alerta | Condición | Durante | Severidad | Qué revisar |
|---|---|---|---|---|
| Componente reiniciándose | Un servicio de la plataforma reinicia en bucle. | 2 min | Crítica | Registros del componente; casi siempre una configuración o un secreto que dejó de ser válido. |
| Componente sin réplicas listas | Un servicio de la plataforma no está listo. | 5 min | Aviso | Estado del clúster; si dura, escalar a Saptiva. |
| Réplicas no coinciden / despliegue atascado | Un despliegue no alcanza sus réplicas o no progresa. | 10 / 15 min | Aviso | Suele acompañar a una actualización a medias; ver Actualización. |
| Cuota casi llena / llena | Un laboratorio consume más del umbral de su presupuesto o lo agota. | 15 min | Informativa | Nada que arreglar en la plataforma: es el laboratorio de un usuario. Avisar al administrador del Cliente si se repite (Cuotas). |
| Latencia alta en el ingreso | p95 de las peticiones por encima de 2 s en una ruta. | 15 min | Aviso | Carga de GPU o modelo saturado; correlacionar con el tablero de InferNode. |
| Latencia alta en autenticación | La verificación de sesión tarda más de lo normal. | 5 min | Aviso | Proveedor de identidad lento o base de datos de identidad cargada. |
| Tasa de errores alta | Más de un umbral de respuestas 5xx en rutas de la plataforma (una regla aparte para la ruta de laboratorios). | 5 / 15 min | Crítica | Registros del servicio que responde 5xx; si es InferNode, el proveedor del modelo. |
| Certificado por caducar | Un certificado expone menos de 21 días de vigencia. | 30 min | Aviso | Renovar. Los certificados del Cliente no se renuevan solos: se cargan en el almacén de secretos. |
| Certificado crítico | Menos de 7 días. | 30 min | Crítica | Renovar ya para evitar una caída visible a los usuarios. |
| Volumen casi lleno | Un volumen supera el 85 % de uso. | 5 min | Aviso | Si es de un laboratorio, avisar al dueño; si es del catálogo de modelos o de artefactos, ampliar o limpiar. |
| Secreto sin sincronizar | Un secreto del almacén no se pudo leer en 15 min. | 15 min | Crítica | Conectividad o credencial del almacén de secretos; hasta resolverlo, las rotaciones no se aplican. |
| Envío de métricas fallido | Las métricas no se están archivando. | 10 min | Crítica | Almacenamiento de objetos del clúster. |
| Escalado automático inactivo o imposible | Un servicio no puede escalar. | 15 min | Aviso | Falta de capacidad de CPU o memoria en los nodos. |
| Desalojos de pods | El nodo expulsó procesos por falta de recursos. | Inmediata | Aviso | Presión de memoria o disco en un nodo; revisar qué laboratorio la provocó. |
| Fallos de página de memoria | Un nodo pagina a disco a ritmo alto. | 60 min | Aviso | Nodo sobrecargado; mover carga o ampliar memoria. |
| Respaldo fallido | El respaldo diario no terminó. | Crítica | Procedimiento de respaldo (Actualización y respaldo). |
Dos alertas que no están en el conjunto base y conviene pedir en instalaciones con muchos laboratorios: trabajos esperando GPU más de un tiempo fijo, y una GPU que deja de reportar métricas. Ambas se derivan de los datos del tablero de GPU.
Cómo reportar un problema a Saptiva
Un reporte con estos datos se resuelve sin idas y vueltas:
- Qué alerta o síntoma, con hora y zona horaria.
- Cliente y, si aplica, laboratorio o flujo afectado.
- El identificador de petición (
X-Request-Idde InferNode) o de ejecución (visible en la traza del workflow). - Captura del tablero o del mensaje en Studio.
Registros
Los registros de la plataforma se conservan en el clúster por un periodo configurable (por defecto 14 días) y pueden enviarse al sistema de registros del Cliente. Cada petición a InferNode y cada ejecución de workflow llevan un identificador que aparece en los registros y en las respuestas al usuario, para correlacionar reportes.