Actualización y respaldo
Actualización
- Saptiva publica la nueva versión (imágenes y configuración) y acuerda una ventana con el operador.
- Respaldo completo antes de cualquier actualización mayor o menor. Sin excepción.
- Se cambia la versión fijada en el repositorio de despliegue; el agente del clúster aplica el cambio capa por capa. Una capa que falla a mitad se revierte sola.
- Pruebas de humo.
- Si algo falla, reversión: se vuelve a la versión anterior en el repositorio y el clúster la reaplica. Si la actualización ya migró datos, la reversión usa el respaldo del paso 2.
Las actualizaciones de Studio (la consola) no interrumpen laboratorios ni trabajos en curso. Las de la plataforma de laboratorios pueden requerir detener notebooks; se anuncia con antelación.
Qué se respalda
Cuatro clases de estado, con un objetivo de pérdida máxima (RPO) de 24 horas:
| Clase | Qué contiene | Cómo |
|---|---|---|
| Bases de datos de la plataforma | Clientes, miembros, agentes, workflows, ejecuciones, metadatos de pipelines | Respaldo base diario a las 02:00 (hora del clúster) más archivo continuo de transacciones, con 30 días de retención. Al instalar se toma un primer respaldo de inmediato, no en la siguiente madrugada. |
| Almacén de artefactos | Artefactos y resultados de pipelines | Copia diaria del almacén de objetos |
| Configuración declarativa | Laboratorios, cuotas, colas, políticas | Vive en el repositorio de despliegue; el repositorio es el respaldo |
| Volúmenes de usuario | Notebooks, datasets, modelos de cada laboratorio | Snapshots del almacenamiento del Cliente, con la frecuencia que su sistema permita. Es la clase que más depende del hardware: acuérdala en la instalación. |
Los secretos (llaves de proveedores, certificados) se guardan en el almacén de secretos, fuera del respaldo del clúster, y se restituyen desde ahí. La alerta Secreto sin sincronizar (Observabilidad) es la que avisa cuando esa restitución no está ocurriendo.
Qué no se respalda
- El disco temporal de un notebook: solo los volúmenes. Es la razón de El notebook perdió los archivos al reiniciar.
- Las imágenes de la plataforma: se vuelven a espejar desde el paquete de la versión.
- Los modelos descargados al catálogo: se vuelven a descargar o a cargar desde el medio físico. En instalaciones sin internet, conserva el medio.
Objetivos
| Objetivo | Valor | Qué significa para el Cliente |
|---|---|---|
| RPO (pérdida máxima de datos) | 24 horas | En el peor caso se pierde el trabajo del último día que no esté en un volumen respaldado. |
| RTO (tiempo de recuperación) | 3 días hábiles | Para pérdida total del clúster. Una falla parcial (un componente, un nodo) se resuelve en horas. |
Si el Cliente necesita un RPO menor para los volúmenes de usuario, se acuerda una frecuencia de snapshots mayor; el costo es espacio de almacenamiento.
Recuperación
Objetivo de tiempo de recuperación (RTO): 3 días hábiles para pérdida total del clúster. Orden:
- Reconstruir el clúster base y los requisitos.
- Reaplicar la configuración declarativa desde el repositorio.
- Restaurar bases de datos y almacén de artefactos a un mismo punto en el tiempo.
- Restaurar volúmenes de usuario desde snapshots.
- Pruebas de humo y un laboratorio de prueba.
El ensayo de recuperación es parte de la entrega. Un respaldo cuya restauración no se ha probado no cuenta como recuperación ante desastres. Saptiva ejecuta el ensayo antes de la puesta en producción y lo repite en cada actualización mayor.