Saltar al contenido principal

Actualización y respaldo

Actualización

  1. Saptiva publica la nueva versión (imágenes y configuración) y acuerda una ventana con el operador.
  2. Respaldo completo antes de cualquier actualización mayor o menor. Sin excepción.
  3. Se cambia la versión fijada en el repositorio de despliegue; el agente del clúster aplica el cambio capa por capa. Una capa que falla a mitad se revierte sola.
  4. Pruebas de humo.
  5. Si algo falla, reversión: se vuelve a la versión anterior en el repositorio y el clúster la reaplica. Si la actualización ya migró datos, la reversión usa el respaldo del paso 2.

Las actualizaciones de Studio (la consola) no interrumpen laboratorios ni trabajos en curso. Las de la plataforma de laboratorios pueden requerir detener notebooks; se anuncia con antelación.

Qué se respalda

Cuatro clases de estado, con un objetivo de pérdida máxima (RPO) de 24 horas:

ClaseQué contieneCómo
Bases de datos de la plataformaClientes, miembros, agentes, workflows, ejecuciones, metadatos de pipelinesRespaldo base diario a las 02:00 (hora del clúster) más archivo continuo de transacciones, con 30 días de retención. Al instalar se toma un primer respaldo de inmediato, no en la siguiente madrugada.
Almacén de artefactosArtefactos y resultados de pipelinesCopia diaria del almacén de objetos
Configuración declarativaLaboratorios, cuotas, colas, políticasVive en el repositorio de despliegue; el repositorio es el respaldo
Volúmenes de usuarioNotebooks, datasets, modelos de cada laboratorioSnapshots del almacenamiento del Cliente, con la frecuencia que su sistema permita. Es la clase que más depende del hardware: acuérdala en la instalación.

Los secretos (llaves de proveedores, certificados) se guardan en el almacén de secretos, fuera del respaldo del clúster, y se restituyen desde ahí. La alerta Secreto sin sincronizar (Observabilidad) es la que avisa cuando esa restitución no está ocurriendo.

Qué no se respalda

  • El disco temporal de un notebook: solo los volúmenes. Es la razón de El notebook perdió los archivos al reiniciar.
  • Las imágenes de la plataforma: se vuelven a espejar desde el paquete de la versión.
  • Los modelos descargados al catálogo: se vuelven a descargar o a cargar desde el medio físico. En instalaciones sin internet, conserva el medio.

Objetivos

ObjetivoValorQué significa para el Cliente
RPO (pérdida máxima de datos)24 horasEn el peor caso se pierde el trabajo del último día que no esté en un volumen respaldado.
RTO (tiempo de recuperación)3 días hábilesPara pérdida total del clúster. Una falla parcial (un componente, un nodo) se resuelve en horas.

Si el Cliente necesita un RPO menor para los volúmenes de usuario, se acuerda una frecuencia de snapshots mayor; el costo es espacio de almacenamiento.

Recuperación

Objetivo de tiempo de recuperación (RTO): 3 días hábiles para pérdida total del clúster. Orden:

  1. Reconstruir el clúster base y los requisitos.
  2. Reaplicar la configuración declarativa desde el repositorio.
  3. Restaurar bases de datos y almacén de artefactos a un mismo punto en el tiempo.
  4. Restaurar volúmenes de usuario desde snapshots.
  5. Pruebas de humo y un laboratorio de prueba.

El ensayo de recuperación es parte de la entrega. Un respaldo cuya restauración no se ha probado no cuenta como recuperación ante desastres. Saptiva ejecuta el ensayo antes de la puesta en producción y lo repite en cada actualización mayor.

Siguiente paso