Saltar al contenido principal

Entrenamiento

Un entrenamiento se lanza como un trabajo del laboratorio (PyTorch o TensorFlow), no dentro del notebook. Así corre sin que tengas el navegador abierto, queda registrado y puede encolarse.

La regla de la GPU

La GPU de tu talla es un presupuesto compartido. Si tu notebook la tiene reservada, el trabajo de entrenamiento esperará. El flujo habitual:

  1. Guarda tu script y datos en el volumen del notebook.
  2. Detén el notebook para liberar la GPU.
  3. Lanza el trabajo de entrenamiento apuntando al mismo volumen.
  4. Cuando termine, reanuda el notebook: el modelo y las métricas están en tu carpeta.

Un trabajo PyTorch mínimo

apiVersion: kubeflow.org/v1
kind: PyTorchJob
metadata:
name: entrena-fugas
spec:
pytorchReplicaSpecs:
Master:
replicas: 1
template:
spec:
containers:
- name: pytorch
image: pytorch/pytorch:2.3.0-cuda12.1-cudnn8-runtime
command: ["python", "/workspace/train.py"]
resources:
limits: { nvidia.com/gpu: 1 }
volumeMounts:
- { name: ws, mountPath: /workspace }
volumes:
- name: ws
persistentVolumeClaim: { claimName: workspace-mi-notebook }

Aplica el archivo desde el notebook o desde el panel del laboratorio. El nombre del volumen es el de tu notebook (aparece en Volumes).

Seguir el progreso

En el panel del laboratorio, Training lista los trabajos con estado y logs. Si el trabajo queda en espera, revisa Colas y Tallas y cuota.

Para opciones avanzadas (varios workers, checkpoints), consulta la documentación de Kubeflow Trainer.

Siguiente paso