Entrenamiento
Un entrenamiento se lanza como un trabajo del laboratorio (PyTorch o TensorFlow), no dentro del notebook. Así corre sin que tengas el navegador abierto, queda registrado y puede encolarse.
La regla de la GPU
La GPU de tu talla es un presupuesto compartido. Si tu notebook la tiene reservada, el trabajo de entrenamiento esperará. El flujo habitual:
- Guarda tu script y datos en el volumen del notebook.
- Detén el notebook para liberar la GPU.
- Lanza el trabajo de entrenamiento apuntando al mismo volumen.
- Cuando termine, reanuda el notebook: el modelo y las métricas están en tu carpeta.
Un trabajo PyTorch mínimo
apiVersion: kubeflow.org/v1
kind: PyTorchJob
metadata:
name: entrena-fugas
spec:
pytorchReplicaSpecs:
Master:
replicas: 1
template:
spec:
containers:
- name: pytorch
image: pytorch/pytorch:2.3.0-cuda12.1-cudnn8-runtime
command: ["python", "/workspace/train.py"]
resources:
limits: { nvidia.com/gpu: 1 }
volumeMounts:
- { name: ws, mountPath: /workspace }
volumes:
- name: ws
persistentVolumeClaim: { claimName: workspace-mi-notebook }
Aplica el archivo desde el notebook o desde el panel del laboratorio. El nombre del volumen es el de tu notebook (aparece en Volumes).
Seguir el progreso
En el panel del laboratorio, Training lista los trabajos con estado y logs. Si el trabajo queda en espera, revisa Colas y Tallas y cuota.
Para opciones avanzadas (varios workers, checkpoints), consulta la documentación de Kubeflow Trainer.