Colas y prioridades
Cuando varios trabajos piden más GPU de la que hay, la plataforma los encola y los admite en orden. Un trabajo encolado no falla: espera hasta que haya recursos.
Cómo saber por qué espera
En el panel del laboratorio, el trabajo muestra estado pendiente con una condición que indica el motivo: "esperando cuota" (no hay GPU o memoria libre en la talla) o "no admitido" (pide algo fuera del presupuesto). En Studio, la tarjeta del laboratorio muestra el rechazo si es por cuota.
Enviar un trabajo a la cola
Añade la etiqueta de cola al trabajo. La cola de tu laboratorio la indica tu administrador; el nombre habitual es cola-investigacion:
metadata:
labels:
kueue.x-k8s.io/queue-name: cola-investigacion
Prioridad
Un trabajo urgente puede llevar una clase de prioridad más alta. Si la política de tu instalación lo permite, un trabajo de prioridad alta desplaza a uno de prioridad normal, que vuelve a la cola y se reanuda después. Usa prioridades con criterio: un trabajo desplazado pierde el progreso no guardado en checkpoint.
metadata:
labels:
kueue.x-k8s.io/queue-name: cola-investigacion
kueue.x-k8s.io/priority-class: prioridad-critica
Recomendaciones
- Guarda checkpoints en el volumen del laboratorio cada pocas épocas.
- No pidas más GPU de la que el trabajo usa: un trabajo que pide 2 y usa 1 bloquea a otro.
- Si un trabajo lleva más de lo esperado en cola, revisa si tu propio notebook tiene la GPU.
Referencia en la documentación de Kueue.