Saltar al contenido principal

Colas y prioridades

Cuando varios trabajos piden más GPU de la que hay, la plataforma los encola y los admite en orden. Un trabajo encolado no falla: espera hasta que haya recursos.

Cómo saber por qué espera

En el panel del laboratorio, el trabajo muestra estado pendiente con una condición que indica el motivo: "esperando cuota" (no hay GPU o memoria libre en la talla) o "no admitido" (pide algo fuera del presupuesto). En Studio, la tarjeta del laboratorio muestra el rechazo si es por cuota.

Enviar un trabajo a la cola

Añade la etiqueta de cola al trabajo. La cola de tu laboratorio la indica tu administrador; el nombre habitual es cola-investigacion:

metadata:
labels:
kueue.x-k8s.io/queue-name: cola-investigacion

Prioridad

Un trabajo urgente puede llevar una clase de prioridad más alta. Si la política de tu instalación lo permite, un trabajo de prioridad alta desplaza a uno de prioridad normal, que vuelve a la cola y se reanuda después. Usa prioridades con criterio: un trabajo desplazado pierde el progreso no guardado en checkpoint.

metadata:
labels:
kueue.x-k8s.io/queue-name: cola-investigacion
kueue.x-k8s.io/priority-class: prioridad-critica

Recomendaciones

  • Guarda checkpoints en el volumen del laboratorio cada pocas épocas.
  • No pidas más GPU de la que el trabajo usa: un trabajo que pide 2 y usa 1 bloquea a otro.
  • Si un trabajo lleva más de lo esperado en cola, revisa si tu propio notebook tiene la GPU.

Referencia en la documentación de Kueue.

Siguiente paso