Saltar al contenido principal

Catálogo de modelos

El Catálogo lista los modelos descargados en la infraestructura de tu Cliente y el almacenamiento que ocupan. Es el inventario; el consumo en vivo de memoria de GPU se administra en la sección de modelos en ejecución.

Antes de empezar

  • Rol de administrador del Cliente. El Catálogo está en Infraestructura, sección visible solo para administradores.

Abre Infraestructura > Catálogo.

Catálogo con almacenamiento usado, modelos descargados y la lista filtrable

  • Almacenamiento usado: espacio ocupado por los modelos sobre el volumen asignado (por ejemplo 127.38 GB de 1717.99 GB).
  • Modelos descargados: cuántos hay y cuánto espacio queda.
  • Activos (no borrables) y Actualización disponible: marcados Próximamente; aparecen en gris.

El consumo en vivo de memoria de GPU no está aquí: lo ves por modelo en el Panel de infraestructura, en la lista de workloads de cada GPU.

Buscar y filtrar

Escribe en Buscar modelo o filtra por tipo: Todos, Instrucción, Visión, OCR, Embeddings, Otros.

ColumnaQué muestra
ModeloIdentificador (el mismo que usarás en la API de InferNode, por ejemplo Qwen/Qwen3-Embedding-8B) y nombre legible.
ProveedorQuien publica el modelo (Qwen, nvidia...).
TipoInstrucción, Visión, OCR, Embeddings u Otros (por ejemplo, modelos de guarda de contenido).
ParamsTamaño del modelo en parámetros (8B, 27B).
TamañoEspacio en disco.
VRAM est.Memoria de GPU estimada para servirlo. Úsala para saber si cabe en la capacidad Disponible del Panel.
EstadoDescargado y, si está sirviendo, Activo.

Detalle de un modelo

Al pulsar el identificador de un modelo se abre su ficha en un panel lateral:

Ficha de un modelo: especificaciones, recursos, capacidades y activación

Tres bloques:

  • Especificaciones: tipo, parámetros, contexto (por ejemplo 262.144K tokens: cuánto texto cabe en una sola petición, entrada y salida juntas), cuantización (fp8 ocupa la mitad que fp16 con una pérdida de calidad pequeña), familia y proveedor.
  • Recursos: almacenamiento en disco y VRAM al cargar. Este último es el número que debes comparar con Disponible en el Panel antes de activar un modelo.
  • Capacidades: etiquetas como chat, tool-use (herramientas), json-mode, vision, reasoning, code, multilingual, video. Un agente con herramientas necesita un modelo con tool-use; el esfuerzo de razonamiento solo funciona con reasoning.

Debajo, Activación muestra el estado (Listo · Activo) y el Endpoint interno del motor que lo sirve; no lo uses desde código, llama siempre a InferNode con el identificador del modelo. Detalles avanzados lista la versión del motor y sus parámetros de arranque, sin secretos.

Acciones: Activar provisiona un motor de inferencia para el modelo (pide una descripción, un nombre público que será el alias en la API y el tipo); Detener lo retira y libera su VRAM; Borrar descarga elimina el archivo del almacenamiento. Estados de activación: Provisionando, En cola, Cargando, Listo, Falló, Deteniendo. Un modelo Listo aparece como Activo en la lista y como workload Ejecutando en el Panel. Los modelos de embeddings y guarda muestran "Este tipo de modelo no se activa desde aquí": los activa el operador.

Descargar añade un modelo del registro al almacenamiento (asíncrono: "queda inactivo hasta activarlo"); en instalaciones sin internet los modelos llegan por medio físico (Instalación sin internet).

Los miembros no ven el Catálogo, pero sí eligen entre sus modelos al configurar un agente o un nodo de workflow: el selector de modelo de Studio muestra los mismos identificadores.

Siguiente paso