Catálogo de modelos
El Catálogo lista los modelos descargados en la infraestructura de tu Cliente y el almacenamiento que ocupan. Es el inventario; el consumo en vivo de memoria de GPU se administra en la sección de modelos en ejecución.
Antes de empezar
- Rol de administrador del Cliente. El Catálogo está en Infraestructura, sección visible solo para administradores.
Leer el catálogo
Abre Infraestructura > Catálogo.

- Almacenamiento usado: espacio ocupado por los modelos sobre el volumen asignado (por ejemplo
127.38 GB de 1717.99 GB). - Modelos descargados: cuántos hay y cuánto espacio queda.
- Activos (no borrables) y Actualización disponible: marcados Próximamente; aparecen en gris.
El consumo en vivo de memoria de GPU no está aquí: lo ves por modelo en el Panel de infraestructura, en la lista de workloads de cada GPU.
Buscar y filtrar
Escribe en Buscar modelo o filtra por tipo: Todos, Instrucción, Visión, OCR, Embeddings, Otros.
| Columna | Qué muestra |
|---|---|
| Modelo | Identificador (el mismo que usarás en la API de InferNode, por ejemplo Qwen/Qwen3-Embedding-8B) y nombre legible. |
| Proveedor | Quien publica el modelo (Qwen, nvidia...). |
| Tipo | Instrucción, Visión, OCR, Embeddings u Otros (por ejemplo, modelos de guarda de contenido). |
| Params | Tamaño del modelo en parámetros (8B, 27B). |
| Tamaño | Espacio en disco. |
| VRAM est. | Memoria de GPU estimada para servirlo. Úsala para saber si cabe en la capacidad Disponible del Panel. |
| Estado | Descargado y, si está sirviendo, Activo. |
Detalle de un modelo
Al pulsar el identificador de un modelo se abre su ficha en un panel lateral:

Tres bloques:
- Especificaciones: tipo, parámetros, contexto (por ejemplo
262.144K tokens: cuánto texto cabe en una sola petición, entrada y salida juntas), cuantización (fp8ocupa la mitad quefp16con una pérdida de calidad pequeña), familia y proveedor. - Recursos: almacenamiento en disco y VRAM al cargar. Este último es el número que debes comparar con Disponible en el Panel antes de activar un modelo.
- Capacidades: etiquetas como
chat,tool-use(herramientas),json-mode,vision,reasoning,code,multilingual,video. Un agente con herramientas necesita un modelo contool-use; el esfuerzo de razonamiento solo funciona conreasoning.
Debajo, Activación muestra el estado (Listo · Activo) y el Endpoint interno del motor que lo sirve; no lo uses desde código, llama siempre a InferNode con el identificador del modelo. Detalles avanzados lista la versión del motor y sus parámetros de arranque, sin secretos.
Acciones: Activar provisiona un motor de inferencia para el modelo (pide una descripción, un nombre público que será el alias en la API y el tipo); Detener lo retira y libera su VRAM; Borrar descarga elimina el archivo del almacenamiento. Estados de activación: Provisionando, En cola, Cargando, Listo, Falló, Deteniendo. Un modelo Listo aparece como Activo en la lista y como workload Ejecutando en el Panel. Los modelos de embeddings y guarda muestran "Este tipo de modelo no se activa desde aquí": los activa el operador.
Descargar añade un modelo del registro al almacenamiento (asíncrono: "queda inactivo hasta activarlo"); en instalaciones sin internet los modelos llegan por medio físico (Instalación sin internet).
Los miembros no ven el Catálogo, pero sí eligen entre sus modelos al configurar un agente o un nodo de workflow: el selector de modelo de Studio muestra los mismos identificadores.
Siguiente paso
- Panel de infraestructura
- InferNode y Usar la API desde código (guía del usuario)