7. Buscar, descargar y administrar modelos locales

Objetivo del tema

Aprender a seleccionar un modelo local apropiado para Bionic, interpretar su ficha, escoger formato y cuantización, completar la descarga, verificar su funcionamiento y mantener ordenada la biblioteca.

Principio de trabajo: empieza con el modelo más pequeño que complete correctamente tus tareas reales. Un modelo que cabe con margen suele ofrecer una experiencia más estable que otro teóricamente superior que deja el equipo sin memoria.

7.1 ¿Qué significa ejecutar un modelo local?

Un modelo local utiliza pesos descargados en un dispositivo propio. Al cargarlo, Bionic reserva memoria y utiliza el runtime de LM Studio para procesar las instrucciones. La inferencia principal no consume créditos de Bionic Secure Cloud.

El modelo y Bionic cumplen funciones diferentes:

  • El modelo interpreta la tarea, genera texto, razona y solicita herramientas.
  • Bionic administra la conversación, archivos, herramientas, permisos, sesiones y resultados.
  • El runtime ejecuta matemáticamente los pesos en CPU, GPU y memoria.

Por eso descargar cualquier LLM no garantiza una buena experiencia agéntica. El modelo debe seguir instrucciones y utilizar correctamente las herramientas que Bionic le ofrece.

7.2 El recorrido de una descarga

  1. ExplorarBuscar una familia o elegir una recomendación.
  2. EvaluarRevisar capacidades, licencia y ajuste al dispositivo.
  3. ElegirSeleccionar formato, variante y destino.
  4. DescargarSupervisar el progreso y resolver interrupciones.
  5. ValidarCargar el modelo y probar una tarea agéntica.

7.3 Preparar el equipo

Antes de descargar, registra:

  • Memoria RAM total y memoria libre aproximada.
  • GPU disponible y cantidad de VRAM, si corresponde.
  • Espacio libre en el disco donde se guardan los modelos.
  • Arquitectura y sistema operativo.
  • Tipo de tarea: texto, programación, documentos, herramientas o imágenes.

No necesitas calcular manualmente un límite exacto. Bionic muestra información de ajuste al dispositivo; úsala como primera barrera y conserva margen para el sistema operativo, la aplicación y el contexto.

7.4 Abrir Explore y buscar

  1. Abre Settings.
  2. Dentro de Local Models, selecciona Explore.
  3. Escribe el nombre de una familia, un editor o un modelo, o elige una opción presentada por el catálogo.
  4. Aplica los filtros de formato y utiliza la indicación de ajuste al dispositivo para reducir los resultados.
  5. Abre la ficha del candidato antes de pulsar Download.

Evita buscar solamente por frases como «mejor modelo». La disponibilidad cambia y un resultado popular puede no admitir herramientas, imágenes, tu idioma o la licencia que necesitas.

7.5 Cómo leer una ficha de modelo

Datos que deben revisarse antes de descargar
Dato Qué indica Por qué importa en Bionic
Familia y versión Modelo base, generación y variante funcional. Versiones parecidas pueden tener capacidades distintas.
Parámetros Tamaño aproximado de la red, expresado normalmente en miles de millones. Afecta recursos y capacidad, pero no determina por sí solo la calidad.
Formato Representación compatible con un runtime, por ejemplo GGUF o MLX. Debe ser apropiado para el hardware y sistema.
Cuantización Nivel de compresión de los pesos. Cambia tamaño, memoria, velocidad y fidelidad.
Contexto máximo Cantidad de tokens que puede considerar. Las tareas agénticas acumulan mensajes, archivos y resultados de herramientas.
Tool use Capacidad o entrenamiento para solicitar herramientas. Es fundamental para crear archivos y ejecutar flujos de varios pasos.
Vision Compatibilidad con imágenes. Necesaria si el modelo debe interpretar capturas o material visual directamente.
Licencia Condiciones legales de uso y distribución. Puede limitar uso comercial, redistribución u otros escenarios.

7.6 GGUF y MLX

GGUF es un formato habitual para modelos ejecutados mediante llama.cpp y se utiliza en distintos sistemas y tipos de hardware. MLX está orientado al ecosistema Apple Silicon y aprovecha el runtime basado en MLX.

Orientación general de formatos
Formato Entorno habitual Elección inicial
GGUF Runtime llama.cpp en hardware compatible. Buena opción general cuando Bionic la marca compatible con el dispositivo.
MLX Mac con Apple Silicon. Considerarlo cuando aparece recomendado para ese equipo.

La existencia de ambos formatos para una familia no significa que produzcan exactamente el mismo rendimiento. Sigue la recomendación de Bionic para el dispositivo y prueba con una tarea real.

7.7 Cuantización

Cuantizar consiste en representar los pesos con menor precisión para reducir el archivo y la memoria necesaria. Los nombres varían según el formato: en GGUF son frecuentes etiquetas como Q3, Q4_K_M, Q5 o Q8; en MLX puede aparecer una cantidad de bits.

Guía orientativa, no regla absoluta
Nivel aproximado Ventaja Compromiso
2 o 3 bits Archivo y memoria reducidos. Mayor riesgo de pérdida de calidad, especialmente en tareas exigentes.
4 bits Equilibrio frecuente entre tamaño y fidelidad. Puede perder precisión frente a variantes mayores.
5 o 6 bits Conserva más fidelidad. Requiere más almacenamiento y memoria.
8 bits o mayor Menor pérdida por cuantización. Uso de recursos mucho mayor; no siempre mejora la tarea de forma proporcional.

La documentación general de LM Studio recomienda comenzar con una variante de 4 bits o superior cuando el equipo pueda ejecutarla. Para Bionic, además debes validar tool use y seguimiento de instrucciones.

7.8 Tamaño en disco no es memoria de ejecución

Memoria total aproximada = pesos + contexto y caché + runtime + recursos visuales + margen del sistema

El archivo descargado representa principalmente los pesos. Durante una sesión se agrega memoria para procesar el contexto, mantener la caché y ejecutar el runtime. Un contexto largo o un modelo con visión puede aumentar significativamente el consumo.

No llenes toda la memoria disponible: si el sistema empieza a intercambiar datos con el disco, la respuesta puede volverse extremadamente lenta o fallar. Elige una variante con margen y cierra cargas innecesarias.

7.9 Seleccionar destino, formato y variante

Al iniciar la descarga:

  1. Elige el dispositivo de destino si Bionic muestra más de uno mediante LM Link.
  2. Selecciona un formato compatible con ese dispositivo.
  3. Escoge la cuantización o variante que quepa con margen.
  4. Comprueba el tamaño de la descarga y el espacio libre.
  5. Confirma que se trata del modelo instruct o agéntico correcto, no de otra variante de la familia.
  6. Inicia la descarga.

Elegir el destino es importante: si descargas en un dispositivo remoto, el archivo y la inferencia pertenecen a ese equipo, no al almacenamiento local.

7.10 Controlar la descarga

Bionic permite pausar, reanudar, cancelar o reintentar una descarga. Utiliza estas acciones en lugar de cerrar forzosamente la aplicación.

Acciones durante la descarga
Acción Cuándo utilizarla
PauseNecesitas liberar ancho de banda y quieres continuar más tarde.
ResumeLa descarga fue pausada y la conexión vuelve a estar disponible.
CancelElegiste el modelo, formato, destino o tamaño equivocado.
RetryLa transferencia falló por un problema temporal de red o almacenamiento.

No consideres el modelo instalado hasta que el estado indique que la descarga finalizó correctamente.

7.11 Library y selector de la sesión

Abre Settings → Local Models → Library para comprobar los modelos indexados en el dispositivo. Después abre una sesión y utiliza el model picker para seleccionarlo.

Conviene distinguir tres estados:

  • Descargado: los pesos existen en el almacenamiento.
  • Cargado: el runtime reservó memoria para ejecutar el modelo.
  • Seleccionado: la sesión utilizará ese modelo como principal.

La primera carga puede tardar. Las versiones actuales muestran en el transcript el progreso de carga y procesamiento del prompt para modelos locales.

7.12 Ajustes avanzados de carga

Según formato, dispositivo y versión, Bionic puede ofrecer ajustes relacionados con GPU, contexto o caché. Modifícalos de uno en uno y registra el resultado.

  • Context length: un valor mayor permite conservar más información, pero consume más memoria.
  • GPU: descargar trabajo en la GPU suele mejorar velocidad si existe memoria suficiente.
  • MLX prompt disk cache: en configuraciones compatibles puede reutilizar procesamiento, a cambio de almacenamiento.
  • Ajuste automático: Bionic puede dimensionar el contexto de modelos MLX según la memoria disponible.

No copies parámetros de otro equipo sin comprobar hardware, modelo y versión. Los valores óptimos no son universales.

7.13 Práctica: validar un modelo local como agente

  1. Busca un modelo que Bionic indique como adecuado para tu dispositivo y para tareas con herramientas.
  2. Selecciona una variante de 4 bits o superior que deje margen de memoria, si está disponible.
  3. Descárgala y confirma su presencia en Library.
  4. Crea un proyecto sin coding llamado Prueba de modelo local.
  5. Selecciona el modelo descargado y envía el siguiente prompt.
Crea prueba-modelo-local.md usando únicamente estos datos: - Proyecto: huerta escolar. - Duración: seis semanas. - Participan 24 estudiantes. - Recursos: cuatro canteros y herramientas manuales. El archivo debe contener un título, una tabla de seis semanas con una actividad por semana, cuatro normas de seguridad y una conclusión de dos oraciones. No busques información en Internet ni inventes recursos adicionales. Al finalizar, confirma el nombre del archivo.

Revisa el resultado con esta ficha:

Validación del modelo local
Criterio Resultado
Cargó sin agotar la memoria 
Tiempo hasta comenzar a responder 
Creó el archivo correcto 
Respetó las seis semanas 
Incluyó exactamente cuatro normas 
Evitó recursos inventados 
Utilizó correctamente las herramientas 
Modelo validado: no basta con que produzca texto fluido. Debe cargar de forma estable, respetar restricciones y completar la acción solicitada. Conserva esta prueba para comparar futuras variantes.

7.14 Mantener la biblioteca

Los modelos ocupan mucho espacio y es fácil acumular variantes casi idénticas. Revisa periódicamente Local Models → Library:

  • Conserva la variante que realmente utilizas y documenta para qué tareas funciona.
  • Elimina variantes redundantes mediante los controles disponibles en la biblioteca.
  • Antes de borrar, comprueba modelo, cuantización, dispositivo y tamaño.
  • No manipules manualmente carpetas internas mientras un modelo está cargado o descargándose.
  • Vuelve a validar una versión nueva antes de retirar la anterior.

7.15 Problemas frecuentes

Diagnóstico de modelos locales
Problema Comprobaciones
La descarga no comienza o falla. Revisa conexión, espacio libre y dispositivo de destino; luego utiliza Retry.
El modelo no aparece en el selector. Confirma que finalizó, revisa Library y verifica que el dispositivo esté disponible.
La carga agota la memoria. Reduce contexto, cierra otras cargas o descarga una cuantización menor.
Responde bien, pero no crea archivos. Verifica soporte de herramientas y prueba un modelo entrenado para tool use.
Ignora instrucciones en tareas largas. Divide la tarea, reduce fuentes, usa una variante de mayor fidelidad o cambia de modelo.
El equipo se vuelve muy lento. Comprueba presión de memoria, procesos paralelos, contexto y uso de CPU/GPU.

7.16 Resumen

  • Explore permite buscar modelos y Library muestra los modelos indexados.
  • Antes de descargar hay que revisar formato, cuantización, tamaño, licencia, contexto, herramientas y visión.
  • Una cuantización de 4 bits suele ser un punto de partida, no una garantía universal.
  • La memoria de ejecución es mayor y más variable que el tamaño del archivo.
  • Bionic permite pausar, reanudar, cancelar y reintentar descargas.
  • Un modelo local debe validarse con tareas agénticas reales, no sólo con preguntas de chat.

En el próximo tema aprenderemos a utilizar LM Link para ejecutar modelos desde otro dispositivo.

Fuentes oficiales consultadas: modelos locales en Bionic, selección de modelos, formatos y cuantización, carga y memoria, tool use y ajustes locales de Bionic 1.1.0.