Objetivo del tema
Aprender a seleccionar un modelo local apropiado para Bionic, interpretar su ficha, escoger formato y cuantización, completar la descarga, verificar su funcionamiento y mantener ordenada la biblioteca.
Un modelo local utiliza pesos descargados en un dispositivo propio. Al cargarlo, Bionic reserva memoria y utiliza el runtime de LM Studio para procesar las instrucciones. La inferencia principal no consume créditos de Bionic Secure Cloud.
El modelo y Bionic cumplen funciones diferentes:
Por eso descargar cualquier LLM no garantiza una buena experiencia agéntica. El modelo debe seguir instrucciones y utilizar correctamente las herramientas que Bionic le ofrece.
Antes de descargar, registra:
No necesitas calcular manualmente un límite exacto. Bionic muestra información de ajuste al dispositivo; úsala como primera barrera y conserva margen para el sistema operativo, la aplicación y el contexto.
Evita buscar solamente por frases como «mejor modelo». La disponibilidad cambia y un resultado popular puede no admitir herramientas, imágenes, tu idioma o la licencia que necesitas.
| Dato | Qué indica | Por qué importa en Bionic |
|---|---|---|
| Familia y versión | Modelo base, generación y variante funcional. | Versiones parecidas pueden tener capacidades distintas. |
| Parámetros | Tamaño aproximado de la red, expresado normalmente en miles de millones. | Afecta recursos y capacidad, pero no determina por sí solo la calidad. |
| Formato | Representación compatible con un runtime, por ejemplo GGUF o MLX. | Debe ser apropiado para el hardware y sistema. |
| Cuantización | Nivel de compresión de los pesos. | Cambia tamaño, memoria, velocidad y fidelidad. |
| Contexto máximo | Cantidad de tokens que puede considerar. | Las tareas agénticas acumulan mensajes, archivos y resultados de herramientas. |
| Tool use | Capacidad o entrenamiento para solicitar herramientas. | Es fundamental para crear archivos y ejecutar flujos de varios pasos. |
| Vision | Compatibilidad con imágenes. | Necesaria si el modelo debe interpretar capturas o material visual directamente. |
| Licencia | Condiciones legales de uso y distribución. | Puede limitar uso comercial, redistribución u otros escenarios. |
GGUF es un formato habitual para modelos ejecutados mediante llama.cpp y se utiliza en distintos sistemas y tipos de hardware. MLX está orientado al ecosistema Apple Silicon y aprovecha el runtime basado en MLX.
| Formato | Entorno habitual | Elección inicial |
|---|---|---|
| GGUF | Runtime llama.cpp en hardware compatible. | Buena opción general cuando Bionic la marca compatible con el dispositivo. |
| MLX | Mac con Apple Silicon. | Considerarlo cuando aparece recomendado para ese equipo. |
La existencia de ambos formatos para una familia no significa que produzcan exactamente el mismo rendimiento. Sigue la recomendación de Bionic para el dispositivo y prueba con una tarea real.
Cuantizar consiste en representar los pesos con menor precisión para reducir el archivo y la memoria necesaria. Los nombres varían según el formato: en GGUF son frecuentes etiquetas como Q3, Q4_K_M, Q5 o Q8; en MLX puede aparecer una cantidad de bits.
| Nivel aproximado | Ventaja | Compromiso |
|---|---|---|
| 2 o 3 bits | Archivo y memoria reducidos. | Mayor riesgo de pérdida de calidad, especialmente en tareas exigentes. |
| 4 bits | Equilibrio frecuente entre tamaño y fidelidad. | Puede perder precisión frente a variantes mayores. |
| 5 o 6 bits | Conserva más fidelidad. | Requiere más almacenamiento y memoria. |
| 8 bits o mayor | Menor pérdida por cuantización. | Uso de recursos mucho mayor; no siempre mejora la tarea de forma proporcional. |
La documentación general de LM Studio recomienda comenzar con una variante de 4 bits o superior cuando el equipo pueda ejecutarla. Para Bionic, además debes validar tool use y seguimiento de instrucciones.
El archivo descargado representa principalmente los pesos. Durante una sesión se agrega memoria para procesar el contexto, mantener la caché y ejecutar el runtime. Un contexto largo o un modelo con visión puede aumentar significativamente el consumo.
Al iniciar la descarga:
Elegir el destino es importante: si descargas en un dispositivo remoto, el archivo y la inferencia pertenecen a ese equipo, no al almacenamiento local.
Bionic permite pausar, reanudar, cancelar o reintentar una descarga. Utiliza estas acciones en lugar de cerrar forzosamente la aplicación.
| Acción | Cuándo utilizarla |
|---|---|
| Pause | Necesitas liberar ancho de banda y quieres continuar más tarde. |
| Resume | La descarga fue pausada y la conexión vuelve a estar disponible. |
| Cancel | Elegiste el modelo, formato, destino o tamaño equivocado. |
| Retry | La transferencia falló por un problema temporal de red o almacenamiento. |
No consideres el modelo instalado hasta que el estado indique que la descarga finalizó correctamente.
Abre Settings → Local Models → Library para comprobar los modelos indexados en el dispositivo. Después abre una sesión y utiliza el model picker para seleccionarlo.
Conviene distinguir tres estados:
La primera carga puede tardar. Las versiones actuales muestran en el transcript el progreso de carga y procesamiento del prompt para modelos locales.
Según formato, dispositivo y versión, Bionic puede ofrecer ajustes relacionados con GPU, contexto o caché. Modifícalos de uno en uno y registra el resultado.
No copies parámetros de otro equipo sin comprobar hardware, modelo y versión. Los valores óptimos no son universales.
Revisa el resultado con esta ficha:
| Criterio | Resultado |
|---|---|
| Cargó sin agotar la memoria | |
| Tiempo hasta comenzar a responder | |
| Creó el archivo correcto | |
| Respetó las seis semanas | |
| Incluyó exactamente cuatro normas | |
| Evitó recursos inventados | |
| Utilizó correctamente las herramientas |
Los modelos ocupan mucho espacio y es fácil acumular variantes casi idénticas. Revisa periódicamente Local Models → Library:
| Problema | Comprobaciones |
|---|---|
| La descarga no comienza o falla. | Revisa conexión, espacio libre y dispositivo de destino; luego utiliza Retry. |
| El modelo no aparece en el selector. | Confirma que finalizó, revisa Library y verifica que el dispositivo esté disponible. |
| La carga agota la memoria. | Reduce contexto, cierra otras cargas o descarga una cuantización menor. |
| Responde bien, pero no crea archivos. | Verifica soporte de herramientas y prueba un modelo entrenado para tool use. |
| Ignora instrucciones en tareas largas. | Divide la tarea, reduce fuentes, usa una variante de mayor fidelidad o cambia de modelo. |
| El equipo se vuelve muy lento. | Comprueba presión de memoria, procesos paralelos, contexto y uso de CPU/GPU. |
En el próximo tema aprenderemos a utilizar LM Link para ejecutar modelos desde otro dispositivo.
Fuentes oficiales consultadas: modelos locales en Bionic, selección de modelos, formatos y cuantización, carga y memoria, tool use y ajustes locales de Bionic 1.1.0.