18. Entrada de voz y transcripción local con Voxtral

Bionic permite transformar la voz en texto en el propio equipo. Puedes dictar ideas, instrucciones y correcciones sin escribir cada palabra, revisar la transcripción y enviarla al agente como cualquier otro mensaje.

La implementación actual utiliza Voxtral de Mistral AI, un modelo multilingüe de transcripción en tiempo real. El procesamiento local del audio reduce la dependencia de servicios externos y mantiene la grabación en el dispositivo.

Idea central: la voz es un mecanismo de entrada. Voxtral produce texto; luego Bionic procesa ese texto con el modelo principal elegido para la sesión.

18.1 El recorrido completo de la voz

1. CapturaEl micrófono recibe el audio.
2. TranscripciónVoxtral convierte voz en texto localmente.
3. RevisiónEl usuario comprueba y corrige.
4. EnvíoEl texto entra en la sesión.
5. RespuestaEl modelo principal ejecuta el pedido.

La transcripción y la respuesta del agente son inferencias diferentes. Cambiar el modelo de chat no cambia necesariamente el modelo de voz, y mantener Voxtral cargado consume recursos aunque la sesión utilice un modelo en la nube.

18.2 Qué es Voxtral

Voxtral es la familia de modelos de audio de Mistral AI. Bionic emplea una variante orientada a transcripción multilingüe y de baja latencia. Su función en este flujo es reconocer lo dicho y generar texto; no sustituye al agente encargado de investigar, programar o editar documentos.

Responsabilidades separadas
ComponenteEntradaSalida
VoxtralAudio del micrófono.Transcripción textual.
Compositor de BionicTexto transcrito y correcciones.Mensaje que el usuario decide enviar.
Modelo de la sesiónMensaje, contexto y herramientas.Respuesta o acciones del agente.

18.3 Requisitos iniciales

  • Una versión actual de LM Studio Bionic.
  • Un micrófono reconocido por el sistema operativo.
  • Permiso del sistema para que Bionic acceda al micrófono.
  • Espacio para descargar el modelo de voz cuando Bionic lo solicite.
  • Memoria y capacidad de cómputo suficientes para mantenerlo cargado.

La descarga inicial requiere red. Una vez disponible el modelo, la documentación de Bionic describe la transcripción como local; las funciones que consulten servicios externos conservan sus propios requisitos de conectividad.

18.4 Primera configuración

  1. Abre Bionic y entra en Settings.
  2. Selecciona la sección Voice.
  3. Instala o selecciona el modelo de voz ofrecido por la aplicación, si todavía no está disponible.
  4. Concede el permiso de micrófono cuando el sistema operativo lo solicite.
  5. Regresa a una sesión y realiza una grabación breve de prueba.

La interfaz puede cambiar entre versiones. Sigue los nombres visibles en tu instalación y no descargues un archivo de voz desde un sitio no verificado para intentar incorporarlo manualmente.

18.5 Iniciar y detener el dictado

Coloca el foco en el compositor de la sesión, activa el control de voz y habla con naturalidad. La interfaz muestra la actividad del micrófono y permite detener la captura. Cuando termine, revisa el texto antes de enviarlo.

Necesito un resumen de los tres informes del proyecto. Compara objetivos, resultados y riesgos. No modifiques ningún archivo. Devuelve una tabla y termina con tres preguntas pendientes.

Conviene expresar los signos lógicos mediante pausas y frases breves, en lugar de dictar un párrafo demasiado largo sin estructura.

18.6 El teclado de voz en otras aplicaciones

La presentación oficial de Bionic indica que el teclado de voz puede iniciarse desde cualquier aplicación y transcribir donde se encuentre el cursor. Esto permite dictar en un editor, navegador o formulario sin limitarse al chat de Bionic.

Comprueba siempre el foco: antes de hablar, verifica qué ventana y campo están activos. Una transcripción podría insertarse en un chat, correo o terminal diferente del esperado.

Los atajos y permisos globales dependen de la versión de Bionic y del sistema operativo. Consúltalos en Settings → Voice en lugar de memorizar una combinación que puede variar.

18.7 Transcripción local no significa flujo totalmente local

AudioVoxtral lo procesa localmente en el dispositivo.
Texto transcritoSe inserta en Bionic o en la aplicación activa.
Destino posteriorDepende del modelo, las herramientas y la aplicación elegidos.

Si la sesión utiliza un modelo local, el prompt puede permanecer en el equipo. Si utiliza LM Studio Secure Cloud, el texto se procesa en la nube bajo la política de Zero Data Retention. Si dictas en otra aplicación, esa aplicación recibe el texto y se aplican sus propias reglas.

No dictes secretos por comodidad: contraseñas, claves API, datos médicos o información contractual pueden quedar en el campo activo, historial de la aplicación o contexto posterior.

18.8 Auto load voice model

La primera transcripción puede tardar mientras se carga el modelo. Para reducir esa espera, la documentación propone:

  1. Abrir Settings → Voice.
  2. Activar Auto load voice model.
Decidir si mantener Voxtral cargado
ConfiguraciónVentajaCoste
ActivadaEl dictado suele comenzar antes.Reserva memoria y recursos mientras el modelo permanece cargado.
DesactivadaLibera recursos cuando no se usa la voz.La primera captura puede esperar la carga.

Actívala si dictas con frecuencia y tu equipo tiene margen. Desactívala si necesitas priorizar modelos locales grandes u otras aplicaciones.

18.9 Preparar el micrófono y el entorno

  • Elige el micrófono correcto en el sistema operativo.
  • Evita saturación: mantén una distancia constante y no grites.
  • Reduce ventiladores, televisores y conversaciones de fondo.
  • Usa auriculares para impedir que la salida del equipo vuelva a entrar al micrófono.
  • Haz una prueba corta antes de dictar contenido importante.

La animación de audio confirma actividad, pero no garantiza que el nivel sea óptimo. Si el texto pierde palabras o inventa segmentos, compara primero con una grabación en una aplicación del sistema.

18.10 Dictar instrucciones que el agente pueda ejecutar

Hablar rápido no compensa un pedido ambiguo. Organiza mentalmente el mensaje en seis piezas:

Estructura recomendada
PiezaPreguntaEjemplo
Objetivo¿Qué resultado necesito?Prepara un informe.
Fuentes¿Qué debe leer?Usa los PDF de la carpeta reportes.
Alcance¿Qué queda incluido?Sólo el segundo trimestre.
Restricciones¿Qué no debe hacer?No modifiques originales.
Salida¿En qué formato?Markdown con una tabla.
Verificación¿Cómo demostrará calidad?Cita archivo y página.

18.11 Pausas, puntuación y correcciones

La puntuación automática puede variar según idioma, ritmo y audio. En instrucciones técnicas, una coma o una negación mal interpretada puede cambiar el objetivo.

  • Formula una idea completa por frase.
  • Haz una pausa entre objetivo, restricciones y salida.
  • Revisa especialmente palabras como «no», cifras y fechas.
  • Edita el texto manualmente en lugar de repetir todo el dictado.
  • No envíes automáticamente una orden con efectos externos.

18.12 Idiomas, nombres propios y términos técnicos

Voxtral es multilingüe, pero nombres de personas, acrónimos, rutas y palabras mezcladas entre idiomas son más difíciles. Pronuncia con claridad y verifica:

  • Extensiones como .html, .js y .css.
  • Identificadores con guiones o mayúsculas.
  • Versiones, importes, porcentajes y fechas.
  • Nombres de paquetes, ramas y archivos.
  • Términos parecidos que cambian una instrucción.
En el archivo tema dieciocho punto HTML, cambia solamente el título H uno. No modifiques main punto CSS ni main punto JS. Antes de guardar, muéstrame el texto exacto que interpretaste.

18.13 Dictado seguro para programación

La voz es excelente para explicar el síntoma y el resultado esperado, pero es frágil para cadenas exactas. Escribe o adjunta manualmente rutas, comandos, hashes y credenciales.

Investiga por qué falla la validación del formulario. Inspecciona primero los archivos relacionados. No cambies código todavía. Explica la causa con referencias a líneas y propón una corrección mínima.

Antes de autorizar una operación destructiva, lee el texto transcrito y los argumentos de la herramienta. Nunca confirmes basándote sólo en lo que recuerdas haber dicho.

18.14 Dictado para documentos y lluvia de ideas

La voz resulta especialmente útil para capturar ideas no estructuradas. Separa la captura de la transformación:

  1. Dicta ideas sin pedir acciones externas.
  2. Revisa nombres, cifras y afirmaciones.
  3. Pide al agente que organice el texto sin agregar hechos.
  4. Revisa el esquema antes de solicitar el documento final.
Organiza esta transcripción en objetivos, decisiones, tareas y preguntas abiertas. Conserva el significado, elimina repeticiones y marca como [REVISAR] cualquier frase ambigua. No inventes responsables ni fechas.

18.15 Medir calidad con una muestra conocida

Para evaluar el sistema, utiliza un texto de referencia de 50 a 100 palabras con vocabulario similar al de tu trabajo. Léelo en condiciones normales y compara la transcripción.

Registro sencillo de prueba
AspectoQué registrar
EntornoSilencioso, oficina o ruido alto.
MicrófonoDispositivo y distancia aproximada.
ArranqueTiempo hasta comenzar a transcribir.
ExactitudPalabras, cifras y nombres corregidos.
LatenciaDemora percibida durante y al finalizar.

Compara con y sin carga automática. No cambies micrófono, distancia e idioma simultáneamente: modifica una variable por prueba.

18.16 Práctica guiada dentro de Bionic

Objetivo: dictar, corregir y enviar un pedido verificable sin acciones de escritura.

  1. Abre una sesión nueva y confirma que el micrófono adecuado esté activo.
  2. Inicia la entrada de voz y dicta el texto propuesto.
  3. Detén la captura y no envíes todavía.
  4. Corrige nombres, negaciones, fecha y formato solicitado.
  5. Envía el mensaje y comprueba que la respuesta respete todas las restricciones.
Crea un plan de estudio para el viernes 4 de septiembre. Debe tener tres bloques de cuarenta minutos sobre MCP, Skills y permisos. Incluye diez minutos de descanso entre bloques. No crees archivos ni eventos. Devuelve solamente una tabla con horario, tema y objetivo.
Resultado esperado: la transcripción conserva fecha, cantidades y negaciones; la respuesta contiene tres bloques, dos descansos y ninguna acción externa.

18.17 Práctica con el teclado de voz

Abre un editor de texto sin información sensible, coloca el cursor en un documento de prueba e inicia el teclado de voz según los controles de tu versión.

Prueba de transcripción local. Hoy voy a registrar una idea, una decisión y una tarea pendiente. Idea: simplificar la portada. Decisión: conservar veinte temas. Tarea: revisar los enlaces mañana.

Detén la captura, comprueba el texto y deshaz la inserción. Esta prueba confirma el recorrido sin publicar, enviar ni guardar datos.

18.18 Diagnóstico de problemas

Problemas frecuentes
ProblemaComprobación o solución
No aparece el control de voz.Actualiza Bionic y revisa Settings → Voice.
No recibe audio.Comprueba permisos, micrófono predeterminado, silencio físico y nivel de entrada.
La primera transcripción tarda.Espera la carga del modelo o activa Auto load voice model.
Consume demasiada memoria.Desactiva la carga automática y reduce otras cargas locales.
Faltan palabras.Reduce ruido, habla en frases cortas y evita saturar el micrófono.
Falla con nombres o código.Corrige manualmente o escribe los literales exactos.
Se inserta en otra aplicación.Detén el dictado, corrige o deshaz y comprueba el foco antes de reintentar.
La onda queda inmóvil o saturada.Reinicia la captura, verifica el dispositivo y actualiza Bionic.

18.19 Lista de comprobación antes de enviar

  • El texto representa lo que realmente quise pedir.
  • Las negaciones, cantidades, fechas y nombres son correctos.
  • El cursor estaba en la aplicación y campo esperados.
  • No aparecieron secretos o datos innecesarios.
  • Las rutas y los comandos exactos fueron revisados manualmente.
  • Las acciones permitidas y prohibidas son inequívocas.
  • Si hay efectos externos, revisaré también la llamada antes de aprobarla.

18.20 Buenas prácticas cotidianas

  • Usa voz para ideas y contexto; usa teclado para literales exactos.
  • Dicta primero y envía después de revisar.
  • Divide solicitudes largas en etapas verificables.
  • Mantén Voxtral cargado sólo si el ahorro de tiempo justifica la memoria.
  • Realiza pruebas sin datos sensibles cuando cambies de micrófono o entorno.
  • Distingue privacidad del audio, destino del texto y ejecución del modelo principal.

18.21 Resumen

  • Bionic convierte voz en texto localmente mediante Voxtral.
  • El texto transcrito se revisa y luego se envía al agente.
  • El teclado de voz también puede insertar texto en otras aplicaciones.
  • La primera captura puede esperar mientras se carga el modelo.
  • Auto load voice model reduce la espera a cambio de memoria.
  • Transcripción local no implica que todo el flujo posterior sea local.
  • Negaciones, cifras, nombres, rutas y comandos requieren verificación.
  • La voz mejora la velocidad, pero no reemplaza la revisión humana.

En el próximo tema estudiaremos permisos, sandbox, modos de aprobación y Auto Review.

Fuentes oficiales consultadas: entrada de voz en Bionic, presentación de Bionic y su teclado de voz, descarga de modelos locales, modelos locales, remotos y cloud y cambios recientes de voz y transcripción.