Bionic permite transformar la voz en texto en el propio equipo. Puedes dictar ideas, instrucciones y correcciones sin escribir cada palabra, revisar la transcripción y enviarla al agente como cualquier otro mensaje.
La implementación actual utiliza Voxtral de Mistral AI, un modelo multilingüe de transcripción en tiempo real. El procesamiento local del audio reduce la dependencia de servicios externos y mantiene la grabación en el dispositivo.
La transcripción y la respuesta del agente son inferencias diferentes. Cambiar el modelo de chat no cambia necesariamente el modelo de voz, y mantener Voxtral cargado consume recursos aunque la sesión utilice un modelo en la nube.
Voxtral es la familia de modelos de audio de Mistral AI. Bionic emplea una variante orientada a transcripción multilingüe y de baja latencia. Su función en este flujo es reconocer lo dicho y generar texto; no sustituye al agente encargado de investigar, programar o editar documentos.
| Componente | Entrada | Salida |
|---|---|---|
| Voxtral | Audio del micrófono. | Transcripción textual. |
| Compositor de Bionic | Texto transcrito y correcciones. | Mensaje que el usuario decide enviar. |
| Modelo de la sesión | Mensaje, contexto y herramientas. | Respuesta o acciones del agente. |
La descarga inicial requiere red. Una vez disponible el modelo, la documentación de Bionic describe la transcripción como local; las funciones que consulten servicios externos conservan sus propios requisitos de conectividad.
La interfaz puede cambiar entre versiones. Sigue los nombres visibles en tu instalación y no descargues un archivo de voz desde un sitio no verificado para intentar incorporarlo manualmente.
Coloca el foco en el compositor de la sesión, activa el control de voz y habla con naturalidad. La interfaz muestra la actividad del micrófono y permite detener la captura. Cuando termine, revisa el texto antes de enviarlo.
Conviene expresar los signos lógicos mediante pausas y frases breves, en lugar de dictar un párrafo demasiado largo sin estructura.
La presentación oficial de Bionic indica que el teclado de voz puede iniciarse desde cualquier aplicación y transcribir donde se encuentre el cursor. Esto permite dictar en un editor, navegador o formulario sin limitarse al chat de Bionic.
Los atajos y permisos globales dependen de la versión de Bionic y del sistema operativo. Consúltalos en Settings → Voice en lugar de memorizar una combinación que puede variar.
Si la sesión utiliza un modelo local, el prompt puede permanecer en el equipo. Si utiliza LM Studio Secure Cloud, el texto se procesa en la nube bajo la política de Zero Data Retention. Si dictas en otra aplicación, esa aplicación recibe el texto y se aplican sus propias reglas.
La primera transcripción puede tardar mientras se carga el modelo. Para reducir esa espera, la documentación propone:
| Configuración | Ventaja | Coste |
|---|---|---|
| Activada | El dictado suele comenzar antes. | Reserva memoria y recursos mientras el modelo permanece cargado. |
| Desactivada | Libera recursos cuando no se usa la voz. | La primera captura puede esperar la carga. |
Actívala si dictas con frecuencia y tu equipo tiene margen. Desactívala si necesitas priorizar modelos locales grandes u otras aplicaciones.
La animación de audio confirma actividad, pero no garantiza que el nivel sea óptimo. Si el texto pierde palabras o inventa segmentos, compara primero con una grabación en una aplicación del sistema.
Hablar rápido no compensa un pedido ambiguo. Organiza mentalmente el mensaje en seis piezas:
| Pieza | Pregunta | Ejemplo |
|---|---|---|
| Objetivo | ¿Qué resultado necesito? | Prepara un informe. |
| Fuentes | ¿Qué debe leer? | Usa los PDF de la carpeta reportes. |
| Alcance | ¿Qué queda incluido? | Sólo el segundo trimestre. |
| Restricciones | ¿Qué no debe hacer? | No modifiques originales. |
| Salida | ¿En qué formato? | Markdown con una tabla. |
| Verificación | ¿Cómo demostrará calidad? | Cita archivo y página. |
La puntuación automática puede variar según idioma, ritmo y audio. En instrucciones técnicas, una coma o una negación mal interpretada puede cambiar el objetivo.
Voxtral es multilingüe, pero nombres de personas, acrónimos, rutas y palabras mezcladas entre idiomas son más difíciles. Pronuncia con claridad y verifica:
.html, .js y .css.La voz es excelente para explicar el síntoma y el resultado esperado, pero es frágil para cadenas exactas. Escribe o adjunta manualmente rutas, comandos, hashes y credenciales.
Antes de autorizar una operación destructiva, lee el texto transcrito y los argumentos de la herramienta. Nunca confirmes basándote sólo en lo que recuerdas haber dicho.
La voz resulta especialmente útil para capturar ideas no estructuradas. Separa la captura de la transformación:
Para evaluar el sistema, utiliza un texto de referencia de 50 a 100 palabras con vocabulario similar al de tu trabajo. Léelo en condiciones normales y compara la transcripción.
| Aspecto | Qué registrar |
|---|---|
| Entorno | Silencioso, oficina o ruido alto. |
| Micrófono | Dispositivo y distancia aproximada. |
| Arranque | Tiempo hasta comenzar a transcribir. |
| Exactitud | Palabras, cifras y nombres corregidos. |
| Latencia | Demora percibida durante y al finalizar. |
Compara con y sin carga automática. No cambies micrófono, distancia e idioma simultáneamente: modifica una variable por prueba.
Objetivo: dictar, corregir y enviar un pedido verificable sin acciones de escritura.
Abre un editor de texto sin información sensible, coloca el cursor en un documento de prueba e inicia el teclado de voz según los controles de tu versión.
Detén la captura, comprueba el texto y deshaz la inserción. Esta prueba confirma el recorrido sin publicar, enviar ni guardar datos.
| Problema | Comprobación o solución |
|---|---|
| No aparece el control de voz. | Actualiza Bionic y revisa Settings → Voice. |
| No recibe audio. | Comprueba permisos, micrófono predeterminado, silencio físico y nivel de entrada. |
| La primera transcripción tarda. | Espera la carga del modelo o activa Auto load voice model. |
| Consume demasiada memoria. | Desactiva la carga automática y reduce otras cargas locales. |
| Faltan palabras. | Reduce ruido, habla en frases cortas y evita saturar el micrófono. |
| Falla con nombres o código. | Corrige manualmente o escribe los literales exactos. |
| Se inserta en otra aplicación. | Detén el dictado, corrige o deshaz y comprueba el foco antes de reintentar. |
| La onda queda inmóvil o saturada. | Reinicia la captura, verifica el dispositivo y actualiza Bionic. |
En el próximo tema estudiaremos permisos, sandbox, modos de aprobación y Auto Review.
Fuentes oficiales consultadas: entrada de voz en Bionic, presentación de Bionic y su teclado de voz, descarga de modelos locales, modelos locales, remotos y cloud y cambios recientes de voz y transcripción.