Canonical prueba en Ubuntu 26.10 una función de dictado por voz con inteligencia artificial llamada Myna, capaz de transcribir texto en cualquier campo activo sin conexión a Internet. La herramienta, todavía en desarrollo, ya permite activar el reconocimiento de voz con un atajo de teclado y ha empezado a mostrar sus primeras piezas visibles mientras el sistema entra en la fase de congelación de funciones previa al lanzamiento.
Esta semana se ha añadido a las instalaciones por defecto de Ubuntu 26.10 una extensión de GNOME Shell que muestra un indicador en pantalla cuando Myna está escuchando y grabando audio. Conviene aclarar que Myna no es esa extensión: es un orquestador que carga un modelo de inteligencia artificial, gestiona la activación por atajo de teclado, envía el audio del micrófono al modelo y devuelve la transcripción al campo de texto de la aplicación mediante IBus. La extensión es solo la parte visible, la que os avisa de que el sistema está procesando vuestra voz.
Cómo se activa el dictado y qué vemos en pantalla
Para dictar con Myna basta con situar el cursor en el campo de texto donde queráis escribir y pulsar Super + T. A diferencia de lo que Canonical había descrito antes, ya no es necesario mantener la combinación pulsada: con una sola pulsación se activa la escucha. En pantalla aparece un indicador (OSD) con una onda animada que oscila mientras habláis, a modo de confirmación visual de que el micrófono está captando audio.
Al volver a pulsar el mismo atajo, la escucha se detiene, la animación se aplana y el sistema transcribe el audio en segundo plano. Tras una breve pausa, el texto aparece en el campo elegido. En las pruebas que hemos podido realizar, la entrada llegó correctamente a la mayoría de las aplicaciones probadas, incluidos el editor de texto de Ubuntu, la vista general de GNOME Shell y el navegador Firefox, aunque con cierta lentitud propia de una versión de desarrollo ejecutada desde código fuente en una máquina virtual.
Según la especificación de Myna, cerrar o minimizar la ventana de destino después de activar el dictado debería detener el proceso, aunque ese comportamiento no siempre se ha reproducido de forma fiable; el indicador en pantalla sí ha avisado en alguna ocasión de que se había perdido el foco de la ventana. Cambiar a otra ventana con Alt+Tab, en cambio, no interrumpe el dictado: Myna recuerda cuál era el campo de texto original y evita que el resultado acabe pegado en el sitio equivocado. Si el sistema no detecta ningún audio, también lo indica, ya que no puede transcribir silencio.
Whisper, modelos locales y una función opcional
Canonical asegura que ningún audio sale del dispositivo: Myna no depende de modelos en la nube, funciona íntegramente offline y el audio empleado para la transcripción no se almacena, registra ni se usa para entrenar ningún modelo. En las pruebas actuales, la herramienta emplea Whisper, pero el proyecto contempla ofrecer varios modelos locales distribuidos como snaps, algunos pensados para ejecutarse solo con GPU NVIDIA y otros exclusivamente en CPU, con distinto soporte de idiomas según el caso.
La idea es que, cuando la función esté lista para pruebas más amplias, el propio sistema elija automáticamente el modelo local más adecuado según el hardware disponible. Por ahora, ni los snaps de voz ni el orquestador de Myna están publicados en la Snap Store; la única forma de probarlos es compilando el código disponible en GitHub.
Jon Seager, vicepresidente de Ingeniería de Canonical, ha explicado que usar inteligencia artificial por el simple hecho de incluirla rara vez funciona, y que cualquier función que llegue a Ubuntu deberá aportar un valor real a quienes la usen. Bajo esa premisa, Myna está pensado como una función opt-in: nadie tendrá que activarla si el dictado por voz no le interesa.
Tanto el orquestador como los modelos de reconocimiento de voz que se descarguen se distribuirán como snaps, lo que facilita eliminarlos por completo si no queréis usarlos. Canonical tiene previsto además un método de entrada nativo para Wayland en una futura versión.
