Saltar al contenido principal

Seguimiento por voz - un teleprompter controlado por voz

El seguimiento por voz mueve el guion al ritmo al que hablas de verdad. Qué navegadores pueden hacerlo, adónde va el audio en cada uno y qué pasa cuando no pueden.

Qué hace el seguimiento por voz

El seguimiento por voz escucha mientras lees y mueve el guion para no quedarse atrás. Si bajas el ritmo, baja. Si te paras a contestar una pregunta, se para. Si retomas la frase, sigue desde ahí.

Está apagado cuando la página carga, y sigue apagado hasta que pulsas el botón del micrófono en la barra de controles. Antes de eso no escucha nada, y encenderlo es el momento en el que tu navegador te pide el micrófono. No hay ningún diálogo nuestro delante de ese, porque el interruptor ya eres tú pidiendo la función.

Lo que mueve el guion es una coincidencia, no un nivel de volumen. Toma las últimas palabras que ha oído, las busca entre las palabras que hay justo delante de la línea de lectura y mueve el guion hasta donde han caído. El habla que no está en el guion deja el guion donde estaba: una tos, un comentario a quien sujeta la luz, una palabra que el reconocedor entendió mal. Espera en lugar de dar un salto.

Adónde va tu audio

El reconocimiento de voz es el de tu navegador, no el nuestro. Según en qué navegador estés, tu audio se queda en tu máquina o va al fabricante de ese navegador para convertirse en texto. La línea que hay junto al interruptor te dice en cuál de los dos casos estás antes de que actives nada. En el primer camino dice:

El reconocimiento de voz se ejecuta en tu dispositivo. El audio no se sube.

En el segundo:

Tu navegador no puede reconocer el habla en el propio dispositivo. Si activas esto, el audio se envía al fabricante de tu navegador para transcribirlo.

Cuando el navegador puede reconocer el habla en el dispositivo, esto se lo pide. La primera vez que enciendes el seguimiento por voz puede que eso implique descargar un paquete de idioma; una vez instalado, el reconocimiento ocurre en tu máquina. Cuando el navegador no puede, que hoy significa Safari e iOS, el audio va al fabricante del navegador para transcribirse bajo las condiciones de ese fabricante.

En cualquiera de los dos casos nosotros no recibimos, no guardamos ni reenviamos tu audio. No estamos en ese camino en absoluto. Tu micrófono habla con tu navegador, y tu navegador nos entrega texto.

Esa línea está permanentemente junto al interruptor porque no lo dice nada más. El aviso de permisos de tu navegador pregunta si un sitio puede usar el micrófono. No dice adónde va el audio después, y la propia guía de Apple pone la tarea de explicarlo del lado del sitio y no del sistema.

Dos frases que no vamos a escribir, porque en algunos navegadores son falsas: aquí el reconocimiento no siempre es local, y el seguimiento por voz no siempre se puede usar sin conexión. Las dos son ciertas en el camino en el dispositivo, una vez descargado su paquete de idioma. Ninguna lo es en el camino del fabricante, donde la transcripción ocurre en otro sitio y hace falta conexión para llegar hasta ahí.

Qué navegadores pueden hacerlo

A 27 de agosto de 2026:

  • Chrome, en escritorio y en Android, funciona. El reconocimiento está ahí detrás de un prefijo desde Chrome 25, y desde Chrome 139 puede ejecutarse en el dispositivo, que es el camino que esto pide primero.
  • Safari funciona en Mac desde la 14.1 y en iOS desde la 14.5, por el camino del fabricante. Que Apple transcriba en el dispositivo o en un servidor depende del aparato y de sus ajustes, y un sitio web no puede ver cuál de las dos cosas está pasando, así que esta página no dice saberlo.
  • Edge tiene la interfaz y no es fiable con ella. Es habitual que falle en cuanto arranca el reconocimiento, sea cual sea el idioma que le pidas. Cuando eso pasa, el guion vuelve a una velocidad fija y lo dice.
  • Firefox, en escritorio y en Android, no lo pone a disposición de los sitios web. Se distribuye desactivado desde la versión 22.
  • Opera no lo admite.
  • Samsung Internet lo admite desde la versión 4.

caniuse sitúa el reconocimiento de voz en el 87,55 % del uso mundial de navegadores, contando el soporte parcial. Dos de los agujeros de ese número importan aquí: Firefox, y el Edge que te toque.

No te vamos a decir que todos los navegadores modernos admiten esto. Uno de los grandes no lo hace, y la primera persona que abriera esta página en Firefox podría decirlo.

El camino del fabricante también necesita conexión para funcionar siquiera. Solo el camino en el dispositivo funciona sin conexión, y solo una vez descargado su paquete de idioma.

Qué pasa cuando no puede

Tres estados, no dos.

Funciona. El interruptor está ahí y apagado. Lo enciendes, tu navegador te pide el micrófono, tú decides.

Aquí no puede funcionar. El botón se queda donde está, marcado como no disponible, con una línea debajo que dice que este navegador no puede reconocer el habla y que el guion avanzará a una velocidad fija. No escondemos el botón. Una página que describe una función que luego no encuentras por ninguna parte del producto se ha gastado tu visita en una promesa que nunca pensó cumplir. Al botón no disponible se sigue llegando con el teclado y sigue recibiendo el anillo de foco, y la línea que lo explica va pegada al botón en lugar de flotar cerca de él, así que un lector de pantalla recibe la explicación junto con el control.

Se rompió sobre la marcha. El reconocimiento puede estar presente y aun así fallar en el momento de arrancar. Edge lo hace de forma rutinaria, y un micrófono denegado o una conexión caída lo provocan en cualquier sitio. El seguimiento por voz se apaga solo, el avance a velocidad fija toma el relevo y la barra de controles dice que el guion ha vuelto a una velocidad fija. Lo anuncia en voz alta en lugar de limitarse a cambiar un color, porque en ese momento estás mirando la línea de lectura, no la barra.

Ese tercer estado es la razón por la que preguntarle al navegador si tiene la función no basta por sí solo. Edge responde que sí y después falla, así que el fallo hay que recogerlo donde ocurre y responderlo con algo que puedas ver.

En qué idioma escucha

El seguimiento por voz le pide al reconocedor el idioma en el que está la página, y le pregunta a tu navegador en ese momento si puede con ese idioma, en lugar de consultarlo en una lista que mantengamos nosotros. Chrome no publica ninguna lista de los idiomas que admite su reconocedor, y el conjunto de idiomas con modelos en el dispositivo cambia sin avisar. Una tabla en nuestro código estaría desactualizada en unos meses, y equivocada con aplomo.

Aquí se confunden dos listas. Los idiomas en los que está disponible la interfaz de este sitio y los idiomas que tu navegador sabe transcribir vienen de sitios distintos y no son el mismo conjunto. Ninguna de las dos te dice nada de la otra.

Si de verdad lo necesitas

La mayoría de las lecturas no lo necesitan. Una velocidad fija ajustada a tus propias palabras por minuto es el camino principal aquí, y el teleprompter está montado alrededor de eso. El seguimiento por voz se gana su sitio cuando el ritmo no lo pones tú: una entrevista donde alguien interrumpe, una demo donde esperas a que termine una compilación, una toma en la que te paras a mover una luz y empiezas el párrafo otra vez.

También cuesta algo. Quiere un micrófono, una sala lo bastante silenciosa para el reconocedor de tu navegador y, en casi todos los navegadores, conexión. Una velocidad fija no quiere nada de eso, y de ella salen tanto la duración que se ve en el escenario como el cronómetro de guiones.

Tampoco es una función rara. A 27 de agosto de 2026, VoicePrompter y SolPrompter siguen la voz gratis y sin registro. Lo que tiene de particular esta es más estrecho y comprobable: está apagado hasta que lo pides, toma el camino en el dispositivo siempre que el navegador ofrezca uno, te dice por qué camino vas antes de encenderlo y avisa en voz alta cuando se ha rendido.

Preguntas

¿Funciona en Firefox? No. Firefox no pone el reconocimiento de voz a disposición de los sitios web. El teleprompter sigue funcionando ahí; el guion avanza a una velocidad fija.

¿Se sube mi voz a algún sitio? Depende de tu navegador, y por eso el interruptor lo dice antes de que lo enciendas. En los navegadores que pueden reconocer el habla en el dispositivo, el audio se queda en el dispositivo. En Safari y en iOS va al fabricante del navegador para transcribirse. Nosotros no lo recibimos nunca.

¿Tengo que permitir el micrófono? Sí. Si no, el seguimiento por voz no puede oírte. Decir que no es una respuesta normal, y deja el guion a una velocidad fija.

¿Graba algo? No. Aquí no se graba ni audio ni video. El reconocedor convierte el habla en texto y el texto mueve el guion.

¿Qué pasa si se para en mitad de una toma? El guion vuelve a la velocidad que fijaste y la barra de controles lo dice, para que no tengas que averiguarlo tú.