跳过主要内容

语音跟读 - 声控提词器

语音跟读让文稿按你真实的语速走。哪些浏览器能用、各自的音频去了哪里、不能用的时候会怎样。

语音跟读做了什么

语音跟读在你念的时候听着,让文稿跟上你。你慢下来它就慢,你停下来回答一个问题它就 停,你接着往下念它就从那儿继续。

页面加载时它是关的,一直关到你按下控件栏里的麦克风按钮为止。在那之前没有任何东西 在听;打开它的那一刻,就是浏览器向你要麦克风权限的那一刻。我们不会在浏览器那个弹 窗前面再加一个自己的弹窗——你按下开关,本身就已经是你在要这个功能。

推动文稿的是匹配,不是音量。它取你刚说完的几个词,在阅读线前方的那一小段文字里 找,找到就把文稿移到那里。文稿里没有的话不会让文稿动:一声咳嗽、跟举灯的人说的一 句闲话、识别错的一个词,都不会。它宁可等着,也不会猛地跳一下。

你的音频去了哪里

语音识别是浏览器的,不是我们的。你在哪个浏览器里,决定了音频是留在你的机器上,还 是交给那个浏览器的厂商去转成文字。开关旁边的那行字,在你打开任何东西之前就写明了 你走的是哪一条。第一条路上写的是:

语音识别在你的设备上进行,音频不会上传。

第二条路上写的是:

你的浏览器无法在本机进行语音识别。开启后,音频会发送给你的浏览器厂商转写。

只要浏览器能在设备上识别,我们就请它这么做。第一次打开语音跟读时,这可能意味着要 下载一个语言包;语言包装好之后,识别就发生在你自己的机器上。浏览器做不到的时候 ——今天是 Safari 和 iOS——音频会交给浏览器厂商转写,适用该厂商的条款。

两条路都一样:我们不接收、不存储、也不转发你的音频。我们根本不在这条路上。你的麦 克风对着你的浏览器讲话,浏览器交给我们的是文字。

那行字常驻在开关旁边,因为没有别的地方会说这件事。浏览器的权限弹窗问的是「这个网 站能不能用麦克风」,它不会说音频之后去了哪儿;而苹果自己的指引,就是把解释这件事 的责任放在网站身上,而不是系统身上。

有两句话我们不会写,因为在某些浏览器上它们是假的:这里的识别并不总是在本机,语音 跟读也并不总是能离线用。在本机那条路上、语言包下载完之后,这两句都成立;在厂商那 条路上,两句都不成立——转写发生在别处,要联网才到得了。

哪些浏览器能用

截至 2026 年 8 月 27 日:

  • Chrome,桌面版和 Android 版,可用。语音识别从 Chrome 25 起就带前缀存在,从 Chrome 139 起可以在设备上跑,而这正是我们优先请求的那条路。
  • Safari 可用:Mac 上从 14.1 起,iOS 上从 14.5 起,走的是厂商那条路。苹果究竟是在 设备上转写还是在服务器上转写,取决于设备和它的设置,网站看不到实际走的是哪种, 所以这一页不假装知道。
  • Edge 有这个接口,但用起来不可靠。不管你请求哪种语言,它常常在识别刚开始的那一刻 就失败。真发生时,文稿会退回固定速度滚动,并且会说出来。
  • Firefox,桌面版和 Android 版,都不向网站开放这个功能。它从第 22 版起就是默认关闭 发布的。
  • Opera 不支持。
  • 三星浏览器从第 4 版起支持。

caniuse 给语音识别的数字是全球浏览器使用量的 87.55%,其中含部分支持。这个数字里有 两个缺口跟这里有关:Firefox,以及你手上碰巧是哪一版的 Edge。

我们不会跟你说「所有现代浏览器都支持」。大牌里就有一个不支持,而第一个用 Firefox 打开这一页的人就能当场戳穿。

厂商那条路还得联网才能工作。只有本机那条路能离线跑,而且要等它的语言包下载完。

用不了的时候会怎样

三种状态,不是两种。

能用。开关在那儿,是关着的。你打开它,浏览器向你要麦克风,你自己决定。

这里用不了。按钮还在原处,标成不可用,下面一行字说明这个浏览器做不了语音识 别,文稿将按固定速度滚动。我们不把按钮藏起来。一个页面描述了某个功能,你却在产品 里到处都找不到它,那这次访问就被一个从没打算兑现的承诺花掉了。不可用的按钮仍然能 用键盘走到,仍然有焦点框,而那行解释是挂在按钮上的、不是飘在旁边的,所以读屏软件 会连着控件一起把解释念出来。

跑着跑着坏了。识别可以明明存在,却在启动的那一刻失败。Edge 就经常这样;而麦 克风被拒绝、或者连接掉了,在哪个浏览器上都会这样。语音跟读会自己关掉,固定速度接 管,控件栏说明文稿已回到固定速度。它是出声说,而不是只换一个颜色——因为在那一刻你 看的是阅读线,不是控件栏。

第三种状态正是「问一句浏览器支不支持」不够用的原因。Edge 会回答支持,然后失败;所 以失败必须在它发生的地方被接住,并且用你看得见的东西回应。

它听的是哪种语言

语音跟读向识别器请求的是页面当前的语言,并且是在那一刻去问你的浏览器能不能做这门 语言,而不是去查一张我们自己维护的表。Chrome 没有公布它的识别器支持哪些语言,而带 本机模型的语言集合会不打招呼地变。一张写在我们代码里的表,几个月内就会过期,而且 会错得很笃定。

这里有两份名单容易被混为一谈:这个网站的界面有哪些语言,和你的浏览器能转写哪些语 言,来自不同的地方,也不是同一个集合。哪一份都推不出另一份。

你到底需不需要它

大部分读稿并不需要它。按你自己的每分钟词数设一个固定速度,才是这里的主路, 提词器就是围着它做的。语音跟读值回票价的场合,是节奏不由你定的时候:一场随时 有人插话的访谈,一个要等编译跑完的演示,一条中途停下来挪灯、然后从这一段重来的 录制。

它也是要付代价的。它要一个麦克风、一个安静到浏览器识别器听得清的房间,在多数浏览 器上还要联网。固定速度这些都不要,而舞台上的时长估算和 文稿计时器都是从它来的。

这也不是什么稀有功能。截至 2026 年 8 月 27 日, VoicePrompterSolPrompter 都免费、免注册地跟读语音。这一个的特别之处 更窄,也更容易核对:你不叫它,它就不开;只要浏览器给得出本机那条路,它就走本机; 在你打开之前它就告诉你走的是哪条路;它放弃的时候会说出来。

常见问题

Firefox 里能用吗? 不能。Firefox 不向网站开放语音识别。提词器在那里照样能用,只是文稿按固定速度滚。

我的声音会被上传吗? 取决于你的浏览器,所以开关在你打开之前就写明了。能在设备上识别的浏览器,音频留在 设备上;Safari 和 iOS 上,音频交给浏览器厂商转写。我们从不接收它。

必须允许麦克风吗? 必须。否则语音跟读听不见你。拒绝是很正常的回答,拒绝之后文稿按固定速度走。

它会录下什么吗? 不会。这里没有任何东西录音或录像。识别器把语音变成文字,文字推动文稿。

录到一半它停了会怎样? 文稿回到你设的速度,控件栏会说明这件事,不用你自己去猜。