跳過主要內容

語音跟讀 - 聲控提詞器

語音跟讀讓文稿按你真實的語速走。哪些瀏覽器能用、各自的音訊去了哪裡、不能用的時候會怎樣。

語音跟讀做了什麼

語音跟讀在你念的時候聽著,讓文稿跟上你。你慢下來它就慢,你停下來回答一個問題它就 停,你接著往下念它就從那裡繼續。

頁面載入時它是關的,一直關到你按下控制項欄裡的麥克風按鈕為止。在那之前沒有任何東西 在聽;打開它的那一刻,就是瀏覽器向你要麥克風權限的那一刻。我們不會在瀏覽器那個彈 窗前面再加一個自己的彈窗——你按下開關,本身就已經是你在要這個功能。

推動文稿的是字詞比對,不是音量。它取你剛說完的幾個詞,在閱讀線前方的那一小段文字裡 找,找到就把文稿移到那裡。文稿裡沒有的話不會讓文稿動:一聲咳嗽、跟舉燈的人說的一 句閒話、辨識錯的一個詞,都不會。它寧可等著,也不會猛地跳一下。

你的音訊去了哪裡

語音辨識是瀏覽器的,不是我們的。你在哪個瀏覽器裡,決定了音訊是留在你的機器上,還 是交給那個瀏覽器的廠商去轉成文字。開關旁邊的那行字,在你打開任何東西之前就寫明了 你走的是哪一條。第一條路上寫的是:

語音辨識在你的裝置上進行,音訊不會上傳。

第二條路上寫的是:

你的瀏覽器無法在本機進行語音辨識。開啟後,音訊會發送給你的瀏覽器廠商轉寫。

只要瀏覽器能在裝置上辨識,我們就請它這麼做。第一次打開語音跟讀時,這可能意味著要 下載一個語言包;語言包裝好之後,辨識就發生在你自己的機器上。瀏覽器做不到的時候 ——今天是 Safari 和 iOS——音訊會交給瀏覽器廠商轉寫,適用該廠商的條款。

兩條路都一樣:我們不接收、不儲存、也不轉發你的音訊。我們根本不在這條路上。你的麥 克風對著你的瀏覽器講話,瀏覽器交給我們的是文字。

那行字常駐在開關旁邊,因為沒有別的地方會說這件事。瀏覽器的權限彈窗問的是「這個網 站能不能用麥克風」,它不會說音訊之後去了哪裡;而蘋果自己的指引,就是把解釋這件事 的責任放在網站身上,而不是系統身上。

有兩句話我們不會寫,因為在某些瀏覽器上它們是假的:這裡的辨識並不總是在本機,語音 跟讀也並不總是能離線用。在本機那條路上、語言包下載完之後,這兩句都成立;在廠商那 條路上,兩句都不成立——轉寫發生在別處,要聯網才到得了。

哪些瀏覽器能用

截至 2026 年 8 月 27 日:

  • Chrome,桌面版和 Android 版,可用。語音辨識從 Chrome 25 起就帶前綴存在,從 Chrome 139 起可以在裝置上跑,而這正是我們優先請求的那條路。
  • Safari 可用:Mac 上從 14.1 起,iOS 上從 14.5 起,走的是廠商那條路。蘋果究竟是在 裝置上轉寫還是在伺服器上轉寫,取決於裝置和它的設定,網站看不到實際走的是哪種, 所以這一頁不假裝知道。
  • Edge 有這個API,但用起來不可靠。不管你請求哪種語言,它常常在辨識剛開始的那一刻 就失敗。真發生時,文稿會退回固定速度滾動,並且會說出來。
  • Firefox,桌面版和 Android 版,都不向網站開放這個功能。它從第 22 版起就是預設關閉 發布的。
  • Opera 不支援。
  • 三星瀏覽器從第 4 版起支援。

caniuse 給語音辨識的數字是全球瀏覽器使用量的 87.55%,其中含部分支援。這個數字裡有 兩個缺口跟這裡有關:Firefox,以及你手上碰巧是哪一版的 Edge。

我們不會跟你說「所有現代瀏覽器都支援」。大牌裡就有一個不支援,而第一個用 Firefox 打開這一頁的人就能當場戳穿。

廠商那條路還得聯網才能工作。只有本機那條路能離線跑,而且要等它的語言包下載完。

用不了的時候會怎樣

三種狀態,不是兩種。

能用。開關在那裡,是關著的。你打開它,瀏覽器向你要麥克風,你自己決定。

這裡用不了。按鈕還在原處,標成不可用,下面一行字說明這個瀏覽器做不了語音辨 識,文稿將按固定速度滾動。我們不把按鈕藏起來。一個頁面描述了某個功能,你卻在產品 裡到處都找不到它,那這次訪問就被一個從沒打算兑現的承諾花掉了。不可用的按鈕仍然能 用鍵盤走到,仍然有焦點框,而那行解釋是掛在按鈕上的、不是飄在旁邊的,所以螢幕報讀軟體 會連著控制項一起把解釋念出來。

跑著跑著壞了。辨識可以明明存在,卻在啟動的那一刻失敗。Edge 就經常這樣;而麥 克風被拒絕、或者連接掉了,在哪個瀏覽器上都會這樣。語音跟讀會自己關掉,固定速度接 管,控制項欄說明文稿已回到固定速度。它是出聲說,而不是只換一個顏色——因為在那一刻你 看的是閱讀線,不是控制項欄。

第三種狀態正是「問一句瀏覽器支不支援」不夠用的原因。Edge 會回答支援,然後失敗;所 以失敗必須在它發生的地方被接住,並且用你看得見的東西回應。

它聽的是哪種語言

語音跟讀向辨識器請求的是頁面目前的語言,並且是在那一刻去問你的瀏覽器能不能做這門 語言,而不是去查一張我們自己維護的表。Chrome 沒有公布它的辨識器支援哪些語言,而帶 本機模型的語言集合會不打招呼地變。一張寫在我們程式碼裡的表,幾個月內就會過期,而且 會錯得很篤定。

這裡有兩份名單容易被混為一談:這個網站的介面有哪些語言,和你的瀏覽器能轉寫哪些語 言,來自不同的地方,也不是同一個集合。哪一份都推不出另一份。

你到底需不需要它

大部分讀稿並不需要它。按你自己的每分鐘詞數設一個固定速度,才是這裡的主路, 提詞器就是圍著它做的。語音跟讀值回票價的場合,是節奏不由你定的時候:一場隨時 有人插話的訪談,一個要等編譯跑完的簡報,一條中途停下來挪燈、然後從這一段重來的 錄製。

它也是要付代價的。它要一個麥克風、一個安靜到瀏覽器辨識器聽得清的房間,在多數瀏覽 器上還要聯網。固定速度這些都不要,而舞臺上的時長估算和 文稿計時器都是從它來的。

這也不是什麼稀有功能。截至 2026 年 8 月 27 日, VoicePrompterSolPrompter 都免費、免註冊地跟讀語音。這一個的特別之處 更窄,也更容易核對:你不叫它,它就不開;只要瀏覽器給得出本機那條路,它就走本機; 在你打開之前它就告訴你走的是哪條路;它放棄的時候會說出來。

常見問題

Firefox 裡能用嗎? 不能。Firefox 不向網站開放語音辨識。提詞器在那裡照樣能用,只是文稿按固定速度滾。

我的聲音會被上傳嗎? 取決於你的瀏覽器,所以開關在你打開之前就寫明了。能在裝置上辨識的瀏覽器,音訊留在 裝置上;Safari 和 iOS 上,音訊交給瀏覽器廠商轉寫。我們從不接收它。

必須允許麥克風嗎? 必須。否則語音跟讀聽不見你。拒絕是很正常的回答,拒絕之後文稿按固定速度走。

它會錄下什麼嗎? 不會。這裡沒有任何東西錄音或錄影。辨識器把語音變成文字,文字推動文稿。

錄到一半它停了會怎樣? 文稿回到你設的速度,控制項欄會說明這件事,不用你自己去猜。