L Lexi 下載 Lexi

怎麼把語音合成用出價值

語音合成不是母語者,但它有一個母語者沒有的優點:它可以無限次地、用一模一樣的方式重複同一句話。這篇說明聽、跟讀、錄自己、比對這一整套流程怎麼做,TTS 擅長什麼、不擅長什麼,以及為什麼把字唸出聲也幫你把它記住。

大多數人使用語音合成的方式是這樣:點一下,聽一遍,覺得「喔,原來是這樣唸」,然後往下一個。這個動作花了兩秒,效果也接近兩秒該有的樣子——你得到的是一個模糊的印象,隔天就沒了。

但語音合成有一個真人沒有的優點,而且這個優點被嚴重低估了:它可以無限次地、用完全一樣的方式重複同一句話,不會不耐煩,也不會第二次唸得跟第一次不一樣。這正是練發音最需要的條件——一個穩定的參考點。真人不會給你這個,因為真人每次唸都不太一樣,而且你不好意思請他唸第二十遍。

一套四步的流程

把「點一下聽聽看」換成下面這四步,同一句話花的時間會變成一分鐘左右,但得到的東西不是量級上的差別,是種類上的差別。

第一步:聽,而且要聽不只一次

先不要跟著唸。連續聽三遍,每一遍注意不同的東西:第一遍聽整句的意思和語調的起伏;第二遍找重音落在哪幾個字上;第三遍聽字和字之間有沒有黏在一起。

這一步很多人跳過,但它是最重要的一步。你唸不出來的音,多半是因為你還沒有真的聽出它。先建立一個清楚的目標,再去模仿那個目標。

第二步:跟讀

跟讀有兩種。一種是聽完一句、暫停、然後自己唸一遍,這比較容易,適合開始的時候用。另一種是幾乎同步地跟著唸,落後一兩個字,像影子一樣,這種比較難,但它逼你去複製節奏和語調,而不只是複製每一個音。

跟讀的重點在整句,不在單字。你要複製的是這句話的旋律——哪裡快、哪裡慢、哪裡拉長、哪裡吞掉。一個字一個字唸得標準、但節奏是平的,聽起來反而比帶點口音卻節奏對的更難懂。

第三步:錄自己

這一步大部分人不願意做,而它剛好是整套流程裡效果最明顯的一步。原因很簡單:你在講話的時候聽到的自己,和別人聽到的你,是兩個不同的東西——一部分聲音是透過你的頭骨傳到耳朵的。所以你自我感覺良好的發音,在錄音裡常常完全是另一回事。

用手機的錄音程式就夠了,不需要任何專門的軟體。唸同一句話,錄下來,然後放給自己聽。頭幾次會很不舒服,這是正常的,撐過去。

第四步:比對

把合成的那一句和自己錄的那一句連著放,中間不要停。差異會自己跳出來,而且通常不是你以為的那個地方——多數人以為問題在某個難唸的子音,實際聽起來最不對的往往是重音位置和整句的節奏。

找出最明顯的那一個差異,只修那一個,然後重錄一次。不要一次修五個地方,你做不到,而且你會分不清哪一個改動起了作用。

TTS 擅長的事

TTS 不擅長的事,要說清楚

它是合成音,不是母語者,而這兩件事的差別在幾個地方會浮出來。

第一,它給不了你回饋。它不會告訴你剛才唸錯了,也不會告訴你哪一個音在母語者耳裡最刺耳。整套流程裡的「判斷」那一步,仍然要靠你自己的耳朵,而你的耳朵正是還在訓練中的那個東西。這是這個方法真實的天花板。

第二,它處理罕見字、人名、地名和多音字時可能出錯。像 read、live、lead、bow 這種同拼不同音的字,合成引擎要靠上下文判斷,判斷錯了它會照樣很有自信地唸出來。所以遇到這類字,值得多找一個來源確認。

第三,它的情緒和口語變化有限。真實的對話裡有猶豫、有重講、有情緒帶來的語調變形,這些合成語音給不了。所以 TTS 適合用來建立標準的參考,不適合當作你唯一的聽力來源——那些還是要靠真實的說話素材。

第四,它是一個特定的聲音,而世界上的英文有很多種。把某一個合成聲音當成唯一的標準,會讓你在遇到真實的、帶著各種口音的英文時措手不及。

唸出聲,不只是在練發音

這一段可能是整篇裡最有用的。把一個字唸出來,對記住它本身就有幫助,而這和發音好不好無關。

原因有幾層。唸出聲會多動用一套通道——你不只看到它,還發出了它、聽到了自己發出的它。一個同時經過視覺、發音動作和聽覺的東西,比只經過視覺的東西留下更多的痕跡。這在記憶研究裡是個相當穩固的發現,通常被稱為產出效應。

還有一層比較實際:唸出聲會逼你在腦子裡把這個字完整地處理一遍。你可以用眼睛滑過一個字而幾乎沒有真的讀它——這件事每天都在發生。但你沒辦法唸出一個你沒有真正處理過的字,因為你得決定重音放哪裡、每個音節怎麼發。這個「不得不處理」的強制性,本身就是價值。

所以就算你完全不在意口音、只想把字記住,唸出聲仍然是划算的。它花的時間很少,而且不需要任何額外的東西。

Lexi 在這一塊的做法是:單字可以朗讀,整句也可以,用的是你裝置本身內建的語音合成,所以關掉網路它照樣出聲。閱讀的時候每個字上方都標著國際音標,你點任何一個字也會看到它的音標和釋義,所以你可以先看著音標猜一次怎麼唸,再讓它唸出來對答案——這個順序比直接聽有效,理由和讀句子的時候先猜再查是同一個。整句自動朗讀和整句逐字音標是 Pro 才有的。

一個十分鐘就能做完的練習

  1. 挑三到五句你今天實際讀過的句子,不要另外找材料。用你剛讀懂的句子,因為意思已經在你腦子裡了,你的注意力可以全部放在聲音上。
  2. 每一句先聽三遍,分別注意意思、重音、連音。
  3. 暫停跟讀兩遍,再試著同步跟讀一遍。
  4. 錄下自己唸的那一遍。
  5. 合成的和自己的連著放,找出最明顯的一個差異。
  6. 只修那一個,重錄一次,結束。

這套流程一天做五句,比一次做五十句然後三天不碰有用得多。發音的改變是靠反覆的小修正累積出來的,不是靠某一次很用力的練習。

常見問題

用語音合成練發音有效嗎?

有效,但要看你怎麼用。只點一下聽過去,效果非常有限;照著聽、跟讀、錄自己、比對這四步走,效果就明顯得多。語音合成最大的優勢是它可以無限次用完全一樣的方式重複同一句話,而這正是練發音需要的穩定參考點,真人反而給不了。

合成語音的發音準確嗎?

在常見字的重音和整句語調上通常相當可靠,因為這些是從詞典資料來的。比較容易出錯的是罕見字、人名地名,以及 read、live、bow 這類同拼不同音的字——合成引擎要靠上下文判斷,判斷錯了它還是會很有自信地唸出來。遇到這類字值得多找一個來源確認。

為什麼要把自己唸的錄下來?

因為你講話時聽到的自己和別人聽到的你不一樣,有一部分聲音是透過頭骨傳到你耳朵的。所以你自我感覺良好的發音,在錄音裡常常完全是另一回事。用手機內建的錄音程式就夠了,把合成的那一句和自己的連著放,差異會自己跳出來。

跟讀應該跟整句還是跟單字?

整句。你要複製的是這句話的旋律——哪裡快、哪裡慢、哪裡拉長、哪裡吞掉。每個字都唸得標準但節奏是平的,聽起來反而比帶點口音卻節奏正確的更難懂,因為英文的聽者主要是靠重音模式和節奏來辨認詞句的。

把單字唸出聲真的有助於記住嗎?

有。唸出聲會多動用發音動作和聽覺兩套通道,留下的痕跡比只用眼睛看多;而且你沒辦法唸出一個你沒有真正處理過的字,因為你得先決定重音和每個音節怎麼發。這個強制處理的效果,就算你完全不在意口音,也仍然划算。

花十分鐘把這個方法試一次

Lexi 每次給你一個短的英文句子,句子裡剛好只有一個字是你沒看過的:點它看音標和釋義,再點一下看整句翻譯,字和句都能朗讀。句庫就裝在你手機裡,所以沒網路也能讀,也不必註冊帳號。每天三十句、全部字表、全部釋義語言,都是免費的。

前往 App Store 下載

相關文章

全部文章