怎么用语音合成练发音
合成语音不能替你判断口音,但它能做另外几件很有用的事:给你一个随叫随到的参照、把重音位置摆清楚、让你听见连读。这篇讲怎么用它,以及为什么把词读出声不只是练发音。
过去要知道一个词怎么读,你得找到一段录音,或者找到一个人。现在几乎每一部手机里都内置了语音合成,任何一段文字都能立刻被读出来。这是个很大的便利,但它也带来一个新问题:很多人拿到这个工具之后,只是反复地按播放键听,然后什么也没发生。
听不等于练。这篇讲怎么把合成语音真正用出价值,也讲清它的边界在哪儿——因为把它当成一个能判断你发音对不对的老师,是最常见的误用。
一个可执行的四步循环
这四步加起来处理一个词大概三十秒,处理一个句子大概一分钟。关键是每一步都要做,尤其是第三步——那一步最不舒服,也最有用。
- 听。播放一遍,什么都不做,只听。注意听两件事:重音落在哪个音节上,以及这个词整体的节奏轮廓是长是短、是先重后轻还是相反。第一遍不要试图分辨每一个音素,那样反而会漏掉整体。
- 跟读。再播放一遍,然后立刻用同样的节奏把它说出来。注意是模仿节奏,不是模仿音素。多数人的发音问题在节奏上,而不在某个音上——一个每个音都准但节奏是平的句子,比一个有几个音不准但节奏对的句子更难懂。
- 录自己。用手机自带的录音功能录下你刚才那一遍。这一步是整个循环里唯一真正提供信息的一步,也是绝大多数人跳过的一步。原因很简单:人在说话时听到的自己,和别人听到的自己,是两个不同的声音——你的骨传导会给你一个更饱满、更接近你想要的效果的版本。不录音,你永远在校对一个失真的参照。
- 对比。把合成语音和你的录音连着放两遍。不要试图找出所有差别,只找最明显的那一处——通常是重音位置、某个元音的长短,或者一个句子里你把该弱读的部分读得太饱满了。改这一处,然后重来。
把这个循环用在你今天新学的三到五个词上就够了,不必对所有词都做。这件事的收益来自重复而不是覆盖面。
TTS 擅长什么
三件事,而且它在这三件事上比大多数替代方案都方便。
它给你一个随叫随到的读音参照
这解决了一个非常具体的问题:你在书上见过很多次、也知道意思、但从来没听过的词。这类词在阅读量大的人身上特别多,而且往往会被读错很多年,因为拼写会误导你——colonel、queue、subtle、debt、choir、epitome,这些词的读音和它们看起来的样子相差很远。让机器读一遍,两秒钟解决。
它把重音位置摆得很清楚
重音是英语可懂度里最要紧的一个变量,比任何单个元音都重要。而合成语音在重音上通常是可靠的——它读 photograph 和 photographer 时,你能清楚听出重音跑到了不同的位置。配合音标里的 ˈ 一起看,眼睛和耳朵会互相印证。
它让你听见连读
让它读整句,你会听到词与词之间发生的事:辅音和元音连起来(an apple 听起来像 a napple)、相同的辅音只发一次(this song)、以及那些功能词被压得很轻很短(of、to、and、for、can 在句子里几乎缩成一个模糊的音)。这些现象在单个词的发音里完全不存在,只有整句才显现,而它们正是「每个词都认识却听不懂整句」的主要原因。
TTS 不擅长什么
要说清楚边界,否则你会对它抱有错误的期待。
第一,它不能判断你读得对不对。它只会读,不会听。你用它对比是你在做判断,而你的判断能力恰恰受限于你能听出多少差别——这是一个循环。所以在能力的某一层之上,你还是需要一个人(或者一个专门做发音评测的工具)来告诉你哪里不对。
第二,它是合成音。近几年的合成语音已经相当自然,但它仍然是按规则和模型生成的,在情感、语气、真实对话里的犹豫和不规则处理上,跟一个活人说话不一样。它是一个稳定、干净、中性的参照,不是真实语言的完整样本。
第三,它在个别情况下会读错。多音词(read、live、lead、tear、wind)依赖上下文,机器有时会挑错那个读法;生僻的人名地名和缩写更容易出问题。所以当合成语音读出来的东西和你的预期严重不符时,值得再查一次,而不是直接相信它。
第四,也是最容易被误解的一点:它不是关于你口音的判断。你练到自己听着和它一样,并不等于母语者听你说话没有障碍。合成语音只能给你一个目标,不能给你一份反馈。
为什么读出声也帮你记住这个词
发音练习通常被归在「口语」那一栏,好像和记单词是两件事。其实不是。
一个词在你脑子里的表征,不只是它的拼写和意思,还包括它的声音形状——多少个音节、重音在哪儿、听起来是紧凑还是拖沓。如果你从来没有把一个词读出来过,那这一层几乎是空的,你记住的是一个视觉图形加一个中文对应,两个都相当脆弱。
而把它读出声,会同时调动发音动作和听觉,等于给同一个词多加了两条可以检索到它的路径。这也解释了一个很常见的现象:你在阅读里认得的词,在听力里完全反应不过来。因为你从来没有建立过那个词的声音形象,它在你脑子里只以文字形式存在。
所以读出声这件事,值得作为学词的默认步骤,而不是一个可选的加练。一个词学下来的完整动作大概是:在句子里读到它,猜它的意思,看释义确认,看一眼音标里的重音,读出来一遍。最后那一步只花两秒,但它把这个词从纯视觉的记忆里挪了出来。
在 Lexi 里的做法
这个 App 里任何一个单词都能被读出来,整句也能。声音用的是你手机自带的语音合成,所以关掉网络照样出声——这意味着上面那个四步循环在地铁上也做得了。点一个词,出来的是它的国际音标和释义,你可以边看着重音符号边听。
实践中比较顺的用法是:读到一句读不出来的,先点那个新词,看音标、听它读一遍、自己跟一遍;然后再听整句,注意这个词在句子里的读法和它单独被读时不一样——重音会重新分配,弱读会出现,这正是连读发生的地方。整句自动朗读和整句逐词音标是 Pro 的部分;但单个词的音标、单个词和整句的朗读,免费档就有。
常见问题
用语音合成练发音有用吗?
有用,但要看你怎么用。只是反复按播放键听,几乎不会有变化。有用的做法是一个循环:听一遍注意重音和节奏,跟读一遍,用手机把自己录下来,然后把两段连着放对比。第三步录音是最关键也最常被跳过的一步,因为人说话时听到的自己和别人听到的不是同一个声音。
合成语音和真人录音,哪个更适合练发音?
各有各的位置。合成语音的优势是随叫随到、任何一个词任何一句话都能读、而且稳定中性,适合当作参照来对比。真人录音的优势是它包含真实的语气、情感和对话里的不规则处理,这些是合成音给不了的。比较务实的分法是:查读音和练单词句子的节奏用合成语音,培养语感和听力则要靠真实的语料。
为什么我听自己的录音觉得完全不像自己?
因为你说话时听到的自己包含骨传导的成分,那会给你一个更低沉更饱满的版本,而别人听到的只有从空气里传过去的那一份。这也正是录音这一步不可省略的原因:不录音,你一直在校对一个失真的参照,你以为自己读得和范例一样,实际上差别可能很明显。
语音合成会读错吗?
会,主要在几种情况下。多音词依赖上下文,read、live、lead、tear、wind 这类词机器有时会挑错读法;生僻的人名地名和缩写更容易出问题。所以当它读出来的东西和你的预期严重不符时,值得另外查一次而不是直接相信。不过在常用词和普通句子上,它通常是可靠的,尤其在重音位置上。
把单词读出声,对记住它有帮助吗?
有,而且这一步常被低估。一个词在记忆里的表征包括它的声音形状——几个音节、重音在哪儿、听起来紧凑还是拖沓。从来没读出来过的词,这一层是空的,你记住的只是一个视觉图形加一个中文对应。这也解释了为什么很多人阅读里认得的词,在听力里完全反应不过来:那个词在脑子里只以文字形式存在。
练发音要不要先学音标?
建议先学,大概两三个小时能把符号认全。原因是成年人对母语里不存在的语音差别常常听不出来,中文里没有长短元音的对立,也没有 th 那个音,所以你可能一直在模仿一个自己根本没听见的区别。音标的作用是把这些差别用眼睛摆出来。之后再配合语音合成,一边看着重音符号一边听,眼睛和耳朵会互相印证。
拿十分钟试一遍这个方法
Lexi 每次给你一句短的英语句子,句子里恰好只有一个词是你没见过的:点它看音标和释义,再点一下看整句翻译,词和句都能朗读。句库就装在你手机里,所以没网也能读,也不用注册账号。每天三十句、全部词表、全部释义语言,都是免费的。