Logo
返回博客
Fundamentals

从音标到段落,一次讲清英语发音评测基础题型

DolphinSOE 英语发音评测该如何选择 phoneme、word、sentence、chapter、wordcheck 等基础题型?本文按评测粒度、时长和纠错能力逐一说明。

从音标到段落,一次讲清英语发音评测基础题型

当你在语言学习 App 里念出 "good morning",屏幕几乎瞬间就给出了一组分数,还把哪个词、哪个音素拖了后腿都高亮了出来。在前一篇文章中,我们拆解过这套"音频 → 多维分数"的流水线。但很多开发者和产品经理第一次真正要着手开发一款应用时,可能会卡在一个看似简单的问题上:我到底该用哪种题型?

题型决定了参考文本怎么组织、评到什么粒度——引擎能评出什么,最终由它说了算。

英语发音评测从音标、单词、句子到段落的粒度递进示意图英语发音评测粒度从音标递进到段落

本篇文章将把英文基础题型一次性讲清楚,让你理解每种题型各自适合什么场景,关注哪些考察维度。

基础题型是什么?和高阶题型有何区别?

一个最简洁的定义:

基础题型 = 以固定参考文本(refText)驱动的朗读/跟读类题型。

引擎把用户发音和 refText 逐词、逐音素对齐后,输出分数与纠错信息。

英文基础题型共有七种:

题型名称&代码音频时长上限音频大小上限参考文本上限考察维度
音标 phoneme20 秒1 MB1 万字符整体:准确度、完整度;音标级别:准确度
单词 word / word_kids20 秒1 MB1 万字符整体:准确度、流利度、完整度;单词、音标级别:准确度
句子 sentence / sentence_kids90 秒1.5 MB1 万字符整体:准确度、流利度、完整度、韵律评分;单词级别:准确度、韵律评分;音标级别:准确度
段落 chapter / chapter_kids300 秒10 MB1 万字符整体:准确度、流利度、完整度;单词级别:准确度
单词纠错 wordcheck20 秒1 MB1 万字符整体:准确度;音标级别:准确度、类型(正常/多读/漏读/错读)
句子纠错 sentencecheck40 秒1.5 MB1 万字符整体:准确度、完整度、流利度、韵律评分;单词级别:准确度、韵律评分、类型(正常/多读/漏读/错读)
单词拼读 wordspell20 秒1.5 MB1 万字符拼读是否正确

它和高阶题型(问答题 qa、话题描述 topic、故事复述 retell、自由说 freedom 等)的核心区别在于:高阶题型大多没有固定 refText,评测目标也不再是"按参考文本读",而是"表达内容本身"。如果你想考察用户“读”的能力,那么就应该选择基础题型。

发音评测最细能评到什么粒度?先从音标题型(phoneme)说起

如果你想训练用户区分 /θ/ 和 /s/、/l/ 和 /r/ 的音标,那么真正关键的得分点在于"这个音素读对了吗"。这时候就该用音标题(phoneme)

音标题是所有题型里粒度最细的一个:用一个或多个音标作为参考文本,用户读出来,引擎返回整体得分 + 每个音素的得分。

它返回的评分信息包括:

  • overall / accuracy / integrity 分别对应三个整体得分:总分、准确度、完整度
  • 每个音标对应的:phoneme(标准音素)、hypothesis(实际读的音素)、score(音标得分),以及一个 type 标签(正常/漏读/重复读)

这就是评分体系里最末一级的粒度:单词题把“总分 → 单词 → 音节 → 音素”整条层级打包返回,而音标题相当于把“音素”这一层单独拎出来、重点评。它特别适合这些场景:

  • 音素启蒙教学(先不背单词,先搞定单个音)
  • 最小对立对训练(minimal pairs,如 ship / sheep)
  • 纠音前的“病灶定位”

单词题型(word)能看出哪些发音问题?

单词题(word)是口语学习App中最常见的入门题型:界面通常会显示一个单词或词组,用户朗读,评分引擎考察整体发音准确度、流利度、完整度,以及单词、音标级别的准确度

它也是文章开头示例的真实出处——"good morning" 返回的分数,从外层的总分,到每个单词的得分,再到音节、音素:

overall / accuracy
  └─ wordInfo(good / morning)
       └─ syllables(g_uh_d / m_ao_r ...)
            └─ phonemes(g / uh / d ...)

对照评测维度,单词题已经能覆盖其中的四项overallaccuracyfluencyintegrity,再加上单词级的 stress(重音节是否正确)。

单词题在实战里能解决几类具体问题,重点看你用它来应对什么场景:

  • 单词、词组、纯音标,通吃:参考内容既可以是普通单词或词组,也能直接是一串 IPA88 音标(比如 /mɑːkɪt/)。同一道题型,既能做词汇跟读,也能直接做音素级练习。
  • 英美口音都可以:引擎可以分别适配英式或美式发音。像 tomato、schedule 这类英美读法不同的词,通过参数指定对应变体后,就可以按指定口音标准打分。也可以设置不区分,用户读哪种口音就用哪种标准打分,不会因为口音不对被误伤。
  • 生僻读音手动标注:有些单词可能读法不常见,或者希望指定单词的读法,你可以提前把可接受的读法都告诉引擎,这样就可以按照你标注的读法来评分。
  • 为儿童专门设计:除了通用模型外,还专门提供了儿童语音模型,更贴合孩子的发声特点,打分比通用模型更适配、更友好。

句子题型(sentence)比单词题型多评了什么?

把单词连成句子,发音考察的维度立刻丰富起来。句子题型(sentence)时长上限 90 秒,比单词题更接近真实表达。句子题型同样也提供通用模型和儿童专用模型。

它比单词题多出来的,主要是语流维度

  • rhythm(韵律):包括 stress 重音、tone 音调、sense 意群停顿、句末语调 rearTone(升调/降调),以及总分
  • fluencypause 停顿次数、speed 语速快慢、总分
  • 单词级还多了 liaison(连读)的判定:是否该连读、实际连读与否、连读类型(失去爆破、叠合、辅音+元音……)

为什么这些维度在单词题里不考察?因为连读、弱读、停顿分布、句末语调,只有在连续语流里才有意义。单个单词是"静态"的,句子才提供"上下文",让流利度和韵律真正有数据支撑。

句子题还有两个进阶选项,对于陪练类产品非常合适:

  • comparison:在题型参数中传入一段标准音频的ID(需定制),开启对比模式,返回语速、语调、音量这3个维度与标准音的相关度曲线
  • realtime:通过公共参数传入,开启实时返回,可以边读边出分,用户体验更流畅
DolphinSOE 句子题型实时返回演示

段落题型(chapter)为什么是最综合的题型?

当文本长到一整段,比如课文、演讲片段、长对话,此时就该用段落题型(chapter)了。它的时长上限 300 秒,能够满足绝大多数场景需求。

段落题的返回结构也最立体:最外层是整体的评分,往下是 sentenceInfo(逐句),再往下是 wordInfo(逐词)。换句话说,它把句子题型的层级再包了一层。音素级评分和韵律评分,默认是不开启的,如果你需要这两个评分维度,需要手动设置一下参数。

此外还有一个实用的 clause_sign(分句标识)参数:默认按句号、问号、感叹号、分号分句;如果你的文本里有特殊断句需求(比如只想按换行符分句),也可以自己指定。

段落越长,漏读、多读、重复读就越容易发生,因此每个 wordInfo 都会带上 normal / delete / repeat 标签,帮你把“读漏了哪句、重复了哪句”直接标出来。段落题型同样也提供通用模型和儿童专用模型,也支持实时返回结果。

纠错类题型(wordcheck / sentencecheck)和上面几个题型的区别在哪?

前面几种题型,重点在“打分”。而 wordcheck(单词纠错)sentencecheck(句子纠错),重点在"指出错在哪"。这两种题型,表面上参数和普通题很像,但返回里把 type 字段变成了核心输出

type 取值含义出现在哪
normal正常读普通题 / 纠错题
insert多读(目标里没有、用户多说的)纠错题(句子)
repeat重复读普通题 / 纠错题
delete漏读普通题 / 纠错题
replace错读(如把 three 读成 tree)纠错题(句子 / 单词音素级)
oov集外词,无法评分普通题

具体来说:

  • wordcheck:只支持单个单词。词级 typenormal / repeat / delete;更细到音素级,还会标 insert(多读了一个音标)和 replace(某个音读错了,比如 /θ/ 读成 /s/)。
  • sentencecheck:句子级,词级 type 直接覆盖 normal / insert / delete / replace 四种,配合完整的 rhythm / fluency / integrity / accuracy,既打分又定位错误。

顾名思义,纠错类题型重点用于发音的纠正环节,陪练类、纠音类 App 几乎离不开纠错类的两个题型。选型时一句话总结:

  • 只想要得分 → 用 word / sentence
  • 想明确指出"哪里读错了" → 用 wordcheck / sentencecheck

单词拼读(wordspell)是个什么新题型?

最后是基础题型里的"新成员"——单词拼读(wordspell)。它走了一条不太一样的路:App 界面给出一个单词的含义,用户要想到对应的英文单词,并按字母拼读,比如看到提示词“猫”,就依次说出“C-A-T”。

它的返回也更简单,直接返回实际读的字母和置信度,以及每个字母的开始和结束时间。典型场景是线上拼读比赛、自然拼读(Phonics)教学。需要注意它只支持逐个字母拼,目前还不支持 double、triple 这类连读式拼写。

对于这个题型,不必关注打分维度,把它理解为“基础题型矩阵里一个面向拼写场景的特殊入口”即可。

为什么不同题型的评分维度会不一样?

原因其实很简单:**题型决定评测粒度,粒度决定能计算哪些维度。**以下面四个题型为例:

题型评测粒度能拿到的核心维度
phoneme 音标音素overall / accuracy / integrity + 音素级分
word 单词单词 → 音节 → 音素+ fluency、stress(重音)
sentence 句子句 → 单词 → 音素+ rhythm(重音 / 音调 / 意群停顿)、liaison 连读
chapter 段落段 → 句 → 单词 → 音素综合全部,外加逐句 sentenceInfo

可以看到一条清晰的递进链:粒度越粗,能观测的语流特征越多——单词没有"上下文",自然算不出连读和句末语调;到了句子、段落,韵律和流利度才真正有数据支撑。对于韵律评分,需要进行特殊标注以指定韵律读法,具体内容将在后续文章中详细讲解。

选型时最该先问自己哪三个问题?

作为产品经理,实际选型时先问自己三个问题就够了:

  1. 文本多长、能录音多久?
    • 一两个词 → word(20 秒)
    • 一两句话 → sentence(90 秒)
    • 一整段课文 → chapter(300 秒)
  2. 关注综合打分,还是关注纠错?
    • 只要打分 → 普通题(word / sentence / chapter
    • 要定位错误 → 纠错题(wordcheck / sentencecheck
  3. 用户是成人还是儿童?
    • 成人 → 标准模型
    • 儿童 → 对应的 word_kids / sentence_kids / chapter_kids

如果还涉及“拼写”或“最小音素训练”这类特殊场景,考虑 wordspellphoneme 题型即可。

结语

基础题型,本质上是一套**"由参考文本驱动、粒度从音素到段落"的朗读评测体系**。看懂 phoneme → word → sentence → chapter 这条粒度轴,你就掌握了 DolphinSOE 英文评测的能力边界;再配合 wordcheck / sentencecheck 的纠错标签,又能把“打分”升级成“教学”。

如果还想了解无固定参考文本的开放题型——问答题、话题描述、故事复述等,欢迎关注后续的高阶题型相关文章。

DolphinSOE 发音评测已在日本市场稳定运行,目前日均调用量约 10 万次(100k calls/day),客户覆盖外语学习 App、学校、课外班等各类教育机构,能力经过真实高并发、教学级场景的持续验证。我们提供API接入的免费技术咨询和一个月的无偿试用,如需商务合作,欢迎联系我们

分享文章