从音标到段落,一次讲清英语发音评测基础题型
DolphinSOE 英语发音评测该如何选择 phoneme、word、sentence、chapter、wordcheck 等基础题型?本文按评测粒度、时长和纠错能力逐一说明。

当你在语言学习 App 里念出 "good morning",屏幕几乎瞬间就给出了一组分数,还把哪个词、哪个音素拖了后腿都高亮了出来。在前一篇文章中,我们拆解过这套"音频 → 多维分数"的流水线。但很多开发者和产品经理第一次真正要着手开发一款应用时,可能会卡在一个看似简单的问题上:我到底该用哪种题型?
题型决定了参考文本怎么组织、评到什么粒度——引擎能评出什么,最终由它说了算。
英语发音评测粒度从音标递进到段落本篇文章将把英文基础题型一次性讲清楚,让你理解每种题型各自适合什么场景,关注哪些考察维度。
基础题型是什么?和高阶题型有何区别?
一个最简洁的定义:
基础题型 = 以固定参考文本(refText)驱动的朗读/跟读类题型。
引擎把用户发音和 refText 逐词、逐音素对齐后,输出分数与纠错信息。
英文基础题型共有七种:
| 题型名称&代码 | 音频时长上限 | 音频大小上限 | 参考文本上限 | 考察维度 |
|---|---|---|---|---|
| 音标 phoneme | 20 秒 | 1 MB | 1 万字符 | 整体:准确度、完整度;音标级别:准确度 |
| 单词 word / word_kids | 20 秒 | 1 MB | 1 万字符 | 整体:准确度、流利度、完整度;单词、音标级别:准确度 |
| 句子 sentence / sentence_kids | 90 秒 | 1.5 MB | 1 万字符 | 整体:准确度、流利度、完整度、韵律评分;单词级别:准确度、韵律评分;音标级别:准确度 |
| 段落 chapter / chapter_kids | 300 秒 | 10 MB | 1 万字符 | 整体:准确度、流利度、完整度;单词级别:准确度 |
| 单词纠错 wordcheck | 20 秒 | 1 MB | 1 万字符 | 整体:准确度;音标级别:准确度、类型(正常/多读/漏读/错读) |
| 句子纠错 sentencecheck | 40 秒 | 1.5 MB | 1 万字符 | 整体:准确度、完整度、流利度、韵律评分;单词级别:准确度、韵律评分、类型(正常/多读/漏读/错读) |
| 单词拼读 wordspell | 20 秒 | 1.5 MB | 1 万字符 | 拼读是否正确 |
它和高阶题型(问答题 qa、话题描述 topic、故事复述 retell、自由说 freedom 等)的核心区别在于:高阶题型大多没有固定 refText,评测目标也不再是"按参考文本读",而是"表达内容本身"。如果你想考察用户“读”的能力,那么就应该选择基础题型。
发音评测最细能评到什么粒度?先从音标题型(phoneme)说起
如果你想训练用户区分 /θ/ 和 /s/、/l/ 和 /r/ 的音标,那么真正关键的得分点在于"这个音素读对了吗"。这时候就该用音标题(phoneme)。
音标题是所有题型里粒度最细的一个:用一个或多个音标作为参考文本,用户读出来,引擎返回整体得分 + 每个音素的得分。
它返回的评分信息包括:
overall/accuracy/integrity分别对应三个整体得分:总分、准确度、完整度- 每个音标对应的:
phoneme(标准音素)、hypothesis(实际读的音素)、score(音标得分),以及一个type标签(正常/漏读/重复读)
这就是评分体系里最末一级的粒度:单词题把“总分 → 单词 → 音节 → 音素”整条层级打包返回,而音标题相当于把“音素”这一层单独拎出来、重点评。它特别适合这些场景:
- 音素启蒙教学(先不背单词,先搞定单个音)
- 最小对立对训练(minimal pairs,如 ship / sheep)
- 纠音前的“病灶定位”
单词题型(word)能看出哪些发音问题?
单词题(word)是口语学习App中最常见的入门题型:界面通常会显示一个单词或词组,用户朗读,评分引擎考察整体发音准确度、流利度、完整度,以及单词、音标级别的准确度。
它也是文章开头示例的真实出处——"good morning" 返回的分数,从外层的总分,到每个单词的得分,再到音节、音素:
overall / accuracy └─ wordInfo(good / morning) └─ syllables(g_uh_d / m_ao_r ...) └─ phonemes(g / uh / d ...)
对照评测维度,单词题已经能覆盖其中的四项:overall、accuracy、fluency、integrity,再加上单词级的 stress(重音节是否正确)。
单词题在实战里能解决几类具体问题,重点看你用它来应对什么场景:
- 单词、词组、纯音标,通吃:参考内容既可以是普通单词或词组,也能直接是一串 IPA88 音标(比如
/mɑːkɪt/)。同一道题型,既能做词汇跟读,也能直接做音素级练习。 - 英美口音都可以:引擎可以分别适配英式或美式发音。像 tomato、schedule 这类英美读法不同的词,通过参数指定对应变体后,就可以按指定口音标准打分。也可以设置不区分,用户读哪种口音就用哪种标准打分,不会因为口音不对被误伤。
- 生僻读音手动标注:有些单词可能读法不常见,或者希望指定单词的读法,你可以提前把可接受的读法都告诉引擎,这样就可以按照你标注的读法来评分。
- 为儿童专门设计:除了通用模型外,还专门提供了儿童语音模型,更贴合孩子的发声特点,打分比通用模型更适配、更友好。
句子题型(sentence)比单词题型多评了什么?
把单词连成句子,发音考察的维度立刻丰富起来。句子题型(sentence)时长上限 90 秒,比单词题更接近真实表达。句子题型同样也提供通用模型和儿童专用模型。
它比单词题多出来的,主要是语流维度:
rhythm(韵律):包括stress重音、tone音调、sense意群停顿、句末语调rearTone(升调/降调),以及总分fluency:pause停顿次数、speed语速快慢、总分- 单词级还多了
liaison(连读)的判定:是否该连读、实际连读与否、连读类型(失去爆破、叠合、辅音+元音……)
为什么这些维度在单词题里不考察?因为连读、弱读、停顿分布、句末语调,只有在连续语流里才有意义。单个单词是"静态"的,句子才提供"上下文",让流利度和韵律真正有数据支撑。
句子题还有两个进阶选项,对于陪练类产品非常合适:
comparison:在题型参数中传入一段标准音频的ID(需定制),开启对比模式,返回语速、语调、音量这3个维度与标准音的相关度曲线realtime:通过公共参数传入,开启实时返回,可以边读边出分,用户体验更流畅
段落题型(chapter)为什么是最综合的题型?
当文本长到一整段,比如课文、演讲片段、长对话,此时就该用段落题型(chapter)了。它的时长上限 300 秒,能够满足绝大多数场景需求。
段落题的返回结构也最立体:最外层是整体的评分,往下是 sentenceInfo(逐句),再往下是 wordInfo(逐词)。换句话说,它把句子题型的层级再包了一层。音素级评分和韵律评分,默认是不开启的,如果你需要这两个评分维度,需要手动设置一下参数。
此外还有一个实用的 clause_sign(分句标识)参数:默认按句号、问号、感叹号、分号分句;如果你的文本里有特殊断句需求(比如只想按换行符分句),也可以自己指定。
段落越长,漏读、多读、重复读就越容易发生,因此每个 wordInfo 都会带上 normal / delete / repeat 标签,帮你把“读漏了哪句、重复了哪句”直接标出来。段落题型同样也提供通用模型和儿童专用模型,也支持实时返回结果。
纠错类题型(wordcheck / sentencecheck)和上面几个题型的区别在哪?
前面几种题型,重点在“打分”。而 wordcheck(单词纠错) 和 sentencecheck(句子纠错),重点在"指出错在哪"。这两种题型,表面上参数和普通题很像,但返回里把 type 字段变成了核心输出:
| type 取值 | 含义 | 出现在哪 |
|---|---|---|
| normal | 正常读 | 普通题 / 纠错题 |
| insert | 多读(目标里没有、用户多说的) | 纠错题(句子) |
| repeat | 重复读 | 普通题 / 纠错题 |
| delete | 漏读 | 普通题 / 纠错题 |
| replace | 错读(如把 three 读成 tree) | 纠错题(句子 / 单词音素级) |
| oov | 集外词,无法评分 | 普通题 |
具体来说:
- wordcheck:只支持单个单词。词级
type给normal/repeat/delete;更细到音素级,还会标insert(多读了一个音标)和replace(某个音读错了,比如 /θ/ 读成 /s/)。 - sentencecheck:句子级,词级
type直接覆盖normal/insert/delete/replace四种,配合完整的rhythm/fluency/integrity/accuracy,既打分又定位错误。
顾名思义,纠错类题型重点用于发音的纠正环节,陪练类、纠音类 App 几乎离不开纠错类的两个题型。选型时一句话总结:
- 只想要得分 → 用 word / sentence
- 想明确指出"哪里读错了" → 用 wordcheck / sentencecheck。
单词拼读(wordspell)是个什么新题型?
最后是基础题型里的"新成员"——单词拼读(wordspell)。它走了一条不太一样的路:App 界面给出一个单词的含义,用户要想到对应的英文单词,并按字母拼读,比如看到提示词“猫”,就依次说出“C-A-T”。
它的返回也更简单,直接返回实际读的字母和置信度,以及每个字母的开始和结束时间。典型场景是线上拼读比赛、自然拼读(Phonics)教学。需要注意它只支持逐个字母拼,目前还不支持 double、triple 这类连读式拼写。
对于这个题型,不必关注打分维度,把它理解为“基础题型矩阵里一个面向拼写场景的特殊入口”即可。
为什么不同题型的评分维度会不一样?
原因其实很简单:**题型决定评测粒度,粒度决定能计算哪些维度。**以下面四个题型为例:
| 题型 | 评测粒度 | 能拿到的核心维度 |
|---|---|---|
| phoneme 音标 | 音素 | overall / accuracy / integrity + 音素级分 |
| word 单词 | 单词 → 音节 → 音素 | + fluency、stress(重音) |
| sentence 句子 | 句 → 单词 → 音素 | + rhythm(重音 / 音调 / 意群停顿)、liaison 连读 |
| chapter 段落 | 段 → 句 → 单词 → 音素 | 综合全部,外加逐句 sentenceInfo |
可以看到一条清晰的递进链:粒度越粗,能观测的语流特征越多——单词没有"上下文",自然算不出连读和句末语调;到了句子、段落,韵律和流利度才真正有数据支撑。对于韵律评分,需要进行特殊标注以指定韵律读法,具体内容将在后续文章中详细讲解。
选型时最该先问自己哪三个问题?
作为产品经理,实际选型时先问自己三个问题就够了:
- 文本多长、能录音多久?
- 一两个词 →
word(20 秒) - 一两句话 →
sentence(90 秒) - 一整段课文 →
chapter(300 秒)
- 一两个词 →
- 关注综合打分,还是关注纠错?
- 只要打分 → 普通题(
word/sentence/chapter) - 要定位错误 → 纠错题(
wordcheck/sentencecheck)
- 只要打分 → 普通题(
- 用户是成人还是儿童?
- 成人 → 标准模型
- 儿童 → 对应的
word_kids/sentence_kids/chapter_kids
如果还涉及“拼写”或“最小音素训练”这类特殊场景,考虑 wordspell 和 phoneme 题型即可。
结语
基础题型,本质上是一套**"由参考文本驱动、粒度从音素到段落"的朗读评测体系**。看懂 phoneme → word → sentence → chapter 这条粒度轴,你就掌握了 DolphinSOE 英文评测的能力边界;再配合 wordcheck / sentencecheck 的纠错标签,又能把“打分”升级成“教学”。
如果还想了解无固定参考文本的开放题型——问答题、话题描述、故事复述等,欢迎关注后续的高阶题型相关文章。
DolphinSOE 发音评测已在日本市场稳定运行,目前日均调用量约 10 万次(100k calls/day),客户覆盖外语学习 App、学校、课外班等各类教育机构,能力经过真实高并发、教学级场景的持续验证。我们提供API接入的免费技术咨询和一个月的无偿试用,如需商务合作,欢迎联系我们。
分享文章
继续阅读

发音评测 API 的工作原理:从音频到多维度打分
一段朗读音频提交后,发音评测 API 如何给出总分、准确度、流利度等多维评分?本文拆解 DolphinSOE 从音频采集、识别对齐到多维度打分的完整流程,并附真实返回示例。

OpenAI Whisper API vs DolphinVoice API:企业级语音识别成本与能力全景对比
从技术架构、实时与离线 API 定价、全包 TCO、热词、语者分离、文本后处理到生产环境验证,系统对比 OpenAI Whisper API 与 DolphinVoice API。

“实时”不一定真实时:纯流式与伪流式语音识别 API 的区别
同样叫“实时语音识别 API”,文本可能在说话过程中逐步出现,也可能等整句话结束才返回。本文用返回时机、连接方式和中间结果拆解纯流式与伪流式的真正区别。