Logo
返回博客
FundamentalsContact Center

“实时”不一定真实时:纯流式与伪流式语音识别 API 的区别

同样叫“实时语音识别 API”,文本可能在说话过程中逐步出现,也可能等整句话结束才返回。本文用返回时机、连接方式和中间结果拆解纯流式与伪流式的真正区别。

“实时”不一定真实时:纯流式与伪流式语音识别 API 的区别

当一个产品写着“支持流式”,你可能以为文字会跟着声音同步出现。真正接入后却发现:说话时屏幕一片空白,直到整句话结束,文本才一次性跳出来。

这不是几百毫秒的性能差异,而是两种不同的返回机制。对字幕、合规监控和 Voice Agent 来说,文本是在发言中出现,还是在发言后出现,会直接改变产品体验。

先说结论

纯流式会在发言过程中持续返回中间结果;伪流式通常等一句话结束后才返回完整文本。需要实时介入时,重点不是宣传页有没有“streaming”,而是文本何时开始出现。

DolphinVoice 的使用场景、功能与价格DolphinVoice 的使用场景、功能与价格

区别不在“快一点”,而在什么时候返回文字

语音识别 API 会把麦克风、电话或直播中的音频交给识别引擎,再把文本返回给业务系统。两种方式都可能不断接收音频,但返回文本的节奏完全不同。

DolphinVoice 实时语音识别演示DolphinVoice 实时语音识别演示

纯流式:边说边返回

客户端通过 WebSocket 等方式维持长连接,持续发送几十毫秒级音频块。识别引擎先返回中间结果,再在句子结束时切换为最终结果。

伪流式:等一句话结束

音频被分段发送或按固定区间请求,服务在检测到句子结束后返回整句结果。实现相对容易,短指令和事后确认场景通常够用,但发言越长,等待越明显。

纯流式与伪流式实时识别对比纯流式与伪流式实时识别对比

把两种方式放在一起看

对比项目传统伪流式纯流式
文本出现时间一句话结束后说话过程中
返回单位整句一次返回文字或单词逐步返回
连接方式HTTP 断续连接WebSocket 长连接
中间结果有(interim / final)
实时介入困难可以
实现难度相对容易略高

用三个问题识别真正的纯流式

不要只看产品文档中的“实时”或“流式”,直接确认下面三点。

用三个问题识别真正的纯流式

1: 说话过程中是否已经有文字出现?如果没有,很可能是伪流式。

2: 接口是否持续返回中间结果?如果只有最终结果,就不是纯流式体验。

3: 是否通过 WebSocket 等方式维持长连接?每次请求都关闭连接,更接近伪流式。

DolphinVoice 如何实现纯流式体验

DolphinVoice 通过 WebSocket 长连接接收音频,让文字在发言过程中逐步出现,并提供识别、并发和实际运营所需的配套能力。它可以接入现有核心系统或应用,前端展示方式由企业自行设计。

边说边出字

按文字或单词逐步返回,中间结果平滑切换为最终结果。

低延迟处理

音频帧处理延迟 0.5ms 级,句末确定约 800ms,首次响应约 1000ms,RTF 不超过 0.3。

高并发

一个 API Key 最多支持 3000 个并发连接,可同时处理大量通话或直播。

单词级说话人标签

以单词为单位标记发言人,便于直接形成带发言归属的记录。

运营功能

支持最多 20000 热词、填充词去除、correction_words 表记统一和 ITN。

按时长计费

价格从每小时 72 日元起,便于估算使用成本。

技术规格一览

项目规格
方式纯流式(WebSocket 长连接)
处理延迟0.5ms(音频帧)
句末确定延迟约 800ms
首次响应约 1000ms
RTF0.3 以下
并发连接数最多 3000
连续运行最长 37 小时
识别准确率(CER)5%~10%
热词注册上限最多 20000 条
价格72 日元/小时起

真正需要“边说边出字”的五个场景

纯流式的价值,通常出现在不能等一句话结束的现场。

Before: 通话结束后再转写,质量管理和指导只能事后进行。

After: 实时转写并检测违规或危险表达,主管可以当场介入。

价值: 禁用词出现时立即告警,降低损失或投诉继续扩大的风险。

Before: 字幕需要事后转写,直播观众无法及时获得信息。

After: 说话时字幕同步出现,信息在现场即可被理解。

价值: 改善听障观众和多语言用户的可访问性,并减少字幕延迟造成的流失。

Before: 机器人等用户说完整句话后才开始响应,轮次之间出现明显停顿。

After: 发言过程中即可理解内容,提前准备意图判断和反馈。

价值: 让轮次控制更自然,使对话更接近人与人交流。

Before: 会后上传录音,再等待数小时生成纪要。

After: 会议进行时持续生成文本,并以单词级标签区分说话人。

价值: 会议结束即可共享,也能在现场发现并补充遗漏的决定事项。

Before: 事后抽样检查通话,仍可能漏掉存在问题的内容。

After: 实时监控全部通话,立即检查必需说明和禁用表达。

价值: 从抽样转向全量覆盖,并保留实时判定日志作为审计证据。

选择方式的最后标准

如果业务只需要短指令或事后确认,伪流式可能已经足够;如果需要字幕同步、实时告警或自然对话,就要确认文字能否在说话过程中持续出现。方式没有绝对优劣,关键是返回时机是否匹配业务。

亲自确认文字是否真的“实时”

通过免费试用观察中间结果和最终结果的返回过程。

分享文章