“实时”不一定真实时:纯流式与伪流式语音识别 API 的区别
同样叫“实时语音识别 API”,文本可能在说话过程中逐步出现,也可能等整句话结束才返回。本文用返回时机、连接方式和中间结果拆解纯流式与伪流式的真正区别。

当一个产品写着“支持流式”,你可能以为文字会跟着声音同步出现。真正接入后却发现:说话时屏幕一片空白,直到整句话结束,文本才一次性跳出来。
这不是几百毫秒的性能差异,而是两种不同的返回机制。对字幕、合规监控和 Voice Agent 来说,文本是在发言中出现,还是在发言后出现,会直接改变产品体验。
先说结论
纯流式会在发言过程中持续返回中间结果;伪流式通常等一句话结束后才返回完整文本。需要实时介入时,重点不是宣传页有没有“streaming”,而是文本何时开始出现。
DolphinVoice 的使用场景、功能与价格区别不在“快一点”,而在什么时候返回文字
语音识别 API 会把麦克风、电话或直播中的音频交给识别引擎,再把文本返回给业务系统。两种方式都可能不断接收音频,但返回文本的节奏完全不同。
DolphinVoice 实时语音识别演示纯流式:边说边返回
客户端通过 WebSocket 等方式维持长连接,持续发送几十毫秒级音频块。识别引擎先返回中间结果,再在句子结束时切换为最终结果。
伪流式:等一句话结束
音频被分段发送或按固定区间请求,服务在检测到句子结束后返回整句结果。实现相对容易,短指令和事后确认场景通常够用,但发言越长,等待越明显。
纯流式与伪流式实时识别对比把两种方式放在一起看
| 对比项目 | 传统伪流式 | 纯流式 |
|---|---|---|
| 文本出现时间 | 一句话结束后 | 说话过程中 |
| 返回单位 | 整句一次返回 | 文字或单词逐步返回 |
| 连接方式 | HTTP 断续连接 | WebSocket 长连接 |
| 中间结果 | 无 | 有(interim / final) |
| 实时介入 | 困难 | 可以 |
| 实现难度 | 相对容易 | 略高 |
用三个问题识别真正的纯流式
不要只看产品文档中的“实时”或“流式”,直接确认下面三点。
用三个问题识别真正的纯流式
1: 说话过程中是否已经有文字出现?如果没有,很可能是伪流式。
2: 接口是否持续返回中间结果?如果只有最终结果,就不是纯流式体验。
3: 是否通过 WebSocket 等方式维持长连接?每次请求都关闭连接,更接近伪流式。
DolphinVoice 如何实现纯流式体验
DolphinVoice 通过 WebSocket 长连接接收音频,让文字在发言过程中逐步出现,并提供识别、并发和实际运营所需的配套能力。它可以接入现有核心系统或应用,前端展示方式由企业自行设计。
边说边出字
按文字或单词逐步返回,中间结果平滑切换为最终结果。
低延迟处理
音频帧处理延迟 0.5ms 级,句末确定约 800ms,首次响应约 1000ms,RTF 不超过 0.3。
高并发
一个 API Key 最多支持 3000 个并发连接,可同时处理大量通话或直播。
单词级说话人标签
以单词为单位标记发言人,便于直接形成带发言归属的记录。
运营功能
支持最多 20000 热词、填充词去除、correction_words 表记统一和 ITN。
按时长计费
价格从每小时 72 日元起,便于估算使用成本。
技术规格一览
| 项目 | 规格 |
|---|---|
| 方式 | 纯流式(WebSocket 长连接) |
| 处理延迟 | 0.5ms(音频帧) |
| 句末确定延迟 | 约 800ms |
| 首次响应 | 约 1000ms |
| RTF | 0.3 以下 |
| 并发连接数 | 最多 3000 |
| 连续运行 | 最长 37 小时 |
| 识别准确率(CER) | 5%~10% |
| 热词注册上限 | 最多 20000 条 |
| 价格 | 72 日元/小时起 |
真正需要“边说边出字”的五个场景
纯流式的价值,通常出现在不能等一句话结束的现场。
Before: 通话结束后再转写,质量管理和指导只能事后进行。
After: 实时转写并检测违规或危险表达,主管可以当场介入。
价值: 禁用词出现时立即告警,降低损失或投诉继续扩大的风险。
Before: 字幕需要事后转写,直播观众无法及时获得信息。
After: 说话时字幕同步出现,信息在现场即可被理解。
价值: 改善听障观众和多语言用户的可访问性,并减少字幕延迟造成的流失。
Before: 机器人等用户说完整句话后才开始响应,轮次之间出现明显停顿。
After: 发言过程中即可理解内容,提前准备意图判断和反馈。
价值: 让轮次控制更自然,使对话更接近人与人交流。
Before: 会后上传录音,再等待数小时生成纪要。
After: 会议进行时持续生成文本,并以单词级标签区分说话人。
价值: 会议结束即可共享,也能在现场发现并补充遗漏的决定事项。
Before: 事后抽样检查通话,仍可能漏掉存在问题的内容。
After: 实时监控全部通话,立即检查必需说明和禁用表达。
价值: 从抽样转向全量覆盖,并保留实时判定日志作为审计证据。
选择方式的最后标准
如果业务只需要短指令或事后确认,伪流式可能已经足够;如果需要字幕同步、实时告警或自然对话,就要确认文字能否在说话过程中持续出现。方式没有绝对优劣,关键是返回时机是否匹配业务。
亲自确认文字是否真的“实时”
通过免费试用观察中间结果和最终结果的返回过程。


