Voxtral Transcribe 2:Mistral 的开源实时语音转写,亚 200ms 延迟

AI
语音识别
开源
Mistral
ASR
Voxtral
2026/9/29
·

阅读时间: 大约 5 分钟

Voxtral Transcribe 2:Mistral 的开源实时语音转写,亚 200ms 延迟

Mistral 官方 Voxtral Transcribe 2 页面截图(经 Koala 项目库转存):"Voxtral transcribes at the speed of sound",手机端显示实时 Listening 界面与波形

可达性说明:本文写作环境中 Mistral 官方博客(mistral.ai)与文档站(docs.mistral.ai)均无法连接(连接超时),因此下列数据来自 Koala 项目库对官方发布的转述,未能在官方页面二次逐条核对。引用时请以 Mistral 官方公告原文为准。

语音转写(ASR)这条赛道,在 Whisper 之后又热闹起来。Mistral 推出的 Voxtral Transcribe 2 系列,主打两点:开源权重 + 亚秒级实时延迟。本文基于项目库转述的官方信息做分析。

一、两个版本:Mini 与 Realtime

据项目库转述,本系列分两个版本,定位不同:

  • Mini(批量处理):面向离线、高吞吐的转写批量任务;
  • Realtime(实时转写):面向低延迟的流式场景。

一个关键的商业区分(项目库特别提醒):本次开源只针对 Realtime 版本,Mini 版仍只提供 API 服务。也就是说,想自部署开源权重,拿到的是实时那一路;批量版仍要走 Mistral 的云 API。

二、关键数据(项目库转述口径)

据项目库引述官方发布:

  • Realtime 延迟:做到 200 毫秒以内;
  • 多语言错误率:在意大利语、西班牙语等语种上,词错误率(WER)已压到 3% 以下;
  • 中文表现相对较弱:项目库明确指出中文不如上述语种;
  • 价格:比 ElevenLabs 的 Scribe v2 便宜约 五倍;
  • 许可:Realtime 版基于 Apache 2.0 开源。

需要强调:以上均为项目库转述,未在官方页核实。“200ms 延迟”通常指流式首字/端到端延迟的特定测量条件,“3% 以下 WER”对应特定测试集与语种,“便宜五倍”是两家定价的对比——这些数字的前提都需要看官方原文才站得住。

三、口径偏差与局限

  1. 开源不彻底:只有 Realtime 开源,批量 Mini 闭源走 API——“开源”标签不能覆盖整个系列;
  2. 中文偏弱:项目库自己点出中文表现相对弱,对中文用户是重要限制;
  3. 延迟数字依赖测量:200ms 是在何种硬件、多长音频、网络条件下测的,未核实;
  4. 对比对象单一:“比 ElevenLabs Scribe v2 便宜五倍”是与一个特定竞品比,不是绝对性价比;
  5. 官方页不可达:如开头所述,本文未能直接核对 Mistral 官方页面,所有数字应视为待复核的转述。

四、适用 / 不适用

适合:

  • 需要本地/私有化部署、对隐私敏感的实时语音场景(会议字幕、客服实时转写);
  • 在意开源权重、不想被单一云厂商锁定的团队;
  • 以西/意等欧洲语言为主、对延迟敏感的应用。

不适用:

  • 中文为主、对转写准确率要求高的场景(官方转述中中文偏弱);
  • 需要批量离线转写大文件、又想自部署开源版的人——Mini 不开源;
  • 想要经过独立第三方基准验证的数字、不能只看厂商自述的团队。

五、它意味着什么

Voxtral Transcribe 2 的信号是:开源 ASR 正在从”离线转录”卷向”实时流式”。开源权重 + 亚秒延迟的组合,对隐私敏感的本地实时场景确实有吸引力。但它开源不彻底(只开 Realtime)、中文偏弱,且本文无法直接核对官方数字——所以对它的判断应保持保留,等能访问官方原文、或有独立基准复测后再下结论。

参考来源