微软这次放出的 VibeVoice-ASR-Streaming-7B,我觉得挺适合做实时语音 Agent。

微软这次放出的 VibeVoice-ASR-Streaming-7B,我觉得挺适合做实时语音 Agent。

它不是“录完一段音频,再慢慢转文字”,而是人还在说,文字就已经开始出来了。

比较实用的几个点:

支持实时流式转写、能识别谁说了什么、支持自定义 Hotwords,技术名词、人名这类词可以单独加强
支持中英日韩等 10 种语言
7B 版本,权重直接开源,MIT License (Hugging Face)

更有意思的是,微软的技术报告里称,7B 版本在 5 个评测集上的平均 WER/CER 最低,13 个说话人归属评测里有 12 个拿到最佳或并列最佳。

实时语音 Agent 现在缺的可能不是一个更大的模型,而是这种真正能边听边处理的 ASR。

会议记录、实时字幕、语音助手、电话 Agent,都能直接用上。

而且微软这次直接把模型权重和推理代码放出来了。

语音 Agent 这条赛道,开始越来越卷了。

Hugging Face:https://huggingface.co/microsoft/VibeVoice-ASR-Streaming-7B

#

https://huggingface.co/microsoft/VibeVoice-ASR-Streaming-7B

分类