4TRcz6NRsnX tech.huanqiu.comarticle微软推出流式转录模型 MAI-Transcribe-2-Streaming/e3pmh164r/e3pmtmdvg【环球网科技综合报道】10月2日消息,微软方面宣布微软人工智能推出首个流式转录模型 MAI-Transcribe-2-Streaming,以及两款文本转语音模型 MAI-Voice-2.1、MAI-Voice-2.1-Flash,均可通过 Microsoft Foundry 获取。其中,MAI-Transcribe-2-Streaming模型支持60种语言,可低延迟实时转录并自动连续检测语言。微软称,其在 Artificial Analysis 最终和部分转录准确率排名中均居首,且兼顾准确率与延迟;最终词错误率2.5%,首次部分转录错误率2.8%,最终转录耗时0.13秒。 它无需等说话者说完,收到音频后100毫秒内生成初始假设,并随上下文修正。内部评估显示,其实时语音识别和字幕生成速度约为最接近竞品的两倍。目前,该模型以每小时音频0.54美元优惠价发售至年底,并进一步扩展微软 MAI 音频产品线。(勃潺)1790907596833环球网版权作品,未经书面授权,严禁转载或镜像,违者将被追究法律责任。责编:李文瑶环球网179090759683311[]{"email":"liwenyao@huanqiu.com","name":"李文瑶"}
【环球网科技综合报道】10月2日消息,微软方面宣布微软人工智能推出首个流式转录模型 MAI-Transcribe-2-Streaming,以及两款文本转语音模型 MAI-Voice-2.1、MAI-Voice-2.1-Flash,均可通过 Microsoft Foundry 获取。其中,MAI-Transcribe-2-Streaming模型支持60种语言,可低延迟实时转录并自动连续检测语言。微软称,其在 Artificial Analysis 最终和部分转录准确率排名中均居首,且兼顾准确率与延迟;最终词错误率2.5%,首次部分转录错误率2.8%,最终转录耗时0.13秒。 它无需等说话者说完,收到音频后100毫秒内生成初始假设,并随上下文修正。内部评估显示,其实时语音识别和字幕生成速度约为最接近竞品的两倍。目前,该模型以每小时音频0.54美元优惠价发售至年底,并进一步扩展微软 MAI 音频产品线。(勃潺)