OpenAI 发布新语音系统「Whisper 」，英文识别能力可接近人类水平

来源：AI科技评论

作者：黄楠

编辑：陈彩娴

9月21日，OpenAI 发布了一个名为「Whisper 」的神经网络，声称其在英语语音识别方面已接近人类水平的鲁棒性和准确性。

「Whisper 」式一个自动语音识别（ASR）系统，研究团队通过使用从网络上收集的68万个小时多语音和多任务监督数据，来对其进行训练。

训练过程中研究团队发现，使用如此庞大且多样化的数据集可以提高对口音、背景噪音和技术语言的鲁棒性。

此前有不同研究表明，虽然无监督预训练可以显著提高音频编码器的质量，但由于缺乏同等高质量的预训练解码器，以及特定于数据集中的微调协议，因此在一定程度上限制了模型的有效性和鲁棒性；而在部分有监督的方式预训练语音识别系统中，其表现会比单一源训练的模型呈现出更高的鲁棒性。

对此，在「Whisper 」中，OpenAI 在新数据集比现有高质量数据集总和大几倍的基础上，将弱监督语音识别的数量级扩展至68万小时；同时，研究团队还演示了在这种规模下，所训练模型在转移现有数据集的零射击表现，可消除任何特定于数据集微调的影响，以实现高质量结果。

图注：方法概述

在许多不同的语音处理任务中训练一个序列到序列的转换器模型，包括多语言语音识别、语音翻译、口头语言识别和语音活动检测；所有任务都表示为要由解码器预测的标记序列，允许单一模型取代传统语音处理管道的不同阶段；多任务训练格式使用一组特殊的标记，作为任务指定者或分类目标

Whisper 架构采用一种简单的端到端方法，通过编码器-解码器 Transformer 来实现：输入音频被分成30秒的块，转换成 log-Mel 频谱图后传递到编码器。解码器可预测相应的文本标题，并与特殊标记混合，由这些标记指导单个模型执行诸如语言识别、短语级时间戳、多语言语音转录和英语语音翻译等任务。

图注：Whisper 架构

值得一提的是，由于「Whisper 」是在一个庞大且多样的数据集上进行，没有针对任何特定的数据集进行微调，因此它不会击败专门研究 LibriSpeech 性能的模型。

此外研究团队还发现，当在许多不同的数据集上测量「Whisper 」的零样本性能时，「Whisper 」相比其他模型表现更加稳健，错误率降低了 50%。

除了足够大的数据集规模外，「Whisper 」还支持多种语言的转录，以及将这些语言翻译成英语。

当前在68万小时音频中，共11.7万个小时覆盖了96中其他语言，还包括12.5万个小时的转录和翻译数据，即大约有三分之一是非英语的。

「Whisper 」会交替执行以原始语言转录或翻译成英语的任务，对此研究团队发现，这种方法在学习语音到文本的翻译方面特别有效，并且优于 CoVoST2 到英语翻译零样本的监督 SOTA。

目前，「Whisper 」已开源，可用于对语音识别方面的进一步研究。

OpenAI 创始人 Ilya Sutskever 对此表示，“终于有一个能理解我说话的可靠的语音识别系统。”

前特斯拉人工智能和自动驾驶部门负责人 Andrej Karpathy 也转发了这一消息称“OpenAI 正处于最好的状态中”。

但对使用 Whisper 上，有不少用户也还存在疑虑。

网友 Vincent Lordier 提出，“此前在 GTP-3 和 Dalle-2 中出现对相关言论禁止行为，是否在使用 Whisper 时也会有，是否会出现 Whisper 编辑/删除用户语音的情况？”

那么大家怎么看？

参考链接：https://openai.com/blog/whisper/

未来智能实验室的主要工作包括：建立AI智能系统智商评测体系，开展世界人工智能智商评测；开展互联网（城市）大脑研究计划，构建互联网（城市）大脑技术和企业图谱，为提升企业，行业与城市的智能水平服务。每日推荐范围未来科技发展趋势的学习型文章。目前线上平台已收藏上千篇精华前沿科技文章和报告。

如果您对实验室的研究感兴趣，欢迎加入未来智能实验室线上平台。扫描以下二维码或点击本文左下角“阅读原文”

本文来自互联网用户投稿，该文观点仅代表作者本人，不代表本站立场。本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。如若转载，请注明出处：http://www.mzph.cn/news/481595.shtml

如若内容造成侵权/违法违规/事实不符，请联系多彩编程网进行投诉反馈email:809451989@qq.com，一经查实，立即删除！

OpenAI 发布新语音系统「Whisper 」，英文识别能力可接近人类水平

相关文章

论文学习5-NODE2BITS: Compact Time- and Attribute-aware Node Representations for User Stitching

谷歌科学家亲讲：具身推理如何实现？让大模型「说」机器人的语言

论文学习6-（M2DNE）Temporal Network Embedding with Micro- and Macro-dynamics

蒲慕明院士：我们为什么要探索人脑的奥秘

论文学习7-Spam Review Detection with Graph Convolutional Networks（阿里巴巴）

新型AI芯片其能效或是替代品的两倍

论文学习8-How Question Generation Can Help Question Answering over Knowledge Base（KBQA-知识问答）

1575万美元！2023科学突破奖揭晓，AlphaFold、量子计算等突破斩获殊荣

nlp4-语料库

费曼：任何伟大的科学成就，都源于思想自由

nlp5-n-gram/语言模型(数据平滑方法

《科学》：3.8亿年前的心脏，揭示生命演化历史

论文学习9-Bidirectional LSTM-CRF Models for Sequence Tagging（LSTM，BILSTM,LSTM-CRF,BILSTM-CRF

从连接组学到行为生物学，AI 助力使从图像中提取信息变得更快、更容易

论文学习10-Joint entity recognition and relation extraction as a multi-head selection problem（实体关系联合抽取模型

Gary Marcus：文本生成图像系统理解不了世界，离 AGI 还差得远

论文学习11-Adversarial training for multi-context joint entity and relation extraction(实体关系买抽取模型，对抗学习

【前沿技术】美国脑计划2.0！投5亿美元，绘制史上最全人脑地图

尘福通：智慧城市建设、运营、演进路径思考

HMM总结