arxiv wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations

/documents/79652/

基本信息

文件基本信息

名称
wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations
描述
我们首次证明,仅从语音音频中学习强大的表示,然后对转录语音进行微调可以超越最好的半监督方法,同时在概念上更简单。 wav2vec 2.0 屏蔽潜在空间中的语音输入,并解决通过共同学习的潜在表示的量化定义的对比任务。使用 Librispeech 的所有标记数据进行的实验在干净/其他测试集上实现了 1.8/3.3 WER。当将标记数据量减少到一小时时,wav2vec 2.0 在 100 小时子集上的性能优于之前的技术水平,同时使用的标记数据量减少了 100 倍。仅使用 10 分钟的标记数据并对 53,000 小时的未标记数据进行预训练仍然可以达到 4.8/8.2 WER。这证明了使用有限数量的标记数据进行语音识别的可行性 ...