arxiv GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot

/documents/74519/

基本信息

文件基本信息

名称
GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot
描述
我们推出 GLM-4-Voice,一种智能且类人的端到端语音聊天机器人。它支持中文和英文,进行实时语音对话,并根据用户指令改变情感、语调、语速和方言等语音细微差别。 GLM-4-Voice 使用超低比特率 (175bps)、单码本语音分词器,帧速率为 12.5Hz,源自自动语音识别 (ASR) 模型,通过将矢量量化瓶颈合并到编码器中。为了有效地将知识从文本模式转移到语音模式,我们使用文本到 Token 模型从现有的文本预训练语料库中合成语音文本交错数据。我们继续从预训练的文本语言模型 GLM-4-9B 出发,结合无监督语音数据、交错语音文本数据和监督语音文本数据进行预训练,规模高达 1 万亿个 token,在语音语言建模和口语问答方面实现了最先进的性能。然后,我们使用高质量的会话语音数据对预训练模型进行微调,与现有的会话能力和语音质量基线相比,实现了卓越的性能。可以通过此 https URL 和此 https URL 访问开放模型 ...