arxiv Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena

/documents/75256/

基本信息

文件基本信息

名称
Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena
描述
评估基于大型语言模型 (LLM) 的聊天助手具有挑战性,因为它们具有广泛的功能,而且现有基准在衡量人类偏好方面的不足。为了解决这个问题,我们探索使用强大的 LLM 作为评委,在更开放的问题上评估这些模型。我们研究了 LLM 作为法官的用法和局限性,包括立场、冗长和自我增强偏见,以及有限的推理能力,并提出了缓解其中一些问题的解决方案。然后,我们通过引入两个基准来验证LLM法官和人类偏好之间的一致性:MT-bench,一个多轮问题集;以及 Chatbot Arena,一个众包战斗平台。我们的结果表明,像 GPT-4 这样强大的 LLM 法官可以很好地匹配受控和众包的人类偏好,达到超过 80% 的一致性,与人类之间的一致性水平相同。因此,LLM作为法官是一种可扩展且可解释的方式来近似人类的偏好,否则获得这些偏好的成本非常昂贵。此外,我们通过评估 LLaMA 和 Vicuna 的几种变体来展示我们的基准测试和传统基准测试的互补性。 MT-bench 问题、3K 专家投票以及 30K 与人类偏好的对话均可在此 https URL 上公开获取 ...