/documents/78990/
基本信息
文件基本信息
名称
Rule Based Rewards for Language Model Safety
描述
基于强化学习的大语言模型 (LLM) 根据人类偏好进行的微调已被证明可以增强其能力和安全行为。然而,在与安全相关的情况下,如果没有对人类注释者进行精确的指示,收集的数据可能会导致模型变得过于谨慎,或者以不良的方式做出响应,例如做出判断。此外,随着模型功能和使用模式的发展,可能需要添加或重新标记数据来修改安全行为,成本高昂。我们提出了一种新颖的偏好建模方法,该方法利用人工智能反馈,并且只需要少量的人类数据。我们的方法,基于规则的奖励(RBR),使用一系列针对期望或不期望行为的规则(例如拒绝不应该是判断性的)以及 LLM 评分者。与之前使用 AI 反馈的方法相比,我们的方法在 RL 训练中直接使用细粒度、可组合、LLM 分级的小样本提示作为奖励,从而实现更好的控制、准确性和易于更新。我们证明,RBR 是一种有效的训练方法,其 F1 分数为 97.1,而人类反馈基线为 91.7,通过更好地平衡有用性和安全性,从而获得更高的安全行为准确性 ...