/documents/77546/
基本信息
文件基本信息
名称
Reinforced Preference Optimization for Recommendation
描述
大语言模型 (LLM) 的最新突破从根本上将推荐系统从判别式转变为生成式,其中用户行为建模是通过生成以历史交互为条件的目标项目来实现的。然而,当前的生成推荐器仍然面临两个核心限制:缺乏高质量的负面模型和对隐性奖励的依赖。具有可验证奖励的强化学习(RLVR)通过实现更难的负样本的策略采样和显式奖励信号的基础优化,提供了一种自然的解决方案。然而,将 RLVR 应用于生成推荐器仍然很重要。其独特的生成空间通常会导致无效或重复的项目,从而破坏采样效率,并且由于大多数项目获得相同的零奖励,因此排名监督稀疏。为了应对这些挑战,我们提出了强化偏好优化推荐(ReRe),这是一种针对基于 LLM 的推荐器量身定制的基于强化的范例,是生成推荐的一个重要方向。 ReRe 结合了约束波束搜索来提高采样效率并使硬负例多样化,同时通过辅助排名奖励来增强基于规则的准确性奖励,以实现更细粒度的监督。对三个真实世界数据集的大量实验表明,ReRe 在排名性能方面始终优于传统推荐器和基于 LLM 的推荐器。进一步的分析表明,ReRe 不仅增强了基础模型和 SFT 初始化模型的性能,而且还可以在不同的主干系列和规模上稳健地泛化。除了经验收益之外,我们还系统地研究了 RLVR 在跨代推荐、采样策略、奖励建模和优化算法方面的设计空间,为未来的研究提供了见解 ...