跳到正文
原文
上海人工智能实验室 InternLM:原创项目· InternLM·· 2025-07-03AI 评分35

InternLM 推出 POLAR:基于策略判别学习的预训练可扩展高性能奖励模型

InternLM/POLAR

AI 导读

上海人工智能实验室 InternLM 项目发布 POLAR,一种通过策略判别学习(Policy Discriminative Learning)训练的奖励模型,具备预训练、可扩展、高性能特性。该方法将奖励建模转化为区分不同策略的判别任务,以支撑大规模强化学习训练。

来源:上海人工智能实验室 InternLM:原创项目 ·