上海人工智能实验室 InternLM:原创项目· InternLM·2025-07-03 20:59· 2025-07-03AI 评分35InternLM 推出 POLAR:基于策略判别学习的预训练可扩展高性能奖励模型InternLM/POLARAI 导读上海人工智能实验室 InternLM 项目发布 POLAR,一种通过策略判别学习(Policy Discriminative Learning)训练的奖励模型,具备预训练、可扩展、高性能特性。该方法将奖励建模转化为区分不同策略的判别任务,以支撑大规模强化学习训练。来源:上海人工智能实验室 InternLM:原创项目 · #模型发布#开源/仓库#数据/训练