跳到正文
热点事件持续更新

Mental-R1:面向心理健康评估的LLM推理对齐

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

研究提出 Cognitive Relative Policy Optimization(CRPO)强化学习框架,用于心理健康评估中的 LLM 推理对齐。该框架通过分阶段熵正则化模拟人类从不确定到确定的认知转变,并基于认知评价理论形式化推理阶段。 在 8 个心理健康数据集上,CRPO 的加权 F1-score 较最佳强化学习基线平均提升 10.4 个百分点。经 CRPO 训练的 Mental-R1 在推理密集型案例上优于现有大语言模型。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv:cs.AI
    Mental-R1:为心理健康评估对齐 LLM 推理

    研究提出 Cognitive Relative Policy Optimization(CRPO)强化学习框架,通过分阶段熵正则化模拟人类从不确定到确定的认知转变,并基于认知评价理论形式化推理阶段。在 8 个心理健康数据集上,CRPO 的加权 F1-score 较最佳强化学习基线平均提升 10.4 个百分点。经 CRPO 训练的 Mental-R1 在推理密集型案例上优于现有大语言模型。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。