跳到正文
热点事件持续更新

多 LLM 协同对齐的 Stackelberg 博弈框架

1 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

研究者提出 Stackelberg Alignment,一种受博弈论启发的 leader-follower 框架,用于多 LLM 协同对齐。该框架将指令选择转化为自适应课程:EXP3 bandit 作为 leader 分配采样预算,语言模型作为 follower 通过 DPO 或 GRPO 学习偏好信号。 现有报道未披露实验结果、参与模型或适用条件,因此该框架的实际效果尚不明确。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv:cs.LG
    基于 Stackelberg 博弈的多 LLM 协同对齐

    研究者提出 Stackelberg Alignment,一种受博弈论启发的 leader-follower 框架,将指令选择转化为自适应课程,由 EXP3 bandit 作为 leader 分配采样预算,语言模型作为 follower 通过 DPO 或 GRPO 学习偏好信号。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。