跳到正文
热点事件持续更新

SERL-SQL选择性强化学习框架提出

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

Tao Liu等作者提出SERL-SQL,一种面向多轮Text-to-SQL智能体的选择性执行反馈强化学习框架:将教师-学生似然差转化为有界掩码权重,仅对SQL和工具动作token重加权GRPO优势。作者称该框架在BIRD-Dev上执行准确率达76.56%,Spider-Test上达89.92%,其奖励选择策略接近oracle Best-of-N上界,并持续优于一致性选择方法。 上述准确率为作者在论文中报告的结果。作者表示代码将在论文给出的网址发布。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv:cs.CL
    SERL-SQL:面向 Text-to-SQL 强化学习智能体的选择性事后蒸馏框架

    SERL-SQL 通过选择性执行反馈强化学习框架,将教师-学生似然差转化为有界掩码权重,仅对 SQL 和工具动作 token 重加权 GRPO 优势。在 BIRD-Dev 上达到 76.56% 执行准确率,Spider-Test 上达 89.92%,其奖励选择策略接近 oracle Best-of-N 上界并持续优于一致性选择方法。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。