SERL-SQL选择性强化学习框架提出
热点事件持续更新
SERL-SQL选择性强化学习框架提出
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
Tao Liu等作者提出SERL-SQL,一种面向多轮Text-to-SQL智能体的选择性执行反馈强化学习框架:将教师-学生似然差转化为有界掩码权重,仅对SQL和工具动作token重加权GRPO优势。作者称该框架在BIRD-Dev上执行准确率达76.56%,Spider-Test上达89.92%,其奖励选择策略接近oracle Best-of-N上界,并持续优于一致性选择方法。 上述准确率为作者在论文中报告的结果。作者表示代码将在论文给出的网址发布。
AI 根据报道生成 · 2 小时前更新
最新进展10月9日 12:00
SERL-SQL:面向 Text-to-SQL 强化学习智能体的选择性事后蒸馏框架报道时间线
沿着报道,了解事件的不同侧面。
10月9日
- arXiv:cs.CLSERL-SQL:面向 Text-to-SQL 强化学习智能体的选择性事后蒸馏框架
SERL-SQL 通过选择性执行反馈强化学习框架,将教师-学生似然差转化为有界掩码权重,仅对 SQL 和工具动作 token 重加权 GRPO 优势。在 BIRD-Dev 上达到 76.56% 执行准确率,Spider-Test 上达 89.92%,其奖励选择策略接近 oracle Best-of-N 上界并持续优于一致性选择方法。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。