arXiv:cs.AI(全量分类)· Baode Wang, Zuming Huang, Kexuan Ren, Jun Huang, Wei Chu·· 3 小时前AI 评分35
GAD-RL:通过门控与衰减的在线策略蒸馏提升 OCR 忠实度
Improving OCR Faithfulness via Gated and Attenuated On-Policy Distillation
AI 导读
GAD-RL 通过门控与衰减机制自适应调节教师监督,在 Qwen3.5-2B 上于 CHAOS-Bench 取得 59.92% Micro Recall,分别超越 GRPO 和 GRPO+OPD(固定权重)8.45 和 4.43 个百分点。
来源:arXiv:cs.AI(全量分类) · arxiv.org