arXiv:cs.CL(计算语言学,全量分类)· Ting-Chih Chen, Emile van Krieken, Shujian Yu, Filip Ilievski·· 1 天前AI 评分36
VisKG:面向高效视觉推理的问题特定知识图谱框架
Question-Specific Knowledge Graphs for Efficient Visual Reasoning
AI 导读
研究者提出 VisKG,一个用强化学习让模型把视觉内容转译为问题特定知识图谱(KG)表示的框架,过滤感知噪声并保留链式推理所需的实体-关系结构,所需 token 少于基于 caption 的表示。VisKG 采用 GDPO 稳定 RL 后训练,并用负向推理样本加强监督阶段;在科学、数学和通用视觉理解基准上表现与基线相当或更优,GDPO 训练版本平均准确率比 GRPO 版本高 2%。
来源:arXiv:cs.CL(计算语言学,全量分类) · arxiv.org