LensVLM:压缩视觉文本的选择性上下文扩展
热点事件持续更新
LensVLM:压缩视觉文本的选择性上下文扩展
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
Roy Xie 等作者提出 LensVLM,一种让视觉语言模型(VLM)先扫描压缩图像、再通过学到的工具只把相关图像展开为未压缩形式的推理框架与后训练方案,基于 Qwen3.5-9B-Base 构建。 据该研究称,LensVLM 在 4.3 倍有效压缩下保持与全文上限相当的准确率,并在七个文本 QA 基准上以最高 10.1 倍有效压缩超越基于检索、文本压缩和视觉压缩的基线。
AI 根据报道生成 · 1 小时前更新
最新进展10月5日 12:00
LensVLM:面向文本压缩视觉表征的选择性上下文扩展报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- arXiv:cs.AILensVLM:面向文本压缩视觉表征的选择性上下文扩展
基于 Qwen3.5-9B-Base 的 LensVLM 通过让 VLM 扫描压缩图像并按需用学习到的工具选择性展开相关图像,在 4.3 倍有效压缩下保持与全文上限相当的准确率,并在七个文本 QA 基准上以最高 10.1 倍有效压缩超越基于检索、文本压缩和视觉压缩的基线。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。