OpenRouter 实测:LLM 图像输入用低细节档反而更贵更差
Choosing the Optimal Image Input Detail Level in LLMs
OpenRouter 在 MMMU-Pro Vision 上对 OpenAI 和 Google 五个模型实测图像 detail 参数,发现推理模型用 low 细节反而更差更贵:gpt-5.5 low 比 auto 准确率低 13.8 个百分点(65.2% vs 79.0%),每题成本更高(5.1¢ vs 4.5¢),因为模型为弥补降采样图像多用了 1.6 倍推理 token。
实测显示低图像细节在推理模型上反而更贵更差,读者可据此调整图像输入和推理档位来控制成本。
如果你为了降低成本而将图像输入的 detail: low 设置为低,你可能得不到预期的改进。我们对 OpenAI 和 Google 最新模型的图像细节参数进行了基准测试,发现细节级别、推理和成本之间存在一些令人惊讶的关系。
例如,当我们在 MMMU-Pro Vision 上对 gpt-5.5 的 low 与 auto 图像细节进行基准测试时,低细节得分低了 13.8 分(65.2% 对 79.0%),且每个问题的成本更高(5.1¢ 对 4.5¢)。模型通过多思考 1.6 倍来补偿降采样的图像。这些推理 token 的成本超过了输入上节省的图像 token。

我们发现在推理模型中节省图像处理成本的更有效路径:发送更清晰的图像(auto 或 high),并改为调整推理力度。
自动细节在每个模型上都能产生更好的结果,有时成本更低
我们在 low 和 auto 两种设置下运行了来自 OpenAI 和 Google 的五个模型,温度 0,一个 epoch。每个模型在自动设置下得分都更高。

| 模型 | 细节 | 准确率 | 成本 / 问题 | 推理 token/请求 |
|---|---|---|---|---|
| gpt-5.5 | 低 | 65.2% | 5.1¢ | 1,180 |
| gpt-5.5 | 自动 | 79.0% | 4.5¢ | 730 |
| gpt-5.4-mini | 低 | 46.1% | 0.08¢ | 0 |
| gpt-5.4-mini | 自动 | 55.8% | 0.14¢ | 0 |
| gpt-4.1 | 低 | 40.1% | 0.43¢ | 0 |
| gpt-4.1 | 自动 | 57.5% | 0.66¢ | 0 |
| gemini-3.5-flash | 低 | 77.9% | 2.96¢ | 2,876 |
| gemini-3.5-flash | 自动 | 80.1% | 2.80¢ | 2,602 |
| gemini-3.1-pro | 低 | 75.5% | 9.53¢ | 6,344 |
| gemini-3.1-pro | 自动 | 78.4% | 11.12¢ | 6,964 |
低细节让 gpt-5.5 思考更费力
根据 OpenAI 的视觉文档,detail: low 会给模型一个低分辨率的 512x512 版本图像,无论原始尺寸如何,并按一个小的固定 token 成本计费。虽然这节省了输入 token,但也意味着有用的精细细节可能在降采样中丢失。
在 gpt-5.5 上,低细节产生了 每个请求 1,180 个推理 token,而自动为 730 个,跃升 1.6 倍,另外完成 token 多了 39%(489 对 351)。模型花费了额外的精力去眯着眼看它再也无法清晰阅读的小字和图表。

输出 token 的计费高于图像 token,因此更便宜的输入成本被抵消了。同一模型在低细节下问同样的问题,每个问题多花 0.6¢。你付了更多钱,得分却更差。
在推广之前有一个警告:token 模式因模型而异。gemini-3.5-flash 在低细节下也使用了更多推理 token(2,876 对 2,602),但 gemini-3.1-pro 使用的略少(6,344 对 6,964),且其低细节运行结果更便宜。
gpt-5.4-mini 和 gpt-4.1 不进行推理,因此它们在两种设置下都停留在 0 个思考 token。没有输出侧的增长,输入节省得以保留(详见下文)。
更清晰的图像能带来多少准确率提升?
从低切换到自动带来了 2 到 17 个百分点的准确率提升,具体取决于模型。

OpenAI 模型获益最多,因为它们的低设置将每张图像降采样到 512x512,并收取一个小的固定 token 成本(gpt-4.1 上为 85 个 token)。Gemini 的低分辨率每个部分保留大约 273 个 token,因此它从一个更清晰的基线开始,损失更少。
提升集中在特定图像类型上。数据集 76% 是文本和 OCR,另有 19% 是截图,因此大多数问题已经接近模型的上限,几乎不随细节变化。最明显的跃升出现在图表和图形上:gemini-3.1-pro 在这些问题上从 78.6% 攀升到 91.7%(使用自动细节)。图表无论如何都是最难的类别,正确率约为三分之一(基于 21 个问题的小样本)。

下面是其中一个问题,一张 2239×1279 的机械工程图,要求你从四个几乎相同的正交投影中选出正确的主视图:

这四个候选视图的区别仅在于阴影线和隐藏线的位置。在 auto 细节下,gpt-5.5 选择了 B,即正确答案。在 low 下,同一张图被压缩成 512px 的缩略图,那些细线变得模糊不清,模型经过更长的思维链后落在了 C 上。更长的推理并不能替代一张清晰可辨的图像。
推理级别对成本的影响最为显著
细节级别和推理投入看起来作用相似,但在我们的运行中,它们落在了截然不同的位置。改变细节使准确率波动 2 到 17 个百分点,却几乎不影响账单。改变推理投入使账单波动 50% 到 75%,而准确率仅在 1 到 2 个百分点之间徘徊,属于噪声范围。

将 gpt-5.5 限制到 reasoning=low 后,低细节成本从每题 5.1¢ 降至 1.7¢,削减了 67%,而准确率变动了 1.3 个百分点(65.2% 到 63.9%)。在 gemini-3.1-pro 上,auto 运行从 11.1¢ 降至 2.7¢,准确率上升了 1.5 个百分点。所以,如果你想要更便宜的图像处理流程,就限制推理投入并保持图像清晰。
低细节在非推理模型上仍然划算
在非推理模型上,低细节的表现符合预期。gpt-5.4-mini 在 low 下每题运行成本为 0.08¢,而 auto 下为 0.14¢,便宜约 40%,因为没有推理循环来推高账单。代价是准确率,从 55.8% 降至 46.1%。
延迟也呈现同样的趋势。gpt-4.1 在 low 下平均每次请求 960ms,而 auto 下为 1,148ms;gpt-5.4-mini 则为 1,348ms 对 1,776ms。低细节将图像限制为固定的少量提示词 token 成本(gpt-4.1 上为 85 个 token),因此在模型开始生成之前需要读入的内容少得多。由于没有推理循环拖长尾部,更短的预填充就体现为更快的响应。
为你的工作负载选择合适的细节级别
选择取决于你的模型是否进行推理:
- 推理模型(gpt-5.5 及类似模型):保留
auto或high,并使用推理投入来控制成本。在我们的运行中,低细节在每个推理模型上得分都更差,且在三个模型中的两个上成本更高。 - 非推理模型(gpt-5.4-mini 及类似模型):低细节可降低成本并减少延迟,但在文本密集的图像上准确率有所下降。
无论哪种情况,与更昂贵的输出 token 相比,细节设置对最终成本的影响要小得多。在大多数情况下,最好将图像细节保持在 auto 并调整推理。
OpenRouter 的 图像输入 API 在各模型间是统一的,而像细节级别这样的模型特定参数通过提供商选项传递,因此你无需更改集成即可调整这些设置。
我们如何测试
- 基准:MMMU-Pro Vision(
MMMU/MMMU_Pro,vision 配置,测试集),1,730 道十选项视觉推理题。 - 模型:gpt-5.5、gpt-5.4-mini、gpt-4.1、gemini-3.5-flash、gemini-3.1-pro,每个均在
low和auto细节下,温度 0,一个 epoch。 - 细节:OpenAI
image_url.detaillow/auto;Gemini 按部分mediaResolution。无最大 token 上限。 - 图像类型:由 gpt-5.4-mini vision 分类(文本/OCR、截图、示意图、图表、插图、照片)。按类型准确率针对 Gemini 模型计算;OpenAI 的按类型单元格在本次运行中未评分。
- 指标:准确率来自评估日志;token 和延迟来自 OpenRouter 生成记录。
- 成本:以每题成本报告,即总运行成本除以该次运行中计分的问题数量。这样归一化可以在规模略有不同的运行之间保持公平比较。
来源:OpenRouter:Announcements(RSS) · openrouter.ai