跳到正文
原文
Tomer Tunguz 博客(VC 分析)·· 2 小时前精选AI 评分65

Tomer Tunguz 分析 Gemini 3 Flash 的性价比:输入性价比领先 3.4 倍

A Flash of Deflation

AI 导读

Tomer Tunguz 分析称 Gemini 3 Flash 以 $0.50/百万输入 token、$3.00/百万输出 token 的价格,在 20 项基准上距 SOTA 仅 9%,输入性价比比 GPT-5.2 高 3.4 倍,输出性价比比 Claude Opus 4.5 高约 8.7 倍。

推荐理由

作者用 20 项基准与统一算法量化各家模型性价比,读者可据此比较 Gemini 3 Flash 与竞品的实际推理成本差距。

正文 · AI 翻译

简而言之:与次优替代方案相比,Gemini 3 Flash 的输入性价比高出 3.4 倍,输出性价比高出 3.9 倍,而 Gemini 3 Pro 在 20 项标准化测试中的原始基准性能领先。

Gemini 3 Flash 代表了模型通缩的阶跃式增长:一封挑战书。

谷歌的最新模型将最先进水平的定价压低了 70% 至 79%,而性能水平却非常接近。Gemini 3 Flash 的定价为每百万输入 token 0.50 美元、每百万输出 token 3.00 美元,在 20 项基准测试中与最佳得分的差距在 9% 以内。1

性价比究竟高出多少?团队运行推理能便宜多少?

首先是性能。Gemini 3 Pro 以与最先进水平 6% 的偏差位居本次分析榜首。Gemini 3 Flash 紧随其后,为 9%,然后是 Opus,为 12%。

Average Percentage Delta from SOTA by Model

其次是输入性价比。从输入 token 的总体性价比来看,差距巨大。Gemini 3 Flash 每美元可提供 182 个性能点,而 GPT-5.2 仅为 53 个。这是 3.4 倍的优势。

第三是输出性价比。差距进一步拉大。Gemini 3 Flash 每输出一美元可得 30.3 个性能点,而 Claude Opus 4.5 仅为 3.5 个。Claude 每百万输出 token 收费 25 美元:是 Gemini 的 3 美元的 8 倍:而在综合基准测试中得分却低了 2.9%。23

Gemini 3 Flash Output Price-Performance

Gemini 3 Flash 将 2023 年 3 月需要 65 美元 GPT-4 token 才能实现的同等能力压缩到如今的 1.10 美元。4这意味着 33 个月内通缩了 98%。对于构建 AI 产品的团队来说,这不是渐进式改进:而是一次类别转变,让此前不经济的用例变得可行。

模型 性能得分 与 SOTA 的平均偏差百分比 输入 $/百万 token 输出 $/百万 token
Gemini 3 Flash 90.8 -9.2% $0.50 $3.00
GPT-5.2 92.6 -7.4% $1.75 $14.00
Gemini 3 Pro 93.8 -6.2% $2.00 $12.00
Claude Sonnet 4.5 71.8 -28.2% $3.00 $15.00
Claude Opus 4.5 88.2 -11.8% $5.00 $25.00

第三、四季度的模型发布节奏从未停歇。性能提升打破了预期。更令人难以置信的是:在发布后数周内,这样的性能就打七折到八折。

谷歌正在引领 AI 定价的通缩,以清仓甩卖般的价格出售卓越的性能。


最先进水平(SOTA):某一基准测试中任何模型取得的最佳得分,用作 100% 基线。性能得分 = 100 + 与 SOTA 的平均偏差百分比。

SOTA Delta Heatmap by Model and Benchmark



  1. 方法论:衡量总体性价比很难。我使用了一种启发式方法:在 20 项不同基准测试中,对五个最新前沿模型(Gemini 3 Flash、Gemini 3 Pro、GPT-5.2、Claude Opus 4.5、Claude Sonnet 4.5)进行测试,计算与最先进水平的偏差百分比。每个模型在每项基准测试上的得分与该基准测试中任何模型取得的最佳得分进行比较。然后将所有基准测试的偏差百分比取平均值,得出综合性能得分。 ↩︎

  2. Claude Opus 4.5 的输出定价(25 美元/百万 token)除以 Gemini 3 Flash 的输出定价(3 美元/百万 token)= 8.3 倍。性能得分差异:Gemini 3 Flash(90.8)- Claude Opus 4.5(88.2)= 2.6 分,即相对 Gemini 3 Flash 低 2.9%。 ↩︎

  3. 更正(2025 年 12 月 17 日):将“低 2.6%”更新为“低 2.9%”,以反映正确的百分比计算(2.6 分 / 90.8 = 2.86%)。 ↩︎

  4. 单位性能成本按混合 token 价格(80% 输入 + 20% 输出)除以综合基准得分计算。GPT-4(2023 年 3 月):$36 混合 / 0.55 综合 = $65.45。Gemini 3 Flash(2025 年 12 月):$1.00 混合 / 0.908 综合 = $1.10。通缩幅度:($65.45 - $1.10) / $65.45 = 98.3%。 ↩︎

在你的收件箱中获取下一期

1 分钟阅读,将技术数据转化为战略优势。
150k+ 创始人和运营者正在阅读。

Theory Ventures 的 GP。前 Google PM。分享关于 AI、web3 和风险投资的数据驱动洞察。

Bloomberg • WSJ • Economist

来源:Tomer Tunguz 博客(VC 分析) · tomtunguz.com