导航
AI BENCHY
Advertise here

Gemini 3 Flash Preview vs GPT-5.2 (medium)

GPT-5.2 (medium) 平均分领先,为 8.4 vs 6.8Gemini 3 Flash Preview benchmark 成本更低,为 $0.085 vs $0.951Gemini 3 Flash Preview 更快,为 2.95s vs 22.62s,通过率为 65.2% vs 72.7%

基准结果生成自 AI BENCHY 测试套件,时间:: 2026-07-25

排名
#97
总输出令牌
10,710
响应时间(平均)
2.95s
总成本
$0.085
排名
#27
总输出令牌
54,782
响应时间(平均)
22.62s
总成本
$0.951
推荐模型 Gemini 3 Flash Preview

它提供了最佳整体取舍:得分有竞争力(6.8),成本低于GPT-5.2 (medium),响应时间也较均衡。

详细对比

指标 Gemini 3 Flash Preview Gemini 3 Flash Preview none 发布日期: 2025-12-17 GPT-5.2 GPT-5.2 medium 发布日期: 2025-12-11
分数 6.8 8.4
排名 #97 #27
可靠性 10.0 10.0
一致性 8.9 8.5
测试正确
尝试通过率 65.2% 72.7%
不稳定测试 3 4
总运行次数 66 66
每个结果成本 0.648 6.791
总成本 $0.085 $0.951
输入价格 $0.500 / 1M $1.750 / 1M
输出价格 $3.000 / 1M $14.000 / 1M
总输入令牌 104,210 105,004
输出令牌 10,710 9,914
推理令牌 0 44,868
响应时间(平均) 2.95s 22.62s
响应时间(最大) 21.19s 102.93s
响应时间(总计) 44.26s 339.28s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#97 Gemini 3 Flash Preview

none
成本
$0.003
时间
5.6s
令牌
981 tok

#27 GPT-5.2

medium
成本
$0.047
时间
49.2s
令牌
3,396 tok

按分数排名的模型

分数 vs 总成本

响应时间(平均)

分数 vs 响应时间(平均)

总输出令牌

分数 vs 总输出令牌

类别细分

编程 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Gemini 3 Flash Preview 5.5 10.0 33.3% 0 1.80s 8,122 453 0
GPT-5.2 10.0 10.0 100.0% 0 22.73s 7,302 511 11,912

快速对比

切换对比组合