导航
AI BENCHY
Advertise here

已对比模型

Gemma 4 31B (medium) vs Gemini 3 PRO Preview (medium) vs GLM 5 Turbo (medium) 基准对比: GLM 5 Turbo (medium) 在分数上以 7.6 领先。 Gemma 4 31B (medium) 在可靠性上以 10.0 领先。 Gemma 4 31B (medium) 的总成本最低,为 $0.100Gemini 3 PRO Preview (medium) 最快,为 9.05s

基准结果生成自 AI BENCHY 测试套件,时间:: 2026-08-20

排名
#166
总输出令牌
267,421
响应时间(平均)
78.59s
总成本
$0.100
排名
#185
总输出令牌
11,592
响应时间(平均)
9.05s
总成本
$0.385
排名
#77
总输出令牌
74,522
响应时间(平均)
23.00s
总成本
$0.323
推荐模型 GLM 5 Turbo (medium)

它在这里得分最高(7.6),同时响应速度比本次比较中的其他模型快约 1.9 倍。

详细对比

指标 Gemma 4 31B Gemma 4 31B medium 发布日期: 2026-04-02 免费可用 Gemini 3 PRO Preview Gemini 3 PRO Preview medium 发布日期: 2025-11-18 GLM 5 Turbo GLM 5 Turbo medium 发布日期: 2026-03-15
分数 6.2 6.0 7.6
排名 #166 #185 #77
可靠性 10.0 不适用 10.0
一致性 8.7 9.5 8.1
尝试次数 66/66 63/66 63/66
测试正确
尝试通过率 65.2% 63.6% 71.2%
不稳定测试 3 0 4
总运行次数 66 63 63
每个结果成本 1.152 1.406 2.011
总成本 $0.100 $0.385 $0.323
输入价格 $0.090 / 1M $9.506 / 1M $1.200 / 1M
输出价格 $0.340 / 1M $9.506 / 1M $4.000 / 1M
总输入令牌 94,969 28,848 35,593
输出令牌 34,399 1,490 12,245
推理令牌 233,022 10,102 62,277
响应时间(平均) 78.59s 9.05s 23.00s
响应时间(最大) 437.40s 26.24s 194.23s
响应时间(总计) 1571.84s 90.53s 482.97s
参数量 30.7B ~1.2T 总计 (~20B 激活) 744B 总计 (40B 激活)
开放状态 开源 闭源 闭源

模型生成展示

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#166 Gemma 4 31B

medium
成本
$0.002
时间
45.7s
令牌
2,696 tok

#185 Gemini 3 PRO Preview

medium
No endpoints found for google/gemini-3-pro-preview.
成本
$0.000
时间
0.1s
令牌
0 tok

#77 GLM 5 Turbo

medium
成本
$0.074
时间
206.0s
令牌
18,549 tok

按分数排名的模型

分数 vs 总成本

响应时间(平均)

分数 vs 响应时间(平均)

总输出令牌

分数 vs 总输出令牌

类别细分

编程 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Gemma 4 31B 4.3 5.8 22.2% 1 219.76s 5,568 11,098 33,212
Gemini 3 PRO Preview 3.0 10.0 0.0% 0 0ms 0 0 0
GLM 5 Turbo 8.2 9.3 66.7% 0 45.90s 5,941 363 25,381

快速对比

切换对比组合