导航
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY 对比

已对比模型

摘要

Gemma 4 31B vs Gemini 3 Flash Preview vs Gemini 3 PRO Preview vs Gemini 3.1 Pro Preview 基准对比Gemini 3 Flash Preview 在分数上以 9.6 领先。 Gemma 4 31B 在可靠性上以 10.0 领先。 Gemma 4 31B 的总成本最低,为 $0.033Gemini 3 PRO Preview 最快,为 9.05s

推荐模型: Gemini 3 Flash Preview - 它在这里得分最高(9.6),同时响应速度比本次比较中的其他模型快约 1.5 倍。

基准结果生成自 AI BENCHY 测试套件,时间:: 2026-07-02

指标 Gemma 4 31B Gemma 4 31B medium 发布日期: 2026-04-02 免费可用 Gemini 3 Flash Preview Gemini 3 Flash Preview medium 发布日期: 2025-12-17 Gemini 3 PRO Preview Gemini 3 PRO Preview medium 发布日期: 2025-11-18 Gemini 3.1 Pro Preview Gemini 3.1 Pro Preview medium 发布日期: 2026-02-19
分数 6.3 9.6 6.2 9.2
排名 #91 #2 #94 #7
可靠性 10.0 10.0 不适用 10.0
一致性 9.4 9.7 10.0 10.0
测试正确
尝试通过率 69.8% 98.4% 66.7% 90.5%
不稳定测试 1 1 0 0
总运行次数 63 63 63 63
每个结果成本 0.257 3.335 1.406 5.546
总成本 $0.033 $0.667 $0.385 $1.054
输入价格 $0.120 / 1M $0.500 / 1M $9.506 / 1M $2.000 / 1M
输出价格 $0.350 / 1M $3.000 / 1M $9.506 / 1M $12.000 / 1M
总输入令牌 17,957 37,017 28,848 41,617
输出令牌 22,356 2,006 1,490 1,977
推理令牌 65,726 214,153 10,102 78,896
响应时间(平均) 56.55s 18.64s 9.05s 20.14s
响应时间(最大) 437.40s 117.26s 26.24s 88.68s
响应时间(总计) 1074.41s 391.35s 90.53s 281.92s

生成展示

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#91 Gemma 4 31B

medium
成本
$0.002
时间
45.7s
令牌
2,696 tok

#2 Gemini 3 Flash Preview

medium
成本
$0.010
时间
17.9s
令牌
3,236 tok

#94 Gemini 3 PRO Preview

medium
No endpoints found for google/gemini-3-pro-preview.
成本
$0.000
时间
0.1s
令牌
0 tok

#7 Gemini 3.1 Pro Preview

medium
成本
$0.115
时间
87.2s
令牌
9,629 tok

按分数排名的模型

分数 vs 总成本

响应时间(平均)

分数 vs 响应时间(平均)

总输出令牌

分数 vs 总输出令牌

类别细分

反AI技巧 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Gemma 4 31B 10.0 10.0 100.0% 0 12.89s 816 962 2,046
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 3.88s 494 330 3,216
Gemini 3 PRO Preview 10.0 10.0 100.0% 0 14.99s 500 149 1,485
Gemini 3.1 Pro Preview 10.0 10.0 100.0% 0 7.90s 498 112 3,218
编程 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Gemma 4 31B 4.3 5.8 22.2% 1 219.76s 5,568 11,098 33,212
Gemini 3 Flash Preview 8.6 7.6 88.9% 1 84.40s 8,122 462 161,084
Gemini 3 PRO Preview 3.0 10.0 0.0% 0 0ms 0 0 0
Gemini 3.1 Pro Preview 7.9 9.9 66.7% 0 40.17s 8,124 435 41,247
综合 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Gemma 4 31B 3.0 10.0 0.0% 0 0ms 0 0 0
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 22.42s 12,873 351 10,485
Gemini 3 PRO Preview 3.0 10.0 0.0% 0 10.37s 13,211 351 952
Gemini 3.1 Pro Preview 9.5 10.0 100.0% 0 40.61s 17,240 432 9,281
数据解析与提取 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Gemma 4 31B 10.0 10.0 100.0% 0 21.11s 8,334 1,822 2,951
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 5.43s 7,548 279 4,893
Gemini 3 PRO Preview 10.0 10.0 100.0% 0 10.84s 7,259 279 3,156
Gemini 3.1 Pro Preview 10.0 10.0 100.0% 0 7.72s 7,265 279 3,904
领域专项 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Gemma 4 31B 7.7 10.0 66.7% 0 38.48s 876 4,349 8,985
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 15.27s 633 12 21,684
Gemini 3 PRO Preview 5.3 10.0 33.3% 0 7.01s 643 15 1,195
Gemini 3.1 Pro Preview 7.7 10.0 66.7% 0 32.73s 635 18 12,424
通用智能 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Gemma 4 31B 10.0 10.0 100.0% 0 9.57s 567 105 888
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 5.19s 486 72 1,905
Gemini 3 PRO Preview 10.0 10.0 100.0% 0 9.34s 486 78 374
Gemini 3.1 Pro Preview 10.0 10.0 100.0% 0 11.77s 490 108 1,179
指令遵循 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Gemma 4 31B 10.0 10.0 100.0% 0 12.76s 777 533 2,035
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 4.04s 615 72 2,709
Gemini 3 PRO Preview 9.8 10.0 100.0% 0 3.26s 623 69 754
Gemini 3.1 Pro Preview 10.0 10.0 100.0% 0 9.56s 621 72 2,236
谜题求解 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Gemma 4 31B 9.9 10.0 100.0% 0 26.91s 801 1,795 5,595
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 4.05s 558 183 4,365
Gemini 3 PRO Preview 10.0 10.0 100.0% 0 3.88s 570 225 1,215
Gemini 3.1 Pro Preview 10.0 10.0 100.0% 0 6.90s 570 235 3,128
工具调用 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Gemma 4 31B 3.0 10.0 0.0% 0 0ms 0 0 0
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 12.60s 5,532 234 1,487
Gemini 3 PRO Preview 10.0 10.0 100.0% 0 11.96s 5,556 324 971
Gemini 3.1 Pro Preview 10.0 10.0 100.0% 0 23.15s 6,018 274 982
常识问答 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Gemma 4 31B 3.0 10.0 0.0% 0 90.14s 218 1,692 10,014
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 5.50s 156 11 2,325
Gemini 3 PRO Preview 3.0 10.0 0.0% 0 0ms 0 0 0
Gemini 3.1 Pro Preview 10.0 10.0 100.0% 0 6.27s 156 12 1,297

快速对比

切换对比组合