导航
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

已对比模型

Grok 4.20 Beta (medium) vs Grok 4.20 Multi Agent Beta (medium) vs Grok 4.1 Fast (medium) vs Gemini 3 Flash Preview (medium) 基准对比: Gemini 3 Flash Preview (medium) 在分数上以 9.5 领先。 Grok 4.1 Fast (medium) 在可靠性上以 10.0 领先。 Grok 4.1 Fast (medium) 的总成本最低,为 $0.069Grok 4.20 Multi Agent Beta (medium) 最快,为 9.69s

基准结果生成自 AI BENCHY 测试套件,时间:: 2026-09-10

已对比模型

排名
#210
总输出令牌
93,212
响应时间(平均)
9.75s
总成本
$0.750
排名
#289
总输出令牌
600,042
响应时间(平均)
9.69s
总成本
$5.599
排名
#294
总输出令牌
98,340
响应时间(平均)
23.85s
总成本
$0.069
排名
#10
总输出令牌
239,608
响应时间(平均)
19.86s
总成本
$0.763
推荐模型 Gemini 3 Flash Preview (medium)

它在这里得分最高(9.5),同时成本比本次比较中的其他模型低约 2.8 倍。

详细对比

指标 Grok 4.20 Beta Grok 4.20 Beta medium 发布日期: 2026-03-12 Grok 4.20 Multi Agent Beta Grok 4.20 Multi Agent Beta medium 发布日期: 2026-03-12 Grok 4.1 Fast Grok 4.1 Fast medium 发布日期: 2025-11-19 Gemini 3 Flash Preview Gemini 3 Flash Preview medium 发布日期: 2025-12-17
分数 6.0 4.8 4.7 9.5
排名 #210 #289 #294 #10
可靠性 不适用 不适用 10.0 10.0
一致性 7.8 6.4 6.3 9.7
尝试次数 52/66 52/66 57/66 66/66
测试正确
尝试通过率 66.7% 48.5% 53.0% 93.9%
不稳定测试 1 5 6 1
总运行次数 52 52 57 66
每个结果成本 4.505 62.923 0.642 3.814
总成本 $0.750 $5.599 $0.069 $0.763
输入价格 $5.805 / 1M $4.235 / 1M $0.484 / 1M $0.500 / 1M
输出价格 $5.805 / 1M $4.235 / 1M $0.484 / 1M $3.000 / 1M
总输入令牌 35,955 721,952 42,845 87,870
输出令牌 1,647 294,668 2,006 5,486
推理令牌 91,565 305,374 96,334 234,122
响应时间(平均) 9.75s 9.69s 23.85s 19.86s
响应时间(最大) 31.36s 35.28s 121.79s 117.26s
响应时间(总计) 175.48s 155.07s 286.16s 436.88s
参数量 ~1T 总计 (~100B 激活) ~1T 总计 (~100B 激活) ~500B 总计 (~50B 激活) ~500B 总计 (~20B 激活)
开放状态 闭源 闭源 闭源 闭源

模型生成展示

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#210 Grok 4.20 Beta

medium
成本
$0.034
时间
91.0s
令牌
13,523 tok

#289 Grok 4.20 Multi Agent Beta

medium
成本
$0.261
时间
123.4s
令牌
199,344 tok

#294 Grok 4.1 Fast

medium
Grok 4.1 Fast is deprecated. xAI recommends switching to Grok 4.3 (https://openrouter.ai/x-ai/grok-4.3)
成本
$0.000
时间
0.1s
令牌
0 tok

#10 Gemini 3 Flash Preview

medium
成本
$0.010
时间
18.4s
令牌
3,351 tok

按分数排名的模型

分数 vs 总成本

响应时间(平均)

分数 vs 响应时间(平均)

总输出令牌

分数 vs 总输出令牌

类别细分

编程 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Grok 4.20 Beta 3.3 3.3 33.3% 0 31.36s 360 81 3,987
Grok 4.20 Multi Agent Beta 3.3 3.3 33.3% 0 27.11s 13,212 86 13,141
Grok 4.1 Fast 7.8 4.0 11.1% 1 23.58s 1,167 821 6,703
Gemini 3 Flash Preview 8.6 7.6 88.9% 1 84.40s 8,122 462 161,084

快速对比

切换对比组合