Navigate
AI BENCHY
Advertise here

Compared models

Grok 4.20 Beta (medium) vs Grok 4.20 Multi Agent Beta (medium) vs Grok 4.1 Fast (medium) vs Gemini 3 Flash Preview (medium) benchmark comparison: Gemini 3 Flash Preview (medium) leads on Score with 9.6. Grok 4.1 Fast (medium) leads on Reliability with 10.0. Grok 4.1 Fast (medium) has the lowest Total Cost at $0.069. Grok 4.20 Multi Agent Beta (medium) is fastest at 9.69s.

Last updated at: 2026-07-28

Rank
#147
Total Output Tokens
93,212
Response Time (avg)
9.75s
Total Cost
$0.750
Rank
#203
Total Output Tokens
600,042
Response Time (avg)
9.69s
Total Cost
$5.599
Rank
#207
Total Output Tokens
98,340
Response Time (avg)
23.85s
Total Cost
$0.069
Rank
#3
Total Output Tokens
232,650
Response Time (avg)
19.20s
Total Cost
$0.742
Recommended model Gemini 3 Flash Preview (medium)

It has the best score here (9.6), while costing about 2.9x less than the other models in this comparison.

Detailed comparison

Metric Grok 4.20 Beta Grok 4.20 Beta medium Release: 2026-03-12 Grok 4.20 Multi Agent Beta Grok 4.20 Multi Agent Beta medium Release: 2026-03-12 Grok 4.1 Fast Grok 4.1 Fast medium Release: 2025-11-19 Gemini 3 Flash Preview Gemini 3 Flash Preview medium Release: 2025-12-17
Score 6.0 4.8 4.7 9.6
Rank #147 #203 #207 #3
Reliability N/A N/A 10.0 10.0
Consistency 7.8 6.4 6.3 9.7
Tests Correct
Attempt pass rate 66.7% 48.5% 53.0% 98.5%
Flaky tests 1 5 6 1
Total Runs 52 52 57 66
Cost per result 4.505 62.923 0.642 3.533
Total Cost $0.750 $5.599 $0.069 $0.742
Input Price $5.805 / 1M $4.235 / 1M $0.484 / 1M $0.500 / 1M
Output Price $5.805 / 1M $4.235 / 1M $0.484 / 1M $3.000 / 1M
Total Input Tokens 35,955 721,952 42,845 87,861
Output Tokens 1,647 294,668 2,006 5,486
Reasoning Tokens 91,565 305,374 96,334 227,164
Response Time (avg) 9.75s 9.69s 23.85s 19.20s
Response Time (max) 31.36s 35.28s 121.79s 117.26s
Response Time (total) 175.48s 155.07s 286.16s 422.42s

Model generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#147 Grok 4.20 Beta

medium
Cost
$0.034
Time
91.0s
Tokens
13,523 tok

#203 Grok 4.20 Multi Agent Beta

medium
Cost
$0.261
Time
123.4s
Tokens
199,344 tok

#207 Grok 4.1 Fast

medium
Grok 4.1 Fast is deprecated. xAI recommends switching to Grok 4.3 (https://openrouter.ai/x-ai/grok-4.3)
Cost
$0.000
Time
0.1s
Tokens
0 tok

#3 Gemini 3 Flash Preview

medium
Cost
$0.010
Time
18.4s
Tokens
3,351 tok

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Coding Score Consistency Attempt pass rate Flaky tests Tests Correct Response Time (avg) Input Tokens Output Tokens Reasoning Tokens
Grok 4.20 Beta 3.3 3.3 33.3% 0 31.36s 360 81 3,987
Grok 4.20 Multi Agent Beta 3.3 3.3 33.3% 0 27.11s 13,212 86 13,141
Grok 4.1 Fast 7.8 4.0 11.1% 1 23.58s 1,167 821 6,703
Gemini 3 Flash Preview 8.6 7.6 88.9% 1 84.40s 8,122 462 161,084

Quick Compare

Switch Comparison Pair