Navigate
AI BENCHY
Advertise here

Gemini 3.5 Flash (minimal) vs Qwen3.7 Plus (medium)

Qwen3.7 Plus (medium) leads on average score with 7.9 vs 6.8. Qwen3.7 Plus (medium) has the lower benchmark cost at $0.267 vs $0.300. Gemini 3.5 Flash (minimal) is faster at 2.65s vs 51.51s, with pass rates of 65.2% vs 75.8%.

Last updated at: 2026-07-28

Rank
#99
Total Output Tokens
16,454
Response Time (avg)
2.65s
Total Cost
$0.300
Rank
#43
Total Output Tokens
179,429
Response Time (avg)
51.51s
Total Cost
$0.267
Recommended model Qwen3.7 Plus (medium)

It has the strongest score in this comparison (7.9) and the best overall balance of cost and response time across all 2 models.

Detailed comparison

Metric Gemini 3.5 Flash Gemini 3.5 Flash minimal Release: 2026-05-19 Qwen3.7 Plus Qwen3.7 Plus medium Release: 2026-06-03
Score 6.8 7.9
Rank #99 #43
Reliability 10.0 10.0
Consistency 9.6 8.9
Tests Correct
Attempt pass rate 65.2% 75.8%
Flaky tests 1 3
Total Runs 66 66
Cost per result 2.138 2.072
Total Cost $0.300 $0.267
Input Price $1.500 / 1M $0.320 / 1M
Output Price $9.000 / 1M $1.280 / 1M
Total Input Tokens 100,753 115,233
Output Tokens 16,454 6,162
Reasoning Tokens 0 173,267
Response Time (avg) 2.65s 51.51s
Response Time (max) 25.26s 315.30s
Response Time (total) 58.27s 1133.15s

Model generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#99 Gemini 3.5 Flash

minimal
Cost
$0.041
Time
20.4s
Tokens
4,608 tok

#43 Qwen3.7 Plus

medium
Cost
$0.018
Time
193.2s
Tokens
10,821 tok

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Coding Score Consistency Attempt pass rate Flaky tests Tests Correct Response Time (avg) Input Tokens Output Tokens Reasoning Tokens
Gemini 3.5 Flash 5.6 9.9 33.3% 0 2.75s 8,122 3,456 0
Qwen3.7 Plus 6.1 6.6 55.6% 1 108.60s 6,472 414 43,576

Quick Compare

Switch Comparison Pair