Navigate
AI BENCHY
Advertise here

MoonshotAI: Kimi K2.6 vs Qwen: Qwen3.7 Max

Qwen3.7 Max leads on average score with 7.4 vs 7.2. Qwen3.7 Max has the lower benchmark cost at $0.197 vs $1.036. Qwen3.7 Max is faster at 4.52s vs 109.98s, with pass rates of 63.6% vs 68.2%.

Recommended modelQwen3.7 MaxIt has the best score here (7.4), while costing about 5.3x less than Kimi K2.6 (medium).

Last updated at: 2026-07-20

Metric Kimi K2.6 Kimi K2.6 medium Release: 2026-04-20 Qwen3.7 Max Qwen3.7 Max none Release: 2026-05-22
Score 7.2 7.4
Rank #68 #59
Reliability 9.4 9.9
Consistency 8.3 10.0
Tests Correct
Attempt pass rate 63.6% 68.2%
Flaky tests 4 0
Total Runs 66 66
Cost per result 9.821 1.582
Total Cost $1.036 $0.197
Input Price $0.684 / 1M $1.475 / 1M
Output Price $3.420 / 1M $4.425 / 1M
Total Input Tokens 68,902 95,983
Output Tokens 111,680 12,446
Reasoning Tokens 279,860 0
Response Time (avg) 109.98s 4.52s
Response Time (max) 876.20s 72.30s
Response Time (total) 2309.56s 99.52s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#68 MoonshotAI: Kimi K2.6

medium
Cost
$0.013
Time
103.4s
Tokens
3,620 tok

#59 Qwen3.7 Max

none
Cost
$0.046
Time
195.0s
Tokens
12,171 tok

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Coding Score Consistency Attempt pass rate Flaky tests Tests Correct Response Time (avg) Input Tokens Output Tokens Reasoning Tokens
Kimi K2.6 5.7 8.6 33.3% 0 214.42s 2,925 9,970 77,189
Qwen3.7 Max 5.5 10.0 33.3% 0 1.35s 7,911 582 0

Quick Compare

Switch Comparison Pair