Navigate
AI BENCHY
Advertise here

KAT-Coder-Pro V2.5 (low) vs Qwen3.7 Plus (medium)

Qwen3.7 Plus (medium) leads on average score with 7.9 vs 7.4. Qwen3.7 Plus (medium) has the lower benchmark cost at $0.267 vs $0.387. KAT-Coder-Pro V2.5 (low) is faster at 19.47s vs 51.51s, with pass rates of 69.7% vs 75.8%.

Last updated at: 2026-07-25

Rank
#70
Total Output Tokens
108,640
Response Time (avg)
19.47s
Total Cost
$0.387
Rank
#43
Total Output Tokens
179,429
Response Time (avg)
51.51s
Total Cost
$0.267
Recommended model Qwen3.7 Plus (medium)

It has the strongest score in this comparison (7.9) and the best overall balance of cost and response time across all 2 models.

Detailed comparison

Metric KAT-Coder-Pro V2.5 KAT-Coder-Pro V2.5 low Release: 2026-07-14 Qwen3.7 Plus Qwen3.7 Plus medium Release: 2026-06-03
Score 7.4 7.9
Rank #70 #43
Reliability 10.0 10.0
Consistency 7.0 8.9
Tests Correct
Attempt pass rate 69.7% 75.8%
Flaky tests 8 3
Total Runs 66 66
Cost per result 3.514 2.072
Total Cost $0.387 $0.267
Input Price $0.740 / 1M $0.320 / 1M
Output Price $2.960 / 1M $1.280 / 1M
Total Input Tokens 87,673 115,233
Output Tokens 7,166 6,162
Reasoning Tokens 101,474 173,267
Response Time (avg) 19.47s 51.51s
Response Time (max) 209.15s 315.30s
Response Time (total) 428.31s 1133.15s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#70 KAT-Coder-Pro V2.5

low
Cost
$0.016
Time
47.6s
Tokens
5,182 tok

#43 Qwen3.7 Plus

medium
Cost
$0.018
Time
193.2s
Tokens
10,821 tok

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Coding Score Consistency Attempt pass rate Flaky tests Tests Correct Response Time (avg) Input Tokens Output Tokens Reasoning Tokens
KAT-Coder-Pro V2.5 7.8 10.0 66.7% 0 24.87s 7,893 402 24,945
Qwen3.7 Plus 6.1 6.6 55.6% 1 108.60s 6,472 414 43,576

Quick Compare

Switch Comparison Pair