Navigate
AI BENCHY
Advertise here

Compared models

GLM 5 (medium) vs GLM 5.1 (medium) vs Kimi K2.5 (medium) vs Qwen3.6 Plus Preview (medium) benchmark comparison: GLM 5 (medium) leads on Score with 7.7. GLM 5 (medium) leads on Reliability with 10.0. Qwen3.6 Plus Preview (medium) has the lowest Total Cost at $0.000. Qwen3.6 Plus Preview (medium) is fastest at 15.25s.

Last updated at: 2026-07-25

Rank
#49
Total Output Tokens
124,566
Response Time (avg)
33.54s
Total Cost
$0.307
Rank
#82
Total Output Tokens
152,552
Response Time (avg)
46.77s
Total Cost
$0.535
Rank
#85
Total Output Tokens
227,367
Response Time (avg)
99.00s
Total Cost
$0.600
Rank
#190
Total Output Tokens
63,350
Response Time (avg)
15.25s
Total Cost
$0.000
Recommended model GLM 5 (medium)

It has the best score here (7.7), while costing about 1.8x less than the other models in this comparison.

Detailed comparison

Metric GLM 5 GLM 5 medium Release: 2026-02-12 GLM 5.1 GLM 5.1 medium Release: 2026-04-07 Kimi K2.5 Kimi K2.5 medium Release: 2026-01-27 Qwen3.6 Plus Preview Qwen3.6 Plus Preview medium Release: 2026-04-20 Free Available
Score 7.7 7.1 7.0 4.9
Rank #49 #82 #85 #190
Reliability 10.0 8.3 10.0 N/A
Consistency 8.1 8.4 7.0 8.6
Tests Correct
Attempt pass rate 78.8% 69.7% 65.2% 40.9%
Flaky tests 4 4 8 0
Total Runs 63 66 66 57
Cost per result 1.668 4.202 4.789 0.000
Total Cost $0.307 $0.535 $0.600 $0.000
Input Price $0.950 / 1M $0.966 / 1M $0.571 / 1M $0.000 / 1M
Output Price $2.551 / 1M $3.036 / 1M $2.850 / 1M $0.000 / 1M
Total Input Tokens 35,224 82,623 118,448 32,639
Output Tokens 21,570 16,089 62,124 1,153
Reasoning Tokens 102,996 136,463 165,243 62,197
Response Time (avg) 33.54s 46.77s 99.00s 15.25s
Response Time (max) 99.85s 308.75s 281.00s 43.55s
Response Time (total) 435.99s 982.16s 1485.04s 182.96s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#49 GLM 5

medium
Cost
$0.005
Time
20.7s
Tokens
2,068 tok

#82 GLM 5.1

medium
Invalid SVG
Cost
$0.000
Time
300.0s
Tokens
0 tok

#85 MoonshotAI: Kimi K2.5

medium
Cost
$0.030
Time
58.6s
Tokens
8,683 tok

#190 Qwen3.6 Plus Preview

medium
No showcase result has been generated for this model yet.
Cost
$0.000
Time
-
Tokens
0 tok

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Coding Score Consistency Attempt pass rate Flaky tests Tests Correct Response Time (avg) Input Tokens Output Tokens Reasoning Tokens
GLM 5 10.0 10.0 100.0% 0 74.30s 7,254 2,997 52,930
GLM 5.1 4.6 3.7 44.5% 2 109.63s 5,702 4,871 37,826
Kimi K2.5 6.1 4.6 66.7% 2 217.49s 6,935 5,705 74,693
Qwen3.6 Plus Preview 9.8 3.3 0.0% 0 0ms 0 0 0

Quick Compare

Switch Comparison Pair