Navigate
Advertise here

Qwen3.8 Max (0902) (medium) vs Pareto

Pareto leads on average score with 8.9 vs 8.8. Qwen3.8 Max (0902) (medium) has the lower benchmark cost at $0.677 vs $1.172. Qwen3.8 Max (0902) (medium) is faster at 26.01s vs 31.51s, with pass rates of 83.3% vs 86.4%.

Last updated at: 2026-09-18

Compared models

Rank
#37
Total Output Tokens
80,678
Response Time (avg)
26.01s
Total Cost
$0.677
Rank
#34
Total Output Tokens
119,230
Response Time (avg)
31.51s
Total Cost
$1.172
Recommended model Qwen3.8 Max (0902) (medium)

Its score stays close to the best score here (8.8 vs 8.9), while costing about 1.7x less than Pareto.

Detailed comparison

Metric Qwen3.8 Max (0902) Qwen3.8 Max (0902) medium Release: 2026-09-07 Pareto Pareto none Release: 2026-09-18
Score 8.8 8.9
Rank #37 #34
Reliability 10.0 10.0
Consistency 9.3 9.2
Attempts 66/66 66/66
Tests Correct
Attempt pass rate 83.3% 86.4%
Flaky tests 2 2
Total Runs 66 66
Cost per result 3.981 6.506
Total Cost $0.677 $1.172
Input Price $2.000 / 1M $2.500 / 1M
Output Price $6.000 / 1M $7.500 / 1M
Total Input Tokens 96,323 110,734
Output Tokens 5,961 119,230
Reasoning Tokens 74,717 0
Response Time (avg) 26.01s 31.51s
Response Time (max) 168.09s 143.33s
Response Time (total) 572.19s 693.29s
Parameters 2.4T total (~100B active) -
Availability Closed Closed

Model generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#37 Qwen3.8 Max (0902)

medium
Cost
$0.036
Time
108.3s
Tokens
5,980 tok

#34 Pareto

none
Cost
$0.034
Time
170.7s
Tokens
4,581 tok

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Coding Score Consistency Attempt pass rate Flaky tests Tests Correct Response Time (avg) Input Tokens Output Tokens Reasoning Tokens
Qwen3.8 Max (0902) 8.4 7.4 88.9% 1 45.74s 7,893 551 20,628
Pareto 10.0 10.0 100.0% 0 50.12s 7,471 1,949 0

Quick Compare

Switch Comparison Pair