- Rank
- #35
- Total Output Tokens
- 199,268
- Response Time (avg)
- 16.58s
- Total Cost
- $0.140
Claude Haiku 5.5 (xhigh) vs Qwen3.8 Max (0902) (medium)
Claude Haiku 5.5 (xhigh) leads on average score with 9.1 vs 9.0. Claude Haiku 5.5 (xhigh) has the lower benchmark cost at $0.140 vs $1.096. Claude Haiku 5.5 (xhigh) is faster at 16.58s vs 30.42s, with pass rates of 81.2% vs 84.1%.
Compared models
- Rank
- #40
- Total Output Tokens
- 92,998
- Response Time (avg)
- 30.42s
- Total Cost
- $1.096
Recommended model
Claude Haiku 5.5 (xhigh)
It has the best score here (9.1), while costing about 7.9x less than Qwen3.8 Max (0902) (medium).
Detailed comparison
| Metric | Claude Haiku 5.5 Claude Haiku 5.5 xhigh | Qwen3.8 Max (0902) Qwen3.8 Max (0902) medium |
|---|---|---|
| Score | 9.1 | 9.0 |
| Rank | #35 | #40 |
| Reliability | 10.0 | 10.0 |
| Consistency | 9.3 | 9.3 |
| Attempts | 69/69 | 69/69 |
| Tests Correct | ||
| Attempt pass rate | 81.2% | 84.1% |
| Flaky tests | 2 | 2 |
| Total Runs | 69 | 69 |
| Cost per result | 0.773 | 6.084 |
| Total Cost | $0.140 | $1.096 |
| Input Price | $0.100 / 1M | $2.000 / 1M |
| Output Price | $0.500 / 1M | $6.000 / 1M |
| Cache Read Price | $0.010 / 1M | $0.250 / 1M |
| Cache Write Price | $0.125 / 1M | $2.500 / 1M |
| Total Input Tokens | 394,509 | 268,540 |
| Output Tokens | 10,349 | 7,499 |
| Reasoning Tokens | 188,919 | 85,499 |
| Response Time (avg) | 16.58s | 30.42s |
| Response Time (max) | 92.74s | 168.09s |
| Response Time (total) | 381.40s | 699.68s |
| Parameters | ~50B | 2.4T total (~100B active) |
| Availability | Closed | Closed |
Cache prices apply to input tokens. Reads reuse cached prompts; writes store them and can cost extra. Output tokens use the output price.
Model generation showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#35 Claude Haiku 5.5
xhigh- Cost
- $0.021
- Time
- 189.0s
- Tokens
- 41,343 tok
#40 Qwen3.8 Max (0902)
medium- Cost
- $0.036
- Time
- 108.3s
- Tokens
- 5,980 tok
Category Breakdown
| Agentic | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 10.0 | 10.0 | 100.0% | 0 | 62.72s | 257,002 | 2,786 | 14,500 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 127.50s | 172,217 | 1,538 | 10,782 |
| Anti-AI Tricks | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 10.0 | 10.0 | 100.0% | 0 | 2.88s | 858 | 367 | 3,017 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 5.03s | 672 | 295 | 2,003 |
| Coding | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 10.0 | 10.0 | 100.0% | 0 | 13.13s | 10,608 | 504 | 26,396 | |
| Qwen3.8 Max (0902) | 8.4 | 7.4 | 88.9% | 1 | 45.74s | 7,893 | 551 | 20,628 |
| Combined | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 10.0 | 10.0 | 100.0% | 0 | 38.95s | 99,968 | 4,903 | 45,341 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 94.38s | 68,852 | 3,895 | 24,303 |
| Data parsing and extraction | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 10.0 | 10.0 | 100.0% | 0 | 3.65s | 10,515 | 312 | 2,656 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 10.54s | 7,782 | 261 | 2,591 |
| Domain specific | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 5.3 | 7.2 | 44.4% | 1 | 47.83s | 990 | 65 | 83,800 | |
| Qwen3.8 Max (0902) | 3.6 | 7.2 | 22.2% | 1 | 49.45s | 780 | 44 | 19,572 |
| General Intelligence | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 5.0 | 10.0 | 0.0% | 0 | 9.80s | 714 | 155 | 4,341 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 7.56s | 516 | 202 | 689 |
| Instructions following | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 10.0 | 10.0 | 100.0% | 0 | 3.34s | 921 | 100 | 1,775 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 4.24s | 699 | 90 | 886 |
| Puzzle Solving | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 7.6 | 7.2 | 77.8% | 1 | 3.80s | 912 | 563 | 4,066 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 5.89s | 696 | 353 | 1,599 |
| Tool Calling | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 10.0 | 10.0 | 100.0% | 0 | 6.42s | 11,757 | 354 | 1,285 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 5.93s | 8,229 | 249 | 194 |
| Trivia | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 3.0 | 10.0 | 0.0% | 0 | 4.79s | 264 | 240 | 1,742 | |
| Qwen3.8 Max (0902) | 3.0 | 10.0 | 0.0% | 0 | 17.01s | 204 | 21 | 2,252 |
Quick Compare
Switch Comparison Pair
Claude Haiku 5.5xhighvsGPT-5.3-CodexmediumClaude Haiku 5.5xhighvsMuse Spark 1.3highClaude Haiku 5.5xhighvsQwen3.8 Max (0902)highGemini 3.5 FlashlowvsQwen3.8 Max (0902)mediumClaude Haiku 5.5xhighvsParetodefaultClaude Haiku 5.5xhighvsSeed 2.1 TurbohighGemini 3.5 Flash LitehighvsQwen3.8 Max (0902)mediumClaude Opus 5lowvsQwen3.8 Max (0902)mediumClaude Haiku 5.5xhighvsQwen3.8 MAXmediumGemini 3.6 FlashlowvsQwen3.8 Max (0902)mediumClaude Haiku 5.5xhighvsGPT-5.5mediumQwen3.8 Max (0902)mediumvsGLM 5.3 Flashmax