- Rank
- #35
- Total Output Tokens
- 199,268
- Response Time (avg)
- 16.58s
- Total Cost
- $0.140
Claude Haiku 5.5 (xhigh) vs Claude Sonnet 5.5 (max)
Claude Sonnet 5.5 (max) leads on average score with 9.2 vs 9.1. Claude Haiku 5.5 (xhigh) has the lower benchmark cost at $0.140 vs $8.557. Claude Haiku 5.5 (xhigh) is faster at 16.58s vs 84.26s, with pass rates of 81.2% vs 82.6%.
Compared models
- Rank
- #31
- Total Output Tokens
- 758,707
- Response Time (avg)
- 84.26s
- Total Cost
- $8.557
Recommended model
Claude Haiku 5.5 (xhigh)
Its score stays close to the best score here (9.1 vs 9.2), while costing about 61.5x less than Claude Sonnet 5.5 (max).
Detailed comparison
| Metric | Claude Haiku 5.5 Claude Haiku 5.5 xhigh | Claude Sonnet 5.5 Claude Sonnet 5.5 max |
|---|---|---|
| Score | 9.1 | 9.2 |
| Rank | #35 | #31 |
| Reliability | 10.0 | 10.0 |
| Consistency | 9.3 | 9.4 |
| Attempts | 69/69 | 69/69 |
| Tests Correct | ||
| Attempt pass rate | 81.2% | 82.6% |
| Flaky tests | 2 | 2 |
| Total Runs | 69 | 69 |
| Cost per result | 0.773 | 47.536 |
| Total Cost | $0.140 | $8.557 |
| Input Price | $0.100 / 1M | $2.000 / 1M |
| Output Price | $0.500 / 1M | $10.000 / 1M |
| Cache Read Price | $0.010 / 1M | $0.200 / 1M |
| Cache Write Price | $0.125 / 1M | $2.500 / 1M |
| Total Input Tokens | 394,509 | 484,627 |
| Output Tokens | 10,349 | 11,026 |
| Reasoning Tokens | 188,919 | 747,681 |
| Response Time (avg) | 16.58s | 84.26s |
| Response Time (max) | 92.74s | 488.39s |
| Response Time (total) | 381.40s | 1937.91s |
| Parameters | ~50B | ~1T total (~100B active) |
| Availability | Closed | Closed |
Cache prices apply to input tokens. Reads reuse cached prompts; writes store them and can cost extra. Output tokens use the output price.
Model generation showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#35 Claude Haiku 5.5
xhigh- Cost
- $0.021
- Time
- 189.0s
- Tokens
- 41,343 tok
#31 Claude Sonnet 5.5
max
OpenRouter returned no showcase content (finish_reason: length).
- Cost
- $0.000
- Time
- 571.7s
- Tokens
- 0 tok
Category Breakdown
| Agentic | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 10.0 | 10.0 | 100.0% | 0 | 62.72s | 257,002 | 2,786 | 14,500 | |
| Claude Sonnet 5.5 | 10.0 | 10.0 | 100.0% | 0 | 111.06s | 349,131 | 2,873 | 28,485 |
| Anti-AI Tricks | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 10.0 | 10.0 | 100.0% | 0 | 2.88s | 858 | 367 | 3,017 | |
| Claude Sonnet 5.5 | 10.0 | 10.0 | 100.0% | 0 | 5.39s | 858 | 397 | 3,109 |
| Coding | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 10.0 | 10.0 | 100.0% | 0 | 13.13s | 10,608 | 504 | 26,396 | |
| Claude Sonnet 5.5 | 10.0 | 10.0 | 100.0% | 0 | 55.26s | 10,608 | 580 | 70,730 |
| Combined | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 10.0 | 10.0 | 100.0% | 0 | 38.95s | 99,968 | 4,903 | 45,341 | |
| Claude Sonnet 5.5 | 10.0 | 10.0 | 100.0% | 0 | 113.57s | 97,957 | 5,219 | 95,067 |
| Data parsing and extraction | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 10.0 | 10.0 | 100.0% | 0 | 3.65s | 10,515 | 312 | 2,656 | |
| Claude Sonnet 5.5 | 10.0 | 10.0 | 100.0% | 0 | 16.07s | 10,515 | 312 | 10,487 |
| Domain specific | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 5.3 | 7.2 | 44.4% | 1 | 47.83s | 990 | 65 | 83,800 | |
| Claude Sonnet 5.5 | 5.3 | 10.0 | 33.3% | 0 | 401.38s | 990 | 19 | 485,043 |
| General Intelligence | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 5.0 | 10.0 | 0.0% | 0 | 9.80s | 714 | 155 | 4,341 | |
| Claude Sonnet 5.5 | 5.1 | 3.4 | 33.3% | 1 | 56.66s | 714 | 322 | 20,156 |
| Instructions following | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 10.0 | 10.0 | 100.0% | 0 | 3.34s | 921 | 100 | 1,775 | |
| Claude Sonnet 5.5 | 8.5 | 6.8 | 83.3% | 1 | 6.24s | 921 | 98 | 2,263 |
| Puzzle Solving | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 7.6 | 7.2 | 77.8% | 1 | 3.80s | 912 | 563 | 4,066 | |
| Claude Sonnet 5.5 | 10.0 | 10.0 | 100.0% | 0 | 6.17s | 912 | 578 | 3,186 |
| Tool Calling | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 10.0 | 10.0 | 100.0% | 0 | 6.42s | 11,757 | 354 | 1,285 | |
| Claude Sonnet 5.5 | 10.0 | 10.0 | 100.0% | 0 | 41.40s | 11,757 | 354 | 12,232 |
| Trivia | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 3.0 | 10.0 | 0.0% | 0 | 4.79s | 264 | 240 | 1,742 | |
| Claude Sonnet 5.5 | 3.0 | 10.0 | 0.0% | 0 | 47.01s | 264 | 274 | 16,923 |
Quick Compare
Switch Comparison Pair
Claude Sonnet 5.5maxvsQwen3.8 MAXmediumClaude Haiku 5.5xhighvsGPT-5.3-CodexmediumClaude Haiku 5.5xhighvsMuse Spark 1.3highClaude Sonnet 5.5maxvsGPT-5.5mediumClaude Haiku 5.5xhighvsQwen3.8 Max (0902)highClaude Haiku 5.5xhighvsParetodefaultClaude Haiku 5.5xhighvsSeed 2.1 TurbohighClaude Sonnet 5.5maxvsQwen3.8 Max (0902)highClaude Sonnet 5.5maxvsGPT-5.3-CodexmediumClaude Haiku 5.5xhighvsQwen3.8 MAXmediumClaude Sonnet 5.5maxvsMuse Spark 1.3highClaude Haiku 5.5xhighvsGPT-5.5medium