- Rank
- #70
- Total Output Tokens
- 919,699
- Response Time (avg)
- 61.71s
- Total Cost
- $0.509
Claude Haiku 5.5 (max) vs Qwen3.7 Max (medium)
The average score is effectively tied at 8.5 vs 8.5. Claude Haiku 5.5 (max) has the lower benchmark cost at $0.509 vs $1.689. Qwen3.7 Max (medium) is faster at 48.35s vs 61.71s, with pass rates of 85.5% vs 85.5%.
Compared models
- Rank
- #69
- Total Output Tokens
- 259,032
- Response Time (avg)
- 48.35s
- Total Cost
- $1.689
Recommended model
Claude Haiku 5.5 (max)
It has the best score here (8.5), while costing about 3.3x less than Qwen3.7 Max (medium).
Detailed comparison
| Metric | Claude Haiku 5.5 Claude Haiku 5.5 max | Qwen3.7 Max Qwen3.7 Max medium |
|---|---|---|
| Score | 8.5 | 8.5 |
| Rank | #70 | #69 |
| Reliability | 10.0 | 10.0 |
| Consistency | 9.6 | 8.7 |
| Attempts | 69/69 | 69/69 |
| Tests Correct | ||
| Attempt pass rate | 85.5% | 85.5% |
| Flaky tests | 1 | 4 |
| Total Runs | 69 | 69 |
| Cost per result | 2.677 | 12.033 |
| Total Cost | $0.509 | $1.689 |
| Input Price | $0.100 / 1M | $1.475 / 1M |
| Output Price | $0.500 / 1M | $4.425 / 1M |
| Cache Read Price | $0.010 / 1M | $0.295 / 1M |
| Cache Write Price | $0.125 / 1M | $1.844 / 1M |
| Total Input Tokens | 487,516 | 367,848 |
| Output Tokens | 10,212 | 8,753 |
| Reasoning Tokens | 909,487 | 250,279 |
| Response Time (avg) | 61.71s | 48.35s |
| Response Time (max) | 288.94s | 556.06s |
| Response Time (total) | 1419.40s | 1112.11s |
| Parameters | ~50B | ~1T total (~40B active) |
| Availability | Closed | Closed |
Cache prices apply to input tokens. Reads reuse cached prompts; writes store them and can cost extra. Output tokens use the output price.
Model generation showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#70 Claude Haiku 5.5
max
OpenRouter returned no showcase content (finish_reason: error).
- Cost
- $0.000
- Time
- 164.5s
- Tokens
- 0 tok
#69 Qwen3.7 Max
medium- Cost
- $0.017
- Time
- 68.8s
- Tokens
- 4,526 tok
Category Breakdown
| Agentic | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 4.7 | 1.6 | 66.7% | 1 | 93.30s | 349,997 | 2,345 | 42,315 | |
| Qwen3.7 Max | 6.1 | 3.1 | 66.7% | 1 | 137.00s | 261,819 | 3,005 | 29,925 |
| Anti-AI Tricks | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 10.0 | 10.0 | 100.0% | 0 | 5.52s | 858 | 401 | 10,159 | |
| Qwen3.7 Max | 10.0 | 10.0 | 100.0% | 0 | 6.36s | 672 | 222 | 8,742 |
| Coding | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 10.0 | 10.0 | 100.0% | 0 | 55.87s | 10,608 | 532 | 125,988 | |
| Qwen3.7 Max | 10.0 | 10.0 | 100.0% | 0 | 35.31s | 7,893 | 423 | 34,808 |
| Combined | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 10.0 | 10.0 | 100.0% | 0 | 148.38s | 99,980 | 4,909 | 215,518 | |
| Qwen3.7 Max | 8.7 | 6.9 | 83.3% | 1 | 287.83s | 78,594 | 3,985 | 96,450 |
| Data parsing and extraction | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 10.0 | 10.0 | 100.0% | 0 | 11.11s | 10,515 | 311 | 13,476 | |
| Qwen3.7 Max | 10.0 | 10.0 | 100.0% | 0 | 8.80s | 7,782 | 270 | 6,254 |
| Domain specific | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 5.3 | 10.0 | 33.3% | 0 | 228.16s | 990 | 18 | 426,269 | |
| Qwen3.7 Max | 4.1 | 4.4 | 44.5% | 2 | 52.45s | 780 | 61 | 41,143 |
| General Intelligence | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 10.0 | 10.0 | 100.0% | 0 | 42.22s | 714 | 250 | 26,083 | |
| Qwen3.7 Max | 10.0 | 10.0 | 100.0% | 0 | 11.70s | 516 | 135 | 4,457 |
| Instructions following | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 10.0 | 10.0 | 100.0% | 0 | 6.22s | 921 | 99 | 5,965 | |
| Qwen3.7 Max | 10.0 | 10.0 | 100.0% | 0 | 7.46s | 699 | 102 | 5,452 |
| Puzzle Solving | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 10.0 | 10.0 | 100.0% | 0 | 16.54s | 912 | 716 | 29,419 | |
| Qwen3.7 Max | 10.0 | 10.0 | 100.0% | 0 | 8.84s | 696 | 259 | 8,908 |
| Tool Calling | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 10.0 | 10.0 | 100.0% | 0 | 9.86s | 11,757 | 355 | 3,989 | |
| Qwen3.7 Max | 10.0 | 10.0 | 100.0% | 0 | 6.63s | 8,193 | 267 | 1,220 |
| Trivia | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 3.0 | 10.0 | 0.0% | 0 | 18.80s | 264 | 276 | 10,306 | |
| Qwen3.7 Max | 3.0 | 10.0 | 0.0% | 0 | 33.37s | 204 | 24 | 12,920 |
Quick Compare
Switch Comparison Pair
Muse Spark 1.3lowvsQwen3.7 MaxmediumClaude Haiku 5.5maxvsMuse Spark 1.3lowQwen3.7 MaxmediumvsGrok 4.6highClaude Haiku 5.5maxvsGrok 4.6highClaude Haiku 5.5maxvsQwen3.8 2.4T A95BlowClaude Haiku 5.5maxvsGPT-5 MinimediumClaude Haiku 5.5maxvsMuse Glimmer 30BxhighClaude Haiku 5.5lowvsQwen3.7 MaxmediumClaude Haiku 5.5maxvsGemini 3.1 Pro PreviewmediumClaude Haiku 5.5maxvsQwen3.8 Max (0902)lowMuse Glimmer 30BxhighvsQwen3.7 MaxmediumClaude Sonnet 5.5highvsQwen3.7 Maxmedium