- Rank
- #70
- Total Output Tokens
- 919,699
- Response Time (avg)
- 61.71s
- Total Cost
- $0.509
Claude Haiku 5.5 (max) vs Qwen3.8 2.4T A95B (low)
Claude Haiku 5.5 (max) leads on average score with 8.5 vs 8.4. Claude Haiku 5.5 (max) has the lower benchmark cost at $0.509 vs $4.016. Claude Haiku 5.5 (max) is faster at 61.71s vs 120.40s, with pass rates of 85.5% vs 73.9%.
Compared models
- Rank
- #71
- Total Output Tokens
- 424,019
- Response Time (avg)
- 120.40s
- Total Cost
- $4.016
Recommended model
Claude Haiku 5.5 (max)
It has the best score here (8.5), while costing about 7.9x less than Qwen3.8 2.4T A95B (low).
Detailed comparison
| Metric | Claude Haiku 5.5 Claude Haiku 5.5 max | Qwen3.8 2.4T A95B Qwen3.8 2.4T A95B low |
|---|---|---|
| Score | 8.5 | 8.4 |
| Rank | #70 | #71 |
| Reliability | 10.0 | 9.6 |
| Consistency | 9.6 | 9.2 |
| Attempts | 69/69 | 69/69 |
| Tests Correct | ||
| Attempt pass rate | 85.5% | 73.9% |
| Flaky tests | 1 | 2 |
| Total Runs | 69 | 69 |
| Cost per result | 2.677 | 19.825 |
| Total Cost | $0.509 | $4.016 |
| Input Price | $0.100 / 1M | $2.000 / 1M |
| Output Price | $0.500 / 1M | $6.000 / 1M |
| Cache Read Price | $0.010 / 1M | $0.250 / 1M |
| Cache Write Price | $0.125 / 1M | N/A |
| Total Input Tokens | 487,516 | 313,881 |
| Output Tokens | 10,212 | 123,706 |
| Reasoning Tokens | 909,487 | 388,328 |
| Response Time (avg) | 61.71s | 120.40s |
| Response Time (max) | 288.94s | 534.21s |
| Response Time (total) | 1419.40s | 2769.16s |
| Parameters | ~50B | 2.4T total (95B active) |
| Availability | Closed | Weights available |
Cache prices apply to input tokens. Reads reuse cached prompts; writes store them and can cost extra. Output tokens use the output price.
Model generation showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#70 Claude Haiku 5.5
max
OpenRouter returned no showcase content (finish_reason: error).
- Cost
- $0.000
- Time
- 164.5s
- Tokens
- 0 tok
#71 Qwen3.8 2.4T A95B
low- Cost
- $0.100
- Time
- 193.2s
- Tokens
- 16,767 tok
Category Breakdown
| Agentic | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 4.7 | 1.6 | 66.7% | 1 | 93.30s | 349,997 | 2,345 | 42,315 | |
| Qwen3.8 2.4T A95B | 10.0 | 10.0 | 100.0% | 0 | 151.76s | 200,602 | 2,661 | 13,832 |
| Anti-AI Tricks | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 10.0 | 10.0 | 100.0% | 0 | 5.52s | 858 | 401 | 10,159 | |
| Qwen3.8 2.4T A95B | 10.0 | 10.0 | 100.0% | 0 | 22.04s | 1,104 | 397 | 4,814 |
| Coding | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 10.0 | 10.0 | 100.0% | 0 | 55.87s | 10,608 | 532 | 125,988 | |
| Qwen3.8 2.4T A95B | 7.8 | 9.3 | 66.7% | 0 | 172.53s | 6,716 | 21,405 | 57,399 |
| Combined | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 10.0 | 10.0 | 100.0% | 0 | 148.38s | 99,980 | 4,909 | 215,518 | |
| Qwen3.8 2.4T A95B | 8.2 | 6.9 | 66.7% | 1 | 231.85s | 85,267 | 8,008 | 50,681 |
| Data parsing and extraction | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 10.0 | 10.0 | 100.0% | 0 | 11.11s | 10,515 | 311 | 13,476 | |
| Qwen3.8 2.4T A95B | 10.0 | 10.0 | 100.0% | 0 | 22.27s | 7,956 | 839 | 2,445 |
| Domain specific | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 5.3 | 10.0 | 33.3% | 0 | 228.16s | 990 | 18 | 426,269 | |
| Qwen3.8 2.4T A95B | 3.2 | 9.3 | 0.0% | 0 | 287.65s | 1,008 | 16,133 | 156,114 |
| General Intelligence | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 10.0 | 10.0 | 100.0% | 0 | 42.22s | 714 | 250 | 26,083 | |
| Qwen3.8 2.4T A95B | 6.1 | 3.1 | 66.7% | 1 | 22.97s | 606 | 44 | 1,497 |
| Instructions following | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 10.0 | 10.0 | 100.0% | 0 | 6.22s | 921 | 99 | 5,965 | |
| Qwen3.8 2.4T A95B | 9.8 | 10.0 | 100.0% | 0 | 19.54s | 903 | 263 | 1,480 |
| Puzzle Solving | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 10.0 | 10.0 | 100.0% | 0 | 16.54s | 912 | 716 | 29,419 | |
| Qwen3.8 2.4T A95B | 10.0 | 10.0 | 100.0% | 0 | 43.37s | 1,026 | 1,154 | 25,563 |
| Tool Calling | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 10.0 | 10.0 | 100.0% | 0 | 9.86s | 11,757 | 355 | 3,989 | |
| Qwen3.8 2.4T A95B | 10.0 | 10.0 | 100.0% | 0 | 25.88s | 8,481 | 302 | 975 |
| Trivia | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Haiku 5.5 | 3.0 | 10.0 | 0.0% | 0 | 18.80s | 264 | 276 | 10,306 | |
| Qwen3.8 2.4T A95B | 3.0 | 10.0 | 0.0% | 0 | 422.46s | 212 | 72,500 | 73,528 |
Quick Compare
Switch Comparison Pair
GPT-5 MinimediumvsQwen3.8 2.4T A95BlowMuse Glimmer 30BxhighvsQwen3.8 2.4T A95BlowClaude Haiku 5.5maxvsQwen3.7 MaxmediumGemini 3.1 Pro PreviewmediumvsQwen3.8 2.4T A95BlowClaude Haiku 5.5maxvsMuse Spark 1.3lowQwen3.8 2.4T A95BlowvsInklinghighFree AvailableMuse Spark 1.1highvsQwen3.8 2.4T A95BlowClaude Haiku 5.5maxvsGrok 4.6highDeepSeek V4 Flash 0731highvsQwen3.8 2.4T A95BlowClaude Haiku 5.5maxvsGPT-5 MinimediumClaude Haiku 5.5maxvsMuse Glimmer 30BxhighClaude Haiku 5.5maxvsGemini 3.1 Pro Previewmedium