- Rank
- #99
- Total Output Tokens
- 184,172
- Response Time (avg)
- 29.94s
- Total Cost
- $1.008
GPT-5.4 Mini (medium) vs Qwen3.8 2.4T A95B (high)
GPT-5.4 Mini (medium) leads on average score with 7.9 vs 7.9. GPT-5.4 Mini (medium) has the lower benchmark cost at $1.008 vs $2.805. GPT-5.4 Mini (medium) is faster at 29.94s vs 120.88s, with pass rates of 69.6% vs 75.4%.
Compared models
- Rank
- #102
- Total Output Tokens
- 468,439
- Response Time (avg)
- 120.88s
- Total Cost
- $2.805
Recommended model
GPT-5.4 Mini (medium)
It has the best score here (7.9), while costing about 2.8x less than Qwen3.8 2.4T A95B (high).
Detailed comparison
| Metric | GPT-5.4 Mini GPT-5.4 Mini medium | Qwen3.8 2.4T A95B Qwen3.8 2.4T A95B high |
|---|---|---|
| Score | 7.9 | 7.9 |
| Rank | #99 | #102 |
| Reliability | 10.0 | 9.6 |
| Consistency | 8.2 | 8.4 |
| Attempts | 69/69 | 69/69 |
| Tests Correct | ||
| Attempt pass rate | 69.6% | 75.4% |
| Flaky tests | 5 | 4 |
| Total Runs | 69 | 69 |
| Cost per result | 7.754 | 18.696 |
| Total Cost | $1.008 | $2.805 |
| Input Price | $0.750 / 1M | $2.000 / 1M |
| Output Price | $4.500 / 1M | $6.000 / 1M |
| Total Input Tokens | 238,925 | 295,642 |
| Output Tokens | 7,109 | 115,041 |
| Reasoning Tokens | 177,063 | 353,398 |
| Response Time (avg) | 29.94s | 120.88s |
| Response Time (max) | 138.75s | 532.28s |
| Response Time (total) | 688.57s | 2780.16s |
| Parameters | ~400B total (~17B active) | 2.4T total (95B active) |
| Availability | Closed | Weights available |
Model generation showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#99 GPT-5.4 Mini
medium- Cost
- $0.056
- Time
- 95.5s
- Tokens
- 12,464 tok
#102 Qwen3.8 2.4T A95B
high
Reached the allocated time limit (600 seconds) without receiving showcase output.
- Cost
- $0.000
- Time
- 600.0s
- Tokens
- 0 tok
Top Models by Score
Score vs Total Cost
Response Time (avg)
Score vs Response Time (avg)
Total Output Tokens
Score vs Total Output Tokens
Category Breakdown
| Agentic | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| GPT-5.4 Mini | 10.0 | 10.0 | 100.0% | 0 | 100.66s | 141,761 | 898 | 24,930 | |
| Qwen3.8 2.4T A95B | 10.0 | 10.0 | 100.0% | 0 | 127.11s | 186,711 | 2,240 | 10,171 |
| Anti-AI Tricks | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| GPT-5.4 Mini | 8.6 | 7.9 | 91.7% | 1 | 4.05s | 606 | 296 | 2,876 | |
| Qwen3.8 2.4T A95B | 10.0 | 10.0 | 100.0% | 0 | 24.22s | 1,128 | 305 | 4,864 |
| Coding | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| GPT-5.4 Mini | 8.4 | 7.4 | 88.9% | 1 | 57.87s | 7,305 | 467 | 40,902 | |
| Qwen3.8 2.4T A95B | 5.9 | 6.3 | 55.6% | 1 | 160.52s | 6,399 | 3,310 | 48,078 |
| Combined | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| GPT-5.4 Mini | 6.9 | 5.9 | 66.7% | 1 | 59.64s | 74,058 | 4,347 | 40,924 | |
| Qwen3.8 2.4T A95B | 6.9 | 5.9 | 66.7% | 1 | 266.12s | 81,205 | 7,791 | 41,921 |
| Data parsing and extraction | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| GPT-5.4 Mini | 10.0 | 10.0 | 100.0% | 0 | 2.43s | 7,140 | 234 | 650 | |
| Qwen3.8 2.4T A95B | 10.0 | 10.0 | 100.0% | 0 | 13.67s | 7,928 | 550 | 2,307 |
| Domain specific | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| GPT-5.4 Mini | 3.6 | 7.2 | 22.2% | 1 | 71.05s | 628 | 60 | 49,875 | |
| Qwen3.8 2.4T A95B | 4.1 | 6.5 | 22.2% | 1 | 301.08s | 964 | 11,279 | 139,028 |
| General Intelligence | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| GPT-5.4 Mini | 4.5 | 10.0 | 0.0% | 0 | 3.72s | 477 | 150 | 510 | |
| Qwen3.8 2.4T A95B | 6.1 | 3.1 | 66.7% | 1 | 11.38s | 630 | 2,020 | 2,165 |
| Instructions following | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| GPT-5.4 Mini | 9.8 | 10.0 | 100.0% | 0 | 2.13s | 660 | 96 | 1,185 | |
| Qwen3.8 2.4T A95B | 9.8 | 10.0 | 100.0% | 0 | 11.45s | 927 | 245 | 1,727 |
| Puzzle Solving | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| GPT-5.4 Mini | 7.8 | 10.0 | 66.7% | 0 | 4.37s | 642 | 278 | 2,443 | |
| Qwen3.8 2.4T A95B | 10.0 | 10.0 | 100.0% | 0 | 65.54s | 989 | 698 | 15,073 |
| Tool Calling | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| GPT-5.4 Mini | 4.7 | 1.6 | 66.7% | 1 | 9.62s | 5,453 | 251 | 2,594 | |
| Qwen3.8 2.4T A95B | 10.0 | 10.0 | 100.0% | 0 | 32.93s | 8,481 | 302 | 656 |
| Trivia | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| GPT-5.4 Mini | 3.0 | 10.0 | 0.0% | 0 | 30.10s | 195 | 32 | 10,174 | |
| Qwen3.8 2.4T A95B | 3.0 | 10.0 | 0.0% | 0 | 347.95s | 280 | 86,301 | 87,408 |
Quick Compare
Switch Comparison Pair
Gemini 3.5 FlashmediumvsQwen3.8 2.4T A95BhighClaude Fable 5.1highvsGPT-5.4 MinimediumQwen3.8 2.4T A95BhighvsMiMo-V2.6-FlashmediumGPT-5.4 MinimediumvsGLM 5.3 FlashXmaxGPT-5.4 MinimediumvsQwen3.7 MaxnoneQwen3.8 2.4T A95BhighvsGrok 4.5mediumQwen3.8 2.4T A95BhighvsStep 3.7 FlashmediumQwen3.8 2.4T A95BhighvsGrok 4.6mediumQwen3.8 2.4T A95BhighvsGLM 5.3 FlashXmaxGPT-5.6 TerralowvsQwen3.8 2.4T A95BhighQwen3.8 2.4T A95BhighvsGrok 4.5lowGPT-5.4 MinimediumvsGLM 5.3high