- Rank
- #56
- Total Output Tokens
- 123,963
- Response Time (avg)
- 9.77s
- Total Cost
- $0.655
Muse Spark 1.2 (low) vs Qwen3.6 Max Preview (medium)
Qwen3.6 Max Preview (medium) leads on average score with 8.6 vs 8.4. Muse Spark 1.2 (low) has the lower benchmark cost at $0.655 vs $1.132. Muse Spark 1.2 (low) is faster at 9.77s vs 66.52s, with pass rates of 77.3% vs 83.3%.
Compared models
- Rank
- #49
- Total Output Tokens
- 170,373
- Response Time (avg)
- 66.52s
- Total Cost
- $1.132
Recommended model
Muse Spark 1.2 (low)
Its score stays close to the best score here (8.4 vs 8.6), while costing about 1.7x less than Qwen3.6 Max Preview (medium).
Detailed comparison
| Metric | Muse Spark 1.2 Muse Spark 1.2 low | Qwen3.6 Max Preview Qwen3.6 Max Preview medium |
|---|---|---|
| Score | 8.4 | 8.6 |
| Rank | #56 | #49 |
| Reliability | 10.0 | 10.0 |
| Consistency | 9.0 | 9.3 |
| Attempts | 66/66 | 66/66 |
| Tests Correct | ||
| Attempt pass rate | 77.3% | 83.3% |
| Flaky tests | 3 | 2 |
| Total Runs | 66 | 66 |
| Cost per result | 4.361 | 7.653 |
| Total Cost | $0.655 | $1.132 |
| Input Price | $1.250 / 1M | $1.028 / 1M |
| Output Price | $4.250 / 1M | $6.162 / 1M |
| Total Input Tokens | 101,811 | 79,249 |
| Output Tokens | 8,025 | 5,097 |
| Reasoning Tokens | 115,938 | 165,276 |
| Response Time (avg) | 9.77s | 66.52s |
| Response Time (max) | 47.80s | 238.07s |
| Response Time (total) | 214.83s | 1463.50s |
| Parameters | ~1T total (~50B active) | ~1T total (~40B active) |
| Availability | Closed | Closed |
Model generation showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#56 Muse Spark 1.2
low- Cost
- $0.019
- Time
- 14.6s
- Tokens
- 4,384 tok
#49 Qwen3.6 Max Preview
medium- Cost
- $0.024
- Time
- 76.5s
- Tokens
- 3,861 tok
Top Models by Score
Score vs Total Cost
Response Time (avg)
Score vs Response Time (avg)
Total Output Tokens
Score vs Total Output Tokens
Category Breakdown
| Anti-AI Tricks | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Muse Spark 1.2 | 9.2 | 8.4 | 91.7% | 1 | 3.26s | 618 | 382 | 5,416 | |
| Qwen3.6 Max Preview | 10.0 | 10.0 | 100.0% | 0 | 22.13s | 672 | 228 | 10,075 |
| Coding | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Muse Spark 1.2 | 8.4 | 7.4 | 88.9% | 1 | 10.09s | 7,275 | 343 | 19,717 | |
| Qwen3.6 Max Preview | 8.8 | 7.8 | 88.9% | 1 | 146.48s | 7,895 | 427 | 52,957 |
| Combined | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Muse Spark 1.2 | 9.8 | 10.0 | 100.0% | 0 | 17.03s | 74,073 | 5,751 | 16,847 | |
| Qwen3.6 Max Preview | 7.3 | 5.8 | 83.3% | 1 | 177.48s | 51,812 | 3,215 | 35,050 |
| Data parsing and extraction | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Muse Spark 1.2 | 10.0 | 10.0 | 100.0% | 0 | 4.22s | 6,969 | 240 | 2,972 | |
| Qwen3.6 Max Preview | 10.0 | 10.0 | 100.0% | 0 | 41.15s | 7,782 | 270 | 10,106 |
| Domain specific | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Muse Spark 1.2 | 5.3 | 10.0 | 33.3% | 0 | 28.53s | 738 | 167 | 54,780 | |
| Qwen3.6 Max Preview | 5.3 | 10.0 | 33.3% | 0 | 88.53s | 780 | 59 | 30,805 |
| General Intelligence | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Muse Spark 1.2 | 5.0 | 10.0 | 0.0% | 0 | 8.46s | 477 | 132 | 2,182 | |
| Qwen3.6 Max Preview | 10.0 | 10.0 | 100.0% | 0 | 32.24s | 516 | 129 | 3,510 |
| Instructions following | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Muse Spark 1.2 | 9.8 | 10.0 | 100.0% | 0 | 2.95s | 669 | 117 | 3,085 | |
| Qwen3.6 Max Preview | 10.0 | 10.0 | 100.0% | 0 | 24.31s | 699 | 103 | 5,848 |
| Puzzle Solving | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Muse Spark 1.2 | 8.7 | 7.7 | 88.9% | 1 | 5.17s | 651 | 391 | 6,460 | |
| Qwen3.6 Max Preview | 10.0 | 10.0 | 100.0% | 0 | 24.32s | 696 | 329 | 7,693 |
| Tool Calling | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Muse Spark 1.2 | 10.0 | 10.0 | 100.0% | 0 | 3.58s | 10,158 | 459 | 833 | |
| Qwen3.6 Max Preview | 10.0 | 10.0 | 100.0% | 0 | 18.32s | 8,193 | 309 | 1,571 |
| Trivia | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Muse Spark 1.2 | 3.0 | 10.0 | 0.0% | 0 | 10.00s | 183 | 43 | 3,646 | |
| Qwen3.6 Max Preview | 3.0 | 10.0 | 0.0% | 0 | 60.56s | 204 | 28 | 7,661 |
Quick Compare
Switch Comparison Pair
Muse Spark 1.2lowvsGrok 4.5mediumDeepSeek V4.1 FlashmediumvsMuse Spark 1.2lowMuse Spark 1.2lowvsGrok 4.6mediumDeepSeek V4.1 FlashhighvsMuse Spark 1.2lowMuse Spark 1.2lowvsGPT-5.2mediumMuse Spark 1.2lowvsQwen3.8 27BhighSeed 2.1 TurbomediumvsMuse Spark 1.2lowMuse Spark 1.2lowvsGPT-5.4mediumMuse Spark 1.2lowvsInkling SmallhighMuse Spark 1.2highvsQwen3.6 Max PreviewmediumDeepSeek V4.1 FlashlowvsQwen3.6 Max PreviewmediumDeepSeek V4.1 FlashhighvsQwen3.6 Max Previewmedium