- Rank
- #59
- Total Output Tokens
- 908,171
- Response Time (avg)
- 61.58s
- Total Cost
- $0.368
DeepSeek V4.1 Flash (max) vs Qwen3.7 Max (medium)
DeepSeek V4.1 Flash (max) leads on average score with 8.6 vs 8.5. DeepSeek V4.1 Flash (max) has the lower benchmark cost at $0.368 vs $2.046. Qwen3.7 Max (medium) is faster at 48.35s vs 61.58s, with pass rates of 69.6% vs 85.5%.
Compared models
- Rank
- #67
- Total Output Tokens
- 259,032
- Response Time (avg)
- 48.35s
- Total Cost
- $2.046
Recommended model
DeepSeek V4.1 Flash (max)
It has the best score here (8.6), while costing about 5.6x less than Qwen3.7 Max (medium).
Detailed comparison
| Metric | DeepSeek V4.1 Flash DeepSeek V4.1 Flash max | Qwen3.7 Max Qwen3.7 Max medium |
|---|---|---|
| Score | 8.6 | 8.5 |
| Rank | #59 | #67 |
| Reliability | 9.4 | 10.0 |
| Consistency | 9.3 | 8.7 |
| Attempts | 69/69 | 69/69 |
| Tests Correct | ||
| Attempt pass rate | 69.6% | 85.5% |
| Flaky tests | 2 | 4 |
| Total Runs | 69 | 69 |
| Cost per result | 3.715 | 12.033 |
| Total Cost | $0.368 | $2.046 |
| Input Price | $0.020 / 1M | $1.475 / 1M |
| Output Price | $0.396 / 1M | $4.425 / 1M |
| Total Input Tokens | 414,054 | 367,848 |
| Output Tokens | 7,635 | 8,753 |
| Reasoning Tokens | 900,536 | 250,279 |
| Response Time (avg) | 61.58s | 48.35s |
| Response Time (max) | 335.08s | 556.06s |
| Response Time (total) | 1416.24s | 1112.11s |
| Parameters | 748B total (16B active) | ~1T total (~40B active) |
| Availability | Open source | Closed |
Model generation showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#59 DeepSeek V4.1 Flash
max- Cost
- $0.066
- Time
- 211.0s
- Tokens
- 54,712 tok
#67 Qwen3.7 Max
medium- Cost
- $0.017
- Time
- 68.8s
- Tokens
- 4,526 tok
Top Models by Score
Score vs Total Cost
Response Time (avg)
Score vs Response Time (avg)
Total Output Tokens
Score vs Total Output Tokens
Category Breakdown
| Agentic | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4.1 Flash | 10.0 | 10.0 | 100.0% | 0 | 66.63s | 325,030 | 2,077 | 34,968 | |
| Qwen3.7 Max | 6.1 | 3.1 | 66.7% | 1 | 137.00s | 261,819 | 3,005 | 29,925 |
| Anti-AI Tricks | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4.1 Flash | 8.3 | 10.0 | 75.0% | 0 | 4.35s | 852 | 213 | 7,262 | |
| Qwen3.7 Max | 10.0 | 10.0 | 100.0% | 0 | 6.36s | 672 | 222 | 8,742 |
| Coding | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4.1 Flash | 10.0 | 10.0 | 100.0% | 0 | 62.50s | 7,509 | 373 | 132,357 | |
| Qwen3.7 Max | 10.0 | 10.0 | 100.0% | 0 | 35.31s | 7,893 | 423 | 34,808 |
| Combined | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4.1 Flash | 10.0 | 10.0 | 100.0% | 0 | 160.31s | 66,677 | 4,031 | 221,091 | |
| Qwen3.7 Max | 8.7 | 6.9 | 83.3% | 1 | 287.83s | 78,594 | 3,985 | 96,450 |
| Data parsing and extraction | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4.1 Flash | 6.5 | 10.0 | 50.0% | 0 | 4.56s | 2,397 | 120 | 2,047 | |
| Qwen3.7 Max | 10.0 | 10.0 | 100.0% | 0 | 8.80s | 7,782 | 270 | 6,254 |
| Domain specific | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4.1 Flash | 3.6 | 7.2 | 22.2% | 1 | 198.41s | 909 | 27 | 384,462 | |
| Qwen3.7 Max | 4.1 | 4.4 | 44.5% | 2 | 52.45s | 780 | 61 | 41,143 |
| General Intelligence | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4.1 Flash | 10.0 | 10.0 | 100.0% | 0 | 4.00s | 549 | 148 | 1,093 | |
| Qwen3.7 Max | 10.0 | 10.0 | 100.0% | 0 | 11.70s | 516 | 135 | 4,457 |
| Instructions following | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4.1 Flash | 10.0 | 10.0 | 100.0% | 0 | 7.64s | 783 | 63 | 2,293 | |
| Qwen3.7 Max | 10.0 | 10.0 | 100.0% | 0 | 7.46s | 699 | 102 | 5,452 |
| Puzzle Solving | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4.1 Flash | 5.5 | 7.1 | 44.4% | 1 | 30.82s | 828 | 339 | 54,014 | |
| Qwen3.7 Max | 10.0 | 10.0 | 100.0% | 0 | 8.84s | 696 | 259 | 8,908 |
| Tool Calling | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4.1 Flash | 10.0 | 10.0 | 100.0% | 0 | 9.49s | 8,259 | 228 | 693 | |
| Qwen3.7 Max | 10.0 | 10.0 | 100.0% | 0 | 6.63s | 8,193 | 267 | 1,220 |
| Trivia | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4.1 Flash | 3.0 | 10.0 | 0.0% | 0 | 98.48s | 261 | 16 | 60,256 | |
| Qwen3.7 Max | 3.0 | 10.0 | 0.0% | 0 | 33.37s | 204 | 24 | 12,920 |
Quick Compare
Switch Comparison Pair
Muse Spark 1.3lowvsQwen3.7 MaxmediumDeepSeek V4.1 FlashmaxvsMuse Spark 1.1lowClaude Sonnet 5.5xhighvsDeepSeek V4.1 FlashmaxQwen3.7 MaxmediumvsGrok 4.6highClaude Sonnet 5.5highvsDeepSeek V4.1 FlashmaxDeepSeek V4.1 FlashmaxvsGPT-6 SollowSeed 2.1 TurbomediumvsDeepSeek V4.1 FlashmaxDeepSeek V4.1 FlashmaxvsMiMo-V2.6-PromediumDeepSeek V4.1 FlashmaxvsQwen3.8 27BhighFree AvailableDeepSeek V4.1 FlashmaxvsGPT-5.2mediumDeepSeek V4.1 FlashmaxvsQwen3.8 Max (0902)lowMuse Glimmer 30BxhighvsQwen3.7 Maxmedium