- Rank
- #110
- Total Output Tokens
- 577,214
- Response Time (avg)
- 94.16s
- Total Cost
- $0.462
DeepSeek V4 Flash 0731 (medium) vs Qwen3.7 Max
Qwen3.7 Max leads on average score with 7.9 vs 7.8. DeepSeek V4 Flash 0731 (medium) has the lower benchmark cost at $0.462 vs $0.492. Qwen3.7 Max is faster at 7.85s vs 94.16s, with pass rates of 72.5% vs 69.6%.
Compared models
- Rank
- #100
- Total Output Tokens
- 20,670
- Response Time (avg)
- 7.85s
- Total Cost
- $0.492
Recommended model
Qwen3.7 Max
It has the best score here (7.9), while responding about 12.0x faster than DeepSeek V4 Flash 0731 (medium).
Detailed comparison
| Metric | DeepSeek V4 Flash 0731 DeepSeek V4 Flash 0731 medium | Qwen3.7 Max Qwen3.7 Max none |
|---|---|---|
| Score | 7.8 | 7.9 |
| Rank | #110 | #100 |
| Reliability | 10.0 | 9.9 |
| Consistency | 7.2 | 10.0 |
| Attempts | 69/69 | 69/69 |
| Tests Correct | ||
| Attempt pass rate | 72.5% | 69.6% |
| Flaky tests | 8 | 0 |
| Total Runs | 69 | 69 |
| Cost per result | 1.176 | 3.070 |
| Total Cost | $0.462 | $0.492 |
| Input Price | $0.010 / 1M | $1.475 / 1M |
| Output Price | $1.280 / 1M | $4.425 / 1M |
| Total Input Tokens | 274,189 | 243,553 |
| Output Tokens | 66,689 | 20,670 |
| Reasoning Tokens | 510,525 | 0 |
| Response Time (avg) | 94.16s | 7.85s |
| Response Time (max) | 303.26s | 80.34s |
| Response Time (total) | 2165.72s | 180.65s |
| Parameters | 284B total (13B active) | ~1T total (~40B active) |
| Availability | Closed | Closed |
Model generation showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#110 DeepSeek V4 Flash 0731
medium- Cost
- $0.004
- Time
- 93.3s
- Tokens
- 13,252 tok
#100 Qwen3.7 Max
none- Cost
- $0.046
- Time
- 195.0s
- Tokens
- 12,171 tok
Top Models by Score
Score vs Total Cost
Response Time (avg)
Score vs Response Time (avg)
Total Output Tokens
Score vs Total Output Tokens
Category Breakdown
| Agentic | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | 10.0 | 10.0 | 100.0% | 0 | 303.26s | 184,370 | 8,291 | 18,068 | |
| Qwen3.7 Max | 10.0 | 10.0 | 100.0% | 0 | 80.34s | 147,561 | 8,224 | 0 |
| Anti-AI Tricks | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | 8.2 | 7.9 | 83.3% | 1 | 17.95s | 698 | 2,101 | 6,715 | |
| Qwen3.7 Max | 6.5 | 10.0 | 50.0% | 0 | 1.08s | 696 | 242 | 0 |
| Coding | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | 6.4 | 4.4 | 77.8% | 2 | 198.78s | 6,032 | 4,109 | 160,154 | |
| Qwen3.7 Max | 5.5 | 10.0 | 33.3% | 0 | 1.35s | 7,911 | 582 | 0 |
| Combined | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | 7.3 | 5.8 | 83.3% | 1 | 150.58s | 65,118 | 40,110 | 97,296 | |
| Qwen3.7 Max | 6.5 | 10.0 | 50.0% | 0 | 37.23s | 68,425 | 10,623 | 0 |
| Data parsing and extraction | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | 10.0 | 10.0 | 100.0% | 0 | 5.21s | 7,290 | 287 | 1,519 | |
| Qwen3.7 Max | 10.0 | 10.0 | 100.0% | 0 | 1.35s | 7,794 | 243 | 0 |
| Domain specific | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | 2.9 | 7.2 | 11.1% | 1 | 203.11s | 592 | 9,333 | 154,069 | |
| Qwen3.7 Max | 7.7 | 10.0 | 66.7% | 0 | 1.24s | 798 | 15 | 0 |
| General Intelligence | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | 6.1 | 3.1 | 66.7% | 1 | 12.16s | 471 | 66 | 1,589 | |
| Qwen3.7 Max | 10.0 | 10.0 | 100.0% | 0 | 1.04s | 522 | 120 | 0 |
| Instructions following | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | 8.5 | 6.8 | 83.3% | 1 | 2.42s | 706 | 109 | 580 | |
| Qwen3.7 Max | 10.0 | 10.0 | 100.0% | 0 | 943ms | 711 | 72 | 0 |
| Puzzle Solving | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | 8.2 | 7.3 | 88.9% | 1 | 65.12s | 594 | 1,530 | 66,970 | |
| Qwen3.7 Max | 10.0 | 10.0 | 100.0% | 0 | 1.13s | 714 | 314 | 0 |
| Tool Calling | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | 10.0 | 10.0 | 100.0% | 0 | 4.41s | 8,178 | 374 | 152 | |
| Qwen3.7 Max | 10.0 | 10.0 | 100.0% | 0 | 3.92s | 8,211 | 222 | 0 |
| Trivia | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | 3.0 | 10.0 | 0.0% | 0 | 56.64s | 140 | 379 | 3,413 | |
| Qwen3.7 Max | 3.0 | 10.0 | 0.0% | 0 | 856ms | 210 | 13 | 0 |
Quick Compare
Switch Comparison Pair
DeepSeek V4 Flash 0731mediumvsGrok 4.5lowDeepSeek V4 Flash 0731mediumvsQwen3.7 PlusnoneGPT-5.4 MinimediumvsQwen3.7 MaxnoneClaude Fable 5.1highvsQwen3.7 MaxnoneQwen3.7 MaxnonevsGLM 5.3 FlashXmaxGemini 3.5 FlashmediumvsQwen3.7 MaxnoneGPT-5.6 TerralowvsQwen3.7 MaxnoneQwen3.7 MaxnonevsMiMo-V2.6-FlashmediumDeepSeek V4 Flash 0731mediumvsGLM 5.3highDeepSeek V4 Flash 0731mediumvsGPT-6 LunahighDeepSeek V4 Flash 0731mediumvsMuse Glimmer 30BhighGemini 3.8 FlashmediumvsQwen3.7 Maxnone