- Rank
- #90
- Total Output Tokens
- 371,547
- Response Time (avg)
- 28.04s
- Total Cost
- $0.153
DeepSeek V4.1 Flash (low) vs GLM 5.3 FlashX (max)
DeepSeek V4.1 Flash (low) leads on average score with 8.0 vs 7.9. DeepSeek V4.1 Flash (low) has the lower benchmark cost at $0.153 vs $0.623. DeepSeek V4.1 Flash (low) is faster at 28.04s vs 43.97s, with pass rates of 73.9% vs 78.3%.
Compared models
- Rank
- #97
- Total Output Tokens
- 402,765
- Response Time (avg)
- 43.97s
- Total Cost
- $0.623
Recommended model
DeepSeek V4.1 Flash (low)
It has the best score here (8.0), while costing about 4.1x less than GLM 5.3 FlashX (max).
Detailed comparison
| Metric | DeepSeek V4.1 Flash DeepSeek V4.1 Flash low | GLM 5.3 FlashX GLM 5.3 FlashX max |
|---|---|---|
| Score | 8.0 | 7.9 |
| Rank | #90 | #97 |
| Reliability | 9.6 | 10.0 |
| Consistency | 8.7 | 8.0 |
| Attempts | 69/69 | 69/69 |
| Tests Correct | ||
| Attempt pass rate | 73.9% | 78.3% |
| Flaky tests | 4 | 6 |
| Total Runs | 69 | 69 |
| Cost per result | 1.576 | 4.153 |
| Total Cost | $0.153 | $0.623 |
| Input Price | $0.020 / 1M | $0.370 / 1M |
| Output Price | $0.396 / 1M | $1.250 / 1M |
| Total Input Tokens | 266,849 | 322,894 |
| Output Tokens | 8,284 | 8,010 |
| Reasoning Tokens | 363,263 | 394,755 |
| Response Time (avg) | 28.04s | 43.97s |
| Response Time (max) | 149.84s | 390.70s |
| Response Time (total) | 645.03s | 1011.29s |
| Parameters | 748B total (16B active) | 320B total (18B active) |
| Availability | Open source | Closed |
Model generation showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#90 DeepSeek V4.1 Flash
low- Cost
- $0.017
- Time
- 43.6s
- Tokens
- 14,069 tok
#97 GLM 5.3 FlashX
max- Cost
- $0.046
- Time
- 251.3s
- Tokens
- 36,769 tok
Top Models by Score
Score vs Total Cost
Response Time (avg)
Score vs Response Time (avg)
Total Output Tokens
Score vs Total Output Tokens
Category Breakdown
| Agentic | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4.1 Flash | 6.1 | 3.1 | 66.7% | 1 | 56.02s | 167,134 | 1,903 | 21,681 | |
| GLM 5.3 FlashX | 6.1 | 3.1 | 66.7% | 1 | 104.77s | 221,683 | 1,709 | 25,322 |
| Anti-AI Tricks | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4.1 Flash | 8.3 | 10.0 | 75.0% | 0 | 3.32s | 852 | 171 | 4,328 | |
| GLM 5.3 FlashX | 10.0 | 10.0 | 100.0% | 0 | 2.65s | 639 | 301 | 2,210 |
| Coding | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4.1 Flash | 10.0 | 10.0 | 100.0% | 0 | 40.66s | 7,509 | 378 | 81,978 | |
| GLM 5.3 FlashX | 8.2 | 7.2 | 88.9% | 1 | 24.61s | 7,317 | 463 | 36,503 |
| Combined | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4.1 Flash | 10.0 | 10.0 | 100.0% | 0 | 24.73s | 77,368 | 4,906 | 24,016 | |
| GLM 5.3 FlashX | 8.2 | 6.9 | 66.7% | 1 | 45.23s | 76,431 | 3,485 | 35,762 |
| Data parsing and extraction | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4.1 Flash | 6.5 | 10.0 | 50.0% | 0 | 3.80s | 2,397 | 120 | 1,149 | |
| GLM 5.3 FlashX | 10.0 | 10.0 | 100.0% | 0 | 3.38s | 7,149 | 223 | 2,262 |
| Domain specific | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4.1 Flash | 3.5 | 4.4 | 33.3% | 2 | 95.58s | 909 | 27 | 184,701 | |
| GLM 5.3 FlashX | 3.5 | 4.4 | 33.3% | 2 | 224.00s | 759 | 583 | 279,058 |
| General Intelligence | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4.1 Flash | 10.0 | 10.0 | 100.0% | 0 | 4.34s | 549 | 117 | 1,319 | |
| GLM 5.3 FlashX | 10.0 | 10.0 | 100.0% | 0 | 5.01s | 498 | 209 | 1,290 |
| Instructions following | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4.1 Flash | 10.0 | 10.0 | 100.0% | 0 | 8.38s | 783 | 63 | 1,546 | |
| GLM 5.3 FlashX | 9.9 | 10.0 | 100.0% | 0 | 2.23s | 678 | 72 | 1,032 |
| Puzzle Solving | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4.1 Flash | 8.2 | 7.7 | 77.8% | 1 | 9.39s | 828 | 273 | 14,502 | |
| GLM 5.3 FlashX | 8.2 | 7.7 | 77.8% | 1 | 3.88s | 672 | 456 | 2,848 |
| Tool Calling | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4.1 Flash | 10.0 | 10.0 | 100.0% | 0 | 13.83s | 8,259 | 313 | 284 | |
| GLM 5.3 FlashX | 10.0 | 10.0 | 100.0% | 0 | 9.39s | 6,861 | 231 | 712 |
| Trivia | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4.1 Flash | 3.0 | 10.0 | 0.0% | 0 | 46.86s | 261 | 13 | 27,759 | |
| GLM 5.3 FlashX | 3.0 | 10.0 | 0.0% | 0 | 22.41s | 207 | 278 | 7,756 |
Quick Compare
Switch Comparison Pair
Claude Fable 5.1highvsGLM 5.3 FlashXmaxQwen3.5-27BmediumvsGLM 5.3 FlashXmaxGPT-5.4 MinimediumvsGLM 5.3 FlashXmaxGPT-5.6 TerralowvsGLM 5.3 FlashXmaxQwen3.7 MaxnonevsGLM 5.3 FlashXmaxClaude Opus 4.7mediumvsDeepSeek V4.1 FlashlowDeepSeek V4.1 FlashlowvsGPT-5.6 LunahighDeepSeek V4.1 FlashlowvsNemotron 3 UltramediumFree AvailableGemini 3.8 FlashmediumvsGLM 5.3 FlashXmaxGPT-5.4 NanomediumvsGLM 5.3 FlashXmaxGemini 3.5 FlashmediumvsGLM 5.3 FlashXmaxQwen3.8 2.4T A95BhighvsGLM 5.3 FlashXmax