- Rank
- #63
- Total Output Tokens
- 48,293
- Response Time (avg)
- 10.79s
- Total Cost
- $1.175
Claude Sonnet 5.5 (high) vs DeepSeek V4.1 Flash (medium)
DeepSeek V4.1 Flash (medium) leads on average score with 8.7 vs 8.6. DeepSeek V4.1 Flash (medium) has the lower benchmark cost at $0.591 vs $1.175. Claude Sonnet 5.5 (high) is faster at 10.79s vs 32.88s, with pass rates of 81.2% vs 73.9%.
Compared models
- Rank
- #53
- Total Output Tokens
- 444,665
- Response Time (avg)
- 32.88s
- Total Cost
- $0.591
Recommended model
DeepSeek V4.1 Flash (medium)
It has the best score here (8.7), while costing about 2.0x less than Claude Sonnet 5.5 (high).
Detailed comparison
| Metric | Claude Sonnet 5.5 Claude Sonnet 5.5 high | DeepSeek V4.1 Flash DeepSeek V4.1 Flash medium |
|---|---|---|
| Score | 8.6 | 8.7 |
| Rank | #63 | #53 |
| Reliability | 10.0 | 9.6 |
| Consistency | 8.3 | 9.3 |
| Attempts | 69/69 | 69/69 |
| Tests Correct | ||
| Attempt pass rate | 81.2% | 73.9% |
| Flaky tests | 5 | 2 |
| Total Runs | 69 | 69 |
| Cost per result | 7.340 | 1.757 |
| Total Cost | $1.175 | $0.591 |
| Input Price | $2.000 / 1M | $0.013 / 1M |
| Output Price | $10.000 / 1M | $1.320 / 1M |
| Cache Read Price | $0.200 / 1M | $0.013 / 1M |
| Cache Write Price | $2.500 / 1M | N/A |
| Total Input Tokens | 345,687 | 280,643 |
| Output Tokens | 13,550 | 7,342 |
| Reasoning Tokens | 34,743 | 437,323 |
| Response Time (avg) | 10.79s | 32.88s |
| Response Time (max) | 51.53s | 276.31s |
| Response Time (total) | 248.22s | 756.34s |
| Parameters | ~1T total (~100B active) | 748B total (16B active) |
| Availability | Closed | Open source |
Cache prices apply to input tokens. Reads reuse cached prompts; writes store them and can cost extra. Output tokens use the output price.
Model generation showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#63 Claude Sonnet 5.5
high- Cost
- $0.088
- Time
- 73.5s
- Tokens
- 8,914 tok
#53 DeepSeek V4.1 Flash
medium- Cost
- $0.014
- Time
- 34.7s
- Tokens
- 11,541 tok
Category Breakdown
| Agentic | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5.5 | 10.0 | 10.0 | 100.0% | 0 | 51.53s | 186,231 | 3,380 | 1,608 | |
| DeepSeek V4.1 Flash | 10.0 | 10.0 | 100.0% | 0 | 47.59s | 192,135 | 1,932 | 11,917 |
| Anti-AI Tricks | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5.5 | 10.0 | 10.0 | 100.0% | 0 | 3.69s | 858 | 500 | 917 | |
| DeepSeek V4.1 Flash | 8.3 | 10.0 | 75.0% | 0 | 3.07s | 852 | 156 | 4,108 |
| Coding | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5.5 | 10.0 | 10.0 | 100.0% | 0 | 9.85s | 10,608 | 561 | 6,326 | |
| DeepSeek V4.1 Flash | 10.0 | 10.0 | 100.0% | 0 | 34.45s | 7,509 | 396 | 71,345 |
| Combined | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5.5 | 8.2 | 6.9 | 66.7% | 1 | 24.57s | 121,917 | 7,165 | 5,930 | |
| DeepSeek V4.1 Flash | 10.0 | 10.0 | 100.0% | 0 | 22.21s | 66,161 | 3,956 | 24,673 |
| Data parsing and extraction | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5.5 | 7.3 | 5.8 | 83.3% | 1 | 3.86s | 10,515 | 363 | 1,045 | |
| DeepSeek V4.1 Flash | 6.5 | 10.0 | 50.0% | 0 | 3.77s | 2,397 | 120 | 998 |
| Domain specific | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5.5 | 3.5 | 4.4 | 33.3% | 2 | 17.52s | 990 | 61 | 14,014 | |
| DeepSeek V4.1 Flash | 2.9 | 7.2 | 11.1% | 1 | 153.01s | 909 | 24 | 298,454 |
| General Intelligence | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5.5 | 6.5 | 3.4 | 66.7% | 1 | 6.93s | 714 | 313 | 1,358 | |
| DeepSeek V4.1 Flash | 10.0 | 10.0 | 100.0% | 0 | 3.13s | 549 | 131 | 581 |
| Instructions following | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5.5 | 9.9 | 10.0 | 100.0% | 0 | 5.13s | 921 | 98 | 346 | |
| DeepSeek V4.1 Flash | 10.0 | 10.0 | 100.0% | 0 | 9.69s | 783 | 63 | 1,483 |
| Puzzle Solving | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5.5 | 10.0 | 10.0 | 100.0% | 0 | 3.54s | 912 | 569 | 834 | |
| DeepSeek V4.1 Flash | 8.7 | 7.7 | 88.9% | 1 | 8.01s | 828 | 293 | 12,340 |
| Tool Calling | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5.5 | 10.0 | 10.0 | 100.0% | 0 | 5.22s | 11,757 | 410 | 97 | |
| DeepSeek V4.1 Flash | 10.0 | 10.0 | 100.0% | 0 | 15.33s | 8,259 | 258 | 296 |
| Trivia | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5.5 | 3.0 | 10.0 | 0.0% | 0 | 9.93s | 264 | 130 | 2,268 | |
| DeepSeek V4.1 Flash | 3.0 | 10.0 | 0.0% | 0 | 20.25s | 261 | 13 | 11,128 |
Quick Compare
Switch Comparison Pair
Claude Sonnet 5.5highvsMuse Spark 1.1lowDeepSeek V4.1 FlashmediumvsMuse Spark 1.2lowClaude Sonnet 5.5highvsDeepSeek V4.1 FlashmaxClaude Sonnet 5.5highvsQwen3.8 Max (0902)lowClaude Sonnet 5.5highvsGPT-6 SollowDeepSeek V4.1 FlashmediumvsQwen3.8 27BhighFree AvailableClaude Sonnet 5.5highvsSeed 2.1 TurbomediumClaude Sonnet 5.5highvsMiMo-V2.6-PromediumDeepSeek V4.1 FlashmediumvsQwen3.8 MAXlowClaude Sonnet 5.5highvsGPT-5.2mediumDeepSeek V4.1 FlashmediumvsGPT-6 SollowClaude Sonnet 5.5highvsMuse Spark 1.3low