- Rank
- #110
- Total Output Tokens
- 577,214
- Response Time (avg)
- 94.16s
- Total Cost
- $0.462
DeepSeek V4 Flash 0731 (medium) vs GPT-6 Luna (high)
DeepSeek V4 Flash 0731 (medium) leads on average score with 7.8 vs 7.7. GPT-6 Luna (high) has the lower benchmark cost at $0.074 vs $0.462. GPT-6 Luna (high) is faster at 20.37s vs 94.16s, with pass rates of 72.5% vs 73.9%.
Compared models
- Rank
- #111
- Total Output Tokens
- 101,587
- Response Time (avg)
- 20.37s
- Total Cost
- $0.074
Recommended model
GPT-6 Luna (high)
Its score stays close to the best score here (7.7 vs 7.8), while costing about 6.3x less than DeepSeek V4 Flash 0731 (medium).
Detailed comparison
| Metric | DeepSeek V4 Flash 0731 DeepSeek V4 Flash 0731 medium | GPT-6 Luna GPT-6 Luna high |
|---|---|---|
| Score | 7.8 | 7.7 |
| Rank | #110 | #111 |
| Reliability | 10.0 | 10.0 |
| Consistency | 7.2 | 8.7 |
| Attempts | 69/69 | 69/69 |
| Tests Correct | ||
| Attempt pass rate | 72.5% | 73.9% |
| Flaky tests | 8 | 4 |
| Total Runs | 69 | 69 |
| Cost per result | 1.176 | 0.492 |
| Total Cost | $0.462 | $0.074 |
| Input Price | $0.010 / 1M | $0.100 / 1M |
| Output Price | $1.280 / 1M | $0.500 / 1M |
| Total Input Tokens | 274,189 | 229,986 |
| Output Tokens | 66,689 | 6,037 |
| Reasoning Tokens | 510,525 | 95,550 |
| Response Time (avg) | 94.16s | 20.37s |
| Response Time (max) | 303.26s | 106.93s |
| Response Time (total) | 2165.72s | 468.52s |
| Parameters | 284B total (13B active) | ~400B total (~17B active) |
| Availability | Closed | Closed |
Model generation showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#110 DeepSeek V4 Flash 0731
medium- Cost
- $0.004
- Time
- 93.3s
- Tokens
- 13,252 tok
#111 GPT-6 Luna
high- Cost
- $0.003
- Time
- 49.2s
- Tokens
- 5,231 tok
Top Models by Score
Score vs Total Cost
Response Time (avg)
Score vs Response Time (avg)
Total Output Tokens
Score vs Total Output Tokens
Category Breakdown
| Agentic | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | 10.0 | 10.0 | 100.0% | 0 | 303.26s | 184,370 | 8,291 | 18,068 | |
| GPT-6 Luna | 5.2 | 3.2 | 33.3% | 1 | 82.78s | 149,545 | 1,276 | 8,906 |
| Anti-AI Tricks | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | 8.2 | 7.9 | 83.3% | 1 | 17.95s | 698 | 2,101 | 6,715 | |
| GPT-6 Luna | 10.0 | 10.0 | 100.0% | 0 | 2.64s | 606 | 159 | 1,358 |
| Coding | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | 6.4 | 4.4 | 77.8% | 2 | 198.78s | 6,032 | 4,109 | 160,154 | |
| GPT-6 Luna | 7.8 | 7.4 | 77.8% | 1 | 24.69s | 7,302 | 483 | 15,691 |
| Combined | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | 7.3 | 5.8 | 83.3% | 1 | 150.58s | 65,118 | 40,110 | 97,296 | |
| GPT-6 Luna | 10.0 | 10.0 | 100.0% | 0 | 21.53s | 57,233 | 3,111 | 6,658 |
| Data parsing and extraction | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | 10.0 | 10.0 | 100.0% | 0 | 5.21s | 7,290 | 287 | 1,519 | |
| GPT-6 Luna | 10.0 | 10.0 | 100.0% | 0 | 24.50s | 7,140 | 234 | 352 |
| Domain specific | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | 2.9 | 7.2 | 11.1% | 1 | 203.11s | 592 | 9,333 | 154,069 | |
| GPT-6 Luna | 5.9 | 7.2 | 55.6% | 1 | 51.14s | 732 | 70 | 55,170 |
| General Intelligence | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | 6.1 | 3.1 | 66.7% | 1 | 12.16s | 471 | 66 | 1,589 | |
| GPT-6 Luna | 5.1 | 10.0 | 0.0% | 0 | 17.40s | 477 | 96 | 373 |
| Instructions following | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | 8.5 | 6.8 | 83.3% | 1 | 2.42s | 706 | 109 | 580 | |
| GPT-6 Luna | 8.4 | 6.9 | 83.3% | 1 | 1.92s | 660 | 91 | 420 |
| Puzzle Solving | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | 8.2 | 7.3 | 88.9% | 1 | 65.12s | 594 | 1,530 | 66,970 | |
| GPT-6 Luna | 7.8 | 10.0 | 66.7% | 0 | 7.51s | 642 | 231 | 4,988 |
| Tool Calling | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | 10.0 | 10.0 | 100.0% | 0 | 4.41s | 8,178 | 374 | 152 | |
| GPT-6 Luna | 10.0 | 10.0 | 100.0% | 0 | 6.96s | 5,454 | 256 | 261 |
| Trivia | Score | Consistency | Attempt pass rate | Flaky tests | Tests Correct | Response Time (avg) | Input Tokens | Output Tokens | Reasoning Tokens |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | 3.0 | 10.0 | 0.0% | 0 | 56.64s | 140 | 379 | 3,413 | |
| GPT-6 Luna | 3.0 | 10.0 | 0.0% | 0 | 4.90s | 195 | 30 | 1,373 |
Quick Compare
Switch Comparison Pair
DeepSeek V4 Flash 0731mediumvsGrok 4.5lowDeepSeek V4 Flash 0731mediumvsQwen3.7 PlusnoneGPT-6 LunahighvsQwen3.5 Plus 2026-04-20mediumGPT-6 LunahighvsQwen3.7 FlashlowMuse Glimmer 30BmediumvsGPT-6 LunahighDeepSeek V4 Flash 0731mediumvsGLM 5.3highDeepSeek V4 Flash 0731mediumvsMuse Glimmer 30BhighGPT-6 LunahighvsGrok 4.5lowGPT-6 LunahighvsQwen3.7 PlusnoneDeepSeek V4 Flash 0731mediumvsQwen3.7 FlashlowGPT-6 LunahighvsGrok 4.6mediumDeepSeek V4 Flash 0731mediumvsQwen3.8 2.4T A95Bhigh