Navigatie
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

DeepSeek V4 Pro (high) vs GPT-5.6 Luna (medium)

DeepSeek V4 Pro (high) leidt in gemiddelde score met 7.7 vs 7.4. GPT-5.6 Luna (medium) heeft lagere benchmarkkosten met $0.072 vs $0.761. GPT-5.6 Luna (medium) is sneller met 7.43s vs 92.50s, met slagingspercentages van 63.6% vs 62.1%.

Benchmarks gegenereerd uit AI BENCHY-testsuites op: 2026-08-20

Rang
#75
Totaal aantal uitvoer-tokens
209,444
Responstijd (gem.)
92.50s
Totale kosten
$0.761
Rang
#93
Totaal aantal uitvoer-tokens
44,525
Responstijd (gem.)
7.43s
Totale kosten
$0.072
Aanbevolen model GPT-5.6 Luna (medium)

De score blijft dicht bij de beste score hier (7.4 vs 7.7) en het kost ongeveer 10.6x minder dan DeepSeek V4 Pro (high).

Gedetailleerde vergelijking

Metriek DeepSeek V4 Pro DeepSeek V4 Pro high Releasedatum: 2026-04-24 GPT-5.6 Luna GPT-5.6 Luna medium Releasedatum: 2026-07-09
Score 7.7 7.4
Rang #75 #93
Betrouwbaarheid 10.0 10.0
Consistentie 7.7 9.2
Pogingen 66/66 66/66
Correcte tests
Slaagpercentage per poging 63.6% 62.1%
Instabiele tests 6 2
Totaal runs 66 66
Kosten per resultaat 2.251 2.601
Totale kosten $0.761 $0.072
Invoerprijs $1.600 / 1M $0.200 / 1M
Uitvoerprijs $3.200 / 1M $1.200 / 1M
Totaal aantal invoer-tokens 90,757 89,685
Uitvoer-tokens 22,928 5,701
Redeneer-tokens 186,516 38,824
Responstijd (gem.) 92.50s 7.43s
Responstijd (max) 416.76s 29.85s
Responstijd (totaal) 2035.01s 163.54s
Parameters 1.6T totaal (49B actief) ~400B totaal (~17B actief)
Beschikbaarheid Open-source Gesloten broncode

Model generatie-showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#75 DeepSeek V4 Pro

high
Kosten
$0.023
Tijd
257.6s
Tokens
14,870 tok

#93 GPT-5.6 Luna

medium
Kosten
$0.014
Tijd
14.6s
Tokens
2,362 tok

Topmodellen op score

Score vs totale kosten

Responstijd (gem.)

Score vs Responstijd (gem.)

Totaal aantal uitvoer-tokens

Score vs Totaal aantal uitvoer-tokens

Categorie-uitsplitsing

Programmeren Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
DeepSeek V4 Pro 6.3 8.7 33.3% 0 243.00s 5,090 383 84,580
GPT-5.6 Luna 5.4 7.2 44.4% 1 10.38s 7,302 564 9,928

Snelle vergelijking

Vergelijkingspaar wisselen