Navigatie
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

DeepSeek: DeepSeek V4 Flash vs OpenAI: GPT-5.6 Luna

De gemiddelde score is vrijwel gelijk met 7.7 vs 7.7. DeepSeek V4 Flash (high) heeft lagere benchmarkkosten met $0.042 vs $1.017. GPT-5.6 Luna (high) is sneller met 18.68s vs 49.75s, met slagingspercentages van 72.7% vs 72.7%.

Aanbevolen modelDeepSeek V4 Flash (high)Het heeft hier de beste score (7.7) en kost ongeveer 24.3x minder dan GPT-5.6 Luna (high).

Benchmarks gegenereerd uit AI BENCHY-testsuites op: 2026-07-22

Metriek DeepSeek V4 Flash DeepSeek V4 Flash high Releasedatum: 2026-04-24 GPT-5.6 Luna GPT-5.6 Luna high Releasedatum: 2026-07-09
Score 7.7 7.7
Rang #49 #48
Betrouwbaarheid 10.0 10.0
Consistentie 8.2 8.9
Correcte tests
Slaagpercentage per poging 72.7% 72.7%
Instabiele tests 5 3
Totaal runs 66 66
Kosten per resultaat 0.402 6.780
Totale kosten $0.042 $1.017
Invoerprijs $0.098 / 1M $1.000 / 1M
Uitvoerprijs $0.196 / 1M $6.000 / 1M
Totaal aantal invoer-tokens 108,392 80,918
Uitvoer-tokens 14,478 5,088
Redeneer-tokens 153,687 150,910
Responstijd (gem.) 49.75s 18.68s
Responstijd (max) 218.13s 111.09s
Responstijd (totaal) 1094.41s 411.05s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#49 DeepSeek V4 Flash

high
Kosten
$0.003
Tijd
93.1s
Tokens
7,926 tok

#48 GPT-5.6 Luna

high
Kosten
$0.033
Tijd
34.2s
Tokens
5,484 tok

Topmodellen op score

Score vs totale kosten

Responstijd (gem.)

Score vs Responstijd (gem.)

Totaal aantal uitvoer-tokens

Score vs Totaal aantal uitvoer-tokens

Categorie-uitsplitsing

Programmeren Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
DeepSeek V4 Flash 7.8 10.0 66.7% 0 50.60s 7,279 395 34,862
GPT-5.6 Luna 5.5 4.7 55.6% 2 15.63s 7,302 510 17,746

Snelle vergelijking

Vergelijkingspaar wisselen