Navigatie
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Seed-2.0-Code (low) vs GPT-5.6 Luna (high)

De gemiddelde score is vrijwel gelijk met 7.7 vs 7.7. GPT-5.6 Luna (high) heeft lagere benchmarkkosten met $0.102 vs $0.681. GPT-5.6 Luna (high) is sneller met 18.68s vs 65.89s, met slagingspercentages van 80.3% vs 72.7%.

Benchmarks gegenereerd uit AI BENCHY-testsuites op: 2026-08-12

Rang
#66
Totaal aantal uitvoer-tokens
212,558
Responstijd (gem.)
65.89s
Totale kosten
$0.681
Rang
#69
Totaal aantal uitvoer-tokens
155,998
Responstijd (gem.)
18.68s
Totale kosten
$0.102
Aanbevolen model GPT-5.6 Luna (high)

Het heeft hier de beste score (7.7) en kost ongeveer 6.7x minder dan Seed-2.0-Code (low).

Gedetailleerde vergelijking

Metriek Seed-2.0-Code Seed-2.0-Code low Releasedatum: 2026-08-12 GPT-5.6 Luna GPT-5.6 Luna high Releasedatum: 2026-07-09
Score 7.7 7.7
Rang #66 #69
Betrouwbaarheid 5.7 10.0
Consistentie 7.5 8.9
Pogingen 66/66 66/66
Correcte tests
Slaagpercentage per poging 80.3% 72.7%
Instabiele tests 7 3
Totaal runs 66 66
Kosten per resultaat 5.235 6.780
Totale kosten $0.681 $0.102
Invoerprijs $0.500 / 1M $0.100 / 1M
Uitvoerprijs $3.000 / 1M $0.600 / 1M
Totaal aantal invoer-tokens 85,648 80,918
Uitvoer-tokens 8,142 5,088
Redeneer-tokens 204,416 150,910
Responstijd (gem.) 65.89s 18.68s
Responstijd (max) 485.92s 111.09s
Responstijd (totaal) 1449.53s 411.05s
Parameters ~200B totaal (~20B actief) ~400B totaal (~17B actief)
Beschikbaarheid Gesloten broncode Gesloten broncode

Model generatie-showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#66 Seed-2.0-Code

low
Provider returned error
Kosten
$0.000
Tijd
0.3s
Tokens
0 tok

#69 GPT-5.6 Luna

high
Kosten
$0.033
Tijd
34.2s
Tokens
5,484 tok

Topmodellen op score

Score vs totale kosten

Responstijd (gem.)

Score vs Responstijd (gem.)

Totaal aantal uitvoer-tokens

Score vs Totaal aantal uitvoer-tokens

Categorie-uitsplitsing

Programmeren Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
Seed-2.0-Code 7.0 5.0 77.8% 2 109.70s 7,948 455 55,759
GPT-5.6 Luna 5.5 4.7 55.6% 2 15.63s 7,302 510 17,746

Snelle vergelijking

Vergelijkingspaar wisselen