Navigatie
AI BENCHY
Advertise here

Vergeleken modellen

Benchmarkvergelijking GPT-5.5 (medium) vs GPT-5.4 (medium) vs Gemini 3.1 Pro Preview (medium) vs Claude Opus 4.7 (medium): Gemini 3.1 Pro Preview (medium) leidt op Score met 9.2. GPT-5.5 (medium) leidt op Betrouwbaarheid met 10.0. Gemini 3.1 Pro Preview (medium) heeft de laagste Totale kosten met $1.361. Claude Opus 4.7 (medium) is het snelst met 7.61s.

Benchmarks gegenereerd uit AI BENCHY-testsuites op: 2026-08-07

Rang
#15
Totaal aantal uitvoer-tokens
124,436
Responstijd (gem.)
38.42s
Totale kosten
$4.137
Rang
#29
Totaal aantal uitvoer-tokens
88,670
Responstijd (gem.)
23.10s
Totale kosten
$1.533
Rang
#9
Totaal aantal uitvoer-tokens
97,958
Responstijd (gem.)
21.47s
Totale kosten
$1.361
Rang
#23
Totaal aantal uitvoer-tokens
29,990
Responstijd (gem.)
7.61s
Totale kosten
$1.477
Aanbevolen model Gemini 3.1 Pro Preview (medium)

Het heeft hier de beste score (9.2) en kost ongeveer 1.8x minder dan de andere modellen in deze vergelijking.

Gedetailleerde vergelijking

Metriek GPT-5.5 GPT-5.5 medium Releasedatum: 2026-04-24 GPT-5.4 GPT-5.4 medium Releasedatum: 2026-03-05 Gemini 3.1 Pro Preview Gemini 3.1 Pro Preview medium Releasedatum: 2026-02-19 Claude Opus 4.7 Claude Opus 4.7 medium Releasedatum: 2026-04-16
Score 9.0 8.5 9.2 8.7
Rang #15 #29 #9 #23
Betrouwbaarheid 10.0 10.0 10.0 10.0
Consistentie 8.9 8.6 10.0 9.6
Benchmarkdekking 22/22 tests · 66/66 pogingen 22/22 tests · 66/66 pogingen 22/22 tests · 66/66 pogingen 22/22 tests · 66/66 pogingen
Correcte tests
Slaagpercentage per poging 87.9% 77.3% 90.9% 83.3%
Instabiele tests 3 4 0 1
Totaal runs 66 66 66 66
Kosten per resultaat 22.980 10.220 6.801 8.201
Totale kosten $4.137 $1.533 $1.361 $1.477
Invoerprijs $5.000 / 1M $2.500 / 1M $2.000 / 1M $5.000 / 1M
Uitvoerprijs $30.000 / 1M $15.000 / 1M $12.000 / 1M $25.000 / 1M
Totaal aantal invoer-tokens 80,659 81,127 92,287 145,252
Uitvoer-tokens 5,617 6,155 5,232 24,948
Redeneer-tokens 118,819 82,515 92,726 5,042
Responstijd (gem.) 38.42s 23.10s 21.47s 7.61s
Responstijd (max) 332.10s 100.41s 88.68s 65.40s
Responstijd (totaal) 845.35s 508.26s 322.08s 159.91s

Model generatie-showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#15 GPT-5.5

medium
Kosten
$0.112
Tijd
71.9s
Tokens
3,807 tok

#29 GPT-5.4

medium
Kosten
$0.214
Tijd
199.6s
Tokens
14,349 tok

#9 Gemini 3.1 Pro Preview

medium
Kosten
$0.115
Tijd
87.2s
Tokens
9,629 tok

#23 Claude Opus 4.7

medium
Kosten
$0.059
Tijd
26.8s
Tokens
2,475 tok

Topmodellen op score

Score vs totale kosten

Responstijd (gem.)

Score vs Responstijd (gem.)

Totaal aantal uitvoer-tokens

Score vs Totaal aantal uitvoer-tokens

Categorie-uitsplitsing

Programmeren Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
GPT-5.5 8.8 7.8 88.9% 1 59.77s 7,305 362 24,959
GPT-5.4 8.8 7.8 88.9% 1 44.36s 7,305 433 24,216
Gemini 3.1 Pro Preview 7.9 9.9 66.7% 0 40.17s 8,124 435 41,247
Claude Opus 4.7 7.6 7.2 77.8% 1 12.96s 10,635 7,629 1,114

Snelle vergelijking

Vergelijkingspaar wisselen